← xinka.ai 首页  ·  Xinka Whitepaper

Xinka: The Minimal Unit of Trustworthy Knowledge / 信卡:可信知识的最小单元(白皮书·早期草案 v0.1)

Status: Early Draft v0.1 · 2026-10 · Created by Ren Shiliao(任世燎) 欢迎评论与引用。

摘要

以大模型为代表的内容生成系统已经能够对几乎任何问题给出流畅、完整、语气自信的回答,但流畅并不等于可靠:模型会虚构事实、编造不存在的文献引用、给出无出处的统计数据。使用者因此陷入一种结构性困境——答案「不敢信、不敢引、不敢用」。既有溯源标准并未覆盖这一缺口:C2PA 面向图像与视频等媒介文件,DOI 面向学术论文,FAIR 面向科研数据,而「知识/文本结论」这一层的溯源格目前是空的。本文提出 Xinka(信卡):可信知识的最小单元,亦即知识原子(knowledge atom),并给出使其可落地的最小充分结构。一张信卡由六个要素构成——源(Source)、采(Collected)、信(Trust)、鲜(Freshness)、位(Position)、证(Verified),分别记录出处、采集时间、置信度、保鲜期、在知识树中的坐标与三源互证状态。Xinka 的主张是把「信任」从一种主观感受变为可机器校验、可计量、可衰减的结构化对象,使每一条答案都携带自己的户口本。本文给出设计原则、Schema 草图、信任模型与应用场景,并说明 Xinka 与现有标准的互补关系及后续治理路线。

一、问题:AI 时代的信任赤字

不敢信。 当用户向模型询问一个具体事实时,得到的回答往往语法正确、逻辑连贯、细节充分,却可能整体虚构。模型的训练目标优化的是下一个词的合理性,而非所述内容与真实世界的对应关系;在没有外部校验机制的情况下,用户没有任何线索区分「模型真的检索到了来源」与「模型生成了一段看起来像来源的文本」。

不敢引。 学生撰写论文、分析师撰写报告、开发者编写文档时,需要把外部结论写入自己的文本。传统上这依赖 DOI、URL 或文献引用格式,但在对话式 AI 场景中,用户拿到的常常是一段没有出处的断言,或一条无法确认是否真实存在的参考条目。引用一个未经溯源的结论,风险由引用者独自承担——这使得大量可用知识在实际写作与决策流程中被主动弃用。

不敢用。 在医疗、法律、金融、工程等高后果场景中,「答案可能错」不是学术洁癖而是实际风险。企业若将模型输出直接嵌入产品说明、合同条款或对外公告,一旦内容失实,责任难以追溯:无法回答「这条结论是谁在什么时候依据什么得出的」。信任赤字的根源不在于模型能力不足,而在于知识在传递过程中丢失了自身的身份信息。

二、相关工作与空格

溯源(provenance)与标识(identifier)领域已有若干成熟标准,各自占据清晰的生态位,但均未覆盖「文本结论」这一层。

标准 / 生态溯源对象解决的问题未覆盖之处
C2PA图像、视频、音频等媒介文件媒介内容是否被篡改、由谁生成溯源粒度是文件,不是文件内的知识断言
DOI(ISO 26324)学术论文、数据集等数字对象持久标识与引用计数对象是完整文献,不适用于单条结论
FAIR 原则科研数据集数据的可发现、可访问、可互操作、可重用面向数据管理流程,不面向推理结论
Wikipedia 与搜索引擎网页与条目提供可点击查看的来源链接链接指向原始出处,但不校验「结论是否真的由该出处支持」

这些标准共同构成了一条链的两端:一端是内容的身份(这是谁的论文、这张图是否被改过),另一端是内容的可发现性(这条数据在哪里、能否被机器读取)。链条中间缺一环——当一段知识被抽取、改写、复述并进入新的上下文时,它不再是一篇完整的论文或一个数据集,而是一条独立的结论。这条结论目前没有自己的标识、没有自己的元数据、没有自己的信任状态。

值得指出的是,这一空格并非因为既有标准设计不周,而是因为各标准的粒度选择有其自身的合理性:DOI 若下沉到单条结论,则失去「引用指向稳定对象」的前提;C2PA 若上浮到语义层,则必须对内容真伪做出判断,这超出了格式与签名机制的能力边界。空格之所以空着,是因为它需要一种新的粒度——比文献小、比文件大、以「命题」为单位。这正是信卡所定义的粒度。

Xinka 占的正是这一格:为「知识/文本结论」提供最小粒度的溯源单元。它不替代 C2PA、DOI 或 FAIR,而是补齐它们之间的空档。

三、定义:什么是信卡

信卡(Xinka)是一条知识结论所携带的完整身份档案,是可信知识的最小单元。之所以称为「最小」,是因为信卡对应的是不可再向下拆分而仍保持语义完整的一个断言;再拆即失去可验证的命题结构,再粗则退化为整篇文献的引用(即 DOI 的领域)。

一张信卡包含六个要素,各要素独立、合起来覆盖一条结论可信性所需的全部信息(MECE):

要素英文含义为何不可省
源Source结论的原始出处 URL无出处则无法追溯,任何引用都不成立
采Collected该出处被采集的时刻同一 URL 内容会变,不记录采集时间则档案无法复现
信Trust置信度:已验证 / 待核验区分「已核实」与「尚未核实」是可信与不可信的分界
鲜Freshness保鲜期,到期后降级待复核知识会过期,无保鲜期的「已验证」是过期承诺
位Position结论在知识树中的坐标定位结论所属的主题层级,避免同名断言在不同语境下混淆
证Verified三源互证状态孤证不立:单一来源可能是错误的巧合,交叉验证才是可信的操作定义

六要素的设计遵循「每一条都直接对应一种失败模式」:缺源即失溯,缺采即不可复现,缺信即无分级,缺鲜即过期不降级,缺位即语境丢失,缺证即孤证冒充共识。

四、设计原则

最小性。 信卡是不可再拆的溯源单元。拆开任意一要素,剩余部分都不足以独立支撑「这条结论可信」的判断;因此六要素同时构成信卡的下界,任何声称是信卡的对象必须六项齐备。

完备性。 六要素满足 MECE:彼此不重叠(源是「哪里」,采是「何时」,信是「多可靠」,鲜是「还能信多久」,位是「属于哪个语境」,证是「有没有旁证」),合起来覆盖一条知识结论可信性的全部维度。

可机器校验。 所有要素均为结构化字段而非自然语言描述,可在不理解内容语义的前提下由程序校验其存在性、格式与内部一致性(例如 collected_at 必须早于 freshness_until)。这是信卡区别于人工免责声明的关键。

保鲜衰减。 信任不是静态属性。一张信卡的置信度随时间推移向「待核验」方向衰减,直到被重新验证才恢复。此设计承认一个事实:验证是一次性动作,而世界持续变化。

孤证不立。 单一来源不足以支撑「已验证」。信卡的最高置信档位要求至少三个相互独立的来源指向同一结论;达不到则停留在「待核验」,无论来源本身多么权威。

五项原则之中,前两项(最小性、完备性)约束的是信卡的结构,中间一项(可机器校验)约束的是信卡的形态,后两项(保鲜衰减、孤证不立)约束的是信卡的状态转移。三类约束分别排除三种失效方式:结构不全则无法覆盖、形态非结构化则无法自动处理、状态永不变则无法反映现实。任何后续对规范的修订,都应检验其是否同时维护了这三个层面。

五、Schema 草图

以下为信卡的 JSON 结构草图,字段命名与约束以后续发布的正式 JSON Schema 规范为准;本节仅用于说明六要素的机器可读形态。


{
  "xinka_version": "0.1",
  "source_url": "https://example.org/origin-of-claim",
  "collected_at": "2026-10-01T09:00:00Z",
  "trust_level": "verified | pending",
  "freshness_until": "2027-04-01T09:00:00Z",
  "position": "root/topic/subtopic",
  "verification": {
    "method": "three-source cross-check",
    "sources": ["https://…", "https://…", "https://…"],
    "checked_at": "2026-10-01T09:30:00Z"
  }
}

字段说明(中文注释):

该 Schema 为早期草案,字段可能在正式规范发布前调整;正式 JSON Schema 规范将作为独立工件发布。

六、示例信卡

以下是一张内容完整的活例,用于展示六要素如何落到一条真实公开知识上。示例中的参数数据仅为演示用途,引用前请以模型官方发布页为准。


{
  "xinka_version": "0.1",
  "claim": "MiMo-V2.6-Pro 为 1.02T 参数、激活 42B 的开源大模型",
  "source_url": "https://example.com/official-model-card",
  "collected_at": "2026-10-01T10:00:00Z",
  "trust_level": "pending",
  "freshness_until": "2027-04-01T10:00:00Z",
  "position": "ai/models/open-weights/mimo",
  "verification": {
    "method": "three-source cross-check",
    "sources": [],
    "checked_at": null
  }
}

这张卡表示:该结论采集自一个官方页面,采集时间明确,尚未完成三源互证,因此置信度为 pending;若在保鲜期内由三个独立来源确认,trust_level 升为 verified;若逾越 freshness_until 仍未复核,自动降级回 pending。整条生命周期无需人工介入即可由校验器判定。

七、信任模型

信卡的信任模型由三个相互独立的机制组成,分别回答三个问题:这条结论有多可靠、还能信多久、有没有旁证。

置信度(两档起步)。 初版规范仅设 verified(已验证)与 pending(待核验)两档。刻意不设更细的分数体系,原因有二:其一,精细化评分需要一个公开、可复现的评分算法,过早引入会把尚未经受检验的启发式规则固化为标准;其二,两档已足以支撑下游的差异化处理——系统可以只引用 verified 的信卡,或对 pending 的信卡附加「待核实」提示。后续版本是否引入更细档位,取决于校验器参考实现积累的实际数据。

保鲜期(到期降级)。 每张信卡携带 freshness_until,语义是「在此之前,默认该结论无需重新核实」。越过该时刻,trust_level 自动降级为 pending,直至被重新验证。保鲜期长度由采集方依据结论类型自行设定——技术参数的保鲜期可能以月计,数学定理的保鲜期可以极长,而政策法规类结论的保鲜期往往最短。标准不规定统一时长,只规定「必须显式声明并执行降级」。这一设计使「已验证」成为一种有期限的承诺,而非一旦盖章永久有效的徽章。

三源互证(孤证不立)。 升至 verified 的操作性条件是至少三个相互独立的来源支持同一结论。独立性的判断标准留给校验器实现,但基本原则是:同一机构的多个页面、相互转载的二手报道、由同一上游数据衍生的内容,均不构成独立来源。孤证不立这条准则在史学与情报分析中长期存在,信卡将其写入机器可校验的字段,使「交叉验证」从一种专业习惯变成一种协议要求。

三者合起来构成一条结论的完整信任生命周期:采集时为 pending → 完成三源互证升为 verified → 保鲜期内有效 → 到期降级 → 重新验证后恢复。任何一环缺失,系统都可以在不阅读结论内容的前提下判定其可信状态。

八、应用场景

以下四类场景共享同一结构特征:都存在「一条结论脱离原始出处后被继续使用」的过程,且都因缺少结构化档案而承担额外的核验成本。信卡在这些场景中的作用不是替代人工判断,而是把判断所依赖的元数据固定下来,使判断结果可复用、可传递、可被第三方重检。

AI 引用合规。 对话式 AI 与 AI 搜索产品可以在每条回答旁附上信卡,使用户即时看到出处、采集时间与验证状态。这直接回应了生成式 AI 内容透明度的监管要求(见第九节),也为产品提供了可机读的合规证据,而非仅靠免责声明。

企业数据审计留痕。 当企业将模型输出嵌入报告、公告或产品说明时,随附的信卡构成一条留痕:这条结论在何时依据哪个来源进入组织的知识流,由谁完成核验。审计者可以沿信卡回溯,而不是在事后重新梳理对话记录。对于需要向监管方解释「模型输出如何被采信」的组织,这种结构化留痕的价值在于其可批量导出与机器核对。

教育引用训练。 写作教学中「引用须可追溯」是一条基本原则,但学生在使用 AI 辅助写作时往往拿到无出处的断言。信卡为教学场景提供了可操作的依据:学生被要求为每条外部结论附上信卡,缺源、缺采集时间或未完成互证的结论不得进入正文。这把引用规范从评分标准变成了流程约束。

媒体事实核查。 核查机构的产出可以表达为一组信卡:每条事实判断附带来源、采集时刻、互证结果与保鲜期。与其他核查结果的交换因此变成结构化数据的交换,而非长篇核查报告的互读;同一结论在不同机构的判定也可通过对齐信卡字段进行比对。

九、与现有生态的关系

互补而非替代。 Xinka 不与 C2PA、DOI 或 FAIR 竞争。媒介文件的完整性仍由 C2PA 负责——一张新闻照片是否被篡改,与照片中「事件发生在某时某地」这条结论是否可信,是两个正交的问题,前者由 C2PA 回答,后者由信卡回答。学术文献的持久标识仍由 DOI 负责,信卡的 source_url 恰恰经常指向一个 DOI。科研数据的管理规范仍由 FAIR 负责,信卡可引用 FAIR 数据集作为来源。三者提供上游的「对象身份」,信卡提供下游的「结论身份」,共同构成从对象到断言的完整溯源链。

对 AI 法规透明度义务的呼应。 Regulation (EU) 2024/1689(《人工智能法案》,EU AI Act)第 50 条对特定 AI 系统与生成式内容提出了透明度与信息披露要求,包括使用户知晓自己在与 AI 交互、以及对合成内容进行机器可读标识。信卡与这一方向一致但着力点不同:该条关注「内容由 AI 生成」这一事实的披露,信卡关注「结论依据什么成立」这一实质的披露。前者回答「这是机器写的吗」,后者回答「这是机器编的吗」。在实践上,二者可以叠加使用:生成内容的披露由 C2PA 一类机制承担,内容中知识断言的溯源由信卡承担。信卡不构成对任何法规的合规声明,它提供的是可被合规流程消费的数据结构。

十、治理与路线

当前状态。 本文为早期草案(Early Draft v0.1),目标是把定义、设计原则与 Schema 草图固定下来以便讨论,不承诺向后兼容。文中所有字段、档位与流程均可能在正式规范发布前调整。

下一步。 路线按依赖顺序排列:其一,发布正式 JSON Schema 规范,明确字段类型、必填性与约束条件;其二,发布免费的参考校验器,能够独立校验单张信卡的格式合法性与内部一致性(如时间字段顺序、保鲜期与置信度的联动);其三,发布参考实现,展示信卡的生成、验证与降级流程如何在真实系统中集成;其四,积累示例信卡库与常见失败案例,用于校验器的回归测试与规范修订。

贡献方式。 规范与实现托管于 GitHub(github.com/renshiliao/xinka),问题、缺陷与提案一律通过 GitHub issue 提交。设计讨论在公开渠道进行,避免规范变更仅在私下发生。任何影响字段语义的改动都需要在 issue 中给出理由、示例与对既有信卡的影响评估。

开放性。 Xinka 的定位是公共知识基础设施而非产品:标准本身免费可用,校验器免费分发。本文欢迎评论与引用——引用时请注明版本号与日期。

十一、结语

人类早已把「信任」做成过可计量的对象。摄氏(Celsius)把冷热变成刻度,赫兹(Hertz)把振荡变成频率,帕斯卡(Pascal)把压迫变成压强——名字变成单位的那一刻,原本只能靠经验和直觉把握的现象,变成了任何人都能读数、比较、复现的量。这些单位之所以被记住,不是因为它们被发明得早,而是因为它们选择了一个正确的粒度:足够小以至于处处适用,足够严格以至于读数可以互信。

AI 时代面临一次结构相似的机会。大模型给的是答案的流畅度,Xinka 给的是答案的可信度——不是更会说,而是说了不算瞎说。当每一条结论都携带自己的源、采集时刻、置信度、保鲜期、坐标与互证状态,「信任」就不再是一种需要读者自行揣摩的语气,而成为一种可以被读取、被校验、被计价的结构。信卡要做的,是为这个读数规定刻度。

一条答案带户口本,是这场转变最小、也最不可逆的一步。抄袭者抄得走界面,抄不走为每条答案背的书——因为背书的载体不是界面,而是随结论一起流动、可被任何第三方独立重放的那六个字段。

问得到,更信得过。

参考

1. C2PA, C2PA Specification, Coalition for Content Provenance and Authenticity. https://c2pa.org/specifications/

2. ISO 26324:2012, Information and documentation — Digital object identifier system (DOI).

3. Wilkinson, M. D., Dumontier, M., Aalbersberg, I. J., et al. (2016). "The FAIR Guiding Principles for scientific data management and stewardship." Scientific Data, 3.

4. Regulation (EU) 2024/1689 (Artificial Intelligence Act), Article 50 — Transparency obligations for providers and deployers of certain AI systems. https://eur-lex.europa.eu/eli/reg/2024/1689/oj

5. RFC 3339, Date and Time on the Internet: Timestamps, Internet Engineering Task Force. https://www.rfc-editor.org/rfc/rfc3339


Created by Ren Shiliao(任世燎)· 2026 · xinka.ai