AI决策应有收据:为什么决策追踪是AI治理中的缺失层次
决策追踪

AI决策应有收据:为什么决策追踪是AI治理中的缺失层次

每笔金融交易都有收据。每份法律合同都有签名。但影响数百万人的AI决策?不可见。决策追踪通过捕捉每个AI决策背后的原因——考虑的选项、咨询的证据和遵循的推理链,改变了这一点。

AI
AIAgentree团队
AI治理
2026年7月6日
14分钟阅读

什么是AI决策追踪?

决策追踪是捕捉每个AI代理决策背后完整推理的实践,作为结构化、可审计的文物。与记录发生了什么的执行日志不同,决策追踪记录了为什么会发生——考虑的选项、咨询的证据、权衡的论点和选择的理由。AIAgentree通过决策包实现决策追踪:密封的记录,包含命题、论证树、证据快照、选择的理由和结果跟踪。决策追踪使得符合欧盟AI法案第12-14条,支持三种信任模式(人类在环中、人类在环上、完全自主),并通过先例作为基础设施创建机构记忆。该架构区分规范关系(支持/反对)与描述关系(提及/相关),使AI推理可查询、可比较和可引用。

Share:
TL;DR

大多数组织将日志(代理做了什么)与决策追踪(做了什么以及为什么)混淆。这个区别很重要,因为监管、治理和机构记忆都依赖于后者。

  • 日志 记录执行事件 — API 调用、延迟、错误
  • 决策追踪 捕捉结构化推理 — 选项、证据、理由、结果
  • 决策包 是审计员可以查询和重放的密封文档
  • 先例 自动从结构化决策中产生 — 作为基础设施的机构记忆

一位监管者刚刚要求提供您AI做出的最后100个决策。

您有30天的时间来回应。您实际上有什么?

原始论点,重述

AI决策需要凭证。记录并不等于问责。思维链并不是事实真相。

这些陈述仍然是正确的。但它们是不完整的。

问题"我们为什么要记录决策?"有一个显而易见的答案:合规、问责、调试。更难的问题是:"当我们这样做时会发生什么?"

答案出乎意料:制度记忆变得自动化。不是作为你在其上构建的特性。也不是作为你后来附加的模块。作为数据模型的自然结果。

“决策”实际上意味着什么

决策不是模型输出。它不是API响应。它不是函数返回值。

一个决策是一个包含以下内容的结构化工件:

  • 提案 — 正在决定的事项(批准贷款 #1234)
  • 权衡证据 — 在决策时参考的事实,已被冻结
  • 考虑的替代方案 — 评估并拒绝的选项
  • 选择的理由 — 哪些论点影响了决策
  • 记录的结果 — 之后发生了什么(即时、6个月、1年)

这就是AIAgentree所称的决策包——一个密封的、不可更改的记录,审计员可以查询、重放和引用。

日志无法告诉你的事情

执行日志决策追踪
approve_loan(application_id=1234, score=0.87)
时间戳: 2026-07-01T14:32:11Z
延迟_ms: 247
状态: 200
提议: 批准贷款 #1234
优点: 收入验证通过 (权重:0.92)
优点: 3年工作历史 (权重:0.85)
缺点: 信用评分低于阈值 (权重:0.78)
例外: 高级分析师手动批准的例外
理由: 就业稳定性超过信用问题
结果 (6个月): 0次逾期付款
发生了什么。什么时候发生的。花了多长时间。为什么会做出这个决定。考虑了什么。之后发生了什么。

日志告诉你贷款已获批准。追踪信息告诉你为什么尽管信用评分存在问题仍然获批,谁授权了这个例外,以及这个决定的结果是否良好。

两个原始人

整个决策追踪系统基于两个原始元素:

1

原始 1:持久的推理记录

不是“模型所说的”。一个结构化论证图,包含主张、关系(支持/反对)、证据引用和层次结构。

2

原始 2:持久的结果记录

不是“模型返回200 OK。”一个封闭的决策记录,包含结果、理由论证、决策者和三重视野跟踪。

一旦你拥有了这两者,先例就不再是你“记住”的东西。它变成了你可以查询、比较和引用的东西。

为什么规范性优于描述性

上下文图存储描述性关系:“相关于”、“提及”、“拥有者”。决策论证图存储规范性关系:“支持”、“反对”。

这个区别是根本性的:

  • 描述:“此票提到此客户”
  • 规范性:“这一证据支持批准,因为它证明了持续的付款历史。”

规范结构使可解释性、治理和先例成为可能。描述结构使搜索和发现成为可能。两者都很有价值。只有一种结构能够实现机构判断。

先例是如何(机械地)产生的

飞轮

1

代理生成优缺点论证树

2

人类批准/拒绝 + 选择理由论证

3

决定已定 → 案件记录冻结

4

下一个决定:代理人搜索并引用该案例

5

先例成为新案件中的一个论点节点

6

组织建立了一个“我们如何决策”模式的库

7

模式使安全自动化成为可能(基于先例的自主性)

您获得的机构记忆是正常使用的副产品,而不是作为一个单独的举措。

从存储到可检索:决策作为图形

捕捉决策只是价值的一半。另一半是将其取回——这就是数据模型发挥作用的地方。因为每个决策都作为规范性论证图存储(通过支持/反对边连接的主张),它成为一种一流的检索基础,而不仅仅是一个档案。

将向量搜索指向原始日志,你会得到“块状汤”——不连贯的片段,引用了结论却忽略了反对意见、批准者和先例。相反,从决策图中检索,你会得到一个有限的决策包:命题、支持和反对的理由、证据和结果,完整无缺。这就是GraphRAG用于AI决策——先例是你可以查询和引用的内容,而不仅仅是你希望记住的东西。(关于检索基础的更多信息:什么是决策检索。)

信任的三种模式

企业不会在一夜之间将决策交给人工智能。它们通过不同的模式逐步推进:

模式 1

人机协作

代理人协助,人类决定。代理人生成推理;人类做出最终决定。

模式 2

人类在环中

代理决定,人类监督。代理做出决策;人类可以审查并覆盖。

模式 3

完全自主

代理决定,人类定期审核。已有足够的先例证明自主操作是合理的。

模式进展是基于证据的:置信度 ≥ 95%,相似先例 ≥ 5 且结果一致,模式已建立并验证。这不是“信任但要验证。”这是“验证,然后信任,然后继续验证。”

这对企业人工智能技术栈意味着什么

企业上下文堆栈

  • 层 C:审议 — 为什么会做出这个决定?利弊分析树、先例引用、证据来源
  • 层 B:决策沿革 — 决定了什么?结果、信心、评估的政策、批准
  • 层 A:操作背景 — 谁/什么参与其中?实体、关系、时间状态(CRM,ERP)

大多数团队构建 A。有些构建 B。几乎没有人能很好地构建 C。AIAgentree 提供 C。

三种连接方式 — SDK 只是其中之一

决策追踪不是一个为期6个月的咨询项目——也不需要我们的SDK。有三种连接方式:

  • MCP (代理原生) — 作为工具的完整生命周期,端到端:创建追踪,记录推理,封存决策 (create_trace, append_events, seal_decision) 并立即检索决策包 (get_packet, search_precedents) — 无需安装库
  • REST API — 任何语言,任何运行时,零依赖(SDK是对这些端点的一个薄包装)
  • SDK (Python / TypeScript) — 人体工学选项,自动提取您代理输出中的推理

SDK路径是最简短的写法——大约十行的决策追踪:

from aiagentree import AgentreeClient

client = AgentreeClient(api_key="ask_...", base_url="https://api.aiagentree.com", tenant_id="acme")

# Trace your agent's decision point
trace = client.start_trace(
    agent_id="discount-agent",
    workflow_id="discount_approval",
    entity_type="request",
    entity_id="4521",
)
trace.add_input("discount", 0.18, source="crm")
trace.add_step("s1", title="SEV-1 incident yesterday", category="evidence", confidence=0.9)
trace.add_step("s2", title="Customer flagged as churn risk", category="evidence", confidence=0.85)
trace.add_step("s3", title="Exceeds standard 15% threshold", category="risk", confidence=0.7)
trace.seal("d1", action="approved", confidence=0.9)

该追踪已被封存、加盖时间戳并可查询。当下一个类似请求到达时,可以检索并引用该先例。

合规角度

欧盟人工智能法案对高风险人工智能系统规定了具体要求:

  • 第12条 — 自动记录,能够追踪决策和识别风险
  • 第13条 — 向部署者和用户提供透明度和信息
  • 第14条 — 允许干预和理解的人类监督措施

决策追踪通过捕捉结构化推理、证据来源、人类监督行为和结果记录来满足这些要求——以监管机构可以实际查询和理解的格式。

2027年12月截止日期: 附件III下的高风险AI系统必须遵守日志记录和可追溯性要求。如果您的AI代理在信用、就业、教育或医疗保健方面做出决策,时间已经开始计算。

决策追踪无法解决的问题

决策追踪位于操作上下文之上。它并不替代:

  • CRM/ERP系统 — 你仍然需要你的记录系统
  • 可观察性工具 — LangSmith、W&B、Arize 仍然监控模型健康状况
  • 身份解析 — 您仍然需要跨系统的实体链接

这些工具在不同层面上解决不同的问题。AIAgentree 捕捉到它们都需要但历史上没有存储的一个工件:决策本身

如何开始

1

识别你的高风险决策点

哪些代理决策会影响客户、合规或收入?从这里开始。

2

集成10行SDK

用追踪捕获包装您现有的代理逻辑。无需重写。

3

回答监管机构的问题

选择一个代理并问:“如果监管机构要求提供最后100个决定,我能回答吗?”

常见问题

什么是AI代理的决策追踪?

决策追踪捕捉每个AI决策背后的完整推理——考虑的选项、咨询的证据、权衡的论点和选择的理由——作为结构化、可审计的文物,称为决策包。与记录发生了什么的日志不同,决策追踪记录了为什么会发生。

决策追踪与日志或可观察性有什么不同?

日志记录执行事件(API调用、延迟、错误)。可观察性工具监控系统健康。决策追踪捕捉推理的规范结构——哪些论点支持或反对决策,引用了哪些证据,以及哪些理由主导了结果。这是知道“贷款已批准”和知道“为什么这个贷款在信用评分担忧下被批准”的区别。

什么是决策包?

决策包是AIAgentree的核心文物:一个密封的、不可变的记录,包含命题(做出了什么决定)、论证树(优缺点推理)、证据快照(在决策时被冻结)、选择的理由(哪些论点支持了决策)和结果跟踪(之后发生了什么)。这是监管者或审计员理解和重放决策所需的一切。

决策追踪如何帮助满足欧盟AI法案的合规性?

欧盟AI法案第12-14条要求高风险AI系统维护日志,以允许决策的可追溯性。决策追踪通过捕捉结构化推理、证据来源、人类监督行为和结果记录来满足这些要求——以监管者可以实际查询和理解的格式。

AI治理中的三种信任模式是什么?

三种模式代表一种进展:模式1(人类在环中),代理协助但人类决定;模式2(人类在环上),代理决定并有人类监督;模式3(完全自主),代理决定并定期审计。模式之间的进展是基于证据的,受信心评分、先例一致性和结果跟踪驱动。

先例在决策追踪中如何运作?

当决策作为结构化文物被捕捉时,先例自动产生。可以通过类别、实体引用、论证标签或政策约束检索相似的过去决策。这些先例成为新决策中的一流论证节点——它们可以被引用、挑战或覆盖,就像任何其他理由一样。机构记忆随着每个决策而累积。

集成AIAgentree需要多长时间?

您可以通过三种方式连接:通过MCP作为代理原生工具(无SDK,无库),REST API(任何语言,零依赖),或Python/TypeScript SDK(大约十行,自动提取推理)。完整生命周期——创建追踪、记录推理、密封决策并立即拉回决策包——仅通过MCP工作,端到端,无需任何库。没有为期6个月的咨询项目;这是您添加到现有代理堆栈的基础设施层。

相关主题

相关文章

AI

AIAgentree团队

AI治理

AIAgentree团队正在为AI代理构建决策追踪基础设施。我们的使命是使AI推理可见、可审计和可改进。

准备追踪您的AI决策吗?

今天开始捕捉决策轨迹。提供免费层——无需信用卡。

开始免费试用