什么是AI决策追踪?
决策追踪是捕捉每个AI代理决策背后完整推理的实践,作为结构化、可审计的文物。与记录发生了什么的执行日志不同,决策追踪记录了为什么会发生——考虑的选项、咨询的证据、权衡的论点和选择的理由。AIAgentree通过决策包实现决策追踪:密封的记录,包含命题、论证树、证据快照、选择的理由和结果跟踪。决策追踪使得符合欧盟AI法案第12-14条,支持三种信任模式(人类在环中、人类在环上、完全自主),并通过先例作为基础设施创建机构记忆。该架构区分规范关系(支持/反对)与描述关系(提及/相关),使AI推理可查询、可比较和可引用。
大多数组织将日志(代理做了什么)与决策追踪(做了什么以及为什么)混淆。这个区别很重要,因为监管、治理和机构记忆都依赖于后者。
- •日志 记录执行事件 — API 调用、延迟、错误
- •决策追踪 捕捉结构化推理 — 选项、证据、理由、结果
- •决策包 是审计员可以查询和重放的密封文档
- •先例 自动从结构化决策中产生 — 作为基础设施的机构记忆
一位监管者刚刚要求提供您AI做出的最后100个决策。
您有30天的时间来回应。您实际上有什么?
原始论点,重述
AI决策需要凭证。记录并不等于问责。思维链并不是事实真相。
这些陈述仍然是正确的。但它们是不完整的。
问题"我们为什么要记录决策?"有一个显而易见的答案:合规、问责、调试。更难的问题是:"当我们这样做时会发生什么?"
答案出乎意料:制度记忆变得自动化。不是作为你在其上构建的特性。也不是作为你后来附加的模块。作为数据模型的自然结果。
“决策”实际上意味着什么
决策不是模型输出。它不是API响应。它不是函数返回值。
一个决策是一个包含以下内容的结构化工件:
- •提案 — 正在决定的事项(批准贷款 #1234)
- •权衡证据 — 在决策时参考的事实,已被冻结
- •考虑的替代方案 — 评估并拒绝的选项
- •选择的理由 — 哪些论点影响了决策
- •记录的结果 — 之后发生了什么(即时、6个月、1年)
这就是AIAgentree所称的决策包——一个密封的、不可更改的记录,审计员可以查询、重放和引用。
日志无法告诉你的事情
| 执行日志 | 决策追踪 |
|---|---|
approve_loan(application_id=1234, score=0.87) | 提议: 批准贷款 #1234 优点: 收入验证通过 (权重:0.92) 优点: 3年工作历史 (权重:0.85) 缺点: 信用评分低于阈值 (权重:0.78) 例外: 高级分析师手动批准的例外 理由: 就业稳定性超过信用问题 结果 (6个月): 0次逾期付款 |
| 发生了什么。什么时候发生的。花了多长时间。 | 为什么会做出这个决定。考虑了什么。之后发生了什么。 |
日志告诉你贷款已获批准。追踪信息告诉你为什么尽管信用评分存在问题仍然获批,谁授权了这个例外,以及这个决定的结果是否良好。
两个原始人
整个决策追踪系统基于两个原始元素:
原始 1:持久的推理记录
不是“模型所说的”。一个结构化论证图,包含主张、关系(支持/反对)、证据引用和层次结构。
原始 2:持久的结果记录
不是“模型返回200 OK。”一个封闭的决策记录,包含结果、理由论证、决策者和三重视野跟踪。
一旦你拥有了这两者,先例就不再是你“记住”的东西。它变成了你可以查询、比较和引用的东西。
为什么规范性优于描述性
上下文图存储描述性关系:“相关于”、“提及”、“拥有者”。决策论证图存储规范性关系:“支持”、“反对”。
这个区别是根本性的:
- •描述:“此票提到此客户”
- •规范性:“这一证据支持批准,因为它证明了持续的付款历史。”
规范结构使可解释性、治理和先例成为可能。描述结构使搜索和发现成为可能。两者都很有价值。只有一种结构能够实现机构判断。
先例是如何(机械地)产生的
飞轮
代理生成优缺点论证树
人类批准/拒绝 + 选择理由论证
决定已定 → 案件记录冻结
下一个决定:代理人搜索并引用该案例
先例成为新案件中的一个论点节点
组织建立了一个“我们如何决策”模式的库
模式使安全自动化成为可能(基于先例的自主性)
您获得的机构记忆是正常使用的副产品,而不是作为一个单独的举措。
从存储到可检索:决策作为图形
捕捉决策只是价值的一半。另一半是将其取回——这就是数据模型发挥作用的地方。因为每个决策都作为规范性论证图存储(通过支持/反对边连接的主张),它成为一种一流的检索基础,而不仅仅是一个档案。
将向量搜索指向原始日志,你会得到“块状汤”——不连贯的片段,引用了结论却忽略了反对意见、批准者和先例。相反,从决策图中检索,你会得到一个有限的决策包:命题、支持和反对的理由、证据和结果,完整无缺。这就是GraphRAG用于AI决策——先例是你可以查询和引用的内容,而不仅仅是你希望记住的东西。(关于检索基础的更多信息:什么是决策检索。)
信任的三种模式
企业不会在一夜之间将决策交给人工智能。它们通过不同的模式逐步推进:
人机协作
代理人协助,人类决定。代理人生成推理;人类做出最终决定。
人类在环中
代理决定,人类监督。代理做出决策;人类可以审查并覆盖。
完全自主
代理决定,人类定期审核。已有足够的先例证明自主操作是合理的。
模式进展是基于证据的:置信度 ≥ 95%,相似先例 ≥ 5 且结果一致,模式已建立并验证。这不是“信任但要验证。”这是“验证,然后信任,然后继续验证。”
这对企业人工智能技术栈意味着什么
企业上下文堆栈
- •层 C:审议 — 为什么会做出这个决定?利弊分析树、先例引用、证据来源
- •层 B:决策沿革 — 决定了什么?结果、信心、评估的政策、批准
- •层 A:操作背景 — 谁/什么参与其中?实体、关系、时间状态(CRM,ERP)
大多数团队构建 A。有些构建 B。几乎没有人能很好地构建 C。AIAgentree 提供 C。
三种连接方式 — SDK 只是其中之一
决策追踪不是一个为期6个月的咨询项目——也不需要我们的SDK。有三种连接方式:
- •MCP (代理原生) — 作为工具的完整生命周期,端到端:创建追踪,记录推理,封存决策 (
create_trace,append_events,seal_decision) 并立即检索决策包 (get_packet,search_precedents) — 无需安装库 - •REST API — 任何语言,任何运行时,零依赖(SDK是对这些端点的一个薄包装)
- •SDK (Python / TypeScript) — 人体工学选项,自动提取您代理输出中的推理
SDK路径是最简短的写法——大约十行的决策追踪:
from aiagentree import AgentreeClient
client = AgentreeClient(api_key="ask_...", base_url="https://api.aiagentree.com", tenant_id="acme")
# Trace your agent's decision point
trace = client.start_trace(
agent_id="discount-agent",
workflow_id="discount_approval",
entity_type="request",
entity_id="4521",
)
trace.add_input("discount", 0.18, source="crm")
trace.add_step("s1", title="SEV-1 incident yesterday", category="evidence", confidence=0.9)
trace.add_step("s2", title="Customer flagged as churn risk", category="evidence", confidence=0.85)
trace.add_step("s3", title="Exceeds standard 15% threshold", category="risk", confidence=0.7)
trace.seal("d1", action="approved", confidence=0.9)该追踪已被封存、加盖时间戳并可查询。当下一个类似请求到达时,可以检索并引用该先例。
合规角度
欧盟人工智能法案对高风险人工智能系统规定了具体要求:
- •第12条 — 自动记录,能够追踪决策和识别风险
- •第13条 — 向部署者和用户提供透明度和信息
- •第14条 — 允许干预和理解的人类监督措施
决策追踪通过捕捉结构化推理、证据来源、人类监督行为和结果记录来满足这些要求——以监管机构可以实际查询和理解的格式。
2027年12月截止日期: 附件III下的高风险AI系统必须遵守日志记录和可追溯性要求。如果您的AI代理在信用、就业、教育或医疗保健方面做出决策,时间已经开始计算。
决策追踪无法解决的问题
决策追踪位于操作上下文之上。它并不替代:
- •CRM/ERP系统 — 你仍然需要你的记录系统
- •可观察性工具 — LangSmith、W&B、Arize 仍然监控模型健康状况
- •身份解析 — 您仍然需要跨系统的实体链接
这些工具在不同层面上解决不同的问题。AIAgentree 捕捉到它们都需要但历史上没有存储的一个工件:决策本身。
如何开始
识别你的高风险决策点
哪些代理决策会影响客户、合规或收入?从这里开始。
集成10行SDK
用追踪捕获包装您现有的代理逻辑。无需重写。
回答监管机构的问题
选择一个代理并问:“如果监管机构要求提供最后100个决定,我能回答吗?”
常见问题
什么是AI代理的决策追踪?
决策追踪捕捉每个AI决策背后的完整推理——考虑的选项、咨询的证据、权衡的论点和选择的理由——作为结构化、可审计的文物,称为决策包。与记录发生了什么的日志不同,决策追踪记录了为什么会发生。
决策追踪与日志或可观察性有什么不同?
日志记录执行事件(API调用、延迟、错误)。可观察性工具监控系统健康。决策追踪捕捉推理的规范结构——哪些论点支持或反对决策,引用了哪些证据,以及哪些理由主导了结果。这是知道“贷款已批准”和知道“为什么这个贷款在信用评分担忧下被批准”的区别。
什么是决策包?
决策包是AIAgentree的核心文物:一个密封的、不可变的记录,包含命题(做出了什么决定)、论证树(优缺点推理)、证据快照(在决策时被冻结)、选择的理由(哪些论点支持了决策)和结果跟踪(之后发生了什么)。这是监管者或审计员理解和重放决策所需的一切。
决策追踪如何帮助满足欧盟AI法案的合规性?
欧盟AI法案第12-14条要求高风险AI系统维护日志,以允许决策的可追溯性。决策追踪通过捕捉结构化推理、证据来源、人类监督行为和结果记录来满足这些要求——以监管者可以实际查询和理解的格式。
AI治理中的三种信任模式是什么?
三种模式代表一种进展:模式1(人类在环中),代理协助但人类决定;模式2(人类在环上),代理决定并有人类监督;模式3(完全自主),代理决定并定期审计。模式之间的进展是基于证据的,受信心评分、先例一致性和结果跟踪驱动。
先例在决策追踪中如何运作?
当决策作为结构化文物被捕捉时,先例自动产生。可以通过类别、实体引用、论证标签或政策约束检索相似的过去决策。这些先例成为新决策中的一流论证节点——它们可以被引用、挑战或覆盖,就像任何其他理由一样。机构记忆随着每个决策而累积。
集成AIAgentree需要多长时间?
您可以通过三种方式连接:通过MCP作为代理原生工具(无SDK,无库),REST API(任何语言,零依赖),或Python/TypeScript SDK(大约十行,自动提取推理)。完整生命周期——创建追踪、记录推理、密封决策并立即拉回决策包——仅通过MCP工作,端到端,无需任何库。没有为期6个月的咨询项目;这是您添加到现有代理堆栈的基础设施层。
相关主题
相关文章
AIAgentree团队
AI治理
AIAgentree团队正在为AI代理构建决策追踪基础设施。我们的使命是使AI推理可见、可审计和可改进。
