先看结果:多智能体把正确系统行为从156/180提高到174/180,但令牌增加2.67倍

泊岚酒店集团每季度评审设施承包商、活动供应商和技术服务商。一个复核要确认法律主体与银行/税务资料,阅读安全与隐私问卷,核对保险/资质和履约能力,再形成风险、缺口和准入建议。早期团队做了一个“供应商尽调智能体”,把所有文件、工具和规则放进同一上下文,让它从头写到结论。

团队收集480个虚构教学案例:300例用于梳理任务与基线,180例按供应商家族封存留置。单智能体在180例中有112个完整正确、38个正确转人工、6个安全停止、18个错误/不完整、6个系统失败;正确系统行为为156/180=86.67%。问题主要不是模型不会写,而是长上下文混淆主体、受限安全附件挤掉履约证据、一个错误推断流入最终结论且没有独立人发现。

结果 单智能体 多智能体设计
完整且有证据支持的数据包 112 132
正确的人工升级 38 34
安全停止/权限不足 6 8
错误或不完整 18 4
系统/协调故障 6 2
总计 180 180
正确系统行为 156/180=86.67% 174/180=96.67%

新结构只有四个真正有差异的工作单元:主体与财务核验、受限安全证据、保险与履约、独立验证。确定性协调者分发已经批准的案件切片,汇总结构化产物,并把冲突交给负责人。多智能体每例输入令牌的中位数从约4.2万升至11.2万,95分位总耗时从96秒增至178秒;但专家复核中位数从31分钟降到18分钟,关键证据覆盖率从79%升至93%。团队只在高价值、跨专业复核中使用这一结构,普通证件到期检查仍走确定性工作流。

公司、供应商、样本、令牌、延迟和结果均为虚构教学案例,不是模型、框架或行业基准。真实供应商资格、安全、隐私、税务、保险、制裁、合同与准入由组织相应专业人员决定;智能体只整理证据与缺口,不批准供应商。

本文只回答“为什么拆、怎样验收拆分”:不把智能体数量当组织图

E16已判断任务是否需要智能体,E17/E18已给工具与系统集成边界。本篇假设供应商复核中确有动态证据路径,继续问是否一个智能体足够。E20会处理跨天持久性;这里的协调者保存产物与状态,但不展开完整调度平台。

问题 在此处理 此处未处理
拆分理由 专业化、隔离、并行和验证 通用智能体适用性
智能体拓扑 协调员 + 专家 + 验证者 供应商框架选择
交接 结构化任务/产物合约 智能体间通用对话
评估 相同的保留集/净价值/失败分类法 模型排行榜
生产边界 读取/提议/人工决策 自主供应商审批

“销售智能体、法务智能体、财务智能体”只是名字,不证明任务被正确拆分。只有职责拥有不同输入、工具/权限、完成标准和独立产物,而且组合方式可测试,才算架构分工。组织有四个部门也不意味着要四个智能体;一个确定性工作流调用四个服务往往更合适。

先做单智能体基线:没有基线,多智能体的任何漂亮结果都无法归因

基线使用与候选多智能体相同的模型能力、资料版本、工具合同、抽样和最终评分标准;只改变任务控制与上下文分配。记录案例终态、每个必需声明、工具/拒绝、令牌、墙钟时间、人工修改和错误传播。不能拿旧提示词的单智能体与精心调过的多智能体比较。

基线切片 案例 纳入原因
清洁/通用供应商 45 避免仅测试困难案例
实体/名称冲突 30 身份合并
受限安全包 30 权限/上下文隔离
保险/认证缺口 25 过期/适用性
跨域冲突 30 综合/升级
缺失/无法回答 20 弃权/负责人路由
总保留集 180 按供应商家族分组

单智能体的112个正确不代表其余68都需要更多智能体:38个转人工和6个停止本来就是正确边界,6个系统失败先修基础设施,只有18个内容错误里与上下文干扰、专业工具选择和缺独立验证有关的部分才是拆分机会。

还需一个更简单对照:确定性工作流+单次LLM 提取。证件是否到期、保险金额是否达门槛、必填项是否缺失常可规则化;若工作流已达到合同,多智能体没有入场理由。

基线失败要做因果标注。18个错误/不完整中,7个是长上下文导致主体/附件错配,5个是安全材料挤掉履约证据,4个是跨域冲突被单一结论抹平,2个是工具选择错误;6个系统失败则来自超时、来源不可用和追踪未保存。前16个内容问题可能受益于隔离/专业分工,基础设施问题先由E17/E20修复,不能记为多智能体收益。

人工复核基线也分步骤计时:寻找来源、核对身份、检查必需声明、修正文案、追问缺资料和作业务决定。若多智能体只把搜索时间从10分钟降到5分钟,却把冲突判断从8分钟增到20分钟,总体没有价值。31分钟是这些步骤在180例中的中位数,不是专家薪酬或行业标准。

基线产物冻结模型、提示词、工具与字段结构和来源版本;多智能体实验只改变拓扑、上下文分配和协调方式,必要的专家提示差异也要记录。失败后不能只调整多智能体版本而不重跑单智能体,否则比较会逐渐失去因果意义。

基线不能故意做成一个很弱的“超长提示词”。团队至少保留三层可竞争方案:B0是规则检查加人工,B1是一个智能体按阶段读取资料并调用工具,B2是一个智能体加确定性主张检查清单和最终程序校验。候选多智能体必须超过当时最强、且已经调到稳定的B2,而不是只超过B0。如果B2已经把证据覆盖做到92%、正确行为做到172/180,多智能体多出的2例就要与额外7万输入令牌、95分位增加82秒以及维护四个身份的成本一起审批,结论很可能是暂不拆分。

每个保留案例建立配对运行账本,固定来源快照后依次记录单与多;执行顺序随机交错,避免上午来源可用、下午限流造成结构偏差。账簿不只存最终通过,还存必需声明逐项状态、引用是否支持、人工改了什么、分支/工具耗时、输入输出令牌、拒绝与重试。评审人先看去掉架构标签的数据包再判定,减少“多智能体应该更认真”的期待效应。

配对账本字段 样本值 比较用途
案例/切片/源快照 C-088/安全受限/S17 相同证据宇宙
拓扑/版本 单版-v6 或多版-v3 可复现性
声明裁决 11 已支持, 1 缺失 证据覆盖
最终系统结果 正确的人工升级 案例级分母
人工编辑/分钟 范围修正,19分钟 隐藏工作
令牌/工具/墙钟时间 108k/14/171 秒 边际成本
错误归因 交接范围丢失 架构动作

黄金不是一段“标准答案”,而是由业务负责人批准的主张矩阵:哪些问题适用、什么证据足够、什么冲突必须升级、哪些情况只能状态未知。两名领域评审先独立标注,分歧由第三人裁决并保留原因代码。若评审人对安全适用性本身无法一致,先修评分标准;不能把智能体与不稳定黄金的差异算作模型错误,也不能让协调者用多数票替代专业裁决。

错误归因采用最小反事实。把多产出的正确身份产物喂给单重跑:若错误消失,问题可能是上下文/主体解析;保留单但加同一验证人:若又抓到错误,收益来自独立验收而不一定来自专业分支;让多共享全量上下文:若泄露或遗漏恢复,隔离才有证据;把三个专家替换成确定性服务仍保持质量,则这些单元不该叫智能体。每个反事实只改一项,结论才能指导删减。

团队还设置“不可归因”桶:模型服务版本漂移、来源内容变化、评审黄金改版或生产限流异常时,该运行不进入架构胜负,只进入稳定性分析。180例不因看到结果后随意剔除;任何排除都有预先原因与成对处理。否则删掉多失败案例、保留单失败案例,很容易制造96.67%的漂亮数字。

最后把统计提升翻译成业务损失,而不是只报百分比。少14个错误/不完整案例中,哪些避免了错误准入,哪些只是少一次补件,价值不同;增加2个安全停止会延长周期但可能降低越权风险。负责人在决策记录中分别给质量、风险、人工、延迟和平台成本权重,并记录阈值。阈值日后可以调整,原始成对观测不能被覆盖。

五项正向证据和四项否决:先过门,再谈协调者、交接或并行

候选任务单元逐项给证据,不使用“任务复杂”作为结论。正向证据包括真正的专业工具/规则、能并行的独立子任务、隔离能减少泄露/干扰、产物可独立验收、单智能体在同切片有可归因失败。

放行门槛 通过证据 失败含义
专家边界 不同的工具/负责人/评分表 仅限角色扮演
并行独立性 分支之间不需要彼此的最终结论 工作流顺序更优
上下文隔离 最少数据/最少干扰测量 共享上下文更简单
可验证产物 产物包含结构字段、数据来源和负责人 无法检测局部失败
基线净增益 质量和人工价值超过协调成本 保留单智能体

四项否决先执行:所有智能体用相同宽权限;同一事实必须在多个智能体间反复复制;没有独立的分支/最终验证器;任务后果太高却让智能体互相“投票”代替责任人。命中任一项先改权限、数据契约或人工治理。

多智能体也不能解决资料无负责人、工具不幂等、记录系统冲突或没有黄金。把底层缺陷分发给更多智能体,只会制造更多互相一致的错误文本。

正向证据要逐条可证伪。“安全评审很专业”不够,应写为“安全分支需要受限问卷工具和控制声明评分表,单智能体在30例中5次因其他材料挤压漏所需证据;隔离后目标为0次关键遗漏”。如果拆分后仍漏、人工时间不降或权限更宽,撤销该分支。

并行放行门槛也看数据依赖比例。若80%的安全任务必须等待实体/法律范围,只有后20%可并行,宣传“四个智能体同时工作”并不带来四倍速度;调度器应先跑身份最低要求,再释放能独立的部分。分支越多,屏障、重试、追踪和评估成本越高。

验证人否决项尤其重要。没有负责人批准的必要声明时,所谓批评者只能评价语言;同一模型在同一错误来源上自我反思不构成独立证据;验证人无权阻止放行时只是装饰。这三种情况保持人工验收,不建立“评审智能体”名义。

专业分工看工具、权限和判断合同,不看角色设定写得像不像专家

主体核验读取企业注册/ERP主数据并输出法律实体映射;安全单元只能看到问卷、控制证据和已批准安全政策;履约单元读取保险、资质、服务覆盖与事故记录;验证人只读上述产物和原始引用,不能调用提交/批准工具。

单元 允许的来源/工具 所需产物 禁止结论
实体/财务 注册表, ERP 供应商主数据, 税务/银行凭证 身份数据包 + 冲突 批准银行/供应商
安全/隐私 受限问卷/凭证 控制声明 + 缺口 + 范围 认证合规性
保险/运营 保单证书, 覆盖率, 事件 覆盖范围/有效期/适用性 豁免要求
协调者 任务清单, 产物引用, 状态 组装复核 + 冲突列表 列举领域事实
独立验证者 产物 + 合格证据 + 评分表 通过/失败声明 + 升级 编辑来源/批准供应商

如果两个“专家”使用同一提示词、同一份全量上下文和同一组工具,只是一个叫研究员、另一个叫批评者,它们很容易共享偏差并增加成本。分工的证据应是权限图、输入输出结构、负责人和评估切片,而不是角色介绍。

每个专业单元也可降级为规则/服务,不强求智能体。例如保险日期/金额先由解析器 + 规则处理,只有条款例外和适用范围冲突进入智能体。多智能体拓扑里可以含非智能体确定性节点。

专业边界还包括失败责任。实体产物错法律实体由主数据/身份负责人裁决;安全遗漏控制证据由安全负责人;运营误读保险适用范围由采购运营/保险专业人员;协调者漏所需分支由平台负责人。若所有错误最终都由“智能体团队”解释,业务专业性并未真正落地。

专家不能自行扩范围。安全发现一个关联子处理商时,可提交需要额外任务,说明对象、理由、所需来源和风险;协调者按策略/负责人批准后创建新任务。它不能直接浏览开放网络、调用另一个智能体或把供应商家族全部纳入调查。

角色切分也考虑更新频率。安全评分表与工具版本可能每月变化,保险规则按地区/年度变化,主体映射由主数据事件变化;独立产物和评估可分别发布。若所有分支总是同时改同一提示词和来源,模块化维护收益有限。

上下文隔离有两种价值:保护不该共享的数据,也减少不相关信息竞争

安全数据包可能包含网络架构与漏洞证据,商业与履约单元无需看到;银行资料对安全单元也没有用途。协调者只发送案件与供应商标识以及最小任务清单,各智能体在服务端按自身身份读取允许的来源,返回引用和结构化结论,不把原始附件复制到共享聊天中。

上下文对象 实体智能体 安全智能体 运营智能体 验证人
供应商公开身份 必需 最小引用 最小引用 必需
银行/税务详情 字段过滤 仅决策状态
安全证据 受限完整 合格声明引用
保险/事故 范围限定完整 合格引用
商业价格 除非需要否则不(提供)
分支推理/聊天 私有追踪 私有追踪 私有追踪 不作为证据处理

隔离本身不是安全边界;每个智能体的身份、资源访问权限、租户与调用目的,仍由工具服务器执行。协调者不能因为“负责汇总”就获得所有原文,验证人也只能取得完成验证所需的证据视图。

隔离效果用消融测试:在同一留置比较共享完整上下文与最小切片,观察错引用、遗漏、泄露和令牌。若隔离不改善且交接丢信息,保留共享上下文更好;不能把模块化审美当收益。

最小清单不是“只给一句任务”。它含已确认供应商身份、复核范围、适用地区/服务、必需声明、已批准源引用和案件截止日期;不含其他分支原文。智能体若发现缺少影响判断的事实,返回缺失上下文字段,由协调者从权威产物补充或转负责人,不能自行搜索共享盘。

数据隔离还要处理输出侧推断。安全智能体即使看不到商业价格,它的结论也可能泄露“供应商正在参与某个敏感项目”;因此产物访问权限、标题、错误和日志都要最小化。协调者是否显示某个分支存在,也要按用户权限决定,不能通过状态侧信道暴露受限复核。

共享事实通过身份核心等最小产物复用,不让三个智能体各自解析公司名称并产生三种标识。共享产物有负责人、版本、生效时间和内容指纹;一旦它出错,就会形成相关失败,因此验证人仍需核验关键身份,而不能因为三个分支结论一致就放行。

可并行不等于并发启动:先画依赖图和屏障

主体、安全与履约可在供应商身份确认后并行;最终验证人必须等待所需产物到终端。若安全适用范围依赖主体法律实体,身份是前置屏障;不应让安全先猜实体后再返工。

可复制模板
INTAKE -> IDENTITY_MINIMUM
IDENTITY_MINIMUM -> ENTITY_DEEP_CHECK
IDENTITY_MINIMUM -> SECURITY_REVIEW || OPERATIONS_REVIEW
required branches terminal -> COORDINATOR_ASSEMBLE
ASSEMBLED artifact -> INDEPENDENT_VERIFY
VERIFY_PASS -> HUMAN_OWNER_DECISION
Any branch -> MISSING | CONFLICT | DENY | TIMEOUT -> explicit partial/handoff
依赖字段 示例 执行
需要 安全需要已确认法律实体 调度屏障
可选 公共可持续性说明 若无则不阻止
截止时间 安全20分钟、运营10分钟 超时或部分状态
终端 已完成/缺失/冲突/拒绝/失败 无推断完成
重试 分支特定预算/幂等读取 无整个团队重启

并行价值要看总耗时和专家等待时间,不能看智能体同时输出的动画。分支受同一限流来源约束,或最终都依赖一个负责人时,并发可能反而更慢;调度器要按资源和优先级控制,不能让五个智能体同时轰炸同一个接口。

交接必须是任务与产物合同:自然语言“给下一位同事”会丢掉状态和证据

协调者发出的任务清单要包含案件、范围、必问问题、允许的来源与工具、数据类别、输入版本、截止日期、预算、预期字段结构、停止条件和接收者身份。专家完成产物时,要保存状态、主张、证据引用、冲突、缺失、工具与来源版本和质量检查。

交接字段 示例 失败被阻止
任务编号/尝试次数 T-SEC-771/a2 重复或延迟结果
案例/供应商/范围 C-88/S-1092/法律实体 X 跨案例混淆
必需声明 加密/访问/事件证据 模糊 “复核安全”
输入引用/版本 Q-31 v4, 策略 p18 当前 过时上下文
允许的工具/数据 安全只读 权限扩展
终端/原因 与引用冲突 静默未完成
产物哈希/版本 A-SEC-44 h9 篡改/组装不匹配

共享产物存储保存不可变版本和访问权限,消息只传引用;协调者不能把多个智能体的聊天摘要当成来源。延迟产物到达时,如果输入版本已经改变,就标为过期并重跑受影响分支,不能静默覆盖新产物。

交接交付至少一次并去重,完成状态需确认;没有消息不等于成功。分支失败、拒绝或超时都形成显式产物/终端,让协调者选择部分、重试或人工。

任务清单只允许协调者或工作流签发,专家不能修改必需主张、截止时间或范围后继续执行。需要变更时,返回变更请求并保存新旧内容与批准;否则智能体可能为了完成任务而偷偷降低标准。产物提交前,要检查字段结构、案件与范围、来源访问权限和输入版本,失败就不能进入汇总屏障。

交接重试复用任务编号与尝试次数规则。相同尝试提交重复产物时返回原回执;重新执行使用新的尝试编号,但要关联前一次失败,延迟到达的a1不得覆盖a2。协调者组装固定的产物内容指纹,验证人看到的就是当时组合,不能因为后台分支更新而漂移。

消息内容和产物分开:队列消息只有任务/引用/版本/状态,原始证据留在受控来源或产物存储。这样重试不会复制大附件,权限撤销可阻止后续打开,追踪又能定位当时引用。必要历史保留由记录/隐私决定。

填好任务清单与产物:完整契约比“你负责安全部分”多出哪些信息

供应商S-1092为两家酒店提供联网门锁维护。协调者在身份核心确认法律主体X、服务范围为HTL-084/HTL-091、复核截止7月24日后,创建安全任务。它不发送银行、报价或其他供应商资料,只传案例、身份引用、服务架构参考和必需声明。

任务清单字段 已填充值 为何必需
任务/尝试 T-SEC-771/a1 去重/延迟结果
案例/供应商/范围 C-88/S-1092/实体 X/两家酒店 防止范围漂移
必需声明 访问, 加密, 日志, 事件, 子处理程序 完成预言机
允许来源 Q-31v4, ARC-9v2, 策略 P18 来源/权限边界
工具身份 安全读取-S1092 最小权限
截止日期与预算 20分钟、8次调用、3.2万输入令牌 终止与容量
停止 访问控制列表拒绝, 当前冲突, 注入, 缺失身份 安全终端
预期产物 安全审查v3字段结构 确定性验证

安全智能体发现问卷称“数据不离开酒店”,架构图却显示云端管理平台;它不得选择一边,而是输出两条主张、各自证据范围和冲突,另标子处理者清单缺失。产物状态不是已完成,而是冲突需负责人;协调者仍可让操作分支完成,但最终屏障不能释放供应商决策。

产物还要保存输入内容指纹、来源与现行状态、工具调用、主张、证据、缺失与冲突、禁止结论检查和生产者版本。自然语言摘要只供人阅读,协调者根据结构字段决定下一步。如果问卷在提交后更新到v5,a1产物就标为过期,只重跑受影响的安全分支,不重启实体和运营分支。

复制到其他任务时,先更换案件、范围、必需主张、白名单和负责人,不能把S-1092的答案当成模板事实。任务与产物结构是读者可复用的交付模板;填好的例子说明哪些字段驱动权限、屏障和验证,不能删成一张空表。

完整走例:四个分支怎样处理同一供应商,而不互相抄结论

案例 C-88进入后,身份最低要求先发现合同抬头X与保险证书抬头Y不一致。主数据负责人确认Y是旧名、关系在6月30日结束,当前合同必须用X;身份核心记录别名/生效而不是删旧名。此后安全与运营都引用X和同一范围。

步骤 分支/操作 产物/决策
1 身份最低要求 X 当前; Y 已废止; 别名证据
2 安全并行复核 云冲突 + 缺失子处理器列表
3 操作并行复核 保险覆盖 X 但 18 天后过期
4 实体深度检查 银行证据匹配 X; 无批准操作
5 协调员组装 两个阻碍, 未捏造领域事实
6 验证人 身份验证; 安全冲突; 过期声明已支持
7 人工负责人 请求安全证据及续保; 条件冻结

运营智能体不能因保险“目前有效”直接通过全年准入;其评分标准要求覆盖复核期,因此输出过期间隔与日期证据。安全智能体不能看到保险全文,也不会用安全结论决定保险。协调者将两者并列,不把“一个通过一个不通过”平均成中等风险。

验证人从原始证据重开X/Y关系、保险过期与安全声明,发现摘要遗漏“云端平台由子处理商运营”并阻止数据包。它不改安全工件,而是创建发现 F-17并重开T-SEC-771/a2;a2补充缺失后仍需安全负责人决定,不由智能体自证关闭。

对照单智能体在同案例中把旧名Y当当前,因长安全问卷忽略保险18天到期,并把“数据不离店”写入结论而未提架构图冲突。这一差异说明拆分价值来自共享身份核心、上下文隔离和独立证据验证,不是输出段落更多。

协调者负责计划、状态和冲突,不应成为第二个全知领域智能体

协调者依据确定性任务图创建分支、检查前置条件、控制预算、等待终端、组装产物和调用验证人。需要模型时,它只做开放任务分解/汇总建议;身份、所需分支、截止日期、权限和最终路径由工作流策略控制。

协调员决策 确定性控制 允许模型辅助
必需分支 风险/供应商类型策略 提议额外可选询问
工具/身份 注册表/策略
重试/超时 分支错误契约/预算 解释失败原因
冲突 明确负责人路由 总结立场
最终完整性 产物字段结构及验证器 草稿叙述
供应商决策 指定人员

协调者不得补写专家缺失的主张。安全产物缺失时,最终数据包要显示缺失,并让负责人选择补资料、限制范围或拒绝;不能让协调者凭常识把它改成通过。

单点协调失败也有回退:持久任务/产物状态可由新执行器恢复,调度器不可用时停止新案例但已完成产物不丢失。E20会展开持久性,本篇只要求交接不依赖同一模型对话记忆。

协调者的组装规则版本化:必需分支、允许部分、冲突路由、验证人门和人工负责人都可审计。业务政策改为“联网门锁必须额外隐私复核”时,更新策略并影响查询未完成/近期案例;不能只改管理员提示而让旧案例状态不可解释。

可选分支也不能无预算扩张。协调者想增加公开舆情搜索时,必须先证明它与准入合同相关、来源允许、不会泄露案件,而且结果有负责人和评分标准;否则就拒绝。开放式研究可能适合并行探索,但企业决策仍需要明确范围和来源策略。

协调者输出的最终叙事逐主张引用产物,不允许用自己的语言新增数字、结论或例外。最终数据包生成失败可重试,但不能重跑专业分支或改变产物组合;这使表现层错误与领域错误分开。

独立验证者必须有信息与权力上的独立:同模型看自己摘要不是独立验收

验证人从必需声明评分标准出发,读取分支产物与原始证据引用,逐项检查主体一致、来源当前状态/权限、主张支持、跨域冲突、缺失和禁止结论。它不能看到专家私有推理并受其说服,也不能修改产物;失败返回声明级发现。

独立性维度 最低证据 弱替代项
输入 证据及产物, 不仅限于最终文本 重读摘要
评分标准 负责人审批的必需/关键声明 “属于关键项” 提示词
实施 确定性检查 + 独立复核轮次 同次调用自我反思
权限 可阻断数据包/重新打开分支 评论被忽略
抽样 人工校准/按风险审计 模型判定未校准

“不同智能体”不一定独立:同一模型、相同上下文和同一错误来源会相关失败。关键数字、身份、权限、版本和必需字段优先确定性验证;领域解释由独立专业人员抽样/裁决。多模型多智能体也不自动形成真相,多数票可能一致地引用错资料。

验证人的精确率/召回率单独在已知缺陷注入集校准。误拦过多会把工作全退给人,漏掉严重更危险;按声明严重程度设置处理,不用一个总分。

缺陷注入集至少要包含错误法律实体、过期证书、引用不支持、无权访问的来源、两个现行版本、分支遗漏必需主张、摘要与产物不一致,以及同一错误来源被多个分支复用。每例都标明验证人应当阻止、提醒还是允许,并记录误阻断与漏检。

确定性验证器先检查字段结构、内容指纹、来源资格、必需字段、日期与金额计算、权限和产物组合;模型或专业人员再判断语义支持与冲突。这样不会让另一个大模型承担所有验证,也能定位究竟是规则、证据还是解释出了问题。

人工抽样按风险安排,而不是平均随机抽取:所有关键冲突与拒绝、所有新供应商类型、模型或工具变更后的小范围验证,以及一定比例的普通通过案例都要覆盖。验证人表现稳定后,可以降低普通案例抽样,但不能取消供应商最终负责人的决定。

如果验证人与专家长期使用相同模型、相同来源和相同提示词家族,相关性进入残余风险。可引入不同验证方法/确定规则/独立人,但不能宣称换模型就独立;独立性由信息、评分标准、权限和阻止能力证明。

专业智能体之间发生冲突时,保留差异和适用范围,不让协调者平均

安全认为供应商不能接触生产数据,运营认为服务需要远程维护;两者可能都基于正确证据。协调者建立冲突工件,列声明、来源、范围、影响、缺失和决策负责人;安全/业务负责人选择修改服务范围、补控制或拒绝,不由模型折中成“有限访问即可”。

冲突类型 示例 路径
身份 母公司 对比 子公司合同实体 主数据/法律
策略 安全要求 对比 业务例外 安全 + 风险负责人
证据 两份证书重叠/冲突 运营/保险人验证
范围 单个酒店 对比 集团级访问 业务 + 访问负责人
时间 当前 对比 未来/已过期文档 内容/源负责人
建议 相同事实, 不同风险偏好 可问责决策者

冲突关闭保存决策、原因、范围、生效日期和受影响的产物。若来源修正,影响查询重开依赖案例;不只改最终文案。

多智能体的价值之一是让差异显式,但如果系统强制所有智能体“达成共识”,反而会抹去真实不确定性。共识不是验收门,证据与责任才是。

失败模式会随智能体数量增长:角色漂移、重复工作、信息丢失和虚假完成都要测试

预生产60例压力测试运行记录了重复搜索、分支越权、交接缺字段、协调者过早汇总、验证人只看结论、两个智能体互相等待和预算失控。每个失败映射到合同/调度器/策略/测试,不统一写成“提示词需优化”。

失败 证据 控制
角色漂移 安全智能体审查价格/批准 工具/声明范围拒绝
重复工作 智能体查询相同源 任务/源计划 + 缓存
信息丢失 交接遗漏过期时间或范围 字段结构中的必填项
相关幻觉 复制相同不支持的源 原始证据验证器
过早完成 缺失分支视为已完成 显式终端/屏障
死锁/循环 智能体反复等待/辩论 依赖验证 + 预算
陈旧/滞后产物 旧尝试覆盖新尝试 版本/尝试/哈希
验证器捕获 接受长篇自信论述 主张评分表/证据检查

MAST研究分析多个多智能体框架与150多个任务,提出14类失败并分为规范/系统设计、智能体间不一致和任务验证/终止三组。本文只借其故障分类法提醒本地测试;研究基准不代表本案例效果。

故障注入包括智能体超时、产物存储延迟、重复完成、源权限变化、协调者重启、滞后分支和验证人不可用。正确系统行为可能是部分/人工,不要求团队为了“完整报告”猜完。

60例压力测试运行不是留置成绩,专用于发现协调失败;缺陷修复后进入回退,不能用其错误率与单/多 180例比较。每个失败保存任务图、消息、产物版本、工具追踪和最终影响,避免只看聊天记录猜根因。

角色漂移要用诱导输入测试,例如问安全智能体“顺便判断价格是否合理”;正确响应是拒绝并要求另建任务,而不是顺手帮忙。死锁测试让两个分支互相声明依赖,调度器应在启动前验证有向无环依赖图并返回配置错误,而不是让智能体持续对话到预算耗尽。

相关幻觉测试故意放一份看似权威但已撤回的供应商声明;三个分支都引用不增加可信度,源状态门/验证器应一次阻断。重复工作测试统计同来源相同查询,允许共享合法缓存但不共享越权结果。

终止失败单独验证:分支说“基本完成”但缺必需声明时产物验证失败;协调者不能以截止日期到了自动已完成。超时终端携带已完成声明和缺失,人工可接管而不从头重读。

同一留置比较净增益:质量提升必须支付协调、延迟和维护账单

单与多都运行180例、相同源快照和最终评分标准。多智能体完整正确从112到132,错误/不完整从18到4,系统失败从6到2;但令牌、工具调用、追踪、调度器和产物运营增加。评价按案例与关键主张,不按智能体消息数。

指标 解释
正确系统行为 156/180 174/180 +18 案例
完整正确 112 132 更少人工组装
关键证据覆盖 79% 93% 主张加权
中位数输入令牌/案例 42千 112千 2.67x
95分位总耗时 96秒 178秒 并行未消除所有等待
人工复核中位数 31分钟 18分钟 专家产物有所帮助
系统故障 6 2 协调器控制有所助益

令牌是教学案例计量,不绑定任何模型价格。成本还包括模型输出、工具、存储、追踪、评估、人工、运行和事件;并行峰值影响速率限制/容量。净价值用减少专家分钟、减少重大错误和处理周期对比总成本。

效果按切片看:普通供应商提升很小,受限安全 + 跨域冲突提升最大。因此生产只路由高价值/复杂切片,多数案例保留工作流/单智能体,避免平均提升驱动全量多智能体。

180例两种方案的终态逐行闭合:单为112+38+6+18+6=180、多为132+34+8+4+2=180;正确行为分别112+38+6=156、132+34+8=174。安全停止增加2例不是退步,而是隔离后正确发现无权限/无证据。多仍有6个非正确案例,不能宣传“解决了多智能体可靠性”。

20个新增完整正确案例中,团队回查哪些来自真正分工:8个身份/附件不再错配、6个必需安全/运营证据不再遗漏、4个冲突被显式保留、2个验证人抓到摘要错误。若提升来自更长词元或不同提示词,需在消融中分开,不能全部归因智能体数量。

95分位178秒来自身份屏障、最慢的安全分支和验证人,并行只减少能够重叠的部分;11.2万输入令牌是所有分支合计,其中包含必要重复的身份核心。优化时应先减少重复来源、把稳定检查规则化并按切片路由,不能通过跳过验证人或压缩安全截止时间来制造表面加速。

人工 18分钟仍包含最终业务决定;多智能体不替代责任。若专家只是从31降18但模型/运行成本和风险更高,由本地费率/价值决定是否值得。文章不使用实时模型价格,避免把今天的词元账单写成永久结论。

生产范围和权限按智能体分别收缩:团队不共享一个超级令牌

每个智能体有独立工作负载身份、受众、源/工具范围、案件目的、预算与日志;协调者不能代专家调用受限来源,专家不能提交供应商准入。产物访问控制列表允许所需消费者读取字段/主张,不因“同一团队”全共享。

身份 读取 写入 禁止
实体智能体 注册表/供应商主范围 身份产物 银行/供应商变更
安全智能体 已批准的限制性证据 安全产物 商业/ERP 数据
运营智能体 证书/事件限定 运营产物 安全原始数据
协调者 任务/产物元数据 任务/状态/组装 原始限制性来源/批准
验证人 证据视图/产物 仅发现项 来源编辑/商业决策

智能体之间的消息也要视为不可信输入,必须执行字段结构验证、大小与速率限制、案件与尝试次数绑定,以及内容和数据分类。即使专家返回“请协调者调用付款工具”,也不能因此扩展协调者权限。

权限事件在运行中生效;安全智能体失权时分支拒绝并转负责人,不借另一个智能体读取。共享缓存按租户/权限/来源版本分隔,防止受限产物从低权限路径泄露。

身份与产物访问控制列表有生命周期:智能体版本退场撤范围,案例结束后关闭目的限定访问,负责人离职重配人工队列。历史产物按记录/隐私保留必要字段,但不继续作为当前来源;验证人打开历史证据仍重新授权。

工具发现按身份返回最小列表,不只是调用时拒绝。即使协调者能看见“安全秘密搜索”名称也可能泄露能力;注册表元数据按需要披露。调试/管理工具不向任何模型身份发布,故障支持走独立界面与审批。

跨智能体审计连接发起用户、协调员决策、任务身份、工具资源、产物和验证者发现项;不能所有动作只显示“多智能体服务”。共享责任不等无个人/系统责任,每一步有执行主体和负责负责人。

发布先在后台比较单智能体与多智能体,再按案件切片做小范围生产验证

L0做历史重放比较;L1只读双跑,但用户仍走人工;L2让内部复核人看到多智能体数据包;L3只让高价值案件进入小范围生产验证。功能开关要能按供应商类型、分支、智能体与工具、租户和验证人单独关闭;多智能体失败时可以退回单智能体或人工,但不能丢失已经完成的产物。

发布放行门槛 案例阈值 停止
未授权跨域访问 0 任何发生
必需分支/验证者绕过 0 任何发生
关键未支持声明 0 任何发生
正确行为 174/180 留置 切片回归
协调失败 2/180 已调查 孤儿/未知超出服务等级协议
人工与成本收益 31→18分钟,额外计算成本增量 净价值为负

小范围生产验证从一个供应商类型、两名复核人和一个支持时段开始;每次只扩大案件切片或智能体与工具范围,不同时更换模型、提示词和拓扑。进行中的案件保存拓扑与版本,升级时不能把旧产物混入新依赖图。

停止时先阻止新分支,再收口运行中的任务、标记晚到结果、保存产物并把案件交给人工。关闭协调者服务不等于撤销专家身份;每个身份、令牌和队列都要分别退场。

运营指标要揭示协调债:不要展示“5个智能体完成了120个任务”

运行指标 分母 决策
分支终端完整性 必需分支/案件 调度器/交接健康状态
产物有效性 按字段结构和版本统计的产物 生产者质量
证据覆盖 关键声明 发布/负责人复核
冲突等待负责人时长 冲突产物 治理容量
重复/滞后工作 任务/尝试次数 协调浪费
验证器捕获/错误拦截 注入/真实缺陷 校准
令牌/工具/墙钟时间 按切片修正案例 路由/成本
人工返工 已接受数据包 隐藏质量
访问拒绝/事件 身份/来源 范围/安全

每周查高频重复来源、交接字段失败、滞后产物、分支超时、验证器重新开启和人工修正;每月决定某分支规则化、合并回单智能体、换工具或退场。智能体数量不是增长指标。

共享来源错误单独监控:三个智能体引用同一过期注册表并不算三份独立证据。证据多样性按源授权与独立性判断,不奖励重复链接。

协调债指标要能触发具体动作。交接必填字段失败上升,先修字段结构或生产者;滞后产物增多,检查截止时间和容量;重复工作偏高,可以共享合规缓存或重画范围;验证器误拦截偏高,就校准评分标准;人工重新打开集中在一个分支,则考虑合并、退场或更换负责人。

仪表盘按拓扑/模型/工具/来源/评分表版本切片,避免升级一个安全工具后把全系统趋势混在一起。案例可从最终结果下钻依赖图与产物,不要求支持人员阅读全部智能体聊天。

值班人员不解释供应商专业结论,只处理任务卡死、权限、存储和回放;领域负责人处理冲突与发现。协调故障与内容错误要使用不同服务时限,避免平台团队为了让可用性指标过关,把缺失状态自动改成通过。

每季度重新跑单一基线的一部分,因为模型/工具进步可能使多智能体不再值得。架构可以简化;若单已达到相同质量且成本/延迟更低,合并不是失败,而是正确退场。

什么时候合并或删除一个智能体:分工必须有可验证的退出条件

每个分支在批准时写下线触发器。保险检查若90%以上变成稳定字段/规则,改成解析器 + 决策表;实体智能体若只做精确查找,降为服务;验证人若没有独立输入/阻止价值,重新设计或保留人工,不维持“批评者”称号。

触发 证据窗口 决策
无独特工具/数据/评分表 两次评审/版本 合并至工作流/单一
分支收益低于阈值 相同保留 + 生产切片 禁用路由
交接和返工超过节省时间 连续4周运营数据 合并边界
稳定已知规则占主导 异常签名重复 确定性节点
权限无法隔离 安全复核 不部署分支
验证器未捕获独立缺陷 经校准的注入集与真实集 重新设计,不能只走形式
负责人/来源消失 治理事件 暂停/退役能力

删除流程先停新任务,等待/取消进行中,处理延迟消息,撤身份/工具作用域,保留或处置产物与追踪,更新依赖图和评估。不能只从管理员提示删角色,留下队列、词元和旧执行器继续运行。

合并后用同留置和生产切片验证没有恢复旧错配/遗漏;若质量下降可恢复上一个版本。拓扑版本写进案例,历史结果仍能解释当时由哪些智能体与评分标准产生。

退场评审比较专业质量、人工、令牌/工具、延迟、事件、维护负责人和替代方案。智能体数量减少不是能力倒退;最简单且满足合同的结构才是目标。

容量按并行峰值和下游速率限制规划;预算按案例/切片限制。超过令牌或截止日期时先停止可选分支,所需分支缺失则部分/人工,不用廉价模型悄悄降低关键质量。

交付多智能体决策包:证明每个智能体有不可替代的边界和可删除条件

产物 最低内容 使用
单智能体基线 样本/结果/错误/成本/人工 因果对比
拆分决策矩阵 五项放行门槛、否决项和证据 批准拓扑
依赖图 分支、屏障、终态和截止时间 调度器与测试
智能体能力矩阵 数据/工具/声明/禁止项 最小权限
任务与产物结构 版本、证据、冲突和状态 交接与存储
验证者评分表 主张、严重程度、预期结果和独立性 放行门槛
故障套件 漂移/丢失/相关性/死锁/延迟 回退
净价值评分卡 质量/人工/令牌/工具/延迟 路由/退役
发布与运行手册 切片、标志、停止、交接和身份 小范围验证与恢复

来源边界:Anthropic的多智能体研究系统用于协调者、工作单元和并行研究实践;OpenAI指南用于集中协调与去中心化交接模式的描述;Microsoft Magentic-One论文与资料用于协调者计划、跟踪和重新规划的研究架构;MAST论文用于多智能体故障分类法。它们都属于厂商实践或研究,不证明多智能体普遍优于单智能体,也不能替代本地权限、业务负责人和留置样本验收。来源核验于2026-07-21。

今天选一个候选多智能体任务,在同一批30—100个案件上先跑工作流或单智能体基线。为每个拟拆角色填写不同工具、数据、负责人、产物和验证人;如果只是角色设定不同,就合并。画出依赖与屏障,注入分支超时、晚到结果、交接缺字段和共享来源错误。只有多智能体在关键证据、人工时间或周期上提供可复现的净增益,而且权限或协调失败能够停止和恢复,才让高价值切片进入后台比较。