任务规划
是否能把业务目标拆成可执行步骤,并明确每一步所需的知识、工具、系统和人工复核节点。
TIANGONG AGENT BENCHMARK
Agent 的价值不只看模型速度,而是看它能否把目标拆成步骤、调用正确工具、引用可信知识、接入业务系统,并在权限边界内完成可审计的流程闭环。
01 / 评测目标
销售讲解时可以把 Agent Benchmark 解释为“进入业务流程的验收表”。每个客户项目都应按业务任务、工具权限、知识来源、人工确认和审计留痕确定验收样本。
是否能把业务目标拆成可执行步骤,并明确每一步所需的知识、工具、系统和人工复核节点。
是否能按权限正确调用 OCR、知识库、数据库、报表、工单、CRM/OA/MES/ERP 等接口。
输出是否可追溯到企业私域知识、制度、指标口径或业务系统数据,并能展示引用来源。
02 / 验收清单
这里不填虚构指标,建议在项目 PoC 时用客户真实样本生成具体通过率、人工复核率、系统调用成功率和处置时长。
| 评测维度 | 验收问题 | 证据材料 | 适用场景 |
|---|---|---|---|
| 任务链完整性 | 是否能从用户意图到结果输出形成完整步骤链? | 任务轨迹、步骤日志、失败重试记录 | 智能分析、客服、合规问答 |
| 工具调用正确性 | 是否调用了正确系统,并且参数、权限、结果解析无误? | API 调用日志、权限校验记录、返回结果 | CRM、工单、报表、MES/OA |
| 知识可信度 | 回答是否引用当前有效资料,是否能识别冲突版本? | 知识来源、版本号、引用片段、冲突提示 | 制度问答、法律法规、指标规则 |
| 人机协作 | 关键动作是否进入人工确认或审批? | 审批记录、人工修改记录、最终提交日志 | 高风险操作、合规输出、客户服务升级 |
| 安全审计 | 是否能按用户、角色、时间和动作追溯全流程? | 审计日志、访问控制、导出归档记录 | 金融、政企、关键业务系统 |