06 · 评测、治理与生产采纳
1. 指标树
单一“准确率”无法代表 FDE 项目。建议使用六层指标:
| 层 | 示例 |
|---|---|
| 业务结果 | 收入、损失避免、质量、风险、库存、周期、客户体验 |
| 流程影响 | 等待、返工、交接、处理时长、专家瓶颈、覆盖率 |
| 采纳 | 激活、周活、任务渗透、建议采纳、人工接管、复用 |
| 任务质量 | 完成率、事实性、召回、工具成功、专家通过、失败分布 |
| 生产运行 | 可用性、P95 时延、成本、超时、回滚、告警、恢复时间 |
| 治理安全 | 越权、数据泄露、注入、审计缺口、高风险误动作、合规事件 |
每个指标必须有:Owner、定义、数据源、基线、目标、时间窗、分母、证据和决策阈值。
2. Eval 三层
官网课程将评测分为“功能、质量、业务”,并要求黄金样本、失败分类、红队和 PRR。[S6]
2.1 离线评测
- 数据集来自真实任务,并做脱敏和版本控制。
- 覆盖常见、长尾、异常、高风险和对抗样本。
- 同时测组件和端到端任务。
- 预先确定阈值,不看完结果再改标准。
2.2 生产前评测
- 权限、审批、越权和数据用途测试。
- 超时、依赖不可用、重复调用、并发和幂等测试。
- 人工确认、升级、接管和回滚演练。
- 监控、告警、日志、审计和 Runbook 验证。
2.3 在线运营评测
- 灰度、对照或分阶段上线。
- 持续记录输入、上下文、模型/提示版本、工具调用、人工决定和最终结果。
- 将线上失败回流为 Eval 样本。
- 用 Go/Adjust/Stop 机制决定扩展,不以日活增长自动代表价值。
3. Failure Taxonomy
建议至少分类:
- 需求/任务定义错误。
- 上下文缺失或过期。
- 检索召回/排序错误。
- 推理或事实错误。
- 输出格式/Schema 错误。
- 工具选择或参数错误。
- 外部系统/网络错误。
- 权限、用途或审批错误。
- 人机责任/异常升级错误。
- 流程设计或组织采纳错误。
“模型答错”只是其中一类。若大量失败属于流程或权限,继续调 Prompt 并不会解决根因。
4. PRR 生产准备评审
上线前至少回答:
- 业务 Owner、技术 Owner、风险 Owner、值班责任是否明确?
- 用户和任务边界是否清楚?
- 数据来源、用途、保留和删除策略是否批准?
- Action 是否最小权限、有审批、有幂等、有回退?
- 高风险场景是否强制 HITL?
- 评测阈值、已知失败和残余风险是否被接受?
- 日志、Trace、审计、告警和成本是否可观察?
- 模型、Prompt、知识、工具和策略是否可版本化与回滚?
- 故障、误动作、泄露和供应商不可用是否有预案?
- Pilot 的扩大、暂停、停止条件是否书面化?
5. 组织采纳
采纳不是“办一次培训”,而是行为和运营机制发生变化:[S1][S6]
看见 → 理解 → 首次使用 → 重复使用 → 嵌入流程 → 主动反馈 → 成为标准工作方式
常见阻力:
- 不相信输出质量。
- 担心责任转移或岗位影响。
- 新系统增加额外步骤。
- 异常时不知道找谁。
- Sponsor 没有资源和制度动作。
- 价值归因不清,业务团队只承担成本。
对应策略:用真实证据建立信任;清楚展示来源和责任;减少双重录入;设计人工接管;让 Sponsor 明确资源、指标和决策节奏;把一线反馈纳入迭代。
6. Value Ledger
每个 Pilot 建议维护价值台账:
| 字段 | 含义 |
|---|---|
| 假设与基线 | 原流程的时间、质量、成本和风险 |
| 目标与阈值 | 什么结果支持扩大、调整或停止 |
| 运行范围 | 用户、流程、时间、样本和例外 |
| 使用与采纳 | 实际任务数、覆盖、采纳、接管、退出 |
| 业务结果 | 前后对比、对照、财务或风险证据 |
| 成本 | 模型、算力、人工复核、集成和运维 |
| 风险事件 | 越权、误动作、泄露、投诉、回滚 |
| 归因与限制 | 哪些变化能归因于系统,哪些不能 |
| 决策 | Go / Adjust / Stop 及责任人 |
Lean SIM 还提出数据账、API 账、模型账、算力账、智能体账、业务账的“六账”计量思路,用于支撑投资和收益分配。[S7]