# 06 · 评测、治理与生产采纳

## 1. 指标树

单一“准确率”无法代表 FDE 项目。建议使用六层指标：

| 层 | 示例 |
|---|---|
| 业务结果 | 收入、损失避免、质量、风险、库存、周期、客户体验 |
| 流程影响 | 等待、返工、交接、处理时长、专家瓶颈、覆盖率 |
| 采纳 | 激活、周活、任务渗透、建议采纳、人工接管、复用 |
| 任务质量 | 完成率、事实性、召回、工具成功、专家通过、失败分布 |
| 生产运行 | 可用性、P95 时延、成本、超时、回滚、告警、恢复时间 |
| 治理安全 | 越权、数据泄露、注入、审计缺口、高风险误动作、合规事件 |

每个指标必须有：Owner、定义、数据源、基线、目标、时间窗、分母、证据和决策阈值。

## 2. Eval 三层

官网课程将评测分为“功能、质量、业务”，并要求黄金样本、失败分类、红队和 PRR。[S6]

### 2.1 离线评测

- 数据集来自真实任务，并做脱敏和版本控制。
- 覆盖常见、长尾、异常、高风险和对抗样本。
- 同时测组件和端到端任务。
- 预先确定阈值，不看完结果再改标准。

### 2.2 生产前评测

- 权限、审批、越权和数据用途测试。
- 超时、依赖不可用、重复调用、并发和幂等测试。
- 人工确认、升级、接管和回滚演练。
- 监控、告警、日志、审计和 Runbook 验证。

### 2.3 在线运营评测

- 灰度、对照或分阶段上线。
- 持续记录输入、上下文、模型/提示版本、工具调用、人工决定和最终结果。
- 将线上失败回流为 Eval 样本。
- 用 Go/Adjust/Stop 机制决定扩展，不以日活增长自动代表价值。

## 3. Failure Taxonomy

建议至少分类：

1. 需求/任务定义错误。
2. 上下文缺失或过期。
3. 检索召回/排序错误。
4. 推理或事实错误。
5. 输出格式/Schema 错误。
6. 工具选择或参数错误。
7. 外部系统/网络错误。
8. 权限、用途或审批错误。
9. 人机责任/异常升级错误。
10. 流程设计或组织采纳错误。

“模型答错”只是其中一类。若大量失败属于流程或权限，继续调 Prompt 并不会解决根因。

## 4. PRR 生产准备评审

上线前至少回答：

- 业务 Owner、技术 Owner、风险 Owner、值班责任是否明确？
- 用户和任务边界是否清楚？
- 数据来源、用途、保留和删除策略是否批准？
- Action 是否最小权限、有审批、有幂等、有回退？
- 高风险场景是否强制 HITL？
- 评测阈值、已知失败和残余风险是否被接受？
- 日志、Trace、审计、告警和成本是否可观察？
- 模型、Prompt、知识、工具和策略是否可版本化与回滚？
- 故障、误动作、泄露和供应商不可用是否有预案？
- Pilot 的扩大、暂停、停止条件是否书面化？

## 5. 组织采纳

采纳不是“办一次培训”，而是行为和运营机制发生变化：[S1][S6]

```text
看见 → 理解 → 首次使用 → 重复使用 → 嵌入流程 → 主动反馈 → 成为标准工作方式
```

常见阻力：

- 不相信输出质量。
- 担心责任转移或岗位影响。
- 新系统增加额外步骤。
- 异常时不知道找谁。
- Sponsor 没有资源和制度动作。
- 价值归因不清，业务团队只承担成本。

对应策略：用真实证据建立信任；清楚展示来源和责任；减少双重录入；设计人工接管；让 Sponsor 明确资源、指标和决策节奏；把一线反馈纳入迭代。

## 6. Value Ledger

每个 Pilot 建议维护价值台账：

| 字段 | 含义 |
|---|---|
| 假设与基线 | 原流程的时间、质量、成本和风险 |
| 目标与阈值 | 什么结果支持扩大、调整或停止 |
| 运行范围 | 用户、流程、时间、样本和例外 |
| 使用与采纳 | 实际任务数、覆盖、采纳、接管、退出 |
| 业务结果 | 前后对比、对照、财务或风险证据 |
| 成本 | 模型、算力、人工复核、集成和运维 |
| 风险事件 | 越权、误动作、泄露、投诉、回滚 |
| 归因与限制 | 哪些变化能归因于系统，哪些不能 |
| 决策 | Go / Adjust / Stop 及责任人 |

Lean SIM 还提出数据账、API 账、模型账、算力账、智能体账、业务账的“六账”计量思路，用于支撑投资和收益分配。[S7]
