AI 系统的错误无法完全消除,但可以被设计、测量和控制。评估不仅看平均准确率,还要看错误发生在哪里、影响多大、是否能发现,以及人工兜底是否真实有效。生产就绪不是一个平均准确率数字,而是任务质量、安全、身份权限、可观测性、人工兜底和运行责任共同通过上线门。
- 建立业务代表性的 Golden Set
- 设计质量、价值、成本与时延指标
- 完成错误分类与修正优先级
- 建立安全风险台账和上线质量门
- 将身份、最小权限、敏感数据和人工兜底纳入生产就绪判断
从概念到可执行判断
评估必须从业务任务开始
同一个“准确率”在不同场景意义不同。营销草稿可以允许人编辑,合规审核漏掉关键风险则可能造成重大损失。评估标准必须与任务、责任和风险容忍度对应。
模型不能只给自己打分。业务专家需要参与定义样本、标准答案、可接受差异与严重错误。
建立 Golden Set
Golden Set 是持续使用的代表性评估集,应覆盖常见任务、边界情况、异常输入和对抗情况。每条样本记录来源、预期结果、判断依据和严重程度。
评估集不是一次性考试卷。生产中发现的新失败模式,应经过审核后回流,形成持续改进资产。
设计多维指标
质量可以看准确性、完整性、一致性、来源可追溯和格式合规;工程可以看时延、成本、稳定性;业务可以看效率、质量、增长或风险;采用可以看实际使用与绕行。
指标不宜过多。选择能够支持当前 Scale、Iterate 或 Stop 决策的最小指标集。
错误分类与修正
错误可能来自输入缺失、知识过期、检索失败、模型推理、工具调用、流程设计或人工使用。只有分类,才能把问题交给正确负责人。
根据发生频率、业务影响和可发现性排序。低频但不可发现的严重错误,可能比高频格式问题更值得优先处理。
安全治理与上线门
风险台账记录场景、触发条件、影响、控制措施、Owner 与监测方式。需要考虑隐私泄露、权限越界、提示注入、错误执行、内容风险和供应商变化。
上线门明确最低质量、人工兜底、日志、回滚和停止条件。治理从场景定义开始,不是在上线前补一张表。
同样的错误率,不同的业务后果
内容运营、采购数据处理和医药合规都可能使用文本模型,但错误后果差异巨大。
内容场景允许编辑与抽检;采购场景加强结构校验;合规场景要求来源引用、人工批准和审计记录。
安全要求不是由模型名称决定,而是由具体任务、责任、可逆性和业务影响决定。
四层评估卡
每次评估同时看四层:
输出是否准确、完整、一致且有来源?
成本、时延、稳定性与日志是否达标?
任务效率、质量、增长或风险是否改变?
用户是否使用、信任、纠错并承担责任?
先回答,再展开答案
01为什么不能只看平均准确率?
平均值会掩盖严重错误、边界失败、业务影响和可发现性。
02Golden Set 是否项目结束后就固定不变?
不是,应把生产中的新失败模式经审核后持续加入。
03错误分类有什么价值?
帮助定位输入、知识、检索、模型、工具、流程或使用问题,并分配正确负责人。
04治理应该什么时候开始?
从场景定义和流程设计阶段开始,贯穿原型、试点和运营。
把方法带回真实工作
企业内部推进(默认)
与业务专家建立 Golden Set,运行原型并形成错误分类、风险台账与上线门。
外部客户交付(可选)
与客户确认样本、验收口径、未有证据的指标和人工兜底责任。
所需材料
- 代表性样本
- 业务标准与专家
- 运行日志
- 数据安全与合规要求
- 身份、数据分级与最小权限规则
- 上线、回滚和故障升级要求
交付物
- Golden Set 与多维评估报告
- 身份、数据与工具权限表
- 错误分类、风险台账和上线门
- 发布与回滚条件
通过标准
- Golden Set 覆盖正常、异常和高风险样例,且每个错误都记录业务影响与可发现性
- 高风险结果有真实有效的人工把关、拒绝和升级路径
- 用户、服务身份、数据与工具权限符合最小必要范围
- 上线门含修改、停止、回滚和责任人条件
能力证据
- Golden Set 测试的期望结果、实际结果与人工复核记录
- 一次越权、敏感数据或高风险动作被正确阻断的证据
- 业务、安全和运行角色联合签发的上线门记录
填写模板或完成课程不等于能力达标;通过必须以真实任务、现场行为和可复核证据为依据。