如果 AI 每处理一条数据都要人重新检查,效率提升有限;如果完全无人监督,高风险错误可能被批量放大。Human-in-the-Loop 的核心是识别哪些决定必须由人承担,哪些重复工作可以自动完成,以及异常什么时候升级。
01 先画风险地图,再决定人工节点
一条工作流中,生成草稿、分类标签、发出合同、删除数据的风险差异巨大。人工审核不应该平均分布,而应集中在不可逆、高金额、外部影响和高不确定节点。
NIST AI RMF 强调治理、测量和管理风险。UX 可以把这些风险转化为不同审批和监督模式。
02 低风险高频任务适合抽样,而不是逐条审核
例如 AI 给内部工单打标签,如果历史准确率稳定,可以自动处理大部分,只把低置信度或异常样本交给人。
人工资源应集中在最可能出错、出错代价最高的部分,而不是成为每一步形式化盖章。

03 审核界面要让人快速看到“AI 为什么这样判断”
只显示一个结论和“批准 / 驳回”,审核者还要重新调查全部上下文。可以同时展示关键证据、来源、模型提取字段和异常点。
人的任务应该是判断,而不是替 AI 重做一遍信息搜集。
04 异常升级要有清楚触发条件
当金额超过阈值、来源冲突、用户意图不明确或模型输出触发敏感类别时,系统可以自动进入人工队列。
这些规则应可配置、可审计,并让操作人员知道“为什么这条需要我处理”。
05 人工接管后不要让 AI 和人同时继续执行
客服场景中,如果人工已经接手,AI 仍自动发消息会产生严重冲突。接管状态应明确切换责任主体,并停止相关自动动作。
需要再次交回 AI 时也要有显式操作,让工作流状态可理解。

06 人工反馈应该形成可用数据,而不是只记录批准率
驳回原因可以结构化为“事实错误、格式错误、权限问题、策略不适用”等,帮助产品团队诊断。
Microsoft HAX 和 Google PAIR 都强调粒度化反馈的价值。简单 点赞/点踩 对复杂企业任务往往信息不足。
07 监督者也会疲劳,审核界面需要降低自动同意
如果连续 500 条结果都正确,第 501 条异常很容易被顺手批准。可以通过风险排序、异常突出、批量审核限制和定期校准减少“automation bias”。
人类在环并不天然等于安全,人的注意力同样需要被设计。
08 责任边界必须在产品和流程层面清楚
谁对最终外发邮件负责?谁能批准超过 10 万元的付款?AI 输出是否只是建议?这些不能只靠 UI 文案决定,需要组织政策和权限一起定义。
好的 Human-in-the-Loop 不是给所有 AI 页面加一个 Review 按钮,而是形成一套人和机器各自负责什么的工作制度。

09 人工队列需要优先级和 SLA,而不是一个无限列表
高风险异常、即将超时的客户请求和低置信度普通任务不应混在一起。可以按风险、业务价值和等待时间排序。
如果人工审核成为瓶颈,用户应该看到预计等待或替代路径,而不是任务永远“等待人工”。
10 审核工作要支持批量和模板化处理
同类低风险异常可以批量批准、批量填写原因,高风险个案再逐条深入。
Human-in-the-Loop 的目标仍然包括效率,不能把人工界面做成比原流程更慢的新瓶颈。
11 定期校准人和 AI 的分工
随着模型能力、数据和政策变化,过去必须人工审核的步骤可能可以自动化,过去低风险的场景也可能出现新问题。
团队应通过错误数据和业务结果持续调整阈值,而不是一次配置永久不变。
常见问题
Human-in-the-Loop 是不是所有 AI 输出都要人工审核?
不是。人工应集中在高风险、高不确定和异常节点。
低风险任务怎么监督?
可以抽样、设置异常阈值和持续质量监测,而不是逐条检查。
审核者需要看到模型思考过程吗?
通常不需要完整内部推理,更需要证据、来源、关键输入和可验证解释。
人工接管后 AI 可以继续辅助吗?
可以提供建议,但自动执行权应根据接管状态明确控制,避免双方同时行动。
为什么要记录驳回原因?
可以形成高质量反馈数据,帮助定位模型、数据、流程或权限问题。