“82% 可信”看起来科学,但如果没有经过校准、用户不知道 82% 代表什么,它反而会制造虚假的确定感。更好的设计通常从证据、范围和可验证性开始。
很多 AI 产品为了让用户“知道模型有多确定”,会在答案旁边加一个百分比:可信度 87%、Confidence 0.82。界面看起来更专业,但这类数字很容易被误解。Google PAIR 的 Explainability + Trust 指南明确提醒:数值置信度可能被用户理解错误,需要在真实场景中验证;解释也应优先帮助用户完成任务,而不是追求把模型内部全部暴露出来。
01 最重要的判断是:先回答“用户要做什么决定”,再决定是否显示分数
如果一个置信度数字不能帮助用户采取不同动作,它就只是装饰。对大多数生成式 AI 产品,来源、适用范围、冲突证据和“我不知道”往往比一个孤立百分比更有用。
02 一、为什么“82%”很危险?
用户可能把它理解成“这个答案有 82% 概率是真的”,但实际分数可能来自分类器概率、检索相似度、模型自评或团队自定义规则,含义完全不同。如果系统没有经过校准,数字精确到个位数反而制造了不存在的精度。

03 二、对生成式回答,优先展示证据质量
例如答案可以说明:基于 3 份当前有效制度;最近更新时间 2026-08;其中两份来源一致,一份存在冲突。用户可以直接打开支撑段落。这样的信息与真实判断过程更接近,也更容易验证。
04 三、把不确定性变成“下一步动作”
最好的不确定性提示不是一句“结果仅供参考”,而是告诉用户为什么不确定以及该怎么办。例如:“找到两个不同版本的政策,无法确定当前适用版本,请选择所在地区”;或者“缺少 2026 年第二季度数据,当前只能分析到 6 月”。
05 四、什么时候分数有价值?
在分类、识别、预测等任务中,如果分数经过验证且用户知道阈值含义,它可以帮助决策。例如审核员可能只人工查看低于某阈值的结果。但界面要说明分数代表什么,并给出校准后的动作规则,而不是让用户自己猜。

06 五、解释要分层,不要一次倾倒模型细节
普通用户通常先需要简短理由:用了哪些数据、关键依据是什么。专业用户再展开特征、检索片段、模型版本或更多技术信息。Google PAIR 提倡为理解而解释,并通过渐进披露控制复杂度。
07 六、不要让“高置信度”取代人工判断
在高风险领域,界面应把关键证据、责任人和确认动作保留下来。即使模型分数很高,也不能用一个绿色徽标暗示“可以放心自动执行”。自动化策略应该结合风险、可逆性和权限,而不是只看模型自信。
08 界达设计建议的四层可信度表达
- 第一层:明确答案适用范围与数据时间。
- 第二层:展示直接来源与证据片段。
- 第三层:提示冲突、缺失和不确定原因。
- 第四层:只有在经过校准且有明确决策用途时,再显示置信度数值。
09 最后:解释的目标不是让 AI 看起来更科学
好的 Explainability UX 是帮助用户知道“我为什么可以相信到什么程度,以及下一步该验证什么”。如果用户看完一个 92% 只会更大胆地点确认,那这个数字可能增加风险;如果用户看完证据能更快做出正确判断,解释才真正创造价值。

10 七、四种比“置信度百分比”更实用的 UI 模式
- 证据覆盖:显示答案由几份有效来源支撑,以及是否存在缺失。
- 冲突提示:明确标记来源之间存在不同结论,而不是平均成一个答案。
- 范围标签:说明答案只适用于某地区、时间、客户类型或数据集。
- 验证建议:告诉用户下一步应该查看哪份原文、补什么数据或由谁确认。
这些信息的共同点是可行动。用户看到“87%”往往不知道该做什么;看到“最新政策未覆盖海外分公司,请确认当地 HR 规则”,则能立即采取下一步。
11 八、如果一定要显示分数,至少做好三件事
第一,定义清楚:这是分类概率、检索相关度还是业务风险分;第二,做校准测试,让 80% 在真实数据上确实具有可解释含义;第三,把分数映射到操作规则,例如低于阈值必须人工复核,而不是只改变徽标颜色。用户研究还要验证不同角色是否会过度依赖高分。
常见问题
AI 置信度是不是越精确越好?
不是。未经校准的精确数字可能制造虚假确定感。应先说明分数定义和决策用途。
生成式 AI 适合显示概率吗?
多数开放式生成任务很难把“答案正确率”压缩成单一概率。来源、证据覆盖、冲突和缺失信息通常更有用。
怎样设计“AI 不确定”状态?
说明不确定原因、当前已知范围、缺失条件,并提供澄清、补充数据、查看来源或转人工的下一步。
解释是不是越详细越可信?
不一定。过多技术细节会增加认知负担。应采用分层/渐进披露,让不同角色按需要展开。
高风险 AI 应该隐藏置信度吗?
不一定隐藏,但不能让分数成为自动批准的替代品。应结合证据、风险、人工审核和可逆性一起设计。