很多团队第一次上 AI 客服,最容易把置信阈值当成一个开关:调低一点,AI 多答;调高一点,AI 少答。真到线上就会发现,问题不在「高」或「低」,而在你有没有一套放量流程。
阈值调得太保守,AI 只能当搜索框,坐席还是被重复问题淹没;阈值调得太激进,物流、尺码、优惠码还能扛,一碰到退款、赔付、投诉就容易越界。正确做法是:按主题和风险分批放量,低置信转人工,缺知识就补知识库,学到的经验必须确认后再生效。
调 AI 自动答的置信阈值:把 AI 价值落到可核验数字
先定基线:别一上来就追自动答率
调阈值前,先拿一批真实会话跑离线测试。不要只看 AI 回答得像不像人,要看三件事:
- 答案是否能在知识库里找到依据
- 置信不足时是否愿意转人工
- 高风险动作是否被拦住
建议从最近 2 到 4 周的会话里抽 100 到 200 条,按主题分组:物流、订单、商品、优惠、退款、投诉、售后政策。每条记录 AI 的置信分、回答、是否命中知识库、是否应该转人工。
这一步的产物不是一个漂亮报表,而是一张「哪些主题能放、哪些主题不能放」的清单。没有这张清单,后面所有调参都是凭感觉。
把问题分层:不同风险用不同阈值
AI confidence threshold 不应该全站一个数。跨境电商客服里,不同问题的风险差太大。
| 问题层级 | 典型场景 | 建议策略 |
|---|---|---|
| 低风险 | 物流进度、发货时效、尺码说明、材料说明 | 阈值可适度放宽,AI 直接答 |
| 中风险 | 改地址、优惠码异常、催发货、订单备注 | 阈值收紧,AI 先答但保留转人工入口 |
| 高风险 | 退款、赔付、改价、投诉升级 | 不靠阈值赌,直接走人工审批 |
这里有个硬边界:退款、赔付、改价永远不要让 AI 自动执行。AI 可以解释政策、收集订单号、整理会话摘要,但最后动作必须由人审批并留下记录。
从观察模式开始:先看 AI 会怎么答
第一阶段不要急着让 AI 自动发送。让它在后台生成草稿,由坐席选择采纳、修改或拒绝。你要观察的不是单条答案,而是模式:
- 哪些主题 AI 基本稳定?
- 哪些问题经常缺少依据?
- 哪些表达容易让客户误会?
- 哪些客户明明在生气,AI 还在机械解释政策?
这一步通常会暴露两类问题:一类是知识库缺内容,AI 只能猜;另一类是规则缺边界,AI 不知道什么时候该停。前者补知识库,后者写规则,不要只靠把阈值调高来掩盖。
如果你还没整理知识库,可以先看这篇:知识库不是 FAQ,是 AI 客服的燃料。阈值只能决定「敢不敢答」,不能凭空制造正确答案。
小流量放量:按主题开,不按全站开
第二阶段开始自动发送,但不要一刀切。先挑低风险、高频、答案稳定的主题放量,例如:
- 物流查询
- 发货时效
- 尺码与材料说明
- 优惠码使用规则
- 常见售后政策解释
放量时建议按「主题 + 渠道 + 语言」组合观察。比如网站挂件里的英文物流问题可以先开,Instagram 私信里的投诉先不开;WhatsApp 的订单查询可以开,退款相关仍然转人工。
这样做的好处是,出问题时能快速定位:到底是某个主题知识不够,某个渠道上下文不足,还是某种语言表达需要调整。全站一起开,出了问题只会一团乱。
低置信转人工:别让 AI 硬答
真正成熟的 AI 客服,不是每次都抢答,而是知道什么时候该把话递给人。低置信转人工要有明确规则:
- 知识库没有依据,转人工。
- 客户连续追问两次仍未解决,转人工。
- 客户要求人工,转人工。
- 出现退款、赔付、投诉、威胁差评等高风险意图,转人工。
- 客户情绪明显升级,转人工。
转人工时不要只丢一句「请稍等」。AI 应该把客户问题、已确认信息、可能原因和建议下一步整理成摘要,让坐席接手时不用从头读。
这也是 AI 先接、人工兜底 的关键:AI 不是把人挡在外面,而是把重复信息先接住,把需要判断的部分交给人。
用知识库补缺:每次低置信都是线索
阈值调优最有价值的数据,不是自动答了多少,而是「哪些问题因为不够确定而转人工」。这些低置信会话就是知识库缺口。
建议每天看三类队列:
- AI 没答上的问题
- 坐席改动较大的 AI 草稿
- 客户追问后才转人工的问题
把它们聚类后,不要直接塞回知识库。先由老板或客服主管确认:这个答案是否符合政策?是否适用于所有市场?有没有金额、时效、承诺边界?确认后再沉淀为知识或技能。
复盘阈值:保留测试集和回滚点
每次调阈值,都要留下测试集和回滚点。最小复盘清单可以很简单:
- 本次放量了哪些主题、渠道和语言?
- 自动答占比是否上升?
- 转人工是否集中在少数知识缺口?
- 客诉、退款、投诉类是否仍然稳定转人工?
- 坐席纠正 AI 后,有多少生成了学习建议?
如果某次阈值调低后,自动答占比上去了,但坐席纠错、客户追问、人工补救也明显增加,就说明你不是在提升效率,而是在把错误前移。回滚阈值,补知识库,再测一轮。
附:阈值放量检查清单
- 已抽取真实会话作为测试集
- 低风险主题已通过离线测试
- 高风险意图全部验证转人工
- 转人工摘要包含订单、问题、已答内容和建议下一步
- 知识库缺口有负责人确认
- 每次阈值调整都有回滚记录
AI confidence threshold 的目标不是让 AI 显得更大胆,而是让它在该答的时候多答、该停的时候停。先小范围验证,再按主题放量;低置信转人工,缺知识补知识库;学习建议确认后生效,随时可测可回滚。这样调出来的自动答,才是真正能放进业务里的自动答。