选型会上最容易让人放松警惕的一句话,是“我们的 AI 解决率 95%”。听起来很安心,但下一个问题应该是:95% 是怎么算出来的?谁的对话样本?多长的观察窗口?如果答不上来,这个数字就只是一句宣传语。
我们不会承诺一个固定解决率——因为解决率跟你的行业、客单价、退货政策、知识库完整度都强相关,同一套系统换个客户就是另一个数字。但我们能保证的是:AI 怎么学、学的对不对、能不能测、能不能撤,这几件事必须可验证。这篇文章就是一套选型时能直接照抄的提问清单。
为什么“固定解决率”本身就该让你警惕
任何厂商报出一个孤立的百分比,你都该先问三件事:分母是什么、场景是什么、时间窗口多长。同样是“解决率”,可以是“所有对话里 AI 回复且客户没有追问”,也可以是“客户主动打了满意度好评”,两者差距巨大,而且都可能故意漏掉转人工的那部分对话——因为转人工的对话按定义就是 AI 没解决的。
跨境电商场景更特殊:物流问答和退货政策问答的难度天差地别,旺季和平季的对话结构也不一样。一个通用的百分比,盖不住这些差异。合理的态度是:不承诺固定解决率,但承诺回答有依据、答不上会转人工、每一次学习都留痕。
真实研究更适合用来判断“AI 有没有提效潜力”,而不是替代你自己的准确率测试。选型时要把公开数据当作基线,把你的历史会话当作考题。
准确率宣传之外,更该看可复验的提效证据
提问清单一:这个数字怎么算出来的
选型时可以直接把下面这张表带进会议:
| 你要问的问题 | 警惕的回答 | 靠谱的回答 |
|---|---|---|
| 分母是全部会话还是排除了转人工的会话 | “大概是所有对话” | 能现场拆解出转人工占比 |
| 统计口径是“客户没追问”还是“客户明确满意” | 答不上来 | 能区分不同口径并给出各自数字 |
| 这个数字来自哪个行业、哪类客户 | “我们客户都差不多” | 承认跨境电商知识库差异大,数字会浮动 |
| 观察窗口是一周还是半年 | 只给一个总数 | 能展示随时间变化的趋势 |
如果厂商对这四个问题都能给出具体、可拆解的回答,说明这套数字至少是认真统计出来的;如果每个问题都被一句话糊弄过去,这个百分比大概率是市场部门写的,不是产品团队测的。
提问清单二:AI 答不上来时会发生什么
比固定解决率更值得深挖的问题是:AI 答不上来、或者答错了,接下来是什么流程。AI 先接、人工兜底的边界设计,决定了出错时客户会不会被晾在那里。
- AI 找不到知识库依据时,是老实转人工,还是硬编一个听起来合理的答案?
- 客户主动要求人工时,能不能一键切换,还是要客户重新描述一遍问题?
- 退款、赔付、改价这类高风险动作,是不是永远强制走人工审批?
- 转人工时,坐席能不能看到 AI 之前说过什么、客户情绪是什么样?
这四条里只要有一条是“不确定”或“厂商没提过”,就值得继续追问,而不是被一个漂亮的解决率数字带过去。
提问清单三:所谓“越用越聪明”是不是真的可控
“AI 会自己学习、越用越聪明”是另一句常见宣传语,但很多时候意味着模型在悄悄吸收所有历史对话,你完全不知道它学到了什么、什么时候学的、学错了能不能撤回。
YundaDesk 的做法是把学习拆成可审查的步骤:AI 没答上、坐席补答、坐席主动纠正 AI,这三类信号会先生成【待确认学习建议】,由老板或客服主管在评审台里逐条看过、确认之后才生效,沉淀为技能、知识或客户记忆。每一条建议都可以追溯到是哪次对话触发的、被谁确认的,发现学歪了也能一键回滚。这套闭环的详细拆解可以看这篇。
选型时可以直接问:学习建议能不能导出清单?谁有权限确认?出错了要联系厂商工程师,还是自己就能回滚?
提问清单四:知识库是不是准确率的真正瓶颈
很多时候 AI“不准”根本不是模型的问题,而是知识库本身过时、缺失、或者互相矛盾。选型时该问的不是“你们的模型多先进”,而是知识库怎么维护:
| 维护方式 | 适合场景 | 风险点 |
|---|---|---|
| 上传文档 | 政策类、FAQ 类内容稳定 | 文档更新不及时会拖累准确率 |
| 抓取官网/帮助中心 | 内容本来就要维护 | 抓取频率和覆盖范围要问清楚 |
| 手动问答录入 | 高频但零散的客服话术 | 需要有人持续补充,否则会枯竭 |
知识库和 AI 准确率的关系比模型参数量重要得多。一个厂商如果只谈模型,不谈知识库怎么建、怎么更新、怎么标记过时内容,这本身就是一个信号。
提问清单五:能不能自己测,而不是只信厂商的 PPT
真正靠谱的验证方式,是拿你自己的真实客服场景去试,而不是看对方的案例截图。可以要求:
- 用你自己的历史工单或常见问题去测知识库覆盖率。
- 故意问几个知识库里没有的问题,看 AI 是老实说不知道,还是硬编答案。
- 让坐席实际改几次 AI 草稿,看学习建议是不是真的出现在评审台里,而不是消失在黑箱里。
- 试一次退款场景,确认是不是强制转人工审批,而不是 AI 自己拍板。
能配合你做这套测试的厂商,和只愿意展示案例视频的厂商,选型答案已经很明显了。
提问清单六:账单和准确率宣传是不是绑在一起
有些厂商按“解决率”或“对话结果”计费,这会制造一个隐藏的激励:厂商有动机把“解决”的定义放宽,从而让账单更高。YundaDesk 的套餐里包含 AI credit,不按对话或解决结果二次计费,账单本身可预测,也就没有动机去美化解决率数字。选型时可以直接问一句:如果准确率宣传的数字下降,你们的账单会不会跟着变?如果答案是会,这个数字的公正性就要打个问号。
固定解决率听起来是个安心的承诺,但经不起三个问题的追问:分母是什么、答不上来怎么办、学习是不是可控。比起一句漂亮的百分比,更值得你签合同前确认的是:知识库怎么维护、学习建议能不能追溯和回滚、高风险动作是不是强制人工。想直接感受这套评审闭环怎么运作,可以看看产品详情,或者对照你的场景去了解报价。