选型会上最容易让人放松警惕的一句话,是“我们的 AI 解决率 95%”。听起来很安心,但下一个问题应该是:95% 是怎么算出来的?分母用的是谁的对话样本、观察窗口有多长,这两点答不上来,这个数字就只是一句宣传语。
解决率跟你的行业、客单价、退货政策、知识库完整度都强相关,同一套系统换一个客户就是另一个数字,所以我们只报带条件的口径:首次接入常见咨询 60%+ 即时答复,人工带教一个月后办结率 90%+——条件跟数字连在一起说,不报孤立的裸数字。真正能验证、也应该验证的,是 AI 怎么学、学的对不对、能不能测、能不能撤。这篇文章就是一套选型时能直接照抄的提问清单。
为什么“固定解决率”本身就该让你警惕
任何厂商报出一个孤立的百分比,你都该先问三件事:分母是什么、场景是什么、时间窗口多长。同样是“解决率”,可以是“所有对话里 AI 回复且客户没有追问”,也可以是“客户主动打了满意度好评”,两者差距巨大,而且都可能故意漏掉转人工的那部分对话——因为转人工的对话按定义就是 AI 没解决的。
跨境电商场景更特殊:物流问答和退货政策问答的难度天差地别,旺季和平季的对话结构也不一样,一个通用的百分比盖不住这些差异。选型时真正该盯住的,是回答有没有依据、答不上会不会转人工、每一次学习有没有留痕——这些才是能拿去跟厂商当面对质的标准。
真实研究适合当基线,但检验准确率终究要靠你自己的历史会话,选型时直接把它当考题用。
准确率宣传之外,更该看可复验的提效证据
提问清单一:这个数字怎么算出来的
选型时可以直接把下面这张表带进会议:
| 你要问的问题 | 警惕的回答 | 靠谱的回答 |
|---|---|---|
| 分母是全部会话还是排除了转人工的会话 | “大概是所有对话” | 能现场拆解出转人工占比 |
| 统计口径是“客户没追问”还是“客户明确满意” | 答不上来 | 能区分不同口径并给出各自数字 |
| 这个数字来自哪个行业、哪类客户 | “我们客户都差不多” | 承认跨境电商知识库差异大,数字会浮动 |
| 观察窗口是一周还是半年 | 只给一个总数 | 能展示随时间变化的趋势 |
如果厂商对这四个问题都能给出具体、可拆解的回答,说明这套数字是认真统计出来的;如果每个问题都被一句话糊弄过去,这个百分比多半只是市场部门写的宣传稿。
提问清单二:AI 答不上来时会发生什么
比固定解决率更值得深挖的问题是:AI 答不上来、或者答错了,接下来是什么流程。AI 先接、人工兜底的边界设计,决定了出错时客户会不会被晾在那里。
- AI 找不到知识库依据时,是老实转人工,还是硬编一个听起来合理的答案?
- 客户主动要求人工时,能不能一键切换,还是要客户重新描述一遍问题?
- 退款、赔付、改价这类高风险动作,是不是永远强制走人工审批?
- 转人工时,坐席能不能看到 AI 之前说过什么、客户情绪是什么样?
这四条里只要有一条是“不确定”或“厂商没提过”,就值得继续追问——不要被一个漂亮的解决率数字糊弄过去。
提问清单三:所谓“越用越聪明”是不是真的可控
“AI 会自己学习、越用越聪明”是另一句常见宣传语,但很多时候意味着模型在悄悄吸收所有历史对话,你完全不知道它学到了什么、什么时候学的、学错了能不能撤回。
YundaDesk 的做法是把学习拆成可审查的步骤:AI 没答上、坐席补答、坐席主动纠正 AI,这三类信号会先生成【待确认学习建议】,由老板或客服主管在评审台里逐条看过、确认之后才生效,沉淀为技能、知识或客户记忆。每一条建议都可以追溯到是哪次对话触发的、被谁确认的,发现学歪了也能一键回滚。这套闭环的详细拆解可以看这篇。
选型时可以直接问:学习建议能不能导出清单?确认权限归谁、出错后是要等厂商工程师还是自己就能一键回滚,这两点选型前必须问清楚。
提问清单四:知识库是不是准确率的真正瓶颈
很多时候 AI“不准”,根子出在知识库过时、缺失或互相矛盾,模型本身没那么大责任。选型时该盯住的是知识库怎么维护:
| 维护方式 | 适合场景 | 风险点 |
|---|---|---|
| 上传文档 | 政策类、FAQ 类内容稳定 | 文档更新不及时会拖累准确率 |
| 抓取官网/帮助中心 | 内容本来就要维护 | 抓取频率和覆盖范围要问清楚 |
| 手动问答录入 | 高频但零散的客服话术 | 需要有人持续补充,否则会枯竭 |
知识库和 AI 准确率的关系比模型参数量重要得多。一个厂商如果只谈模型,不谈知识库怎么建、怎么更新、怎么标记过时内容,这本身就是一个信号。
提问清单五:自己测,别只看厂商的 PPT
真正靠谱的验证方式,是拿你自己的真实客服场景去试——案例截图说明不了你的场景。可以要求:
- 用你自己的历史工单或常见问题去测知识库覆盖率。
- 故意问几个知识库里没有的问题,看 AI 是老实说不知道,还是硬编答案。
- 让坐席实际改几次 AI 草稿,确认学习建议真的出现在评审台里,没有悄悄消失在黑箱里。
- 试一次退款场景,确认退款决定必须经人工审批,AI 不能自己拍板。
能配合你做这套测试的厂商,和只愿意展示案例视频的厂商,选型答案已经很明显了。
提问清单六:账单和准确率宣传是不是绑在一起
有些厂商按“解决率”或“对话结果”计费,这会制造一个隐藏的激励:厂商有动机把“解决”的定义放宽,从而让账单更高。YundaDesk 的套餐里包含 AI credit,不按对话或解决结果二次计费,账单本身可预测,也就没有动机去美化解决率数字。选型时可以直接问一句:如果准确率宣传的数字下降,你们的账单会不会跟着变?如果答案是会,这个数字的公正性就要打个问号。
固定解决率经不起三个追问:分母是什么、答不上来怎么办、学习是不是可控。真正该在签合同前确认的,是知识库怎么维护、退款这类高风险动作是不是强制人工、敢不敢让你拿自己的场景去实测——这几条比任何一个漂亮的百分比都更能说明问题。YundaDesk 的 AI 客服把这几条都做成了看得见、审得了的产品能力,具体价格可以直接翻报价页。
