AI 客服上线前,最怕的不是它答不上,而是你不知道它会怎么答。知识库看起来很全,流程也配好了,可真实客户不会按 FAQ 提问:少打几个字、夹着情绪、换一种语言,把物流和退款揉在一句话里。
所以,上线前要有一个答案测试台:把历史真实提问批量喂给 AI 客服,让团队逐条验收。目标不是拿一个漂亮分数,而是看清哪些问题 AI 能接住,哪些要补知识库,哪些从第一句就该转人工。
测试台要给证据,不是给信心
很多团队判断 AI 是否可上线,靠的是“文档已经上传”“演示里答得不错”。这还不够。客服现场的难点,往往是标准问题被客户用不标准的方式问出来。
| 检查项 | 不要只看 | 真正要看 |
|---|---|---|
| 答案准确 | 语气像不像客服 | 是否基于知识库得出正确结论 |
| 依据清楚 | 是否答得很长 | 能否追溯到政策、商品、物流来源 |
| 边界稳定 | 能不能多答一点 | 不确定、高风险、客户要求人工时是否转人工 |
| 语言适配 | 会不会翻译 | 是否跟随客户语言且不丢条件 |
“可测试”的意思,不是相信 AI 永远正确,而是让真实问题先考它一遍。
题库从历史真实提问里来
测试题不要在会议室里编。先从共享工作台里抽最近的真实会话,按主题打标签:物流、发货、尺码、折扣码、改地址、退换货、投诉、赔付、社媒评论、平台私信、多语言消息。
一个起步题库可以这样分:
- 高频低风险:订单何时发、包裹到哪、某国运费怎么算。
- 高频易误解:折扣码没生效、预售发货、尺码换算。
- 中风险判断:改地址、催发货、取消订单。
- 高风险动作:退款、赔付、改价、威胁差评。
- 多语言变体:同一问题用英语、西语、法语、阿语或目标市场语言各问一遍。
第一批 100 条题库可以按业务风险分配,而不是按团队最熟的 FAQ 分配。
上线前测试题库的风险配比(示例测算)
每道题看三件事:答案、依据、动作
测试 AI 答案,不能只看“像不像人话”。客服答案要能落地,至少过三关。
第一,结论是否正确。客户说“包裹还在海关,能不能退款”,AI 不能直接承诺退款,也不能只安抚了事,而要说明物流状态、收集必要信息,并在涉及退款时转人工。
第二,依据是否可追溯。AI 客服应该从知识库找依据,而不是编政策。测试时要看它引用的是否是正确的退换货条款、发货规则或商品说明。没有依据,就该追问或转人工。
第三,动作是否合规。退款、赔付、改价永远需要人工审批。AI 可以收集订单号、整理诉求、给坐席准备建议,但不能自动执行,也不能说“已经退款”。
通过标准按标签定,不要只打总分
一个“80 分”的 AI 可能物流题很稳,退款题却越界。平均分没什么用,标签才有用。
| 标签 | 通过标准 | 不通过时怎么改 |
|---|---|---|
| 可直接回答 | 答案准确、语气合适、依据清楚 | 补知识库或改标准答法 |
| 需追问信息 | 能要到订单号、邮箱、国家等必要信息 | 补追问规则 |
| 应转人工 | 能识别退款、赔付、投诉、客户要求人工 | 强化转人工规则 |
| 不应回答 | 无依据时不编造 | 加“缺依据即转人工”边界 |
每条题只标一个状态:通过、需补知识、需改规则、必须人工。跑完一轮后,你得到的是修复清单,不是空泛分数。
多渠道一起测,别只测网站挂件
跨境电商的问题不会只从网站挂件进来。邮件、WhatsApp、Telegram、Messenger、Instagram、TikTok、LINE、微信、VKontakte、Zalo、YouTube、自定义 API,都会进入同一个工作台和同一份客户档案。测试台也要覆盖这些入口。
同一个问题在不同渠道里长得不一样:网站挂件可能带订单上下文;Instagram 或 TikTok 评论更短更口语;WhatsApp、LINE、Zalo 常常连发几条碎片消息;邮件可能是一大段背景加历史转发。
如果只测“完整、礼貌、一次说清楚”的问题,上线后会被真实渠道教育。测试台要放入碎片问题、错别字、口语表达、不同语言和跨渠道上下文。
失败样本要变成学习建议,但不能自动生效
测试台最有价值的不是证明 AI 完美,而是抓出失败样本。AI 没答上、答偏了、坐席改写了答案,都应该生成待确认学习建议。
YundaDesk 的“越用越聪明”是受控学习闭环:AI 没答上或坐席纠正 AI 后,系统生成学习建议;老板在评审台里看原问题、AI 原答案、坐席补答和建议变更;确认采纳后,才会沉淀为技能、知识或客户记忆。每条都可追溯、可测试、可一键回滚。
这套机制适合测试台,因为测试不是一次性门槛。每次改知识库、规则或政策,都可以重跑旧题库,看新版本有没有变好,也看有没有把原来答对的地方改坏。
上线前跑一轮完整演练
把上线前演练当成一次小发布,不要让客服主管一个人点几下就算完成。客服负责人、熟悉政策的老坐席、运营或老板都应该参与。
- 知识库已上传政策、商品、物流、退换货、促销说明。
- 高风险边界已写清:退款、赔付、改价必须人工审批。
- 从历史会话抽取 50 到 100 条真实问题,按主题和渠道打标签。
- 批量运行 AI 答案,记录答案、依据、是否转人工。
- 把失败样本归类为“补知识库”“改规则”“人工兜底”。
- 修复后重跑关键题,确认问题没有复发。
上线后继续用测试台
AI 客服上线不是测试结束,而是测试常态化的开始。新品上架、物流政策变化、大促开始、目标市场换语言和渠道,都会让旧答案失效。
题库可以分三层:核心题永远跑,比如发货、物流、退换货;活动题按当前促销更新,比如折扣、预售、赠品;失败题来自近期 AI 没答上、坐席补答、客户不满意的真实样本。
如果测试台每次修复后都重跑旧题,团队看到的就不是一次性分数,而是版本质量的变化。
关键题回归通过率走势(示例测算)
测试台不能保证 AI 永远不犯错,但能让团队在错误影响客户前看见它。先用知识库打底,再用AI 先接人工兜底划清边界,最后用真实问题把答案考一遍。
可测试,才敢上线。测试台不是给 AI 做表演,而是让真实问题先替客户问一遍:答得准就放行,答不准就修,风险高就交给人。