选 AI 客服平台,最怕被演示带着走:按钮漂亮、回复流畅,采购会后大家只记得“看起来都差不多”。上线后才发现渠道没接全、AI 学错没人审、退款权限没卡住,客服主管和老板一起补坑。
这份清单不是科普,而是一张可以直接拿去打分的采购表。评分项按 YundaDesk 能力边界设计,重点看三件事:接住真实渠道,越用越聪明但不失控,AI 先接、人工兜底。
先评估运营闭环,而不是功能数量
很多 AI 客服平台会用“上线率”“自动化率”“成本下降”来包装演示,但采购时要先拆开看:采用 AI 不等于已经打通业务系统,回复成本下降也不等于客户体验改善。真正决定上线质量的,是知识是否有依据、升级规则是否清楚、人工是否能接住、结果是否能被追踪。
因此,先把供应商放进同一个运营闭环里评分:客户从哪个渠道来,AI 根据什么回答,答不上如何升级,坐席如何纠正,学习建议谁批准,退款赔付谁把关,账单是否可预测,最后能不能按渠道、语言和风险复盘结果。功能越多但闭环越弱,试用阶段越容易制造漂亮数字,正式上线后越难治理。
采购演示里,先区分会聊天和可治理
| 维度 | 采购问题 | 评分建议 |
|---|---|---|
| Knowledge grounding | AI 是否基于可管理的知识和证据回答 | 看知识来源、版本、冲突提示、缺口沉淀 |
| True resolution | 是否真的解决客户问题,而不是只回复一次 | 看无需二次追问、无需人工重做的比例 |
| Handoff quality | 转人工是否带上下文、摘要和订单线索 | 看坐席是否还要重新问客户背景 |
| Omnichannel coverage | 核心渠道是否进入同一工作台和客户档案 | 看网站、邮件、社媒、即时通讯是否统一 |
| Learning governance | 学习是否可评审、可测试、可回滚 | 看学习建议队列、确认人和原始会话 |
| Approval controls | 退款、赔付、改价是否必须人工审批 | 看审批流、权限和审计记录 |
| Cost predictability | 账单是否能按旺季量级提前估算 | 看 AI credit、超量规则和二次计费 |
| Analytics | 是否能追踪效果并解释为什么 | 看渠道、语言、风险、知识缺口报表 |
这套评分框架不是 YundaDesk 客户数据,也不是行业平均值,而是一个采购评分模板。建议每个维度按 0-5 分评估:0 表示不可验证,3 表示可用但需要人工补流程,5 表示可配置、可审计、可复盘。把 8 个维度先跑完,再进入下面 42 项明细,供应商差异会更明显。
怎么打分:先把演示变成同一张表
建议每项按 0 / 1 / 2 分打分:
| 分数 | 含义 | 判断方式 |
|---|---|---|
| 0 | 不支持或只停留在口头承诺 | 演示里看不到,文档里也没有明确入口 |
| 1 | 支持但有限制 | 需要人工绕流程,或只覆盖部分渠道/场景 |
| 2 | 可直接上线使用 | 可配置、可测试、可追溯 |
别只听“支持 AI”“支持全渠道”。让对方现场跑你的业务题:物流、退款、多语言、知识库没覆盖。看系统怎么答、怎么转人工、怎么留记录。
渠道与客户档案:客户从哪来,都要进同一处
跨境团队最容易低估渠道复杂度。独立站、邮件、WhatsApp、Instagram、TikTok、LINE、微信、Zalo、Telegram、Messenger 往往同时存在。
| # | 评分项 | 0-2 |
|---|---|---|
| 1 | 网站挂件、自定义 API、邮件、WhatsApp、Telegram、Messenger、Instagram、TikTok、LINE、微信、VKontakte、Zalo、YouTube 是否可接入 | |
| 2 | 不同渠道消息是否进入同一个共享工作台 | |
| 3 | 同一客户的邮箱、社媒 ID、即时通讯账号是否可自动合并 | |
| 4 | 客户档案是否内置国家、语言、时区、社媒 ID | |
| 5 | 坐席能否按国家、语言、标签、渠道快速分群 | |
| 6 | AI 是否能自动跟随客户语言回复,而不是只靠固定模板 |
这一组低于 8 分,先别谈 AI 效果。渠道没汇总,AI 和人工都会被切后台拖慢;档案没合并,分群和服务连续性都会打折。
知识库与回答依据:AI 不能靠感觉答
AI 客服的上限不是模型多会说,而是知识库有没有讲清政策、商品、物流和售后规则。
| # | 评分项 | 0-2 |
|---|---|---|
| 7 | 是否支持上传文档、抓取网站、手动问答三种知识录入方式 | |
| 8 | AI 回复时是否能基于知识库找依据,而不是自由发挥 | |
| 9 | 知识库是否能按品牌、店铺、市场或语言分组管理 | |
| 10 | 过期政策、冲突答案是否有提示或版本管理 | |
| 11 | AI 答不上时,是否能把问题沉淀成待补充内容 | |
| 12 | 上线前是否能用历史问题批量测试知识命中情况 |
真正要问:知识库没有答案时,AI 会不会编?合格系统应该承认不知道、转人工,并把缺口变成学习建议。
学习与回滚:越用越聪明,但不能自动失控
“越用越聪明”不是让 AI 偷偷改规则。学习必须是受控闭环:AI 没答上、坐席补答、纠正 AI,系统生成待确认学习建议,老板或负责人确认后才生效。
| # | 评分项 | 0-2 |
|---|---|---|
| 13 | AI 没答上的问题是否会进入学习建议队列 | |
| 14 | 坐席补答是否能沉淀为技能、知识或客户记忆 | |
| 15 | 坐席“纠正 AI”后是否会生成待确认学习建议 | |
| 16 | 学习建议是否必须人工评审后才生效 | |
| 17 | 每条学习结果是否可追溯到原始会话和确认人 | |
| 18 | 新学习内容是否可测试、可回滚 |
人工兜底与审批:退款、赔付、改价必须有人把关
AI 先接住重复问题,把人工时间让给高风险判断。退款、赔付、改价永远走人工审批与审计,AI 不能自动执行。
| # | 评分项 | 0-2 |
|---|---|---|
| 19 | 客户要求人工、AI 答不上、高风险关键词是否会自动转人工 | |
| 20 | 转人工时是否带上会话摘要、客户档案、订单上下文 | |
| 21 | AI 与人工是否能在同一工作台一键切换 | |
| 22 | 退款、赔付、改价是否有审批流 | |
| 23 | 审批记录是否可审计,能看到谁批准、基于什么上下文 | |
| 24 | 坐席是否能纠正 AI,并把纠正反馈进入学习闭环 |
不要只问“能不能转人工”。要看人工是否还要重问订单号、背景和诉求。好的交接应该像接力。
主动触达与护栏:能开口,也要知道什么时候闭嘴
主动触达有用,比如客户停在尺码页、物流页、结账页时,AI 可以适时开口。但它也最容易惹人烦,护栏必须足够硬。
| # | 评分项 | 0-2 |
|---|---|---|
| 25 | 是否支持仅观察、每条需我确认、自动发送三种模式 | |
| 26 | 是否有冷却时间,避免同一客户被连续打扰 | |
| 27 | 是否有频率上限和静默时段 | |
| 28 | 客户正在与坐席对话时,AI 是否不会插话 | |
| 29 | 是否支持别打扰名单 | |
| 30 | 退款、赔付、改价等敏感动作是否必须过人 |
主动触达不是群发营销。它应该接住正在犹豫的客户,而不是制造轰炸入口。边界可参考 主动触达不要打扰客户。
价格、试用与上线验证:别只看月费
AI 客服报价常常看起来都不贵,真正差异在计费口径:按坐席、按对话、按解决、按 outcome、按 AI credit,最后账单完全不同。
| # | 评分项 | 0-2 |
|---|---|---|
| 31 | 套餐内是否包含 AI credit | |
| 32 | 是否不按对话或解决结果二次计费 | |
| 33 | 超量规则是否清楚,账单是否可预测 | |
| 34 | 是否能用历史会话做试用测试,而不是只看样例数据 | |
| 35 | 是否能按渠道、语言、风险等级查看表现 | |
| 36 | 是否能导出试用结果供复盘 |
别只比较标价。要把高峰期会话量、AI credit、人工席位、超量规则都放进同一张表。
单次服务成本量级,先用区间压测账单
最后一轮现场测试:用 6 个问题筛掉不合适的平台
前面 36 项看配置,最后 6 项看真实表现。让每家供应商用同一组问题现场跑一遍。
| # | 评分项 | 0-2 |
|---|---|---|
| 37 | 用目标市场语言问物流,AI 是否能跟随语言并基于知识库回答 | |
| 38 | 问一个知识库没有的问题,AI 是否会转人工而不是编答案 | |
| 39 | 提出退款或赔付要求,系统是否进入人工审批 | |
| 40 | 在 WhatsApp、TikTok、邮件等不同渠道提问,是否汇入同一客户档案 | |
| 41 | 坐席纠正一次 AI 后,是否生成待确认学习建议 | |
| 42 | 回滚一条新学习内容后,AI 是否不再沿用错误口径 |
总分 84 分。70 分以上可深入试用,60-70 分要看短板是否打中核心场景,低于 60 分建议谨慎。红线是:学习不能自动生效,退款赔付不能无人审批,核心渠道不能靠人工搬运。
选型不是找“最会演示”的 AI 客服平台,而是找一个能在真实业务里接住问题、留下证据、持续变聪明的平台。跑完这 42 项,你会很快看清:哪些产品只是会聊天,哪些产品能成为客服团队的工作底座。