01怎么做成这件事
这家公司客服团队 80 人,质检组 4 个人,按 5% 比例抽听录音。问题是:等发现话术违规,客户已经投诉到主管那里了。
做法:AI 预审,人只看高风险
- 录音转写(Whisper 微调客服领域热词),按句切分。
- 质检规则从 SOP 拆成 27 条可判定项(承诺超期、辱骂、泄露价格……),规则+模型双路打标。
- 模型只做「是否有风险+风险类型+证据句」,不打分——分数没法复核,证据可以。
- 输出直接挂在工单详情页,质检员点开就能跳到证据句。
关键决策
第一版想直接让模型输出质检得分,上线前放弃了:同一个录音两次打分差 15 分,质检主管拒绝签字。改成「证据句+风险类型」之后,复核动作变成确认而不是重听,人力才真正省下来。
结果
6 周上线。质检覆盖率 5% → 100%,人工只复核模型标高风险的 12%;人工复核量下降 42%,投诉发现时长从平均 9 天缩到 1 天内。
02关键结果
做之前
人工抽检 5% 通话录音,风险发现靠运气
做之后
全量 AI 预审 + 人工只看高风险 12%
03避坑清单
- 热词表没让客服团队参与,第一版把产品名全部转错,返工一周。
- 直接让模型打分不可复核,换成证据句才推得动。
- 低估了工单系统 API 的分页限制,全量回扫比计划多花 4 天。