01 / 背景
公司是一家 A 轮 SaaS 厂商,核心产品为电商与教育行业提供智能客服。在我加入时, 产品刚从传统的意图分类架构切换到大模型方案,演示惊艳,上线翻车: 客户反馈集中在三类问题——答案幻觉(编造退款政策)、多轮对话丢失上下文、 复杂问题答非所问后无法及时转人工。
我作为唯一有 NLP 研究背景的产品实习生,负责对话链路的功能设计与质量体系。
02 / 挑战
- 幻觉不可接受:客服场景每一条编造的政策都是真实客诉与法务风险,通用大模型的「敢说」在这里是缺陷。
- 知识库脏且散:客户上传的帮助文档格式混乱、版本不一,朴素 RAG 召回的相关片段常常互相矛盾。
- 转人工的悖论:转得太早,客服成本降不下来;转得太晚,用户愤怒值拉满。边界在哪里?
- 没有评测体系:团队用「感觉变好了」评估迭代,无法定位回归发生在哪个环节。
03 / 我的方案
核心思路:把「一个模型回答所有问题」改造成「一套系统决定谁来回答」。 具体拆成四个相互咬合的设计决策:
- 知识分层召回。把知识库按「政策原文 / 操作指引 / FAQ」分三层,查询时先做意图路由再分层检索,冲突时以政策原文为准——幻觉率直接砍半。
- 置信度分级接管。设计了一套轻量置信度信号(检索命中分数 + 答案引用完整性 + 用户复述情绪),映射到三档动作:直接回答 / 附带确认回答 / 无缝转人工。转人工不再是失败,而是产品设计的一部分。
- 引用即约束。要求模型答案必须挂载知识库出处,无出处的回答一律降级处理。这个「强制引用」后来成为向客户售卖的核心卖点。
- Badcase 回流闭环。搭建标注后台:每次人工纠正自动生成训练样本,每周输出 Badcase 归因报告驱动迭代优先级。数据飞轮从第一周就开始转。
04 / 成果与反思
上线四个月后,问题解决率从 54% 提升到 82%,人工接管率下降 47%; 「强制引用 + 分级接管」方案进入三个标杆客户的续约合同附件。 个人层面,我独立完成了 6 份评审通过的 PRD,并推动建立了公司第一套对话质量评测规范。
如果重来一次:我会更早做置信度阈值的灰度实验——最初凭直觉定的阈值 导致前两周误转人工率偏高,靠事后数据分析才修正。直觉给方向,数据给刻度, 这是我在这段实习里最贵的一课。