← 返回项目列表 / PROJECTS

CASE P.01 — LLM × B 端 SaaS

语枢 · 智能客服平台

当大模型开始「一本正经地胡说八道」,客服场景要的不是更聪明的模型, 而是一套让错误可以被预测、被拦截、被兜底的产品机制。

MY ROLE / 我的角色
AI 产品经理实习生(对话链路负责人)
TEAM / 团队
产品 2 · 算法 5 · 工程 8
DURATION / 周期
2025.03 — 2025.09 · 6 个月
STAGE / 阶段
B 轮前 · 已服务 30+ 企业客户

项目主视觉占位
建议放:产品界面截图 或 对话链路架构图
尺寸建议 1600×800

FIG.01 — 对话处理链路总览SOURCE: INTERNAL DESIGN DOC
54% → 82%

问题解决率(上线后 4 个月)

-47%

人工接管率下降

<1.8s

首字响应 P90

30+

付费企业客户续约

01 / 背景

公司是一家 A 轮 SaaS 厂商,核心产品为电商与教育行业提供智能客服。在我加入时, 产品刚从传统的意图分类架构切换到大模型方案,演示惊艳,上线翻车: 客户反馈集中在三类问题——答案幻觉(编造退款政策)、多轮对话丢失上下文、 复杂问题答非所问后无法及时转人工。

我作为唯一有 NLP 研究背景的产品实习生,负责对话链路的功能设计与质量体系。

02 / 挑战

  • 幻觉不可接受:客服场景每一条编造的政策都是真实客诉与法务风险,通用大模型的「敢说」在这里是缺陷。
  • 知识库脏且散:客户上传的帮助文档格式混乱、版本不一,朴素 RAG 召回的相关片段常常互相矛盾。
  • 转人工的悖论:转得太早,客服成本降不下来;转得太晚,用户愤怒值拉满。边界在哪里?
  • 没有评测体系:团队用「感觉变好了」评估迭代,无法定位回归发生在哪个环节。

03 / 我的方案

核心思路:把「一个模型回答所有问题」改造成「一套系统决定谁来回答」。 具体拆成四个相互咬合的设计决策:

  • 知识分层召回。把知识库按「政策原文 / 操作指引 / FAQ」分三层,查询时先做意图路由再分层检索,冲突时以政策原文为准——幻觉率直接砍半。
  • 置信度分级接管。设计了一套轻量置信度信号(检索命中分数 + 答案引用完整性 + 用户复述情绪),映射到三档动作:直接回答 / 附带确认回答 / 无缝转人工。转人工不再是失败,而是产品设计的一部分。
  • 引用即约束。要求模型答案必须挂载知识库出处,无出处的回答一律降级处理。这个「强制引用」后来成为向客户售卖的核心卖点。
  • Badcase 回流闭环。搭建标注后台:每次人工纠正自动生成训练样本,每周输出 Badcase 归因报告驱动迭代优先级。数据飞轮从第一周就开始转。
先定义「什么问题不允许模型自由发挥」,再谈模型能力怎么用。客服产品的竞争力不在聪明上限,而在错误的下限。

04 / 成果与反思

上线四个月后,问题解决率从 54% 提升到 82%,人工接管率下降 47%; 「强制引用 + 分级接管」方案进入三个标杆客户的续约合同附件。 个人层面,我独立完成了 6 份评审通过的 PRD,并推动建立了公司第一套对话质量评测规范。

如果重来一次:我会更早做置信度阈值的灰度实验——最初凭直觉定的阈值 导致前两周误转人工率偏高,靠事后数据分析才修正。直觉给方向,数据给刻度, 这是我在这段实习里最贵的一课。

NEXT CASE — P.02

研知 · 论文洞察工具:从博士课题到 8,000 用户 →