五类生产客服Agent:评测驱动的迭代与A/B上线的原创流程示意,非客户现场或产品截图
流程示意 · 非客户现场 / 非产品截图

外部公开案例,非衍谷交付

enterprise-nubank-support-agents-001 · 金融与保险 · 深度案例|关键链路较完整

Nubank · 五类生产客服Agent:评测驱动的迭代与A/B上线

来源披露≠独立审计;编辑分析不等于客户确认。A级仅表示可定位到案例级来源,详细度不是成功评分。请先阅读下方字段分析边界;未公开细节不可当作已实施事实。

阅读主来源 ↗

字段分析边界

业务问题依据
论文背景与客服场景披露
解决方案
依据论文所述Agent、评测和上线流程整理
技术工作流
论文逐层披露
FDE 行动(请结合分析边界)
依据公开工程过程归纳;未披露FDE岗位
结果(来源方披露)
企业团队论文中的线上A/B结果

业务问题

Nubank的客服需要处理卡片配送、债务管理、信用额度、卡片管理和产品解释等不同问题。传统知识库型机器人难以调用实时业务数据、执行受控操作或处理复杂分支;若只看离线答题分数,也无法证明真实客户满意度和自助解决率会改善。

解决方案

团队把客服SOP拆成可版本化的指令、例行流程、工具说明和工作记忆,并按场景配置Agent。以卡片配送为例,Agent读取物流与客户资料、按地址类型排查、必要时发起补卡或带上下文转人工。团队先用人工标注、LLM评审器和离线模拟定位失败,再用GEPA优化评测提示,最终以小流量A/B逐步发布并跟踪交易NPS和自助服务率。

技术工作流

  1. 把人类客服SOP改写为可组合、语义版本化的指令、例行流程、工具描述与工作记忆
  2. 卡片配送Agent通过客户资料、配送状态与补卡工具执行受控步骤
  3. 离线案例和人工标注构建场景评测集,LLM评审器与人工判断做一致性校准
  4. 用GEPA在DSPy中优化评审提示词,并比较不同模型上的评测稳定性
  5. 新版本先在1%流量发布,再按离线失败率和线上表现扩大A/B流量
  6. 线上同时测交易NPS、自助服务率、任务完成率,并在低置信度时转人工
  7. 客服数据最小化与去标识化,日志及评测集按角色、审计与时限授权

技术组件

  1. 模块化上下文工程
  2. 领域SOP/例行流程
  3. 客户资料与配送工具
  4. LLM-as-a-Judge
  5. GEPA / DSPy
  6. 离线模拟与人工标注
  7. 线上A/B和交易NPS
  8. 转人工与隐私治理

人工责任与复核

人工客服承接低置信度、客户不满或自动流程无法解决的场景,交接时保留上下文。领域专家标注评测集并校准LLM评审器;受监管的授信和债务相关决策仍受既有规则、人工监督与申诉机制约束。对话数据经最小化、去标识化和受控访问。

FDE 行动(请结合分析边界)

  1. 先选高频且可观测的卡片配送问题,明确老版本机器人与人工服务基线
  2. 将客服SOP拆成可维护的步骤、工具权限和触发条件
  3. 用专家标注校准自动评测,而非直接信任模型自评
  4. 根据失败案例逐项增加物流工具、补卡能力、挫败识别和简洁性约束
  5. 从1%流量开始做真实客户A/B,并同时衡量满意度和自助解决率
  6. 为隐私、争议处理和人工接管建立生产边界

结果(来源方披露)

论文报告5个生产客服Agent。卡片配送Agent相对先前版本,AI交易NPS提高37个百分点、自助服务率提高29个百分点;其NPS仍比专家人工客服低10个百分点。债务管理Agent虽有改善,NPS仍低于专家人工客服23.6个百分点;产品解释Agent的自助服务率短暂下降1.5个百分点。论文未公开完整财务回报或独立审计。

核验说明

  1. 100M+是Nubank客户规模,不是这些Agent的实际用户数。
  2. 37和29都是百分点,不是相对百分比;对照组是先前Agent版本。
  3. 五个Agent的交易NPS均改善,但产品解释场景自助服务率短暂下降;不得写作所有指标全面提升。
  4. 论文未给出完整ROI,线上结果和隐私控制均属于企业团队自述。

未公开 / 仍有缺口

未补充记录

可迁移方法

  1. 离线评测应与线上业务指标建立可检验关联
  2. 满意度与自助率可能互相牵制,不能只优化一个指标
  3. 先在单一高频场景验证再扩展为多场景共用框架
  4. 生产Agent的工具权限、人工交接和数据保护与提示词同等重要

来源账本

标题
Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework
发布方
Nubank团队 / KDD 2026论文
来源类型
企业员工署名技术论文
可定位性
案例级直接来源
结论披露方
企业项目团队披露
已记录独立核验
否
源库查阅日期
2026-09-23

补充来源

  1. 标题
    arXiv论文摘要、作者与KDD 2026收录信息

证据说明

Nubank员工署名的KDD 2026论文直接披露五个生产Agent、技术流程和A/B结果;同行评审不等于独立审计公司业务指标。

编辑摘要

Nubank把客服Agent做成评测驱动的生产工程:SOP与工具模块化、人工标注校准评审器、离线模拟筛选版本、1%流量起步A/B,最终在五类客服场景复用。

详细度六维评分(各 0–2)

业务背景
2
改造流程
2
技术工作流
2
人机与治理
2
量化结果
2
来源可定位性
2

原始案例 ID

enterprise-nubank-support-agents-001

技术方案参考

是

来源分类

企业原始材料

企业 / 组织

Nubank

行业

数字银行/金融服务

一级行业

金融与保险

业务场景

五类生产客服Agent:评测驱动的迭代与A/B上线

FDE 标记

企业内部AI改造

FDE 关系

Nubank内部团队建设;未披露FDE岗位

成熟度说明

五个场景生产部署/持续A/B

成熟度阶段

已上线

主来源

https://arxiv.org/html/2606.08867 ↗

证据等级

A

证据等级说明

A级|企业团队论文直接来源

详细度评分(满分 12)

12

详细度分组

deep

详细度说明

深度案例|关键链路较完整

编辑数据:guminghao-avi contributors,MIT。导入 2026-10-02;源版本 ef550123。版权与许可证 · 原案例库。以上保留来源与证据限定,不构成衍谷效果承诺。

PROJECT BRIEF

整理你的企业需求

用几句话描述当前流程,生成一份可用于沟通的需求单。

提交后,信息将保存至本站并仅供衍谷管理者查看和联系你。请勿填写客户隐私、密码或业务机密。未提交草稿仅暂存在当前标签页会话,提交成功后清除本类草稿。

FDE / LEARNING LAB