比特严选智能体:从蓝图开始设计
作者:程序员马丁
Ragent AI —— 从 0 到 1 纯手工打造企业级 Agentic RAG,拒绝 Demo 玩具!AI 时代,助你拿个offer。
上一篇咱们给 Agent 拍了张全景图:LLM 大脑、工具手脚、记忆、规划,四个要素在循环里协作运转。最后还拿扫地机退货串了一遍完整的交互流程,四要素怎么配合已经清楚了。
但那张图里的工具叫 queryOrder、searchKnowledge,都是随手起的名字。大脑的提示词长什么样、工具怎么注册、循环怎么停——这些全是留白。从这一篇开始,咱们要把留白一 块一块填上。
不过别急着写代码。你有没有过这种经历:需求没想清楚就开干,写到一半发现方向跑偏了?Agent 的代码一旦跑起来,循环里套着工具调用,改起来比普通代码更痛苦。所以这一篇先不敲 Java,把比特严选智能体的蓝图画清楚——它要解决哪些任务、需要哪些工具、第一版做成什么样。蓝图画完,从下一篇开始真刀真枪写 ReAct 循环时,你才知道往哪使劲。
比特严选客服的一天
1. 先看真实的用户消息
第一篇已经介绍过比特严选的基本面——自营智能硬件电商,约 300 到 500 个 SKU,6 大品类(手机、平板电脑、笔记本、智能穿戴、智能家居、影音配件)。场景不再重复,但第一篇只看了一个扫地机退货的例子,还不够全面。
咱们换个角度,看看客服一天下来实际会收到哪些消息:
查东西:
帮我看看订单 88231 到哪了。 上周买的耳机发了吗?运单号多少?
要操作:
上周买的扫地机不回充了,修不好我想退。 收到的平板屏幕有划痕,要换货。
问推荐:
3000 块左右给老人买个手机,屏幕大、声音大的。 客厅想搞一套智能家居——音箱、扫地机、摄像头,预算 2000 以内。
搞诊断:
我的比特手表连不上手机蓝牙了。 智能音箱昨天开始说话有回声。
问政策:
你们以旧换新怎么算价? 618 满减和学生优惠能叠加吗?
看到没有——用户的问题不只是查个资料答一句,而是经常涉及多步操作、需要跨系统查数据、还带着模糊的约束条件(“3000 块”“给老人”“预算 2000 以内”)。第一篇说 RAG 接不住这些问题,原因就在这里:它们需要 Agent 循环那个想-做-看的能力。
2. 八大任务拆解
把上面这些用户消息整理一下,比特严选智能体要解决的任务可以归纳成八大类:
| 编号 | 任务 | 典型用户消息 | Agent 需要做什么 |
|---|---|---|---|
| T1 | 查订单状态 | 订单 88231 什么状态了 | 调订单系统,返回商品、时间、当前状态 |
| T2 | 查物流轨迹 | 快递到哪了 | 先从订单取运单号,再查物流接口 |
| T3 | 退款/换货 | 扫地机坏了想退 | 查订单 → 判退货条件 → 发起售后 |
| T4 | 商品规格对比 | A15 和 A18 有什么区别 | 分别查两个商品规格,整理成对比表 |
| T5 | 促销政策咨询 | 618 怎么参加 | 检索促销知识库,组织回答 |
| T6 | 按需求推荐 | 3000 块给老人买手机 | 解析约束 → 筛选商品 → 排序推荐 |
| T7 | IoT 搭配推荐 | 客厅智能家居套装 | 跨品类组合 → 兼容性校验 → 预算匹配 |
| T8 | 故障诊断 | 手表连不上蓝牙 | 多轮问答走诊断树,逐步排查 |
八个任务覆盖了比特严选客服 80% 以上的日常。但它们的复杂度差异很大——有的一步就搞定,有的要在循环里转好几圈。接下来咱们按复杂度分个级。
任务分级:一步到位的 vs 必须循环的
1. 四个复杂度等级
把八大任务按 Agent 循环需要转几圈来分级,画面就清晰了。
一星:单步查询
T1(查订单)和 T5(促销政策)最简单。大脑一想就知道该调什么工具,工具一调就拿到结果,直接回复用户。循环只转一圈:
用户提问 → 大脑:该查订单 → 工具:调订单系统 → 大脑:够了,回复用户
二星:串联查询
T2(查物流)和 T4(商品对比)要稍复杂一些。查物流得先查订单拿运单号,再用运单号查物流——两次工具调用有先后依赖。商 品对比得分别查两个商品的规格,再整理成对比表。循环至少转两圈:
用户提问 → 大脑:先查订单拿运单号 → 工具:查订单 → 大脑:拿到运单号了,查物流 → 工具:查物流 → 大脑:够了,回复用户
三星:带判断的操作
T3(退款/换货)和 T6(按需推荐)不仅要查数据,还得根据数据做判断。退货得先查订单确认收货时间,判断在不在七天退货窗口内、是不是非人为损坏,然后才决定能不能退。推荐得先解析“3000 块”“老人用”“屏幕大”这些约束条件,从商品库筛选,还可能根据用户反馈调整结果。循环转几圈不确定,取决于中间的判断结果。
四星:多轮诊断 / 跨品类编排
T7(IoT 搭配推荐)和 T8(故障诊断)是最复杂的。IoT 搭配要跨手机、智能家居、影音配件等多个品类选品,还得在智能家居品类内部做设备兼容性校验(音箱和摄像头能不能联动、扫地机支不支持同一个 APP 控制),再核算总价。故障诊断更是典型的多轮——让用户检查蓝牙开关、重启手表、清除配对记录,每一步看结果再决定下一步问什么,循环可能要转五六圈甚至更多。
2. 复杂度一览
| 等级 | 任务 | 典型圈数 | 关键挑战 |
|---|---|---|---|
| ⭐ | T1 查订单、T5 促销政策 | 1 圈 | 无,单次工具调用即可 |
| ⭐⭐ | T2 查物流、T4 商品对比 | 2-3 圈 | 多次调用有先后依赖 |
| ⭐⭐⭐ | T3 退款/换货、T6 按需推荐 | 2-5 圈 | 中间结果决定分支走向 |
| ⭐⭐⭐⭐ | T7 IoT 搭配、T8 故障诊断 | 3-8+ 圈 | 跨品类编排或多轮用户交互 |
这张表有个重要的启示:一星任务一次工具调用就够了,严格来说用不着 Agent;但从二星开始,多步串联、条件分支、多轮交互——正是 Agent 循环的价值所在。
第一版做什么,不做什么
1. MVP(最小可行产品)范围
咱们的目标是手写 ReAct 循环,不是做一个完整的客服系统。所以第一版要遵循一个原则:选一组刚好能把循环核心能力跑通的任务,不多也不少。
第一版选这四个任务:
| 入选任务 | 等级 | 入选理由 |
|---|---|---|
| T1 查订单状态 | ⭐ | 最简单的起点,验证单步循环能跑通 |
| T2 查物流轨迹 | ⭐⭐ | 引入多步串联,验证循环能转多圈 |
| T3 退款/换货 | ⭐⭐⭐ | 引入条件判断和有副作用的操作 |
| T5 促销政策咨询 | ⭐ | 把 RAG 检索封装成工具,验证知识库能被 Agent 自主调用 |
这四个任务从一星覆盖到三星,恰好能演示 ReAct 循环的四个核心能力:
- 单步调用——大脑想一次,工具跑一次,直接给答案。
- 多步串联——上一步的输出是下一步的输入,循环要转多圈。
- 条件判断——根据中间结果走不同分支,大脑要会拐弯。
- RAG 作为工具——把你在 RAG 系列写的检索链路封装成 Agent 的一个工具,大脑自己决定什么时候调。
2. 暂不做的部分
| 暂不做 | 推迟到哪里 | 原因 |
|---|---|---|
| T4 商品对比 | 第四部分·多工具编排 | 依赖商品数据库的完整建模 |
| T6 按需推荐 | 第四部分·多工具编排 | 需要商品筛选与排序的完整实现 |
| T7 IoT 搭配 | 第五部分·多 Agent 协作 | 天然适合拆成商品 Agent + IoT 兼容性 Agent 协作 |
| T8 故障诊断 | 第四部分·Plan-and-Execute | 需要诊断树和多轮交互的精细设计 |
不是说这些任务不重要。恰恰相反,它们是后面几个部分的主角。但它们依赖的机制——多 Agent 调度、Plan-and-Execute、反思——要到后面的篇章才讲。先把 ReAct 循环的骨架立稳,再往上加肉。