AI AGENT PLATFORM CASE STUDY

Customer Service
Agent Studio

企业客服 Agent 构建、调试、运营与质量管理平台

以零食电商客服作为当前业务验证场景,将 Agent 的规划、能力调用、运行追踪、运营与评测拆分为可管理的产品体系。

PlannerSkillToolTraceAgentOpsEval
Agent 工作台
运营中心
Eval 实验室

PRODUCT POSITIONING

Agent 能回答,不等于 Agent 能稳定运行。

Agent 不是一个 Prompt,而是一套可规划、可约束、可观察、可运营、可评测的运行系统。

  1. 用户请求
  2. Planner规划
  3. Plan Validator计划校验
  4. Skill / Tool能力调用
  5. Executor执行
  6. Risk Check风险检查
  7. 最终回复
  8. RunRecord / Trace运行记录 / 执行轨迹

AGENT RUNTIME

一次 Agent Run,从这里开始,也从这里被观察。

功能
统一发起 Agent 请求,同时查看 Planner、执行 Trace 与最近运行结果。
目的
让输入、计划、能力选择、执行结果和风险状态处于同一个工作上下文中。
价值
最终回复不再是唯一结果,一次运行本身成为可解释、可追踪的产品对象。

USER EXPERIENCE

面向用户的是对话,背后连接的是完整 Agent Runtime。

功能
提供当前零食电商客服业务实例的终端交互入口。
目的
验证推荐、订单、物流、优惠、风险等能力在真实用户问题中的组合效果。
价值
平台能力最终回到用户问题是否真正被解决,而不是只在后台验证架构。

PLANNER MANAGEMENT

Planner 决定这一轮 Agent 应该调用什么能力。

功能
管理 Planner Prompt、当前可用 Skill / Tool、Mandatory Capabilities 与 Plan Preview。
目的
让 Agent 根据用户问题动态组合能力,而不是通过固定 if / else 完成路由。
价值
规划逻辑成为可配置、可检查、可验证的产品层。

Plan Validator(计划校验器)在执行前检查能力是否存在、是否启用,以及强制能力是否遗漏。

CAPABILITY MANAGEMENT

把 Agent 的能力,从代码和 Prompt 中拆出来管理。

Skills 管理:把认知能力做成可注册、可配置、可版本化的资产。

支持 Skill 注册、启停、Prompt 编辑、Tool 依赖配置与版本快照,并可查看不同版本之间的变化。

让业务 SOP 与认知逻辑能够独立维护,而不是固化在 Agent 主流程中。

Tools 管理:统一管理 Agent 可调用的确定性业务能力。

支持 Tool 注册、Input / Output Schema 配置、独立测试、返回结果检查,并记录调用耗时与错误信息。

在接入 Agent 前先验证接口契约和执行结果,降低运行阶段的不确定性。

模型与运行时:统一管理 Agent 的执行环境。

支持 Provider、Model 与运行模式配置,并可在 Fixture / Live 等环境之间切换,用同一套产品能力验证不同模型与运行条件。

将模型选择与业务能力解耦,避免 Agent 产品逻辑与单一模型绑定。

业务上下文:集中管理 Agent 当前可访问的领域数据。

对商品、订单、物流、优惠、FAQ 等业务数据进行分类组织,为 Skill、Tool 和 Agent Run 提供统一的领域上下文入口。

将平台能力与具体业务实例分离,降低迁移到其他客服场景时的上下文替换成本。

MEMORY-DRIVEN EXPERIENCE

让 Agent 不只理解这一次请求,也能记住用户过去的偏好。

在商品推荐能力中,通过长期记忆保存用户历史偏好,并在后续会话中重新注入推荐上下文,
使推荐从一次性响应演进为跨会话的个性化服务。

长期记忆的价值不是保存聊天记录,而是把历史信息转化为下一次服务可以复用的用户上下文。
商品推荐长期记忆 Workflow
100%滚轮缩放 · 拖拽查看节点
图为商品推荐业务场景中的长期记忆能力及价值验证,而非完整记忆平台。

AGENTOPS

Agent 上线之后,真正的产品工作才开始。

  1. 运行记录Run
  2. 评分 / 人工标注Rating / Annotation
  3. 问题案例Bad Case
  4. 改进建议Improvement
  5. 人工接管Human Handoff

运营中心不是普通数据 Dashboard。它从真实 Run 中发现失败、需要人工处理的问题和待优化能力,并将问题送回下一轮改进和 Eval。

EVALUATION

每一次 Agent 改动,都应该知道它到底变好了还是变差了。

  1. 评测案例
  2. 单条 / 批量运行
  3. 确定性评分
  4. LLM Judge语义评审
  5. 版本对比Compare
  6. 回归验证Regression

Skill、Prompt、Planner 或 Tool 调整以后,通过固定 Case 重复运行、记录结果、版本 Compare 与 Regression,建立 Agent 版本治理依据。

PRODUCT BOUNDARY

Demo 能跑通,与生产级平台之间仍然有清晰边界。

当前 Demo / MVP 已验证

已验证 Planner 动态规划、执行前计划校验、Skill / Tool 能力调用、风险检查、RunRecord / Trace 运行追踪,以及 AgentOps、Eval、Regression 与 Fixture Runtime。

生产化仍需要

生产化还需要接入真实 LLM Provider、企业数据源、Knowledge Base / RAG,以及权限与 RBAC、审计日志、密钥管理、运行基础设施和多用户可靠性能力。