生产级 Agent 排雷实战

生产级 Agent 排雷实战 / 排掉 20 个工程地雷,守住 Agent 生产底线

李号双 eBay 资深架构师 · 极客网编辑部

外部课程链接可能包含推广参数,完整内容和价格以原课程页面为准。

  • 课程介绍
  1. 在线阅读:开篇词|Agent 跑起来之后,真正的工程才刚开始

    创造力让 Agent 诞生,防御性工程让 Agent 活下来

  2. 01|用十倍速制造事故:Loop Engineering 的暗面

    Loop Engineering 应遵循的“宪法”

  3. 02|别把执行权交给概率:六大契约重新定义工具设计

    六大契约重新定义工具的生命周期

  4. 03|注意力稀释:当 113 个工具让模型降智时,工程师该怎么做?

    让候选工具在多维上竞争,而不是预判意图

  5. 04|格式幻觉:为什么 JSON 完美合规却还能毒杀下游?

    结构化输出的本质不是“格式化”,而是“数据契约的工程实现”

  6. 06|分路召回架构:如何避免安全红线被向量检索“漏掉”?

    把你自己知道的约束边界,写进系统里——不再丢给概率去猜

  7. 07|当 Agent 的记忆开始“精神错乱”,敢遗忘才是解药

    记忆的第三个动作——遗忘

  8. 08|蒙眼狂奔的 ReAct:为什么执行前看不到计划的 Agent 最危险?

    计划的本质不是模型的一段自言自语,而是一份必须被系统掌控和追溯的执行契约

  9. 09|Agent 之间的信息传递:从互相投毒到契约交互

    你对协作系统的控制力,等于你对过境通道的控制力

  10. 10|多个 Agent 并发操作同一个世界:隔离优于共享

    在清晰的边界上,用最轻量的手段解决问题

  11. 11|RBAC 挡不住 Agent:如何设计一个企业级 Agent 权限系统

    把 Agent 视作一个概率性执行单元,需要边界约束、全程监控、动态授权,危急时刻还可以直接强制熔断

  12. 12|人审批后事故反而更大:正确设计 HITL 审批系统

    建立分层治理体系

课程介绍

欢迎加入交流群 你将获得 面对 Agent 异常时的根因定位能力与修复方法 Loop、工具、记忆与权限的系统级确定性护栏 多 Agent 编排、测试评估与自我进化的闭环体系 一套可复现问题、验证修复的生产级代码 ProdAgent...

欢迎加入交流群


你将获得

  • 面对 Agent 异常时的根因定位能力与修复方法
  • Loop、工具、记忆与权限的系统级确定性护栏
  • 多 Agent 编排、测试评估与自我进化的闭环体系
  • 一套可复现问题、验证修复的生产级代码 ProdAgent

讲师介绍


课程介绍

今天,搭建一个 Agent 已经不算难了。接入一个强模型,注册几个工具,再套上一层 Loop,它就能自己分析任务、调用工具、根据结果继续行动。哪怕系统只是封装了成熟模型或现成 AI 工具,也能很快做出一个让人眼前一亮的 Demo。

但只要把它放进真实业务,问题很快就会变:

  • Agent 明明没做完,却告诉你任务已经完成;
  • 接口只是超时,退款却执行了两次;
  • 工具从 20 个增加到 200 个,模型反而越来越容易选错;
  • 安全规则明明写进了知识库,这一轮却没有被召回;
  • 日志、指标和接口状态全是绿色,用户的任务还是失败了……

这些问题不能简单归结为“模型不够强”。因为模型解决的是“会不会做”,生产系统还要回答另外一批问题:能不能执行、最多执行几次、什么时候必须停止、失败以后怎样恢复、出了事故如何追查。

模型负责提出行动,工程系统必须负责行动的后果。这就是《生产级 Agent 排雷实战》想解决的问题。

这门课不教你如何搭一个 Agent,也不把精力放在 Prompt 技巧上。讲师李号双(eBay 资深架构师)将基于近年来在研发运维、智能客服、数据分析等场景中落地 Agent 的一线经验,结合企业 AI 工程实践,系统拆解出 Agent 从 Demo 走向生产时绕不开的 20 个工程问题,帮你修复和加固已经跑起来的系统。

课程如何展开?

课程分为七章,沿 Agent 从输入、规划、工具执行到状态恢复、观测评估和持续学习的完整链路展开。

第一章 Loop 控制:用硬边界、独立裁决、状态机和检查点,把终止权与恢复权留在工程系统中。
第二章 工具契约:治理原子性、描述、幂等、错误语义与 Native Tool / MCP Server 的统一执行。
第三章 上下文与记忆:用分层预算、多路径召回、衰减和冲突检测,让关键约束始终在场、旧信息及时退场。
第四章 规划与多 Agent:把计划外化为可查看、可版本化、可恢复的任务图,并用 Handoff 契约隔离协作污染。
第五章 权限与安全:把权限下沉到参数和数据流,通过污点追踪、即时授权、独立熔断与 Guardrails 守住边界。
第六章 韧性与成本:区分故障类型,设计差异化重试与熔断,并通过状态外置、成本预算和轨迹观测定位静默失效。
第七章 测试与闭环:用 FakeLLM、轨迹断言、LLM-as-Judge、经验账本与技能沉淀,验证行为并形成持续改进。

课程亮点

每一讲遵循同一条实战链路:

你会先看到错误是怎么发生的,再判断问题出在哪里。之后给出生产级实现,并坦诚告诉你:这套方案解决了什么、没有解决什么、需要付出怎样的工程成本。

除了复现问题的代码,课程还配备了一套生产级的开源框架 ProdAgent。通过这套代码,你能真正“看见”Agent 在干什么,也能验证改造前后的行为差异。无论是个人学习还是团队 Code Review,都可以把这套代码直接带进工程讨论。

课程中的状态机、幂等、事件溯源、污点追踪、Guardrail 和轨迹测试,不绑定任何模型或框架。无论用 Python、Java、Go 还是 TypeScript,都可以直接迁移。


课程目录


适合人群

这门课适合正在或即将把 Agent 接入真实业务的工程师,也适合维护线上 Agent、建设 Agent 平台、AI 中间层和 LLM 网关的技术负责人。


订阅须知