高级智能体系统训练营 · 第二期

Advanced Agent Systems Engineering Boot Camp · Cohort 2

From rebuilding Claude Code to enterprise-grade agent systems — 13 weeks, hands-on

6 labs14 live sessions6 hands-on labsBilingual · EN / 中
Open the online IDE →

What you'll learn

  • Build a coding agent with planning, tool use, execution and verification from scratch
  • Deploy a trained model as a concurrent, streaming, monitored service
  • Build task agents with grounding, memory, evaluation and continuous improvement
  • Give agents visual perception and control robots through ROS2
  • Safely integrate agents into an existing enterprise system
  • Build permissions, approvals, audit, rollback and recovery for agents
  • Judge a full system by correctness, reliability, latency, cost and safety

Syllabus

Course resources (live sessions / slides / recordings / labs) open to cohort members after signing in.

Sign in →

Prerequisites / self-paced labs

Not tied to any session — do them any time, ideally before the cohort starts.

把课上那 17 个演示跑在你自己的机器上,然后用同一套运行时,给你自己的任务造一个能停、能续、能改自己的循环

课上每个技术点都是一个能跑的源码文件,一运行就自动打开一个实时看板:循环走到哪、prompt 怎么变(并排 diff)、每次调用发出去的上下文有多大、token 花了多少、尺子说了什么、图的节点在走、分数曲线在动。第一步在你自己的机器上把它们跑起来,看懂看板每一栏在说什么。第二步换掉尺子——写你自己领域的六道题,内置的 a0/a1/a3/c3 立刻全变成你的题;再用同一个 live/ 运行时给你自己的一批活写一个带七件套的循环、给你自己的流程画一张带上限的环和人类闸的图。全程纯标准库,不装任何东西。

🔒 Online Lab Mentor
~4–8 h循环七件套:状态 / 步 / 尺子 / 反馈通道 / 停机条件 / 预算 / 检查点,缺一件会怎样 · 尺子工程:公开例子 vs 隐藏用例;一句话反馈(输入/期望/实际)比一百字评价有用 · 归因纪律:一次只动一个变量(K=1 / 盲重试 / 验证-重试三条臂) · 无进展规则:同一份输出第二次出现 = 反馈通道已空,再跑只剩成本 · 原子检查点与幂等续跑:临时文件 + os.replace;按条目编号做键 · tinygraph:节点=函数、边=下一个跑谁、检查点=每步存盘、中断=存盘后进程退出 · 带上限的环:上限是环唯一保证会终止的东西;评委是有噪声的尺子 · 两把尺子:public 涨 private 不动 = 学到答案不是能力 · 可观测性即工程:把一个进程在干什么变成事件流,才谈得上调它

Prerequisites: 复现课上的常驻个人助理(Gmail 哨兵 + Slack + 本机的手),再给它加一只你自己的手

给已有的 ERP 外挂一层 Agent:业务做得漂亮,不等于可以放行

在一套真的在跑的 ERPNext 外面加一层,让 Agent 能安全地用它。十个 Task 从读权限一路做到审计与注入隔离。最后你会看到一个业务分 86% 的 Agent 必须被拒——并亲手写出拦它的那条判据。

🔒 Online Lab Mentor
~8–12 h给已有系统外挂 Agent 层(不改宿主,继承宿主护栏) · 窄工具契约:DocType 是受控参数,不是任意地址 · 身份单出口与 Site 隔离:伪造字段要拒绝而不是忽略 · 风险分类与不可绕过的运行时 FLOOR · 持久幂等台账:原子占位 + 租约 + 进程重启后仍去重 · uncertain 与写后对账:回执成功 ≠ 终态成功 · append-only 审计与双向可追溯 · 宿主数据里的提示词注入隔离

Prerequisites: lab-04-eval-harness

Sessions

Live sessions, slides, recordings and the labs for each session — kept in sync with the learning centre.

  1. 1

    Ended

    Lecture-01: Understand Modern Agent System from First Principle

    Taught by Marvin Gao

    🗓 2026年8月15日 周六 20:00 · 北京时间 Mentor Local: 2026年8月15日 周六 05:00 · 美西时间

    # 现代 Agent 的第一性原理:ReAct、MCP、Tools 与 Skills Plan–Act–Observe–Verify:ReAct 循环的每一步在 token 层面到底发生了什么 Tool Calling 全生命周期:Schema 设计、参数校验、结果回填 —— 一次工具调用如何往返于模型与运行时 MCP 的 Server / Client / Transport 架构,以及与 Function Calling 的区别 Tools、Skills、Sub-agent 三者的边界 沙箱与执行权限:让 Agent「能干活但不闯祸」的工程边界 # Agent 的记忆管理:Memory 与 Context Engineering System Prompt、对话历史、工具结果的上下文排布与「Context Rot」问题 Context 压缩与摘要:什么该留、什么该丢、什么该外置到文件系统 从 KV Cache 视角理解:Prompt 前缀稳定性为什么直接决定推理成本 # Harness Engineering 与 Claude Code 源码分析拆解 Claude Code:目前世界上被验证得最充分的 Agent Harness 二次开发实战:在 Claude Code SDK 之上注入自己的工具、技能与工作流

    🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 Recording

    Labs for this session(2)

    在 Claude Code 之上造一个 Auto-Scientist:给它一个研究问题,它自己复现、跑实验、验证、播报——无人也在跑

    不从零写循环——把 Claude Code 本身当外壳,用它的 5 个注入点(settings/commands/skills/hooks/MCP)把它改造成一个会做科研的 agent。它读方法、下数据、写训练代码、在真 GPU 上微调、提交服务端打分验证、发邮件播报。你会亲手看着它撒谎(报训练集精度)、被一篇投毒论文偷走密钥、跑到迷路重复实验——然后一层层把它补成一个扛得住、无人也在跑的科学家。案例=第五课的 FGVC-Aircraft 飞机分类。

    🔒 Online Lab Mentor
    ~7–10 hagent 四要素 + Verify 是脊椎(服务端 held-out,不是自报) · 工具七阶段 + 参数不可信(会碰世界的工具) · 致命三件套 + 四堵墙(注入防御在执行层) · 长跑=上下文战争(二次成本/Context Rot/外置文件/KV Cache) · compaction 会冲掉 agent 自己的铁律(hook 重注入) · 五个注入点二次开发 Claude Code

    造一个会自己训模型的 Agent —— 而且它说的每句话都得拿出证据

    从一个 HTTP POST 开始,亲手把 agent 一层层搭出来:给它工具、套上循环,然后交给它一台真 A10 GPU 去微调一个 100 类的飞机识别模型。接着是这节课真正的分水岭——它会告诉你「我训到 94%」,你把预测提交服务端 held-out 打分器,只有 60%。它没撒谎,它是量错了尺子。于是你给它装上三道闸:分数要服务端对账、投递要 SMTP 回执、部署要 Actions 真跑过一次。最后推到 GitHub,让它每天自己醒来、自己播报。你交付的不是「我做完了」,是一本证据账本。

    🔒 Online Lab Mentor
    ~6–9 h从零搭出 ReAct 循环(LLM → 工具协议 → 循环 → 停止条件) · 让 agent 碰真钱真硬件:远程 GPU 编排 + 预算纪律 · 提交服务端 held-out 打分器,在公开榜上看到自己的名次与成绩 · 迁移学习实操(冻结骨架 vs 全量微调,超参杠杆) · Verify 机制:证据账本 + 三道闸(自报 ≠ 证据) · 多渠道投递与回执(Gmail SMTP / 飞书 · 凭据即密码) · 常驻部署(GitHub Actions 当闹钟)+ 别让定时器有权花钱
    Files & references(1)
    • PDF

      lecture-note

      206 KB🔒 Download
  2. 2

    Ended

    记忆与手 —— 记忆管理、RAG、常驻助理与电脑操作

    Taught by Marvin

    🗓 2026年8月22日 周六 20:00 · 北京时间 Mentor Local: 2026年8月22日 周六 05:00 · 美西时间

    - Retrieval Augment Generation - Memory Management - Personal Assistant - Computer Use Agent

    🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 Recording

    Labs for this session(1)

    会自己做视频的助理:在你自己的电脑上,指挥 coding agent 造一个能控制 OBS、写口播稿、开提词器、自动剪辑的本地 agent

    不在沙箱里——在你自己的电脑上做一个真的每天能用的东西。起一个 localhost 对话窗口,对它说话:它布置 OBS 场景并录制、按主题下载资料建语料库、三种检索方法在你的语料上对比实验、RAG 写出带引用的口播稿、稿子推上不入镜的提词器、录完自动剪掉冷场和讲错的地方、烧上设计过的字幕、组装 CapCut 草稿。你不手写代码:指挥自己的 coding agent 去做,你负责验收和纠偏;云端评测和 Lab 助手替你把关已知的坑(WebSocket 子协议、双层 SHA256 握手、恒 200 的 API、剪辑时间轴陷阱)。

    🔒 Online Lab Mentor
    ~5–8 hagent 循环 + 工具注册(纯 stdlib,零框架,200 行) · 裸协议:obs-websocket 5.x 手写(与 CDP 同形状:WS+JSON 帧+按 id 配对) · 验收哲学:ffprobe 真读 > 返回值;verified_on_disk;错误说人话回填 · 自动剪辑两层:信号层(silencedetect 零 token)+ 语义层(转录+段编号选剪) · 反幻觉定位:模型绝不产时间戳,只报可复制的编号/引用 · 检索三路在自己语料上量过再选(课上 B02 量法的 lab 版) · 指挥 coding agent:写清期望结果,用评测矩阵验收,用助手排障

    Prerequisites: 在 Claude Code 之上造一个 Auto-Scientist:给它一个研究问题,它自己复现、跑实验、验证、播报——无人也在跑

  3. 3

    Ended

    常驻者与手 —— 上下文管理、Hermes 原理与 Computer Use

    Taught by Marvin Gao

    🗓 2026年8月30日 周日 09:00 · 北京时间 Mentor Local: 2026年8月29日 周六 18:00 · 美西时间

    - Context Management - Hermes / OpenClaw - Computer Use Agent - Agentic Development

    🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 Recording

    Labs for this session(1)

    复现课上的常驻个人助理(Gmail 哨兵 + Slack + 本机的手),再给它加一只你自己的手

    课上那个助理——Gmail 来信(IMAP IDLE)→ Claude 判断值不值得打扰你 → 推 Slack 附回复草稿 → 你回 Y 它就从你的 Gmail 发出去;你在频道里说「用 Keynote 做 6 页提纲导出 PDF 发我」→ 它操作本机软件做完发回来;launchd 让它开机自启、死了拉起——第一步在你自己的机器上原样复现,逐项验证(邮件真推、回信真挂原线程、kill -9 真回来)。第二步:课上的手是 Keynote,你加一只自己的——Pages/日历/提醒/Shortcuts/ffmpeg(macOS)或 PowerPoint/Outlook/通知(Windows,PowerShell COM),形状永远是「一个脚本 + registry 里的一行」,agent 循环一行不改。

    🔒 Online Lab Mentor
    ~3–6 h常驻 vs 一次性三差异:进程模型(launchd / 任务计划)/ 记忆持久化(state/pending/sessions 落盘)/ 事件驱动(IMAP IDLE + Socket Mode) · 两条长连接一个思想:本地拨出去、事件推回来、没有公网地址、没有轮询 · 判断层是一次 Claude 调用:语义命中不是关键词命中;解析失败宁可漏 · 人在环:建议回复 + Y/N/M;意图由模型判,单字母快速路径 · 「手」= 第一课的 tool-use 循环;加一只手 = 脚本 + schema 一行,description 是 prompt · 副作用边界:产物只进 hands/out;对外动作先确认 · 验收以真读为准:Gmail 已发邮件、hands/out 的文件、launchctl 状态

    Prerequisites: 会自己做视频的助理:在你自己的电脑上,指挥 coding agent 造一个能控制 OBS、写口播稿、开提词器、自动剪辑的本地 agent

    Files & references(2)
    • LINK

      MIT Multi-Agent

      https://arxiv.org/pdf/2608.26081

      Open ↗
    • MD

      Slack Assistant Plan Document

      8 KB🔒 Download
  4. 4

    Ended

    多智能体协作与无人值守系统 — Multi-Agent、Loop & Graph、Self-Evolving

    Taught by Marvin Gao

    🗓 2026年9月6日 周日 09:00 · 北京时间 Mentor Local: 2026年9月5日 周六 18:00 · 美西时间

    阶段 1 · 原理解析与架构搭建(W3) a. Multi-Agent System 多智能体系统 b. Loop Engineering 与 Graph Engineering:无人值守的长周期 Agent c. Self-Evolving Agent 与 Recursive Evolving Agent System

    🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 Recording
    Files & references(1)
  5. 5

    Ended

    Lecture-05: 让 Agent 管理现代应用栈 — 部署、DevOps、自托管推理与 Token 治理

    Taught by Marvin Gao

    🗓 2026年9月13日 周日 09:00 · 北京时间 Mentor Local: 2026年9月12日 周六 18:00 · 美西时间

    180 分钟:GitHub、Supabase、Vercel、Cloudflare、Stripe、Render、Daytona 接入与部署;Agentic DevOps;Ollama / vLLM;模型网关与 Token 治理。 中文讲义:https://hkwinbwvcvsvhjtphijj.supabase.co/storage/v1/object/public/lecture-assets/c2-lecture-5/lecture-note-f4a07af0168d.pdf

    🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 Recording
    Files & references(1)
    • PDF

      DevOps Instructions

      303 KB🔒 Download
  6. 6

    Ended

    Lecture-05: 一次大模型请求的完整生命周期与 Server 实现

    Taught by Marvin Gao

    🗓 2026年9月12日 周六 20:00 · 北京时间 Mentor Local: 2026年9月12日 周六 05:00 · 美西时间

    阶段 2 · Project 4(W5–7)· 为企业客服搭建大模型服务基础设施 Prefill/Decode 两阶段、Streaming 流式输出、TTFT/TPOT 与 p99、KV Cache 定量权衡 亲手实现 Toy Server:请求接入 → 排队 → 推理 → 流式返回

    Course link · TBASlides · TBA
  7. W06

    Ended

    Enterprise AI - Part 1

    Taught by Marvin Gao

    🗓 美西时间:2026年9月18日 周五 18:00(PDT) 北京时间:2026年9月19日 周六 09:00(CST)

    本课以 cohort-1 的 OpenWorker + ERPNext 工程为起点,学习如何为已有企业系统增加 Agent,并建立可执行、可观测、可评测的业务闭环。 主要内容: 1. Enterprise Agent 的常见挑战与应对:需求与业务规则恢复、遗留系统兼容、API 异常、权限与审批、提示注入、成本和评测盲区。 2. ERPNext Agent 化现场演示:源码与业务流程测绘、REST API 到 MCP 工具封装、身份边界、草稿与提交审批,以及执行后的业务状态验证。 3. Hyper-τ 原理与自动评测平台:区分构建阶段与用户交互阶段,理解任务事实、业务结果验证和成本约束。 4. 零售系统实战:取消订单的工具契约、政策判断、代码对比与实际案例,建立成功率评测基线。 5. Langfuse 过程观测与状态管理:接入代码、Trace/Span 层级、模型/工具/API 调用关联,现场分析成功、正确拒绝、写入后超时三类案例。 6. 学生动手接入与验证:提交运行证据,定位失败类型,为下一课提升正确率、可信度和稳定性做准备。 课程时长:180 分钟。包含代码演示、流程图、案例对比和课堂练习。

    🔒 Course link (recording)🔒 Slides🔒 Recording
    Files & references(1)
    • PDF

      Enterprise-AI-Deployment

      303 KB🔒 Download
  8. W07

    Ended

    Enterprise AI - Part 2

    Taught by Marvin Gao

    🗓 美西时间:2026年9月26日 周六 18:00(PDT) 北京时间:2026年9月27日 周日 09:00

    本课围绕“Agent 为什么做错、应该改哪里、怎样证明修好了”展开,用可运行的失败案例练习过程观测与工程改进。 一、Langfuse:看懂 Agent 的执行过程 - 理解 Trace、Observation / Span、Generation 与 Score,区分调用成功、任务成功和评估通过。 - 查看每一步的输入、输出、工具参数与父子关系,定位调用链中的第一处偏差。 - 路由错误:分类正确,为什么仍然调用了错误工具?根据 trace 定位并修复 routes 映射。 - 工具配置错误:查询生产环境却返回测试环境数据,如何检查环境选择与参数配置。 - Skill 接口错误:返回结构合法但金额单位解释错误,如何修复适配层与接口契约。 - 模型能力问题:确认上下文与上游流程正确后,如何设计公平的模型 A/B 对照,比较效果、成本与延迟。 二、自动评估:从本地检查到 Jev - 理解本地 evaluate / checks、evaluationPassed 与 Langfuse Scores 的数据关系。 - 比较 Code evaluator、LLM-as-a-judge 和 Decision model 的适用场景。 - 配置 Jev 的 question、policy、answer 映射,判断回答是否推荐了正确或错误入口。 - 使用否定表达、混合建议、缺少方案等样本校准评估器,理解置信度与实际准确率的区别。 三、七个工程案例:问题、原因与修复 1. 商品偏好:新增 rankPrefered 排序工具,避免把目录顺序当作用户偏好。 2. 批量换货:将 exchange 的输入由 item 改为 items,完整校验后一次提交,避免部分写入。 3. 任务遗漏:新增 getAllTodoOrders 工具,发现完整待办范围,避免只处理用户举例的订单。 4. 搜索漏页:在 search 工具内部完成分页、去重与循环保护,正确区分未找到和未搜完。 5. 超时重复预订:在工具内部封装稳定请求标识、状态查询与安全重试,避免重复业务操作。 6. 猜测业务规则:保留未知状态、请求业务确认,并通过工具权限与服务端校验阻止未经批准的写入。 7. 取消后漏退款:新增 verify 步骤,根据真实账本发现缺失退款,自动补救后再次验证。 四、课堂练习与课后复习 - 每个案例先展示用户问题、v1 输出与业务状态,再分析调用路径、查看代码修改并运行 v2。 - 增加边界和反例测试,用独立业务证据验证修复,避免只让原题通过。 - 配套 45 页复习 PPT、案例源码、运行命令、练习与可展开答案的自测题。 说明:案例采用确定性教学模拟,七个工程案例受 Hyper-Tau / τ-bench 启发,并非官方测试原题;模型对照部分不预设任何品牌更强。

    🔒 Course link (recording)🔒 Slides🔒 Recording
  9. W08

    Next up

    Enterprise AI Part-3:工具设计与企业软件接入

    Taught by Howard Cao

    🗓 2026年10月3日 周六 18:00 · 美西时间(PDT) 北京时间:2026年10月4日 周日 09:00

    阶段 2 · Project 5(W8–10)· 基于 ROS2 与多模态 Agent 的 UR5 机器人控制系统 ROS2 核心(Node/Topic/Service/Action)、机器人动力学与坐标系、 RGB/Depth 感知管线、Embodied AI 全景

    🔒 Course link🔒 Slides
  10. 10

    Upcoming

    Lecture-09: 基于多模态基础模型的运动控制与姿态矫正

    Taught by Howard Cao

    🗓 2026年10月10日 周六 20:00 · 北京时间 Mentor Local: 2026年10月10日 周六 05:00 · 美西时间

    阶段 2 · Project 5(W9) VLM 物体检测与三维位姿估计、MoveIt2 路径规划与抓取位姿、 执行反馈与视觉验证、失败分类与重新规划、部署到真实机器

    Course link · TBASlides · TBA
  11. 11

    Upcoming

    Lecture-10: Project 5 项目迭代与答疑 — UR5 机器人控制

    Taught by Howard Cao

    🗓 2026年10月17日 周六 20:00 · 北京时间 Mentor Local: 2026年10月17日 周六 05:00 · 美西时间

    阶段 2 · Project 5(W10)· 项目迭代与答疑 产出:ROS Bag 执行回放、抓取成功率与失败分类报告、可入简历的演示视频

    Course link · TBASlides · TBA
  12. 12

    Upcoming

    Lecture-11: 任务型 Agent 与 Self-Evolving 机制 — 接管航空票务

    Taught by Howard Cao

    🗓 2026年10月24日 周六 20:00 · 北京时间 Mentor Local: 2026年10月24日 周六 05:00 · 美西时间

    阶段 2 · Project 6(W11–13)· 面向航空票务与企业 ERP 的 Agent 智能化 Dialogue State 与任务状态形式化、政策 Grounding 与 RAG 验证 Self-Evolving 闭环实装:Trace → 失败模式 → 改进 → Sandbox 测试 → 审批上线

    Course link · TBASlides · TBA
  13. 13

    Upcoming

    Lecture-12: 让 Agent 安全进入已有 ERP — 权限、审批与审计

    Taught by Howard Cao

    🗓 2026年10月31日 周六 20:00 · 北京时间 Mentor Local: 2026年10月31日 周六 05:00 · 美西时间

    阶段 2 · Project 6(W12) 既有系统能力盘点、ERP API → Agent Tool 封装、API-first + Computer Use 补遗留 RBAC 最小权限、高风险审批、幂等与 Transaction、Audit Trail 全程审计

    Course link · TBASlides · TBA
  14. 14

    Upcoming

    Lecture-13: Project 6 项目迭代与答疑 — 航空票务与企业 ERP

    Taught by Howard Cao

    🗓 2026年11月7日 周六 20:00 · 北京时间 Mentor Local: 2026年11月7日 周六 04:00 · 美西时间

    阶段 2 · Project 6(W13)· 项目迭代与答疑 产出:完整可运行、持续部署、可接受访问与用户实际使用的 Agent 系统

    Course link · TBASlides · TBA