What you'll learn
- Build a coding agent with planning, tool use, execution and verification from scratch
- Deploy a trained model as a concurrent, streaming, monitored service
- Build task agents with grounding, memory, evaluation and continuous improvement
- Give agents visual perception and control robots through ROS2
- Safely integrate agents into an existing enterprise system
- Build permissions, approvals, audit, rollback and recovery for agents
- Judge a full system by correctness, reliability, latency, cost and safety
Syllabus
Course resources (live sessions / slides / recordings / labs) open to cohort members after signing in.
Sign in →Prerequisites / self-paced labs
Not tied to any session — do them any time, ideally before the cohort starts.
把课上那 17 个演示跑在你自己的机器上,然后用同一套运行时,给你自己的任务造一个能停、能续、能改自己的循环
课上每个技术点都是一个能跑的源码文件,一运行就自动打开一个实时看板:循环走到哪、prompt 怎么变(并排 diff)、每次调用发出去的上下文有多大、token 花了多少、尺子说了什么、图的节点在走、分数曲线在动。第一步在你自己的机器上把它们跑起来,看懂看板每一栏在说什么。第二步换掉尺子——写你自己领域的六道题,内置的 a0/a1/a3/c3 立刻全变成你的题;再用同一个 live/ 运行时给你自己的一批活写一个带七件套的循环、给你自己的流程画一张带上限的环和人类闸的图。全程纯标准库,不装任何东西。
Prerequisites: 复现课上的常驻个人助理(Gmail 哨兵 + Slack + 本机的手),再给它加一只你自己的手
给已有的 ERP 外挂一层 Agent:业务做得漂亮,不等于可以放行
在一套真的在跑的 ERPNext 外面加一层,让 Agent 能安全地用它。十个 Task 从读权限一路做到审计与注入隔离。最后你会看到一个业务分 86% 的 Agent 必须被拒——并亲手写出拦它的那条判据。
Prerequisites: lab-04-eval-harness
Sessions
Live sessions, slides, recordings and the labs for each session — kept in sync with the learning centre.
1
Ended
Lecture-01: Understand Modern Agent System from First Principle
Taught by Marvin Gao
🗓 2026年8月15日 周六 20:00 · 北京时间 Mentor Local: 2026年8月15日 周六 05:00 · 美西时间
# 现代 Agent 的第一性原理:ReAct、MCP、Tools 与 Skills Plan–Act–Observe–Verify:ReAct 循环的每一步在 token 层面到底发生了什么 Tool Calling 全生命周期:Schema 设计、参数校验、结果回填 —— 一次工具调用如何往返于模型与运行时 MCP 的 Server / Client / Transport 架构,以及与 Function Calling 的区别 Tools、Skills、Sub-agent 三者的边界 沙箱与执行权限:让 Agent「能干活但不闯祸」的工程边界 # Agent 的记忆管理:Memory 与 Context Engineering System Prompt、对话历史、工具结果的上下文排布与「Context Rot」问题 Context 压缩与摘要:什么该留、什么该丢、什么该外置到文件系统 从 KV Cache 视角理解:Prompt 前缀稳定性为什么直接决定推理成本 # Harness Engineering 与 Claude Code 源码分析拆解 Claude Code:目前世界上被验证得最充分的 Agent Harness 二次开发实战:在 Claude Code SDK 之上注入自己的工具、技能与工作流
🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 RecordingLabs for this session(2)
🔒 Online Lab Mentor在 Claude Code 之上造一个 Auto-Scientist:给它一个研究问题,它自己复现、跑实验、验证、播报——无人也在跑
不从零写循环——把 Claude Code 本身当外壳,用它的 5 个注入点(settings/commands/skills/hooks/MCP)把它改造成一个会做科研的 agent。它读方法、下数据、写训练代码、在真 GPU 上微调、提交服务端打分验证、发邮件播报。你会亲手看着它撒谎(报训练集精度)、被一篇投毒论文偷走密钥、跑到迷路重复实验——然后一层层把它补成一个扛得住、无人也在跑的科学家。案例=第五课的 FGVC-Aircraft 飞机分类。
~7–10 hagent 四要素 + Verify 是脊椎(服务端 held-out,不是自报) · 工具七阶段 + 参数不可信(会碰世界的工具) · 致命三件套 + 四堵墙(注入防御在执行层) · 长跑=上下文战争(二次成本/Context Rot/外置文件/KV Cache) · compaction 会冲掉 agent 自己的铁律(hook 重注入) · 五个注入点二次开发 Claude Code🔒 Online Lab Mentor造一个会自己训模型的 Agent —— 而且它说的每句话都得拿出证据
从一个 HTTP POST 开始,亲手把 agent 一层层搭出来:给它工具、套上循环,然后交给它一台真 A10 GPU 去微调一个 100 类的飞机识别模型。接着是这节课真正的分水岭——它会告诉你「我训到 94%」,你把预测提交服务端 held-out 打分器,只有 60%。它没撒谎,它是量错了尺子。于是你给它装上三道闸:分数要服务端对账、投递要 SMTP 回执、部署要 Actions 真跑过一次。最后推到 GitHub,让它每天自己醒来、自己播报。你交付的不是「我做完了」,是一本证据账本。
~6–9 h从零搭出 ReAct 循环(LLM → 工具协议 → 循环 → 停止条件) · 让 agent 碰真钱真硬件:远程 GPU 编排 + 预算纪律 · 提交服务端 held-out 打分器,在公开榜上看到自己的名次与成绩 · 迁移学习实操(冻结骨架 vs 全量微调,超参杠杆) · Verify 机制:证据账本 + 三道闸(自报 ≠ 证据) · 多渠道投递与回执(Gmail SMTP / 飞书 · 凭据即密码) · 常驻部署(GitHub Actions 当闹钟)+ 别让定时器有权花钱Files & references(1)
- PDF206 KB🔒 Download
lecture-note
- PDF
2
Ended
记忆与手 —— 记忆管理、RAG、常驻助理与电脑操作
Taught by Marvin
🗓 2026年8月22日 周六 20:00 · 北京时间 Mentor Local: 2026年8月22日 周六 05:00 · 美西时间
- Retrieval Augment Generation - Memory Management - Personal Assistant - Computer Use Agent
🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 RecordingLabs for this session(1)
🔒 Online Lab Mentor会自己做视频的助理:在你自己的电脑上,指挥 coding agent 造一个能控制 OBS、写口播稿、开提词器、自动剪辑的本地 agent
不在沙箱里——在你自己的电脑上做一个真的每天能用的东西。起一个 localhost 对话窗口,对它说话:它布置 OBS 场景并录制、按主题下载资料建语料库、三种检索方法在你的语料上对比实验、RAG 写出带引用的口播稿、稿子推上不入镜的提词器、录完自动剪掉冷场和讲错的地方、烧上设计过的字幕、组装 CapCut 草稿。你不手写代码:指挥自己的 coding agent 去做,你负责验收和纠偏;云端评测和 Lab 助手替你把关已知的坑(WebSocket 子协议、双层 SHA256 握手、恒 200 的 API、剪辑时间轴陷阱)。
~5–8 hagent 循环 + 工具注册(纯 stdlib,零框架,200 行) · 裸协议:obs-websocket 5.x 手写(与 CDP 同形状:WS+JSON 帧+按 id 配对) · 验收哲学:ffprobe 真读 > 返回值;verified_on_disk;错误说人话回填 · 自动剪辑两层:信号层(silencedetect 零 token)+ 语义层(转录+段编号选剪) · 反幻觉定位:模型绝不产时间戳,只报可复制的编号/引用 · 检索三路在自己语料上量过再选(课上 B02 量法的 lab 版) · 指挥 coding agent:写清期望结果,用评测矩阵验收,用助手排障Prerequisites: 在 Claude Code 之上造一个 Auto-Scientist:给它一个研究问题,它自己复现、跑实验、验证、播报——无人也在跑
3
Ended
常驻者与手 —— 上下文管理、Hermes 原理与 Computer Use
Taught by Marvin Gao
🗓 2026年8月30日 周日 09:00 · 北京时间 Mentor Local: 2026年8月29日 周六 18:00 · 美西时间
- Context Management - Hermes / OpenClaw - Computer Use Agent - Agentic Development
🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 RecordingLabs for this session(1)
🔒 Online Lab Mentor复现课上的常驻个人助理(Gmail 哨兵 + Slack + 本机的手),再给它加一只你自己的手
课上那个助理——Gmail 来信(IMAP IDLE)→ Claude 判断值不值得打扰你 → 推 Slack 附回复草稿 → 你回 Y 它就从你的 Gmail 发出去;你在频道里说「用 Keynote 做 6 页提纲导出 PDF 发我」→ 它操作本机软件做完发回来;launchd 让它开机自启、死了拉起——第一步在你自己的机器上原样复现,逐项验证(邮件真推、回信真挂原线程、kill -9 真回来)。第二步:课上的手是 Keynote,你加一只自己的——Pages/日历/提醒/Shortcuts/ffmpeg(macOS)或 PowerPoint/Outlook/通知(Windows,PowerShell COM),形状永远是「一个脚本 + registry 里的一行」,agent 循环一行不改。
~3–6 h常驻 vs 一次性三差异:进程模型(launchd / 任务计划)/ 记忆持久化(state/pending/sessions 落盘)/ 事件驱动(IMAP IDLE + Socket Mode) · 两条长连接一个思想:本地拨出去、事件推回来、没有公网地址、没有轮询 · 判断层是一次 Claude 调用:语义命中不是关键词命中;解析失败宁可漏 · 人在环:建议回复 + Y/N/M;意图由模型判,单字母快速路径 · 「手」= 第一课的 tool-use 循环;加一只手 = 脚本 + schema 一行,description 是 prompt · 副作用边界:产物只进 hands/out;对外动作先确认 · 验收以真读为准:Gmail 已发邮件、hands/out 的文件、launchctl 状态Prerequisites: 会自己做视频的助理:在你自己的电脑上,指挥 coding agent 造一个能控制 OBS、写口播稿、开提词器、自动剪辑的本地 agent
Files & references(2)
- LINKOpen ↗
MIT Multi-Agent
https://arxiv.org/pdf/2608.26081
- MD8 KB🔒 Download
Slack Assistant Plan Document
- LINK
4
Ended
多智能体协作与无人值守系统 — Multi-Agent、Loop & Graph、Self-Evolving
Taught by Marvin Gao
🗓 2026年9月6日 周日 09:00 · 北京时间 Mentor Local: 2026年9月5日 周六 18:00 · 美西时间
阶段 1 · 原理解析与架构搭建(W3) a. Multi-Agent System 多智能体系统 b. Loop Engineering 与 Graph Engineering:无人值守的长周期 Agent c. Self-Evolving Agent 与 Recursive Evolving Agent System
🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 RecordingFiles & references(1)
- LINKOpen ↗
第四课源代码
- LINK
5
Ended
Lecture-05: 让 Agent 管理现代应用栈 — 部署、DevOps、自托管推理与 Token 治理
Taught by Marvin Gao
🗓 2026年9月13日 周日 09:00 · 北京时间 Mentor Local: 2026年9月12日 周六 18:00 · 美西时间
180 分钟:GitHub、Supabase、Vercel、Cloudflare、Stripe、Render、Daytona 接入与部署;Agentic DevOps;Ollama / vLLM;模型网关与 Token 治理。 中文讲义:https://hkwinbwvcvsvhjtphijj.supabase.co/storage/v1/object/public/lecture-assets/c2-lecture-5/lecture-note-f4a07af0168d.pdf
🔒 Course link (recording)🔒 Slides🔒 Whiteboard🔒 RecordingFiles & references(1)
- PDF303 KB🔒 Download
DevOps Instructions
- PDF
6
Ended
Lecture-05: 一次大模型请求的完整生命周期与 Server 实现
Taught by Marvin Gao
🗓 2026年9月12日 周六 20:00 · 北京时间 Mentor Local: 2026年9月12日 周六 05:00 · 美西时间
阶段 2 · Project 4(W5–7)· 为企业客服搭建大模型服务基础设施 Prefill/Decode 两阶段、Streaming 流式输出、TTFT/TPOT 与 p99、KV Cache 定量权衡 亲手实现 Toy Server:请求接入 → 排队 → 推理 → 流式返回
Course link · TBASlides · TBAW06
Ended
Enterprise AI - Part 1
Taught by Marvin Gao
🗓 美西时间:2026年9月18日 周五 18:00(PDT) 北京时间:2026年9月19日 周六 09:00(CST)
本课以 cohort-1 的 OpenWorker + ERPNext 工程为起点,学习如何为已有企业系统增加 Agent,并建立可执行、可观测、可评测的业务闭环。 主要内容: 1. Enterprise Agent 的常见挑战与应对:需求与业务规则恢复、遗留系统兼容、API 异常、权限与审批、提示注入、成本和评测盲区。 2. ERPNext Agent 化现场演示:源码与业务流程测绘、REST API 到 MCP 工具封装、身份边界、草稿与提交审批,以及执行后的业务状态验证。 3. Hyper-τ 原理与自动评测平台:区分构建阶段与用户交互阶段,理解任务事实、业务结果验证和成本约束。 4. 零售系统实战:取消订单的工具契约、政策判断、代码对比与实际案例,建立成功率评测基线。 5. Langfuse 过程观测与状态管理:接入代码、Trace/Span 层级、模型/工具/API 调用关联,现场分析成功、正确拒绝、写入后超时三类案例。 6. 学生动手接入与验证:提交运行证据,定位失败类型,为下一课提升正确率、可信度和稳定性做准备。 课程时长:180 分钟。包含代码演示、流程图、案例对比和课堂练习。
🔒 Course link (recording)🔒 Slides🔒 RecordingFiles & references(1)
- PDF303 KB🔒 Download
Enterprise-AI-Deployment
- PDF
W07
Ended
Enterprise AI - Part 2
Taught by Marvin Gao
🗓 美西时间:2026年9月26日 周六 18:00(PDT) 北京时间:2026年9月27日 周日 09:00
本课围绕“Agent 为什么做错、应该改哪里、怎样证明修好了”展开,用可运行的失败案例练习过程观测与工程改进。 一、Langfuse:看懂 Agent 的执行过程 - 理解 Trace、Observation / Span、Generation 与 Score,区分调用成功、任务成功和评估通过。 - 查看每一步的输入、输出、工具参数与父子关系,定位调用链中的第一处偏差。 - 路由错误:分类正确,为什么仍然调用了错误工具?根据 trace 定位并修复 routes 映射。 - 工具配置错误:查询生产环境却返回测试环境数据,如何检查环境选择与参数配置。 - Skill 接口错误:返回结构合法但金额单位解释错误,如何修复适配层与接口契约。 - 模型能力问题:确认上下文与上游流程正确后,如何设计公平的模型 A/B 对照,比较效果、成本与延迟。 二、自动评估:从本地检查到 Jev - 理解本地 evaluate / checks、evaluationPassed 与 Langfuse Scores 的数据关系。 - 比较 Code evaluator、LLM-as-a-judge 和 Decision model 的适用场景。 - 配置 Jev 的 question、policy、answer 映射,判断回答是否推荐了正确或错误入口。 - 使用否定表达、混合建议、缺少方案等样本校准评估器,理解置信度与实际准确率的区别。 三、七个工程案例:问题、原因与修复 1. 商品偏好:新增 rankPrefered 排序工具,避免把目录顺序当作用户偏好。 2. 批量换货:将 exchange 的输入由 item 改为 items,完整校验后一次提交,避免部分写入。 3. 任务遗漏:新增 getAllTodoOrders 工具,发现完整待办范围,避免只处理用户举例的订单。 4. 搜索漏页:在 search 工具内部完成分页、去重与循环保护,正确区分未找到和未搜完。 5. 超时重复预订:在工具内部封装稳定请求标识、状态查询与安全重试,避免重复业务操作。 6. 猜测业务规则:保留未知状态、请求业务确认,并通过工具权限与服务端校验阻止未经批准的写入。 7. 取消后漏退款:新增 verify 步骤,根据真实账本发现缺失退款,自动补救后再次验证。 四、课堂练习与课后复习 - 每个案例先展示用户问题、v1 输出与业务状态,再分析调用路径、查看代码修改并运行 v2。 - 增加边界和反例测试,用独立业务证据验证修复,避免只让原题通过。 - 配套 45 页复习 PPT、案例源码、运行命令、练习与可展开答案的自测题。 说明:案例采用确定性教学模拟,七个工程案例受 Hyper-Tau / τ-bench 启发,并非官方测试原题;模型对照部分不预设任何品牌更强。
🔒 Course link (recording)🔒 Slides🔒 RecordingW08
Next up
Enterprise AI Part-3:工具设计与企业软件接入
Taught by Howard Cao
🗓 2026年10月3日 周六 18:00 · 美西时间(PDT) 北京时间:2026年10月4日 周日 09:00
阶段 2 · Project 5(W8–10)· 基于 ROS2 与多模态 Agent 的 UR5 机器人控制系统 ROS2 核心(Node/Topic/Service/Action)、机器人动力学与坐标系、 RGB/Depth 感知管线、Embodied AI 全景
🔒 Course link🔒 Slides10
Upcoming
Lecture-09: 基于多模态基础模型的运动控制与姿态矫正
Taught by Howard Cao
🗓 2026年10月10日 周六 20:00 · 北京时间 Mentor Local: 2026年10月10日 周六 05:00 · 美西时间
阶段 2 · Project 5(W9) VLM 物体检测与三维位姿估计、MoveIt2 路径规划与抓取位姿、 执行反馈与视觉验证、失败分类与重新规划、部署到真实机器
Course link · TBASlides · TBA11
Upcoming
Lecture-10: Project 5 项目迭代与答疑 — UR5 机器人控制
Taught by Howard Cao
🗓 2026年10月17日 周六 20:00 · 北京时间 Mentor Local: 2026年10月17日 周六 05:00 · 美西时间
阶段 2 · Project 5(W10)· 项目迭代与答疑 产出:ROS Bag 执行回放、抓取成功率与失败分类报告、可入简历的演示视频
Course link · TBASlides · TBA12
Upcoming
Lecture-11: 任务型 Agent 与 Self-Evolving 机制 — 接管航空票务
Taught by Howard Cao
🗓 2026年10月24日 周六 20:00 · 北京时间 Mentor Local: 2026年10月24日 周六 05:00 · 美西时间
阶段 2 · Project 6(W11–13)· 面向航空票务与企业 ERP 的 Agent 智能化 Dialogue State 与任务状态形式化、政策 Grounding 与 RAG 验证 Self-Evolving 闭环实装:Trace → 失败模式 → 改进 → Sandbox 测试 → 审批上线
Course link · TBASlides · TBA13
Upcoming
Lecture-12: 让 Agent 安全进入已有 ERP — 权限、审批与审计
Taught by Howard Cao
🗓 2026年10月31日 周六 20:00 · 北京时间 Mentor Local: 2026年10月31日 周六 05:00 · 美西时间
阶段 2 · Project 6(W12) 既有系统能力盘点、ERP API → Agent Tool 封装、API-first + Computer Use 补遗留 RBAC 最小权限、高风险审批、幂等与 Transaction、Audit Trail 全程审计
Course link · TBASlides · TBA14
Upcoming
Lecture-13: Project 6 项目迭代与答疑 — 航空票务与企业 ERP
Taught by Howard Cao
🗓 2026年11月7日 周六 20:00 · 北京时间 Mentor Local: 2026年11月7日 周六 04:00 · 美西时间
阶段 2 · Project 6(W13)· 项目迭代与答疑 产出:完整可运行、持续部署、可接受访问与用户实际使用的 Agent 系统
Course link · TBASlides · TBA