跳到主要内容

从零到一:七日 Agent Loop Engineering 学习路径

七天实战

本路径与 Loop Engineering 子站 可并行:子站练直觉,本文练 可交付的 Loop Runtime 能力。建议已具备 HermesDSH 基础中的工具调用概念。

路径总览

Day主题交付物对齐文档
1心智模型与划界一页「Harness vs Loop」图intro
2最小 ReAct + 预算可运行骨架 + Tracegetting-started
3指纹、压缩、假完成对照实验报告getting-started + FAQ
4Plan–Execute + Replan修测试到绿(本地)development
5Eval–Optimize / Reflection带评分曲线的任务development
6多 Agent 与写回门禁流水线 Demo + 审阅表development + github
7生产检查单与复盘团队规范 PR + 演练best-practices

每日建议:上午理论 90 分钟 → 下午实现 150 分钟 → 晚上复盘 40 分钟


Day 1 — 划界:什么是 Agent Loop

目标

  • 能口述六类循环及适用边界。
  • 画出 Model / Harness / Loop 三层图。
  • 写出五条「本课不是控制教材」的自我提醒。

上午

精读 intro 公理与六类循环表;对照 Hermes 四件套,标出「循环层」插入点。

下午

用纸或 Mermaid 画一个你真实工作中的任务(例如「生成周报」「修 flaky test」),标注:验收、预算、危险工具。

晚上验收

  • 三层图可讲解 5 分钟不看稿
  • 任务卡字段齐全
  • 明确该任务默认拓扑

常见卡点

把「多轮聊天」误认为闭环——补问:有没有外部比较器?


Day 2 — 最小可收敛 ReAct

目标

实现 run_react_loop 级骨架,接一个 echo/假工具,导出 Trace。

上午

getting-started 骨架;把 Stop 优先级抄成单测用例表。

下午

编码:Budget、fingerprint(先对 echo 生效)、Trace JSON 落盘。

晚上验收

  • 故意同参调用 3 次触发停止
  • Trace 含 step/reason/spend
  • 开环基线数字记在笔记

Day 3 — 卫生与假完成攻防

目标

制造并修复 L04/L05;写一页「Observation 压缩规范」。

练习

  1. 让工具返回超大噪声,观察模型行为。
  2. 启用截断后再跑。
  3. 让模型输出「已完成」但验收失败——确认代码不采信。

晚上验收

  • 压缩前后对比表
  • 假完成被 StopJudge 拦住的单测
  • 阅读 FAQ Q13–Q16

Day 4 — Plan–Execute 实战

目标

选一个小型失败测试集(或故意写坏的函数),跑到绿或清晰失败。

上午

读 development 中计划对象与 Replan 触发器;设计 error_signature

下午

实现外环计划(JSON)+ 内环 ReAct;max_replan=2;禁止改测试文件。

晚上验收

  • 至少一次 Replan 有 Trace
  • 振荡检测逻辑有单测或仿真
  • 成功或失败原因可读

Day 5 — 评测驱动优化

目标

做一个「生成符合 schema 的 JSON 报告」任务:规则评测打分,Optimizer 迭代至阈值。

要点

  • Evaluator 只读。
  • 记录 score_history。
  • 平台期早停。
  • 可选:1 轮 Reflection 仅当规则难表达风格时。

晚上验收

  • 分数曲线(可用表格)
  • 无刷分路径(不能改 schema 文件)
  • 成本记录

Day 6 — 多 Agent 与记忆写回

目标

三条角色流水线:Researcher → Writer → Reviewer;写回门禁拒绝无来源事实。

上午

github-projects 审阅表给一个开源多 Agent 框架打分。

下午

自研最小编排器:handoff 必须带 artifact;TTL 防传球;记忆候选需 source 字段。

晚上验收

  • 审阅表 1 份
  • Demo 故意触发 L08 并停止
  • 写回拒绝用例 2 条

Day 7 — 生产化与毕业设计

目标

向团队提交:configs/loops 草案、Stop 顺序单测、复盘演练记录、个人自评。

毕业设计选项(三选一)

  1. CI 修测 Agent:只开 PR,有费用帽,Trace 上传 artifact。
  2. 文档站助手:根据 diff 更新 changelog,lint 门禁。
  3. 调研报告 Agent:只读工具 + notes 验收 + 单次反思。

评分标准

维度及格优秀
验收机判机判+业务指标
预算二维四维+冷却
观测Trace 文件仪表盘
安全白名单人审点+脱敏
文档READMEADR+复盘

七日之后的 30 天

最佳实践 落地:任务卡强制、影子模式、灰度、复盘。每月抽查 stop_reason 分布,消灭「只会加 max_steps」的文化。


学习契约(可打印)

我理解 Loop Engineering 在本站是 Agent 循环工程,不是控制教材换皮。
我将保持 Harness 与 Loop 分层,不为炫技上多 Agent。
我承诺每个自主环都有外部验收、多维预算与 Trace。
签名:__________ 日期:__________


每日复盘三问(沿用七天)

  1. 今天哪个停止原因出现最多?是否健康?
  2. 花掉的 token 买到了哪些可验证进展?
  3. 若只能改一处,改拓扑、评测还是工具描述?

把三问答案写进学习日志;第七天回顾会清晰看见你从「会调模型」变成「会做循环系统」。


与子站标签的翻译表

子站历史标签(若仍可见)文档站翻译后的学习重点
开环/闭环直觉无验收 vs 有验收 Agent
稳定性停止条件与振荡检测
软件循环Loop Runtime 状态机
系统动力学多 Agent / 记忆正反馈风险
AI 训练环Evaluator–Optimizer
综合项目Day7 毕业设计

不要把时间花在「整定控制增益」上;留给 Trace 与验收脚本。


资源清单

  • 本系列七篇文档(按侧边栏顺序)
  • Hermes / DSH 入门与开发指南
  • 子站:https://loop-engineering.chenxiaoshivivid.top/
  • 个人仓库:loop-runtime 练习项目(自建)
  • 黄金任务集:至少 10 个可重复任务

能力成熟度自评(Day7 必填)

级别描述你是否达到
L0只会多轮聊天
L1有 tool loop,无预算
L2有预算+外部验收
L3有指纹/压缩/Trace
L4Plan–Execute 或 Eval 环稳定
L5生产灰度+复盘文化

目标:七日结束至少 L3;三十日冲 L4–L5。

完成七日路径后,你应能在新工作中 10 分钟内写出任务卡,并在 Code Review 中指出缺停止条件的 PR——这才是从零到一的「一」。


附录 A:七日时间不够时的压缩版(3 日)

合并内容底线交付
D1Day1+2三层图 + 骨架 + 指纹演示
D2Day3+4压缩规范 + Plan–Execute 一次实战
D3Day5+6+7评测环或流水线二选一 + 检查单 PR

压缩版不降低质量条,只减少拓扑种类;禁止跳过外部验收。


附录 B:同伴评审表(Day2/Day4/Day7)

是/否评论
验收可机判
预算≥三维
Trace 可复述故事
无「模型自称完成」成功路径
写工具权限最小
失败模式有编号

两位同伴签字后,才算该 Day 完成——避免自嗨 Demo。


附录 C:推荐实验日志字段

date:
day:
hypothesis:
change:
runs: n=
success_rate:
avg_steps:
avg_tokens:
stop_reason_hist:
next_action:

连续记录 21 天,你会拥有比任何「感觉模型变强了」更硬的个人数据集。


附录 D: entourage 障碍排除

障碍处理
没有可修的测试仓库自建 broken_calc:故意错实现 + pytest
没有云 API Key用 mock LLM:按脚本返回既定 tool_calls
时间被会议占满改用 3 日压缩版,但不要取消同伴评审
同事仍要无限 Agent用 cost 对比开环基线说服,或先影子模式

mock LLM 不是偷懒:它是把 StopJudge / fingerprint 测成确定性工程的正确方式。真模型联调放在每日最后 30 分钟即可。

读完本篇请回到 入门介绍 做一次自测五问;答得出再开始 Day 1 下午的任务卡练习。祝学习顺利。