Hermes Agent 最佳实践
与子站联动
本文是 Hermes 七天子站 的工程化补充:理论在文档,可观测性在 Tool Call Inspector,角色实验在 Persona Lab。生产 checklist 可直接对照子站 Code Sandbox 的 trace 回放验证。
Agent 从 Demo 到生产,失败 rarely 来自「模型不够聪明」,而来自 分层职责不清、工具边界模糊、观测缺失。Hermes 方法论把 Agent 拆成 工具层 / 角色层 / 推理层 / 记忆层 / 安全层,再叠加 生产部署、可观测性、成本与 A/B。每一层都有可执行清单、反模式与真实案例——不是口号,而是你在 Code Review 和 On-call 里能勾选的条目。
一、工具层(Toolchain Layer)
工具层回答:模型能做什么、以什么 Schema 做、失败时如何降级。Hermes 子站 Day 3 TOOLCHAIN 把工具分为信息 / 计算 / 行动 / 感知四类;生产里还要加 编排形态(线性 / 条件 / 并行)。
1.1 可执行清单
| # | 检查项 | 通过标准 | 验证方式 |
|---|---|---|---|
| T1 | 每个工具有唯一 name,≤64 字符,snake_case | Schema 无重名 | 静态扫描 registry |
| T2 | description 采用 Active 描述(何时用 + 何时不用) | 含 NOT FOR 子句 | 人工 + LLM 盲测选工具 |
| T3 | 参数有 enum / default / required 显式声明 | Pydantic 校验通过 | 单测注入非法参数 |
| T4 | 超时分级:读 10s / 写 30s / 批处理 60s | 无 hung 请求 | 压测 + trace |
| T5 | 工具粒度:单工具单意图,组合用 Tool Pack | 平均链长 ≤5 步 | Inspector 统计 |
| T6 | 成功率 / P95 延迟 / LLM 选中率 每周复盘 | 选中率 ≥85% | 仪表盘 |
| T7 | 危险工具(Git push、发邮件)标记 risk: high | 网关强制 HITL | 权限矩阵 |
Active vs Passive 描述示例