Hermes Agent Self-Evolution 教程:先保护仓库和会话数据
Hermes Agent Self-Evolution 把 DSPy 与 GEPA 接到 Hermes Agent 的技能文件上。它读取当前 skill 和执行轨迹,生成候选,跑评测与约束门,再把最佳版本交给人工 PR 审查。
pyproject.toml 标为 0.1.0,Python 要求 3.10+;本轮核对到 main 最新记录日期是 2026-06-17。复现实验要保存 commit。1. 当前只有 Phase 1 已实现
README 把技能文件优化标为 Implemented。工具描述、系统提示词、工具代码和持续改进循环仍是 Planned。首页概述提到的完整目标不能当作现成能力。
现有流程从 Hermes 仓库读取 skill,生成 synthetic 或 sessiondb 评测数据,用 GEPA 分析轨迹并产生变体。候选必须过测试、15KB 技能体积、缓存兼容和语义保持检查。最终结果走人工 PR,官方写明不直接 commit。
2. 依赖与安装
核心依赖是 DSPy 3.0+、OpenAI Python SDK、PyYAML、Click 和 Rich,开发环境另装 pytest。项目不需要 GPU,但候选生成、反思和评估都会访问模型 API。
git clone https://github.com/NousResearch/hermes-agent-self-evolution.git cd hermes-agent-self-evolution python -m venv .venv source .venv/bin/activate pip install -e ".[dev]"
先把 HERMES_AGENT_REPO 指向可丢弃分支,不要指向唯一工作副本。确认 provider key 只通过环境变量提供,也不要把密钥写入评测数据或报告。
3. 先用合成评测跑小规模
export HERMES_AGENT_REPO=/path/to/disposable/hermes-agent python -m evolution.skills.evolve_skill \ --skill github-code-review \ --iterations 2 \ --eval-source synthetic
官方示例是 10 次迭代;第一次可先降到 2,目的是看清 API 请求、写入目录、报告和失败行为。记录使用模型、token、费用、评测集、随机性、基线分数和候选 diff。
4. sessiondb 的隐私边界
sessiondb 可导入 Claude Code、Copilot 与 Hermes 的真实会话。真实日志可能包含私有代码、用户输入、文件路径、凭据片段和个人信息,而反思与评估会调用外部模型。接入前先做脱敏、访问控制、保留期限和 provider 数据策略检查。
官方估算每次优化约 2 至 10 美元,这是用户选择的模型 API 成本,不是项目方售卖 credits。
5. 与 GEPA 官方库对比
GEPA官方库可以优化提示词、代码、Agent 架构和配置,调用者自己提供 evaluator。Hermes Agent Self-Evolution 在它之上限定了 Hermes skill、数据来源、约束门和 PR 交付方式。
要优化非 Hermes 系统,直接使用 GEPA 更合适;只维护 Hermes 技能并希望复用现成约束时,本项目更省接线工作。无论选择哪一个,评测集都决定优化方向。
这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。
先判断这个项目是否适合你
适合谁用
适合已经维护 Hermes Agent 技能、拥有可量化评测集并愿意人工审查每个变体的团队。不适合把它当作通用 Agent 自动升级器,也不能把 README 中 Planned 的 Phase 2 至 5 当作已交付功能。
采用建议
保留。项目自身不售卖 API 额度,2 至 10 美元来自用户选择的模型 provider。使用价值集中在已经实现的 Hermes skill 优化,真实会话隐私和目标仓库写权限是主要边界。
原教程未展开的系统信息
核心功能
轨迹驱动的 GEPA 搜索
反思模型读取执行轨迹,定位失败原因,再生成候选变体并按 Pareto 选择。
约束门与人工 PR
候选必须通过测试、15KB 技能体积、语义保持和缓存兼容检查,官方承诺不直接提交。
官方与对比资料
以下链接用于核对版本、安装方式、功能边界和同类差异。
- https://github.com/gepa-ai/gepa
- https://github.com/NousResearch/hermes-agent-self-evolution
- https://github.com/NousResearch/hermes-agent-self-evolution/releases
- https://github.com/NousResearch/hermes-agent-self-evolution#how-it-works
- https://github.com/NousResearch/hermes-agent-self-evolution#what-it-optimizes
- https://github.com/NousResearch/hermes-agent-self-evolution#quick-start
- https://github.com/NousResearch/hermes-agent-self-evolution#guardrails
- https://github.com/NousResearch/hermes-agent-self-evolution/blob/main/pyproject.toml
常见问题
Hermes Agent Self-Evolution 现在能优化代码和系统提示词吗?
还不能按已交付功能计算。README 只把 Phase 1 的技能文件优化标为 Implemented;工具描述、系统提示词、代码进化和持续循环仍是 Planned。
一次优化为什么会花 2 到 10 美元?
候选生成、反思和评估都通过外部模型 API 完成。2 到 10 美元是官方给出的估算,实际费用取决于模型、iterations、评测集大小和失败重试。
工具会直接改坏 Hermes Agent 主分支吗?
官方流程把最佳候选做成 PR,并明确写着 never direct commit。仍应把 HERMES_AGENT_REPO 指向隔离分支,审查 diff 和测试后再合并。
可以直接用真实 sessiondb 做评测吗?
技术上可以,但会话记录可能含代码、提示词、凭据片段或个人信息。先做脱敏、访问控制和保留期限评估,再允许外部模型读取。
项目的当前正式版本是什么?
pyproject.toml 标为 0.1.0,但 GitHub 没有正式 release 或 tag。要复现结果应记录具体 commit;本轮核对到的 main 最新记录日期是 2026-06-17。