首页 / 开源热榜 / hermes-agent-self-evolution / 使用教程

Hermes Agent Self-Evolution 教程:先保护仓库和会话数据

更新于 2026-09-23 · NGJOO AI 实验室 · 约 10 分钟

Hermes Agent Self-Evolution 把 DSPy 与 GEPA 接到 Hermes Agent 的技能文件上。它读取当前 skill 和执行轨迹,生成候选,跑评测与约束门,再把最佳版本交给人工 PR 审查。

项目没有 GitHub release 或 tag。pyproject.toml 标为 0.1.0,Python 要求 3.10+;本轮核对到 main 最新记录日期是 2026-06-17。复现实验要保存 commit。

1. 当前只有 Phase 1 已实现

README 把技能文件优化标为 Implemented。工具描述、系统提示词、工具代码和持续改进循环仍是 Planned。首页概述提到的完整目标不能当作现成能力。

现有流程从 Hermes 仓库读取 skill,生成 synthetic 或 sessiondb 评测数据,用 GEPA 分析轨迹并产生变体。候选必须过测试、15KB 技能体积、缓存兼容和语义保持检查。最终结果走人工 PR,官方写明不直接 commit。

2. 依赖与安装

核心依赖是 DSPy 3.0+、OpenAI Python SDK、PyYAML、Click 和 Rich,开发环境另装 pytest。项目不需要 GPU,但候选生成、反思和评估都会访问模型 API。

git clone https://github.com/NousResearch/hermes-agent-self-evolution.git
cd hermes-agent-self-evolution
python -m venv .venv
source .venv/bin/activate
pip install -e ".[dev]"

先把 HERMES_AGENT_REPO 指向可丢弃分支,不要指向唯一工作副本。确认 provider key 只通过环境变量提供,也不要把密钥写入评测数据或报告。

3. 先用合成评测跑小规模

export HERMES_AGENT_REPO=/path/to/disposable/hermes-agent
python -m evolution.skills.evolve_skill \
  --skill github-code-review \
  --iterations 2 \
  --eval-source synthetic

官方示例是 10 次迭代;第一次可先降到 2,目的是看清 API 请求、写入目录、报告和失败行为。记录使用模型、token、费用、评测集、随机性、基线分数和候选 diff。

4. sessiondb 的隐私边界

sessiondb 可导入 Claude Code、Copilot 与 Hermes 的真实会话。真实日志可能包含私有代码、用户输入、文件路径、凭据片段和个人信息,而反思与评估会调用外部模型。接入前先做脱敏、访问控制、保留期限和 provider 数据策略检查。

官方估算每次优化约 2 至 10 美元,这是用户选择的模型 API 成本,不是项目方售卖 credits。

验证边界:本轮只核对官方 README、pyproject.toml、MIT 许可说明、release 页面和 main 提交记录。没有安装依赖,没有配置模型 API key,没有读取 sessiondb,没有指向 Hermes 仓库,也没有生成候选、跑评测或创建 PR;本文属于 docs-only。

5. 与 GEPA 官方库对比

GEPA官方库可以优化提示词、代码、Agent 架构和配置,调用者自己提供 evaluator。Hermes Agent Self-Evolution 在它之上限定了 Hermes skill、数据来源、约束门和 PR 交付方式。

要优化非 Hermes 系统,直接使用 GEPA 更合适;只维护 Hermes 技能并希望复用现成约束时,本项目更省接线工作。无论选择哪一个,评测集都决定优化方向。

这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。

先判断这个项目是否适合你

适合谁用

适合已经维护 Hermes Agent 技能、拥有可量化评测集并愿意人工审查每个变体的团队。不适合把它当作通用 Agent 自动升级器,也不能把 README 中 Planned 的 Phase 2 至 5 当作已交付功能。

采用建议

保留。项目自身不售卖 API 额度,2 至 10 美元来自用户选择的模型 provider。使用价值集中在已经实现的 Hermes skill 优化,真实会话隐私和目标仓库写权限是主要边界。

原教程未展开的系统信息

核心功能

  • 轨迹驱动的 GEPA 搜索

    反思模型读取执行轨迹,定位失败原因,再生成候选变体并按 Pareto 选择。

  • 约束门与人工 PR

    候选必须通过测试、15KB 技能体积、语义保持和缓存兼容检查,官方承诺不直接提交。

官方与对比资料

以下链接用于核对版本、安装方式、功能边界和同类差异。

常见问题

Hermes Agent Self-Evolution 现在能优化代码和系统提示词吗?

还不能按已交付功能计算。README 只把 Phase 1 的技能文件优化标为 Implemented;工具描述、系统提示词、代码进化和持续循环仍是 Planned。

一次优化为什么会花 2 到 10 美元?

候选生成、反思和评估都通过外部模型 API 完成。2 到 10 美元是官方给出的估算,实际费用取决于模型、iterations、评测集大小和失败重试。

工具会直接改坏 Hermes Agent 主分支吗?

官方流程把最佳候选做成 PR,并明确写着 never direct commit。仍应把 HERMES_AGENT_REPO 指向隔离分支,审查 diff 和测试后再合并。

可以直接用真实 sessiondb 做评测吗?

技术上可以,但会话记录可能含代码、提示词、凭据片段或个人信息。先做脱敏、访问控制和保留期限评估,再允许外部模型读取。

项目的当前正式版本是什么?

pyproject.toml 标为 0.1.0,但 GitHub 没有正式 release 或 tag。要复现结果应记录具体 commit;本轮核对到的 main 最新记录日期是 2026-06-17。