为什么这篇论文值得关注
论文讨论的是 OpenClaw、Codex 这类可跨环境执行任务的 Agent。作者认为,现有 Agent 对齐框架不足以处理这些执行场景中的新风险,因此更新了安全分类法,并据此构造训练和评测流程。
这项工作的可核对之处很具体:四个模型规模、约 1000 条训练样本、SFT 与 RL 训练环境、在线护栏,以及 Docker 环境中的部署开销。论文摘要报告了与 GPT-5.4 等闭源模型相近的结果,但摘要没有给出逐项分数。
四个核心技术机制
更新的 Agent 安全分类法,覆盖 Codex 和 OpenClaw 新兴风险
AgentDoG 1.5 重新设计了Agent 安全风险分类法(taxonomy),针对 Codex(OpenAI 的代码 Agent)和 OpenClaw(开放生态多功能 Agent)这两类新型场景下的具体风险类型重新归类。分类法不是简单照搬"LLM 越狱"的旧分类,而是覆盖"行为级"风险。
分类法导向的数据引擎 + 影响函数净化
论文用分类法导向的数据引擎批量构造对齐训练样本——每种风险类型都有对应的"正例(应该这样响应)"和"反例(不应该这样做)"。再用影响函数(influence function)净化去除低质量/低影响样本,最终用仅约 1000 个高质量样本完成训练。"小样本 + 高质量"是这篇论文的核心工程论点。
SFT + RL 训练 + 训练无关的在线安全护栏
训练阶段用 SFT(监督微调)+ RL(强化学习)让模型本身对齐。但模型再对齐也不能 100% 安全,所以在线推理时叠加一层训练无关的安全护栏——独立于模型本身的实时拦截器,可以即插即用部署在任何 Agent 系统外层。
Docker 级部署开销降低两个数量级
论文摘要报告,配套的 Agent 安全 SFT 与 RL 训练环境把 Docker 级部署开销降低了两个数量级。摘要没有给出硬件型号、绝对延迟,也没有证明 0.8B 版本可在浏览器或边缘设备运行,因此这里不进一步推断部署位置和响应时间。
四个参数规模 + GPT-5.4 性能对标
| 模型 | 规模 | 论文摘要可确认的信息 |
|---|---|---|
| AgentDoG 1.5 - 0.8B | 0.8B | 已发布的轻量版本之一 |
| AgentDoG 1.5 - 2B | 2B | 已发布的轻量版本之一 |
| AgentDoG 1.5 - 4B | 4B | 已发布的轻量版本之一 |
| AgentDoG 1.5 - 8B | 8B | 已发布版本中参数量最大 |
| 性能对标 | 可与 GPT-5.4 等闭源前沿模型相媲美(论文 abstract 表述) | |
摘要说这些版本的表现可与 GPT-5.4 等闭源模型相比,但没有列出具体评测、指标和差值。因此这句话只能按作者报告理解,不能扩大成所有 Agent 安全任务上的等价表现。
论文能支持的使用范围
- 训练 Agent 安全模型:论文给出了分类法导向的数据引擎,以及 SFT、RL 训练环境。
- 在线安全审查:作者把 AgentDoG 1.5 部署为无需额外训练的实时护栏。
- 研究复现:作者声明模型和数据集公开,可用于核对论文结果和比较后续方法。
论文没有报告金融、医疗、政务等行业部署,也没有证明浏览器、CPU 或特定终端上的延迟。把它用于产品前,仍需按目标环境重新测量误报、漏报、时延和资源占用。
当前局限
1. 仅 1000 个训练样本能覆盖多广? 论文论点是"高质量小样本足够",但 Agent 安全的风险类型极其多样,1000 个样本能否真正覆盖所有重要风险类型,需要看具体 benchmark 数据。
2. abstract 未给出和 GPT-5.4 的具体对比数字。 只说"可媲美",具体差距和适用场景需要正文。
3. 项目主页和代码 / 模型链接未在 abstract 提供。 论文说"所有模型和数据集均公开发布",但具体在哪里下载需要查论文正文或后续 release。
4. 摘要没有报告分布外风险的单独结果。 因此无法从摘要判断模型面对分类法之外的新风险时表现如何。
5. 评测外推范围有限。 摘要称实验覆盖多种复杂交互场景,但没有列出完整任务分布。"可媲美 GPT-5.4"只能用于论文所测条件。
作者与机构
论文共 50 位作者,首位作者是 Dongrui Liu。本页依据的摘要没有列出机构归属,因此不根据作者人数或论文篇幅推测团队背景。
资源链接
- 论文:arXiv:2605.29801(44 页 12 图 9 表)
- HuggingFace Papers:huggingface.co/papers/2605.29801(107 upvotes)
- 模型权重 / 数据集:论文声明"全部公开发布",具体链接需关注 arXiv 正文或后续 release
总结评价
AgentDoG 1.5 把同一套工作拆成训练和在线审查两部分,并发布 0.8B 到 8B 的四个版本。约 1000 条样本、与闭源模型的对比结果,以及 Docker 开销降幅,均为作者报告,仍需结合论文正文和独立复现实验判断。
对实际部署最有用的问题是:目标任务上的漏报率和误报率是多少,在线护栏增加多少延迟,分类法之外的风险如何处理。摘要没有回答这些问题,所以本页不把论文结果外推为商业采用或行业标准。