AgentDoG 1.5 是什么?开放世界 Agent 的实时安全对齐框架

arXiv:2605.29801 2026-05-28 发布 👍 107 upvotes(W22) 0.8B / 2B / 4B / 8B 训练样本仅约 1000

AgentDoG 1.5 是 2026 年 5 月发布的轻量级、可扩展的 AI Agent 安全对齐框架,专门面向 OpenClaw、Codex 等开放世界 Agent 的跨环境执行新风险。论文用仅约 1000 个样本训练了 0.8B、2B、4B、8B 四个参数规模的 AgentDoG 1.5 变体,性能可与 GPT-5.4 等领先闭源模型相媲美。Docker 级环境部署开销降低两个数量级。HuggingFace 上获 107 票。

为什么这篇论文值得关注

论文讨论的是 OpenClaw、Codex 这类可跨环境执行任务的 Agent。作者认为,现有 Agent 对齐框架不足以处理这些执行场景中的新风险,因此更新了安全分类法,并据此构造训练和评测流程。

这项工作的可核对之处很具体:四个模型规模、约 1000 条训练样本、SFT 与 RL 训练环境、在线护栏,以及 Docker 环境中的部署开销。论文摘要报告了与 GPT-5.4 等闭源模型相近的结果,但摘要没有给出逐项分数。

四个核心技术机制

机制 1 / 风险分类法

更新的 Agent 安全分类法,覆盖 Codex 和 OpenClaw 新兴风险

AgentDoG 1.5 重新设计了Agent 安全风险分类法(taxonomy),针对 Codex(OpenAI 的代码 Agent)和 OpenClaw(开放生态多功能 Agent)这两类新型场景下的具体风险类型重新归类。分类法不是简单照搬"LLM 越狱"的旧分类,而是覆盖"行为级"风险。

机制 2 / 数据引擎

分类法导向的数据引擎 + 影响函数净化

论文用分类法导向的数据引擎批量构造对齐训练样本——每种风险类型都有对应的"正例(应该这样响应)"和"反例(不应该这样做)"。再用影响函数(influence function)净化去除低质量/低影响样本,最终用仅约 1000 个高质量样本完成训练。"小样本 + 高质量"是这篇论文的核心工程论点。

机制 3 / 训练 + 在线防护

SFT + RL 训练 + 训练无关的在线安全护栏

训练阶段用 SFT(监督微调)+ RL(强化学习)让模型本身对齐。但模型再对齐也不能 100% 安全,所以在线推理时叠加一层训练无关的安全护栏——独立于模型本身的实时拦截器,可以即插即用部署在任何 Agent 系统外层。

机制 4 / 工程化部署

Docker 级部署开销降低两个数量级

论文摘要报告,配套的 Agent 安全 SFT 与 RL 训练环境把 Docker 级部署开销降低了两个数量级。摘要没有给出硬件型号、绝对延迟,也没有证明 0.8B 版本可在浏览器或边缘设备运行,因此这里不进一步推断部署位置和响应时间。

四个参数规模 + GPT-5.4 性能对标

模型规模论文摘要可确认的信息
AgentDoG 1.5 - 0.8B0.8B已发布的轻量版本之一
AgentDoG 1.5 - 2B2B已发布的轻量版本之一
AgentDoG 1.5 - 4B4B已发布的轻量版本之一
AgentDoG 1.5 - 8B8B已发布版本中参数量最大
性能对标可与 GPT-5.4 等闭源前沿模型相媲美(论文 abstract 表述)

摘要说这些版本的表现可与 GPT-5.4 等闭源模型相比,但没有列出具体评测、指标和差值。因此这句话只能按作者报告理解,不能扩大成所有 Agent 安全任务上的等价表现。

论文能支持的使用范围

论文没有报告金融、医疗、政务等行业部署,也没有证明浏览器、CPU 或特定终端上的延迟。把它用于产品前,仍需按目标环境重新测量误报、漏报、时延和资源占用。

当前局限

1. 仅 1000 个训练样本能覆盖多广? 论文论点是"高质量小样本足够",但 Agent 安全的风险类型极其多样,1000 个样本能否真正覆盖所有重要风险类型,需要看具体 benchmark 数据。

2. abstract 未给出和 GPT-5.4 的具体对比数字。 只说"可媲美",具体差距和适用场景需要正文。

3. 项目主页和代码 / 模型链接未在 abstract 提供。 论文说"所有模型和数据集均公开发布",但具体在哪里下载需要查论文正文或后续 release。

4. 摘要没有报告分布外风险的单独结果。 因此无法从摘要判断模型面对分类法之外的新风险时表现如何。

5. 评测外推范围有限。 摘要称实验覆盖多种复杂交互场景,但没有列出完整任务分布。"可媲美 GPT-5.4"只能用于论文所测条件。

作者与机构

论文共 50 位作者,首位作者是 Dongrui Liu。本页依据的摘要没有列出机构归属,因此不根据作者人数或论文篇幅推测团队背景。

资源链接

总结评价

AgentDoG 1.5 把同一套工作拆成训练和在线审查两部分,并发布 0.8B 到 8B 的四个版本。约 1000 条样本、与闭源模型的对比结果,以及 Docker 开销降幅,均为作者报告,仍需结合论文正文和独立复现实验判断。

对实际部署最有用的问题是:目标任务上的漏报率和误报率是多少,在线护栏增加多少延迟,分类法之外的风险如何处理。摘要没有回答这些问题,所以本页不把论文结果外推为商业采用或行业标准。

关于本页:本文是恩筑 AI 研究团队对 AgentDoG 1.5 论文(arXiv:2605.29801v1)的中文深度解读,基于论文 abstract 公开信息撰写。事实性陈述可追溯到 arXiv,定性判断代表团队观点。论文 abstract 未提供具体 benchmark 数字和模型下载链接,相关内容标注了"待确认"。如有事实错误欢迎反馈到 contact@ngjoo.com