为什么这篇论文值得关注
论文从四个可核对的问题出发:前沿系统闭源、部分开放权重模型依赖昂贵硬件、带推理的策略延迟较高,以及微调后的任务成功率仍不足以稳定使用。
MolmoAct2 对应提出五项改动:专用 VLM 主干、三个新数据集、开放动作 tokenizer、连续动作专家,以及减少重复视觉推理的 MolmoThink。作者同时发布模型权重、训练代码和训练数据,使论文中的主要组件具备复查条件。
五项核心升级
MolmoER:专为空间与具身推理的 VLM 主干
MolmoER 是针对空间推理和具身推理训练的 VLM 主干。作者使用 330 万样本,并采用先专项训练、再回放通用能力的训练流程。具体提升范围应以论文的 13 项具身推理评测为准。
包括 720 小时双臂遥操作数据集 MolmoAct2-BimanualYAM
论文发布三个数据集,包括 MolmoAct2-BimanualYAM 的 720 小时双臂遥操作轨迹,以及经过质量筛选的 Franka(DROID)和 SO100/101 子集。作者称前者是当时最大的开放双臂数据集。
OpenFAST:开源的动作分词器
OpenFAST 是开放权重、开放数据的动作 tokenizer,训练数据包含五种机器人形态、数百万条轨迹。它负责把动作序列编码成离散 token;迁移到新硬件时仍需验证动作空间、控制频率和数据分布是否匹配。
连续动作专家:flow-matching + KV cache 条件化
MolmoAct2 把流匹配(flow-matching)连续动作专家接到离散 token VLM 上,并通过逐层 KV cache 进行条件化。论文摘要说明了结构,但本页没有足够数据判断不同硬件上的绝对延迟或轨迹平滑度。
MolmoThink:只重算画面变化区域的深度 token
MolmoThink 在相邻时间步之间,只重新预测场景中发生变化区域的深度 token。作者报告这种做法保留几何落地能力,同时把延迟降到此前方法的一小部分。它按画面变化区域复用计算,不是根据“任务难度”选择思考深度。
对标的前沿模型
论文摘要报告两组不同评测,比较对象和任务不能合并:
| 评测对象 | 范围 | 作者报告的结论 |
|---|---|---|
| MolmoAct2 VLA | 7 个仿真和真实世界基准 | 超过包括 Pi-05 在内的强基线 |
| MolmoER VLM | 13 个具身推理基准 | 超过 GPT-5 与 Gemini Robotics ER-1.5 |
这些都是论文摘要中的作者报告。摘要没有给出逐项成功率和延迟数字,具体优势大小、统计波动和实验条件需要查正文。
论文和发布内容支持的用途
- 复现论文评测:模型权重、训练代码和完整训练数据已发布。
- 研究双臂策略:720 小时双臂遥操作数据可用于论文覆盖的机器人设置。
- 研究跨机器人动作表示:OpenFAST 的训练覆盖五种机器人形态,可作为动作 tokenizer 的对照实现。
- 测试具身推理主干:MolmoER 可在空间和具身推理任务中单独评测。
论文没有证明模型可直接用于家庭整理或工业装配线。换机器人、相机、控制频率或任务分布后,仍需重新采集数据并做安全评测。
当前局限
1. abstract 未给出与 SOTA 的定量对比数字。 只说做了"史上最大规模实证研究",具体的成功率、延迟数值要看论文 PDF 正文。
2. 真实硬件门槛仍存在。 论文强调"可部署",但实际推理需要的 GPU 配置、机器人硬件兼容性范围未在 abstract 详细说明。
3. MolmoThink 的收益依赖场景变化。 它只重算变化区域的深度 token;摄像机快速移动或画面大范围变化时能节省多少计算,需要看分场景实验。
4. 七个基准不代表所有部署环境。 论文覆盖仿真和真实世界任务,但不能据此推断未测试的机器人、传感器和长尾场景。
作者与机构
论文有 29 位作者,部分核心作者包括 Haoquan Fang、Jiafei Duan、Donovan Clay、Sam Wang、Shuo Liu 等。主导单位是 Allen Institute for AI(Ai2)——这家由微软联合创始人 Paul Allen 创立的非营利 AI 研究机构,近年以"全开放"路线在 LLM 和机器人方向都有重要工作(OLMo、Molmo、MolmoAct 系列)。
项目主页发布在 allenai.org/blog/molmoact2。
资源链接
- 论文:arXiv:2605.02881v2
- Ai2 项目主页:allenai.org/blog/molmoact2
- HuggingFace Papers:huggingface.co/papers/2605.02881(270 upvotes)
总结评价
MolmoAct2 把 VLM 主干、数据、动作 tokenizer、连续动作专家和视觉深度复用放进同一套开放实现。VLA 部分在 7 个基准上与 Pi-05 等方法比较;GPT-5 和 Gemini Robotics ER-1.5 的比较属于 MolmoER 的 13 项具身推理评测。
“适合部署”仍需在目标机器人上验证。论文给出了可复现的起点,但硬件成本、端到端延迟、微调成功率和安全边界都应按实际任务重新测量。