MolmoAct2 是什么?Allen AI 可部署 VLA 模型详解

arXiv:2605.02881 2026-05-08 发布 👍 270 upvotes(W18-W19 第一) Allen Institute for AI 7 基准评测

MolmoAct2 是 Allen Institute for AI(Ai2)2026 年 5 月发布的开放视觉-语言-动作(VLA)模型。论文围绕硬件成本、推理延迟和微调后的任务成功率提出五项改动,并在 7 个仿真与真实世界基准上评测 VLA。GPT-5 和 Gemini Robotics ER-1.5 出现在 MolmoER 的 13 项具身推理评测中,不应与 VLA 控制结果混为一谈。

为什么这篇论文值得关注

论文从四个可核对的问题出发:前沿系统闭源、部分开放权重模型依赖昂贵硬件、带推理的策略延迟较高,以及微调后的任务成功率仍不足以稳定使用。

MolmoAct2 对应提出五项改动:专用 VLM 主干、三个新数据集、开放动作 tokenizer、连续动作专家,以及减少重复视觉推理的 MolmoThink。作者同时发布模型权重、训练代码和训练数据,使论文中的主要组件具备复查条件。

五项核心升级

升级 1 / 视觉主干

MolmoER:专为空间与具身推理的 VLM 主干

MolmoER 是针对空间推理具身推理训练的 VLM 主干。作者使用 330 万样本,并采用先专项训练、再回放通用能力的训练流程。具体提升范围应以论文的 13 项具身推理评测为准。

升级 2 / 三个新数据集

包括 720 小时双臂遥操作数据集 MolmoAct2-BimanualYAM

论文发布三个数据集,包括 MolmoAct2-BimanualYAM 的 720 小时双臂遥操作轨迹,以及经过质量筛选的 Franka(DROID)和 SO100/101 子集。作者称前者是当时最大的开放双臂数据集。

升级 3 / 动作分词器

OpenFAST:开源的动作分词器

OpenFAST 是开放权重、开放数据的动作 tokenizer,训练数据包含五种机器人形态、数百万条轨迹。它负责把动作序列编码成离散 token;迁移到新硬件时仍需验证动作空间、控制频率和数据分布是否匹配。

升级 4 / 架构重设计

连续动作专家:flow-matching + KV cache 条件化

MolmoAct2 把流匹配(flow-matching)连续动作专家接到离散 token VLM 上,并通过逐层 KV cache 进行条件化。论文摘要说明了结构,但本页没有足够数据判断不同硬件上的绝对延迟或轨迹平滑度。

升级 5 / 自适应深度推理

MolmoThink:只重算画面变化区域的深度 token

MolmoThink 在相邻时间步之间,只重新预测场景中发生变化区域的深度 token。作者报告这种做法保留几何落地能力,同时把延迟降到此前方法的一小部分。它按画面变化区域复用计算,不是根据“任务难度”选择思考深度。

对标的前沿模型

论文摘要报告两组不同评测,比较对象和任务不能合并:

评测对象范围作者报告的结论
MolmoAct2 VLA7 个仿真和真实世界基准超过包括 Pi-05 在内的强基线
MolmoER VLM13 个具身推理基准超过 GPT-5 与 Gemini Robotics ER-1.5

这些都是论文摘要中的作者报告。摘要没有给出逐项成功率和延迟数字,具体优势大小、统计波动和实验条件需要查正文。

论文和发布内容支持的用途

论文没有证明模型可直接用于家庭整理或工业装配线。换机器人、相机、控制频率或任务分布后,仍需重新采集数据并做安全评测。

当前局限

1. abstract 未给出与 SOTA 的定量对比数字。 只说做了"史上最大规模实证研究",具体的成功率、延迟数值要看论文 PDF 正文。

2. 真实硬件门槛仍存在。 论文强调"可部署",但实际推理需要的 GPU 配置、机器人硬件兼容性范围未在 abstract 详细说明。

3. MolmoThink 的收益依赖场景变化。 它只重算变化区域的深度 token;摄像机快速移动或画面大范围变化时能节省多少计算,需要看分场景实验。

4. 七个基准不代表所有部署环境。 论文覆盖仿真和真实世界任务,但不能据此推断未测试的机器人、传感器和长尾场景。

作者与机构

论文有 29 位作者,部分核心作者包括 Haoquan Fang、Jiafei Duan、Donovan Clay、Sam Wang、Shuo Liu 等。主导单位是 Allen Institute for AI(Ai2)——这家由微软联合创始人 Paul Allen 创立的非营利 AI 研究机构,近年以"全开放"路线在 LLM 和机器人方向都有重要工作(OLMo、Molmo、MolmoAct 系列)。

项目主页发布在 allenai.org/blog/molmoact2

资源链接

总结评价

MolmoAct2 把 VLM 主干、数据、动作 tokenizer、连续动作专家和视觉深度复用放进同一套开放实现。VLA 部分在 7 个基准上与 Pi-05 等方法比较;GPT-5 和 Gemini Robotics ER-1.5 的比较属于 MolmoER 的 13 项具身推理评测。

“适合部署”仍需在目标机器人上验证。论文给出了可复现的起点,但硬件成本、端到端延迟、微调成功率和安全边界都应按实际任务重新测量。

关于本页:本文是恩筑 AI 研究团队对 MolmoAct2 论文(arXiv:2605.02881v2)的中文深度解读,基于论文 abstract 和 Ai2 项目主页公开信息撰写。事实性陈述均可追溯到 arXiv 和 allenai.org,定性判断代表团队观点,仅供参考。如有事实错误欢迎反馈到 contact@ngjoo.com