LLaDA2.0-Uni 是什么?扩散 LLM 路线的多模态统一架构

arXiv:2604.20796 2026-04-22 发布 👍 221 upvotes(W17 高票) Inclusion AI(蚂蚁集团) 开源

LLaDA2.0-Uni 是 Inclusion AI 2026 年 4 月发布的离散扩散大语言模型(dLLM),在同一框架内支持多模态理解和生成。架构由语义离散 tokenizer、MoE dLLM 主干和扩散解码器组成,用 SigLIP-VQ 离散化视觉输入,并对文本和视觉 token 采用块级掩码扩散。代码和模型已公开。

为什么这篇论文值得关注

目前的大语言模型几乎全部走自回归(autoregressive)路线——一个 token 接一个 token 地生成。GPT 系列、Llama、Qwen、DeepSeek 都是这条路线。

离散扩散语言模型(dLLM, discrete diffusion language model)通过迭代去掩码生成 token。LLaDA2.0-Uni 把这套机制扩展到文本和视觉 token,并让理解、图像生成与编辑共用一个主干。

论文报告,模型的多模态理解能力可与专用 VLM 相当,同时在图像生成和编辑上取得较强结果。摘要没有列出逐项分数,因此本文只解释架构和作者报告的结论,不预测它会取代哪条技术路线。

架构三层组件

组件 1 / 视觉离散化

SigLIP-VQ:把连续视觉信号离散化为 token

主流多模态模型(如 LLaVA)用连续 patch embedding 接 LLM,本质是"两个模型粘起来"。LLaDA2.0-Uni 用 SigLIP-VQ(SigLIP + Vector Quantization)把视觉输入离散化为 token 序列,让视觉和文本在表示空间完全统一——这是扩散 LLM 处理多模态的关键基础。

组件 2 / dLLM 主干

MoE-based dLLM:混合专家 + 离散扩散主干

主干把 MoE(Mixture of Experts)与离散扩散结合。论文还在主干中加入前缀感知优化,并在解码器中使用少步蒸馏。摘要把这些设计与推理效率联系起来,但没有给出本页可引用的端到端延迟数字。

组件 3 / 视觉解码器

扩散解码器:从 token 重建高保真图像

生成图像时,模型先在 token 空间产出离散结果,再用扩散解码器从 token 重建高保真像素级图像。论文还提到使用少步蒸馏降低解码延迟。

训练机制:块级掩码扩散

LLaDA2.0-Uni 用块级掩码扩散(block-level masked diffusion)同时训练理解和生成:

两类任务共用同一个 dLLM 主干,并使用前缀感知优化(prefix-aware optimization)处理前缀上下文。论文还报告了交错生成与推理能力;具体任务流程和质量需结合正文评测判断。

与主流路线对比

路线代表模型理解 + 生成解码方式
自回归 LLM(主流)GPT-4V, Qwen-VL, LLaVA常需分离模型逐 token 序列解码
纯扩散图像生成Stable Diffusion, DALL·E只生成扩散去噪
统一自回归多模态Show-o, Chameleon统一逐 token 解码
LLaDA2.0-Uni(本文)离散扩散 LLM原生统一块级并行扩散去掩码

关键差异:LLaDA2.0-Uni 的解码本质是并行的(虽然是分块迭代),相比逐 token 自回归在长序列生成时有潜在的速度优势。

论文和开源项目展示的能力

当前局限

1. abstract 未给出与自回归 baseline 的详细对比数字。 论文声称统一架构有优势,但具体的多模态 benchmark 得分(MMMU、MMBench、文生图 FID 等)需要查论文正文。

2. 摘要没有给出训练数据总量。 摘要只写明使用经过筛选的大规模数据和多阶段训练流程。

3. 速度优势不能只由并行解码推出。 实际吞吐和延迟还受迭代步数、硬件、批量大小与实现影响,需要同条件测试。

4. 少步蒸馏需要结合质量指标看。 官方仓库说明图像解码可用 8 步推理,但本页没有独立复现实验来量化速度与质量的取舍。

作者与机构

论文有 17 位作者,包括 Tiwei Bie、Haoxing Chen、Tieyuan Chen 等,署名团队为 Inclusion AI。其官方 GitHub 组织说明该团队来自蚂蚁集团;本页不据此推断商业计划。

资源链接

总结评价

LLaDA2.0-Uni 给出了一个可下载、可运行的统一多模态 dLLM:同一主干处理文本和视觉离散 token,扩散解码器负责图像重建,项目提供图像理解、生成和编辑代码。

它是否优于自回归模型,需在相同硬件、数据和任务下比较质量、吞吐、首 token 延迟与显存。论文摘要只支持“理解能力可与专用 VLM 相当”和“图像生成、编辑表现较强”这两个作者结论,不能据此预测未来市场或架构格局。

关于本页:本文是恩筑 AI 研究团队对 LLaDA2.0-Uni 论文(arXiv:2604.20796v1)的中文深度解读,基于论文 abstract 和 GitHub 公开信息撰写。事实性陈述可追溯到 arXiv 和 GitHub,定性判断代表团队观点。如有事实错误欢迎反馈到 contact@ngjoo.com