为什么这篇论文值得关注
目前的大语言模型几乎全部走自回归(autoregressive)路线——一个 token 接一个 token 地生成。GPT 系列、Llama、Qwen、DeepSeek 都是这条路线。
离散扩散语言模型(dLLM, discrete diffusion language model)通过迭代去掩码生成 token。LLaDA2.0-Uni 把这套机制扩展到文本和视觉 token,并让理解、图像生成与编辑共用一个主干。
论文报告,模型的多模态理解能力可与专用 VLM 相当,同时在图像生成和编辑上取得较强结果。摘要没有列出逐项分数,因此本文只解释架构和作者报告的结论,不预测它会取代哪条技术路线。
架构三层组件
SigLIP-VQ:把连续视觉信号离散化为 token
主流多模态模型(如 LLaVA)用连续 patch embedding 接 LLM,本质是"两个模型粘起来"。LLaDA2.0-Uni 用 SigLIP-VQ(SigLIP + Vector Quantization)把视觉输入离散化为 token 序列,让视觉和文本在表示空间完全统一——这是扩散 LLM 处理多模态的关键基础。
MoE-based dLLM:混合专家 + 离散扩散主干
主干把 MoE(Mixture of Experts)与离散扩散结合。论文还在主干中加入前缀感知优化,并在解码器中使用少步蒸馏。摘要把这些设计与推理效率联系起来,但没有给出本页可引用的端到端延迟数字。
扩散解码器:从 token 重建高保真图像
生成图像时,模型先在 token 空间产出离散结果,再用扩散解码器从 token 重建高保真像素级图像。论文还提到使用少步蒸馏降低解码延迟。
训练机制:块级掩码扩散
LLaDA2.0-Uni 用块级掩码扩散(block-level masked diffusion)同时训练理解和生成:
- 理解任务:掩码文本块,根据图像 + 上下文生成;
- 生成任务:掩码图像 token 块,根据文本 + 上下文生成。
两类任务共用同一个 dLLM 主干,并使用前缀感知优化(prefix-aware optimization)处理前缀上下文。论文还报告了交错生成与推理能力;具体任务流程和质量需结合正文评测判断。
与主流路线对比
| 路线 | 代表模型 | 理解 + 生成 | 解码方式 |
|---|---|---|---|
| 自回归 LLM(主流) | GPT-4V, Qwen-VL, LLaVA | 常需分离模型 | 逐 token 序列解码 |
| 纯扩散图像生成 | Stable Diffusion, DALL·E | 只生成 | 扩散去噪 |
| 统一自回归多模态 | Show-o, Chameleon | 统一 | 逐 token 解码 |
| LLaDA2.0-Uni(本文) | 离散扩散 LLM | 原生统一 | 块级并行扩散去掩码 |
关键差异:LLaDA2.0-Uni 的解码本质是并行的(虽然是分块迭代),相比逐 token 自回归在长序列生成时有潜在的速度优势。
论文和开源项目展示的能力
- 图像理解:官方仓库提供图像理解推理代码。
- 文本生成图像:官方仓库提供文本生成图像和 token 解码流程。
- 图像编辑:项目支持单参考和多参考编辑。
- 研究复现:代码、模型权重和推理示例可用于核对论文结论;是否适合具体产品仍需单独评测。
当前局限
1. abstract 未给出与自回归 baseline 的详细对比数字。 论文声称统一架构有优势,但具体的多模态 benchmark 得分(MMMU、MMBench、文生图 FID 等)需要查论文正文。
2. 摘要没有给出训练数据总量。 摘要只写明使用经过筛选的大规模数据和多阶段训练流程。
3. 速度优势不能只由并行解码推出。 实际吞吐和延迟还受迭代步数、硬件、批量大小与实现影响,需要同条件测试。
4. 少步蒸馏需要结合质量指标看。 官方仓库说明图像解码可用 8 步推理,但本页没有独立复现实验来量化速度与质量的取舍。
作者与机构
论文有 17 位作者,包括 Tiwei Bie、Haoxing Chen、Tieyuan Chen 等,署名团队为 Inclusion AI。其官方 GitHub 组织说明该团队来自蚂蚁集团;本页不据此推断商业计划。
资源链接
- 论文:arXiv:2604.20796
- GitHub(开源代码 + 模型):github.com/inclusionAI/LLaDA2.0-Uni
- HuggingFace Papers:huggingface.co/papers/2604.20796(221 upvotes)
总结评价
LLaDA2.0-Uni 给出了一个可下载、可运行的统一多模态 dLLM:同一主干处理文本和视觉离散 token,扩散解码器负责图像重建,项目提供图像理解、生成和编辑代码。
它是否优于自回归模型,需在相同硬件、数据和任务下比较质量、吞吐、首 token 延迟与显存。论文摘要只支持“理解能力可与专用 VLM 相当”和“图像生成、编辑表现较强”这两个作者结论,不能据此预测未来市场或架构格局。