本周三个趋势
Qwen-AgentWorld(137↑)发布 35B-A3B 和 397B-A17B 两个规模,研究语言空间中的环境模拟。In-Context World Modeling(50↑)处理机器人系统变化,Wan-Streamer(95↑)把多段音视频管线合入单个 Transformer。三篇任务和指标不同,本期只把它们作为三种建模路线并列记录。
本周一下子涌现 5 篇 Agent 工程化论文。评测侧:EnterpriseClawBench(80↑)把 852 个真实企业 workplace 会话变成可复现 task,每个 task 附 fixture / 角色分类 / 硬规则 / 语义 rubric;NatureBench(61↑)则把评测难度显著抬高,从 90 篇 Nature 系刊论文蒸馏 task,禁用 web search,问的是 Coding Agent 能不能从「复现」走到「发现」。训练方法侧:EDV(51↑)诊断了单 Agent 经验学习的「Self-Confirmation Trap」,错的但自洽的轨迹被当成正确经验,提出 Execute-Distill-Verify 框架:多个异构执行者并行跑 trajectory,第三方蒸馏者产出候选经验,再由执行组通过共识机制验证后才写入 memory;OPID(46↑)用 on-policy skill distillation 避开外部 skill memory 的失配;OT-Agent(45↑)做了 100+ ablation 公开完整的 agentic data curation pipeline。共同传递的判断:本周高票论文显示,Agent 评测、训练与系统工程正在明显升温,这条线值得持续跟踪。
Agent-Native Memory System(105↑)本周第二高票,研究焦点不在「memory 能不能做」而在「memory 系统该怎么评估」:跳出端到端任务成功率(F1/BLEU)框架,把存储、检索、更新、合并、生命周期管理拆开看,关注 cost / architecture / module trade-off,把 memory 当作有内部结构的系统而不是黑盒。KaLM-Reranker-V1(47↑)从 RAG 工程侧呼应:解耦 query 和 passage 计算,encoder 用 Matryoshka 池化预编码 passage、decoder 处理 query,让 reranker 部署效率拉上来。这条线和我们刚发的 Headroom 中文使用教程 是同一脉络,本地上下文压缩、Memory 治理、RAG reranker 都从「能用就行」走向「按系统指标评估和优化」。
本周精选论文(8 篇)
1. Qwen-AgentWorld: Language World Models for General Agents
论文做法:Qwen-AgentWorld 用 Long-CoT 推理在语言空间直接建模 7 个不同领域的 agentic 环境(基于 10M+ 环境样本训练),发布 35B-A3B / 397B-A17B 两个规模,让 Agent 在做决策前可以在内部「模拟一下」结果再行动。
2. Are We Ready For An Agent-Native Memory System?
论文做法:提出 Agent-Native Memory 系统评测框架,从 system 视角拆开每个 memory 组件分别度量,让架构决策有数据支撑。
3. Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
论文做法:Wan-Streamer 把语言、音频、视频作为单 Transformer的输入和输出,通过 block-causal attention 做增量流式编排,原生支持低延迟、全双工的实时音视频交互。
4. EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions
论文做法:EnterpriseClawBench 从大量企业 workplace session 蒸馏出 852 个可复现 task,每个 task 配套:recovered fixtures(执行环境)、rewritten prompts(脱敏后任务描述)、role classes(角色分类)、skill subclasses(技能子类)、hard rules(硬性约束)、semantic rubrics(语义评分)。因 session 含企业内部内容不公开数据,但发布完整复现方法论。
5. NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?
论文做法:NatureBench 跨学科取 peer-reviewed Nature 系刊 90 个 task,配套 NatureGym 自动给每个 task 起独立容器(避免环境碎片化让评测不可信)。严格禁用 web search,对 10 个前沿 Agent 配置评测「能否从论文 + 数据走到 SOTA 复现/超越」。
6. Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning
论文做法:提出 EDV(Execute-Distill-Verify)框架,多个异构执行者并行跑 trajectory、第三方蒸馏者分析轨迹产出候选经验、再由执行组通过共识机制验证后才写入 memory,避免单 Agent 回路里「自己当裁判」的失真。
7. In-Context World Modeling for Robotic Control
论文做法:ICWM 把系统识别变成 in-context adaptation 问题,给模型一段新系统上的自生成、任务无关的交互历史作为 context,让模型推断 system variables,无需参数更新即可适配。
8. KaLM-Reranker-V1: Fast but Not Late Interaction for Compressed Document Reranking
论文做法:KaLM-Reranker-V1 提出 Fast-But-Not-Late(FBNL)interaction,encoder-decoder 架构,encoder 用 Matryoshka embedding pooling 预编码 passage(可缓存),decoder 处理 query 时只做轻量交互。既保留表达力,又把 throughput 拉上来。
本周总结
W26 的高票论文集中在环境模拟、Agent 评测和记忆系统。本节按公开摘要与论文页面归类,未复现实验。
基础模型层面,Qwen-AgentWorld、ICWM 和 Wan-Streamer 分别研究语言环境模拟、机器人上下文适配和端到端音视频交互。它们不能在同一指标上直接排序,实际收益要回到各自任务验证。
Agent 工程化层面,EnterpriseClawBench、NatureBench、EDV、OPID 和 OT-Agent 分别覆盖企业任务、科研复现、经验验证、在策略蒸馏和数据整理。可优先核对任务是否公开、评测能否复现,以及验证成本。
系统化层面,Agent-Native Memory 和 KaLM-Reranker 双双进入本周高票,反映的是从「黑盒能用就行」走向「按系统指标拆开评估」。这与本站刚发的 Headroom 中文使用教程(本地上下文压缩)属同一脉络,Memory / RAG / context compression 这条「LLM 应用最贵的隐性成本线」开始有了系统性的工程对策。
模型训练、Agent 产品、机器人和 RAG 团队可分别核对稳定性、评测协议与系统成本。论文热度不能替代目标环境中的复现和基线比较。
本文由恩筑AI研究团队依据 Paper Collector 论文热度数据整理并复核后发布。热度数据截至 2026-06-29 10:00 CST 抓取,upvotes 等指标可能随时间变化。论文信息来源为 HuggingFace Papers 和 arXiv,趋势判断代表团队观点,仅供参考。 论文卡片对应抓取时的 arXiv 版本;本站未逐篇复现实验,后续修订以链接页面为准。