本周三个趋势

1. Agent 从工具调用走向技能内化
本周三篇高热论文都在比较 Agent 的外部工具与内部能力。GEMS(78↑)用记忆与技能增强多模态 Agent;SKILL0(72↑)通过强化学习把部分技能写入模型参数;Terminal Agents(76↑)则测试只用终端 API 能否完成任务。这些结果来自不同任务,不能合并成单一路线,但都提醒团队分别测量工具成本、参数内化收益和失败恢复能力。
2. 仿真世界成为 AI 基础设施
本周最高票论文 CARLA-Air(302↑)把驾驶仿真与无人机飞行放进同一物理环境,便于研究空地协同。Generative World Renderer(74↑)使用游戏引擎数据处理合成数据与真实数据之间的差距。这两篇工作说明联合仿真和数据生成正在靠近,但训练效率与泛化收益仍需按具体任务验证。
3. AI 研究走向自主化,垂直领域突破
Medical AI Scientist(64↑)把文献调研、假说生成和实验执行组织成面向临床研究的流程。本文没有复现实验;临床使用还需要伦理审查、外部验证和专业人员监督。The Latent Space(98↑)则是一篇潜在空间综述,两篇论文的问题与证据类型不同,应分别阅读。

本周精选论文(7 篇)

1. CARLA-Air: Fly Drones Inside a CARLA World

👍 302 upvotes 📚 cs.RO 📅 2026-03-30
统一高保真驾驶与无人机飞行的开源仿真平台
研究问题:低空经济、具身智能和空地协同系统对仿真平台提出了新需求,在同一个物理一致的环境中联合建模空中和地面智能体。现有开源平台要么只做驾驶(CARLA),要么只做无人机(AirSim),无法实现空地协同训练。
论文做法:CARLA-Air 在 CARLA 仿真引擎中原生集成无人机飞行能力,支持在同一场景中同时运行自动驾驶车辆和无人机,共享物理引擎和传感器模型,实现真正的空地联合仿真。
302 upvotes,为本周最高。统一仿真环境可用于无人机配送、空地协同巡检等研究;开源代码也降低了重复搭建环境的成本。
仿真平台空地协同CARLA无人机具身智能

2. The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook

👍 98 upvotes 📚 cs.CL 📅 2026-04-02
全面综述语言模型潜在空间的基础、演化机制与能力
研究问题:我们对 LLM 的理解仍停留在 token 级别的生成方法上,但越来越多的研究表明,模型内部的关键过程是在连续的潜在空间中进行的。缺乏对潜在空间的系统性认知,制约了我们优化和控制 LLM 行为的能力。
论文做法:这篇综述系统梳理了语言模型潜在空间的基础理论、演化历程、内部机制和涌现能力,为理解 LLM "如何思考"提供了结构化的理论框架。
这篇综述整理了潜在空间的定义、机制与研究问题,可作为查找相关工作的索引。具体结论仍需回到各章节引用的实验核对。
潜在空间综述LLM机制表征学习

3. GEMS: Agent-Native Multimodal Generation with Memory and Skills

👍 78 upvotes 📚 cs.AI 📅 2026-03-30
借鉴 Claude Code 设计理念,用记忆+技能双引擎增强多模态生成 Agent
研究问题:现有多模态生成模型在通用任务上表现出色,但面对复杂指令和专业下游任务时仍力不从心。核心瓶颈不是模型能力不足,而是缺乏系统化的知识管理和技能编排机制。
论文做法:GEMS 提出 Agent-Native 设计,受 Claude Code 等先进 Agent 框架启发,为多模态生成模型配备记忆系统(持久化经验)和技能系统(可组合的能力模块),让模型能像经验丰富的人类一样,从历史中学习、用技能解决新问题。
GEMS 把记忆和技能直接放进多模态生成流程。本文未复现实验,阅读时应核对消融、任务覆盖和记忆更新带来的成本。
Agent-Native记忆系统技能编排多模态生成

4. Terminal Agents Suffice for Enterprise Automation

👍 76 upvotes 📚 cs.AI 📅 2026-03-31
终端代理通过 API 直接交互足以实现企业自动化,无需复杂工具链
研究问题:企业自动化 Agent 的主流方向有三条:MCP 工具增强、Web Agent(通过 GUI 交互)、以及 API 直接调用。哪种路径最高效?是否需要越来越复杂的工具抽象层?
论文做法:Terminal Agents 提出一个反直觉的结论,通过终端直接调用 API 就足以完成企业自动化任务,无需 MCP 的工具抽象层,也无需 Web Agent 的 GUI 操作。简单、直接的 API 交互在效率和可靠性上优于更复杂的方案。
论文比较终端/API 路径与更复杂的工具抽象。企业选型时应核对任务覆盖、失败率、权限和维护成本,不能由单篇结果推断 MCP 没有价值。
企业自动化终端AgentMCP替代API交互

5. Generative World Renderer

👍 74 upvotes 📚 cs.CV 📅 2026-04-02
用 3A 游戏数据构建大规模动态数据集,支持双向渲染与可控视频生成
研究问题:将生成式渲染扩展到真实场景受制于合成数据集的真实感和时序一致性不足。现有合成数据与真实世界之间存在持久的 domain gap。
论文做法:利用视觉复杂度极高的 3A 游戏引擎,构建大规模动态数据集。通过新颖的数据采集管线获取高真实感、物理一致的场景数据,支持正向和逆向渲染训练,以及可控的视频生成。
论文使用 3A 游戏数据构建动态数据集。它能否缩小合成数据与真实场景的差距,需要看跨数据集评测和下游任务结果。
世界模型3A游戏数据生成式渲染可控视频

6. SKILL0: In-Context Agentic RL for Skill Internalization

👍 72 upvotes 📚 cs.LG 📅 2026-04-02
通过动态课程强化学习将技能内化为模型能力,零样本提升 Agent 表现
研究问题:当前 Agent 依赖运行时技能增强(检索技能包、加载到上下文),但这种方式有根本限制:检索噪声引入无关指导,上下文窗口被技能描述占据,推理效率下降。
论文做法:SKILL0 提出"技能内化",不在推理时加载技能,而是通过动态课程强化学习,在训练阶段就将技能能力编码到模型参数中。训练后的模型无需任何技能包即可零样本完成任务。
SKILL0 把技能学习放到训练阶段。采用这条路线前,应比较训练成本、迁移性、遗忘情况和推理收益。
技能内化强化学习动态课程零样本Agent 2.0

7. Towards a Medical AI Scientist

👍 64 upvotes 📚 cs.AI 📅 2026-03-30
首个面向临床医学的自主研究框架,从文献调研到实验执行全流程自动化
研究问题:现有 AI Scientist 系统大多是领域无关的通用框架,在临床医学这样需要严格伦理审查、复杂实验设计和专业领域知识的场景中表现有限。
论文做法:提出首个面向临床医学的自主研究框架,覆盖从文献调研、假说生成、实验设计到执行的完整研究链路,并针对医学领域的特殊约束(伦理、可复现性、循证标准)进行定制化设计。
论文把自主研究流程放进临床场景。临床结论仍需要伦理审查、外部验证和专业人员监督,本文不推断它可直接用于医疗决策。
AI Scientist临床医学自主研究全流程自动化

本周总结

本周 HuggingFace 热门论文的核心主题是:AI 系统正在从"外部增强"走向"内在能力"。Agent 不再满足于运行时加载工具和技能,而是通过 RL 将能力内化到参数中(SKILL0);仿真环境不再是单一领域的辅助工具,而是成为空地联合的基础设施(CARLA-Air);AI 研究不再是通用框架的概念验证,而是深入到对可靠性要求最高的临床医学(Medical AI Scientist)。

把这些论文放在一起看, Agent 技能内化这条线,GEMS 的记忆+技能框架、SKILL0 的 RL 内化、Terminal Agents 对复杂工具链的质疑,三篇论文从不同角度指向同一个结论:Agent 的下一阶段不是"更多工具",而是"更强内功"。这对 Agent 系统的架构选型和技术投资方向有直接影响。

The Latent Space 这篇综述则从理论层面为上述趋势提供了基础,当我们更深入地理解模型的潜在空间,才能更可靠地将知识和技能编码到模型参数中。基础研究和应用趋势在本周形成了少见的呼应。

想实时追踪每天的 AI 热门论文?Paper Collector 自动采集 HuggingFace 论文并生成中文摘要,每日更新。

访问 Paper Collector

本文由恩筑AI研究团队依据 Paper Collector 论文热度数据整理并复核后发布。热度数据截至 2026-04-03 18:00 CST 抓取,upvotes 等指标可能随时间变化。论文信息来源为 HuggingFace Papers 和 arXiv,趋势判断代表团队观点,仅供参考。 论文卡片对应抓取时的 arXiv 版本;本站未逐篇复现实验,后续修订以链接页面为准。