载入中… | 今日精选 · 实时更新
每日精选全球 AI 与科技资讯
编辑部 · 北京时间 每日 08:00 更新
首页

不训练也能学会新技能?清华AIR”自进化世界模型”引路具身智能

· · 阅读 5 分钟

大模型要变强,不一定非要狂喂数据和算力。清华大学智能产业研究院(AIR)联合域变换团队提出了一种全新方法:通过”具身上下文因果学习”,让世界动作模型(WAM)在参数完全冻结的情况下实现能力暴涨,机器人无需额外训练即可掌握新技能。

世界模型的困境:会预测,但不一定会学

在具身智能领域,”世界模型”被寄予厚望。它像人类大脑中的”物理引擎”,能让机器人基于对环境的理解来规划动作——看到杯子就知道该绕开,看到门把手就知道该下压。传统世界模型通过海量数据训练,学习”感知-动作-结果”的映射关系。

然而,这类模型有一个致命短板:一旦训练完成,参数就固化了。想让机器人学会新技能,必须重新采集数据、重新训练,成本极高。而且,训练过程中往往会破坏模型已有的能力——类似人类学新技能时忘了旧本领,这在机器学习中称为”灾难性遗忘”。

更麻烦的是,真实世界的物理规律和场景千变万化。一个在实验室训练完美的世界模型,放到工厂、家庭等新环境里,性能往往大幅缩水。如何让世界模型”自我进化”,成了具身智能走向实用的关键难题。

新方法的核心:上下文即”训练数据”

针对这一痛点,清华AIR与域变换团队跳出”更新参数”的思维定式,提出了In-Context Causal Learning(上下文因果学习)框架。其核心思想是:通过设计巧妙的上下文序列,让模型在推理时自行”重演”因果规律,从而无需任何参数更新就能适配新任务。

具体来说,该框架做了三件事:

第一,构建因果演示上下文。 研究人员不再把一组静态的”输入-输出”样例塞给模型,而是精心构造包含因果链的演示序列:前一个状态的变化如何导致后一个状态的出现,动作在因果链中扮演什么角色。模型通过”阅读”这些序列,就能在内部表征中建立起对物理规律的动态理解。

第二,引入推理时”内隐学习”。 传统的方法是在训练阶段让模型记住规律,而这项研究让模型在推理阶段根据上下文现场”推导”规律。由于大模型本身具备强大的few-shot(少样本)和in-context learning(上下文学习)能力,只要提示词序列设计得当,模型就能在生成每个动作时,动态参考上下文中的因果信息,实现”现学现卖”。

第三,验证”参数冻结”的可行性。 整个过程中,世界动作模型的权重完全不更新(参数冻结),甚至对于未见过的任务和环境组合,模型也能表现出显著的能力提升。实验显示,在模拟环境和真实机器人平台上,该方法让模型在新任务上的成功率大幅攀升,同时保持了原有技能的稳定性。

从”堆数据”到”用知识”,具身智能的范式转向

这项研究的价值不仅在于技术指标,更在于它预示了一种范式转变。

过去十年,AI 的进步很大程度上依赖”规模定律”——模型越大、数据越多,性能越强。但在机器人领域,高质量的动作-环境数据极其昂贵,一台机械臂实机操作一周的数据,可能还不够训练一个像样的桌面操作模型。如果每个新技能都要重新收集数据、重新训练,具身智能的商业化进程将被严重拖慢。

清华AIR提出的”参数冻结+上下文因果学习”,为业界指明了一个新方向:也许未来,机器人学新技能不再需要”从头再来”,而是像人类一样,通过几段示范视频或几行任务描述,在现场即时调整自己的行为策略。

当然,这项研究仍处于早期阶段,如何在更复杂的长时序任务中保持因果推理的准确性,如何让上下文学习能力覆盖更广阔的动作空间,都是后续需要攻克的课题。但正如研究者所言,当模型学会”学习”本身,机器人的进化速度将不再受限于训练算力和数据采集成本——这,才是真正的”自进化”。