“动作模型”融合 全:自回归模型World,VLA来了

2025-07-21 10:14:21      来源:大河网

岑俊,阿里巴巴达摩院具身智能大模型算法研究员,博士毕业于香港科技大学。研究方向主要是:具身智能VLA模型,世界模型。

阿里巴巴达摩院提出了WorldVLA,首次将世界模型(WorldModel)和动作模型(ActionModel/VLAModel)融合到了一个模型中。WorldVLA是一个统一了文本、图片、动作理解和生成的全自回归模型。

论文标题:WorldVLA:TowardsAutoregressiveActionWorldModel

代码地址:https://github.com/alibaba-damo-academy/WorldVLA

研究简介

近年来,视觉-语言-动作(Vision-Language-Action,VLA)模型的发展成为机器人动作建模研究的重要方向。这类模型通常是在大规模预训练的多模态大语言模型(MultimodalLargeLanguageModels,MLLMs)基础上,添加一个动作输出头或专门的动作模块,以实现对动作的生成。MLLMs在感知和决策方面表现出色,使得VLA模型在多种机器人任务中展现出良好的泛化能力。然而,这些模型存在一个显著的局限性:它们往往缺乏对动作本身的深入理解。在现有方法中,动作只是作为输出结果处理,并未被当作输入进行分析和建模。相比之下,世界模型(WorldModels)能够基于当前观测与动作预测未来的视觉状态,从而同时理解视觉信息和行为动态。尽管具备这一优势,世界模型却无法直接生成动作输出,这导致其在需要显式动作规划的应用场景中存在功能上的空白。

为了解决VLA模型与世界模型各自的局限,我们提出WorldVLA——一种基于自回归机制的统一动作与图像理解与生成模型。如下图所示,WorldVLA使用三个独立的编码器分别处理图像、文本和动作数据。不同模态的token被设计为共享相同的词表,从而使得在同一个语言模型架构下可以统一完成跨模态的理解与生成任务。

其中,世界模型部分通过输入动作来生成对应的视觉表示,从而学习环境中的物理动态规律。这种对动作的解读与物理世界的建模对于动作模型的决策至关重要。与此同时,嵌入在WorldVLA中的动作模型也反过来增强了对视觉信息的理解,进一步提升世界模型在图像生成方面的准确性。这种双向增强机制使整个系统在理解和生成图像与动作方面更加鲁棒和全面。

此外,已有研究表明,动作分块(actionchunking)和并行解码技术对动作模型的性能有显著影响。然而,我们在实验中发现,在自回归模型中连续生成多个动作时会导致性能下降。主要原因在于,预训练的多模态语言模型主要接触的是图像和文本,而对动作的学习较少,因此在动作生成任务中泛化能力有限。而在自回归模型中,后续动作的生成依赖于前面的预测结果,一旦出现错误,便会随时间不断传播放大。为了解决这一问题,我们提出了一种动作注意力掩码策略(actionattentionmaskingstrategy),在生成当前动作时选择性地屏蔽掉之前的动作信息。这种方法有效缓解了错误累积的问题,在动作分块生成任务中带来了显著的性能提升。

在LIBERO基准测试中,我们的WorldVLA相比使用相同主干网络的传统动作模型,在抓取成功率上提升了4%。相较于传统的世界模型,WorldVLA在视频生成质量上表现更优,FVD(FréchetVideoDistance)指标降低了10%。这些结果充分说明,将世界模型与动作模型融合所带来的协同增益,验证了图像与动作统一理解与生成框架的优势。在动作分块生成任务中,传统自回归方式会导致抓取成功率下降10%到50%。但引入我们的注意力掩码策略后,性能下降得到了明显缓解,抓取成功率提升了4%到23%。

研究方法

VLA模型可以根据图像理解生成动作;世界模型可以根据当前图像和动作生成下一帧图像;WorldVLA将将两者融合,实现图像与动作的双向理解和生成,如下图所示。

WorldVLA使用独立的编码器分别处理图像、文本和动作,并让这些模态共享同一个词汇表,从而在单一的大语言模型架构下实现跨模态的统一建模。这种设计不仅提升了动作生成的准确性,也增强了图像预测的质量。WorldVLA使用ActionModel数据和WorldModel数据来训练模型。ActionModel是根据图片输入和文本指令输入来输出动作,数据格式如下:

WorldModel根据当前帧图片和动作来生成下一帧图片,数据格式如下:

在一次性输出多个action时,使用默认的自回归范式会使得效果变差。原因是动作模态并不在原本多模态大模型的预训练中,因此泛化能力较差,这样生成多个动作时就会有误差累积的问题。为了解决这个问题,WorldVLA提出了一种attentionmask策略,使得生成动作时只能看见前面的图片而不能看见前面的动作,从而解决动作累计误差问题,如下图所示。

实验结果

在LIBERObenchmark上的实验结果如下图所示,在没有预训练的情况下超越了需要预训练的全自回归模型OpenVLA。

下图为actionmodel的消融实验结果。对比row2和row1以及row5和row4可以看出,worldmodel的加入可以给actionmodel带来更好的结果。Row3可以看出,使用默认的attentionmask会导致某些任务的成功率下降,但是从row4看出,我们提出的attentionmask可以全面大幅提升任务的成功率。

ActionModel可视化(Text+Image->Action)

下图可以看出WorldVLA可以根据指令完成对应的动作。

WorldModel可视化(Action+Image->Image)

下图可以看出WorldVLA可以根据动作和图片来生成下一帧图片。

  “有些地区出现了多个国际航空枢纽的格局。比如华南的广州、深圳,西南的成都、重庆、昆明,西北的西安、乌鲁木齐。但与成渝不同的是,西北地域辽阔,西安与乌鲁木齐距离非常远,两个枢纽生态位截然不同。”

责编:陈琪君编辑

苏超赛后球迷自发捡垃圾

  美国财政部本周早些时候也公布了新的反俄制裁方案,涉及俄罗斯以及中国等其他国家的300多家公司、银行和数十名个人。中国外交部发言人林剑13日表示,美国在全球范围内滥施单边制裁贻害无穷,严重损害他国主权安全,造成人道惨剧,破坏产供链稳定。乌克兰危机升级后,美方制裁更是变本加厉。而这种乱舞制裁大棒的做法,不仅无助于问题的解决,反而成为世界一个主要的风险源头。

孟子义李昀锐合作的第部剧

  曾文莉认为,在职业选手商业价值充分释放后,其成功效应才会吸引更多的人群尤其是青少年从事网球运动,而这是中国网球经济发展的根基。

特朗普点发表全国讲话

  十二届四川省委科技委员会第一次会议,有多个重要议题,包括“学习中央科技委员会有关会议精神”“审议《省委科技委员会工作规则》等文件”。

内蒙古通报那尔那茜有关核查情况

  第二,议程设置失灵。新任领导刚上任,却没有提出让民众有感的重大改革行动,欠缺议程设置能力,迄未展现其领导能力,无法主导政治议程,反而任由蓝白“在野”党主导议题引领风潮。

那尔那茜高考文化课总成绩分

  去哪儿数据显示,消息发布后,去哪儿平台“澳大利亚”机票搜索量环比增长四成以上。在去哪儿平台上,飞往澳大利亚的航线覆盖多个城市。悉尼可直飞北京、上海、广州、深圳、成都、杭州、重庆、南京、厦门、天津、济南、西安、海口、郑州、太原等多个城市,暑期从郑州、重庆、天津往返悉尼更便宜,价格在2500元左右。此外,墨尔本可直飞北京、上海、广州、成都、杭州、南京、厦门、青岛、海口等城市,上海、广州也有直飞布里斯班的航班在售。从旅游订单来看,大堡礁、悉尼歌剧院、出海观海豚受到旅客欢迎,8-12日团预订更多。在澳大利亚,旅客可以出海观鲸、看企鹅归巢,体验特色风情。

王欣瑜比战胜萨姆索诺娃

  据介绍,根据气象监测情况,今年4月下旬以来,全省平均降水量26.6毫米,较常年同期偏少75%,截至6月13日,大部分地区连续无有效降水日数超60天,郑州等10个地市在70天以上;平均气温23.2度,较常年同期偏高1.8度。/p>

伊朗

  陈玉祥严重违反党的组织纪律、廉洁纪律、工作纪律和生活纪律,构成严重职务违法并涉嫌受贿犯罪,且在党的十八大后不收敛、不收手,性质严重,影响恶劣,应予严肃处理。依据《中国共产党纪律处分条例》《中华人民共和国监察法》《中华人民共和国公职人员政务处分法》等有关规定,经中央纪委常委会会议研究并报中共中央批准,决定给予陈玉祥开除党籍处分;由国家监委给予其开除公职处分;收缴其违纪违法所得;将其涉嫌犯罪问题移送检察机关依法审查起诉,所涉财物一并移送。/p>

内蒙古通报那尔那茜有关核查情况

  今年36岁的李樟煜,已经在残疾人自行车项目征战多年。2012年伦敦残奥会,他第一次实现了残奥冠军梦。接下来,从里约到东京,再到巴黎,他带着梦想破风前行,每届残奥会都有金牌入账。据介绍,李樟煜获得的各类国际赛事奖牌已有50多枚。