ZimaBlue:当机器人学会看120000小时的第一视角视频
有一件事一直让做机器人的人挺头疼的。
你想让机器人学会一个新动作,比如打开空气炸锅的抽屉,最直接的办法是找人示范,让机器人一遍遍学。但这种示范数据贵得吓人:需要专门的机器人、专门的操作员、专门的场地,一小时的数据可能要花掉几百上千块钱。更麻烦的是,这样收集来的数据永远是"窄"的,机器人只见过实验室里那几张桌子、那几个物体、那几种光线,换个环境立刻懵。
(资料图片仅供参考)
那有没有便宜又海量的数据源?
有,就是网上和人们日常生活中拍摄的第一视角视频。你戴个GoPro去做饭、去整理房间、去拧螺丝,这些视频里全是手怎么抓东西、东西怎么滑落、怎么应对失误的真实过程。这类视频储量巨大,而且成本几乎为零。问题是,这些视频没有"动作标签",你不知道视频里的手在某一帧到底用了多大力气、往哪个方向移动了多少厘米。机器人学习恰恰最缺的就是这种精确的动作信息。
这就是这篇论文要解决的核心矛盾:如何把海量但没有动作标签的视频,转化成机器人真正能用的操作能力。
论文的作者团队给这套系统起名叫ZimaBlue,他们做了一件挺大胆的事:把训练数据规模一路推到超过12万小时的第一视角视频,然后证明,单纯依靠目标机器人自己的数据,零样本任务成功率只有36.1%;一旦把这12万小时视频喂进去,成功率飙到了77.8%。
这个数字差距不是量变,是质变。相当于原来10次尝试成功3.6次,现在10次能成功近8次。
在这篇论文出现之前,做机器人控制的主流思路是所谓的VLA模型
VLA(视觉语言动作模型):一种把预训练好的视觉语言理解能力,直接接上机器人动作输出的模型架构,代表作有π0、GR00T、OpenVLA等,核心思路是让模型"看懂指令、看懂画面、直接输出动作"
VLA模型确实很聪明,能听懂"把红色积木放到蓝色积木上"这种指令,也能识别各种物体。但它有一个天生的短板:它学习"怎么做"这件事,完全依赖那些数量有限的机器人动作数据。就像一个博览群书却从没真正下厨房的人,你跟他讲透了每道菜的原理,他也未必真能颠好一次勺。VLA理解语义,但缺乏对物理世界因果关系的直觉,尤其在遇到没见过的场景、没练过的动作时,这个短板会暴露得特别明显。
于是研究者们转向了另一条路,叫世界动作模型
WAM(世界动作模型):不只是预测该做什么动作,还同时预测"如果这么做,世界接下来会变成什么样"的模型,把视频预测和动作预测绑在一起训练,让模型对物理因果关系有更深的理解
这个思路的妙处在于,抓取失败、物体打滑、镜头被遮挡,这些视觉上的"意外"不再被当成噪声甩掉,而是被当成模型必须解释的因果链条的一部分。这也是为什么最近的DreamZero、LingBot-VA这些工作会被认为很有前途,它们让控制这件事,更少依赖死记硬背的动作轨迹,更多依赖对"什么样的画面变化是可能发生的"这种物理直觉的理解。
但直接把一个现成的视频生成大模型拿来做机器人控制,会出很多问题。通用视频模型是为了生成"好看的视频"而训练的,追求的是画面流畅自然,而机器人需要的是"和动作后果精确挂钩"的预测;很多视频模型是一次性看完整段视频再生成,而真实机器人是走一步看一步,只能基于已经发生的事做判断;再加上网络视频里混杂了大量动画、特效、剪辑转场这种和物理世界没关系的内容,硬塞给机器人模型反而是一种干扰。
这就是ZimaBlue要解决的第二层问题:怎么把一个通用视频模型,一步步"驯化"成一个真正懂物理、能指挥机器人干活的世界动作模型。
三级训练,像盖房子一样一层层来
ZimaBlue的训练分成三个阶段,作者管这个叫数据金字塔。
第一阶段叫视频预训练,用的是超过12万小时的人类第一视角视频、机器人视频和仿真视频,完全不涉及动作标签,只让模型学会"预测接下来会发生什么"。这一阶段的骨干网络来自Wan2.2-TI2V-5B
Wan2.2-TI2V-5B:一个开源的文本转视频生成扩散模型,拥有50亿参数,作为ZimaBlue视频预训练阶段的起点骨干网络
这个阶段像什么?
想象你要培养一个新手厨师,最开始不是让他直接颠勺,而是先让他在厨房里站上几百个小时,看老师傅切菜、下锅、翻炒、装盘,不要求他动手,只要求他能预判"油温到这个程度,接下来该下菜了"这种直觉。如果跳过这一步,直接让他上手操作,他确实能照着菜谱一步步做,但一旦锅里的火突然大了、食材比预想的多了,他就手足无措,因为他从没建立过"这种情况接下来会怎样"的直觉库存。
第二阶段是视频动作中期训练,这时候真正的机器人动作数据登场了,但不是随便拿来就用。因为不同机器人的控制接口天差地别,有单臂的、双臂的、带底座移动的、带灵巧手的,论文提出了一个统一状态动作表示
统一状态动作表示:把所有不同机器人的姿态和动作,都映射进一个100维的标准化空间里,每个坐标位置固定表示某个物理含义(比如左臂末端位置、右手手指关节角度),不同机器人只激活自己实际拥有的那部分坐标,其余补零并打上掩码
这个设计有点像给不同国家的插头都配一个通用转换器。你有德标插头、美标插头、英标插头,转换器本身有一整套预留插孔,某个国家的插头插进去只会用到其中一部分插孔,剩下的空着,但整个转换器的接口规格是统一的。如果不这么做,每种机器人都要单独训一套模型,那些从其他机器人身上学来的"手滑了怎么办""抓偏了怎么修正"的经验,就全都浪费掉了,没法迁移。论文里选了DROID、AgiBot、Galaxea、RoboMIND2-Franka四类具有代表性的机器人平台来做这个跨具身的训练。
第三阶段是后训练,把模型精调到具体要部署的机器人上,同时引入一个专门负责快速反应的轻量分支。
这里就要讲到整篇论文里我觉得最有意思的工程设计:Slow-Fast双系统。
慢脑子管大局,快脑子管手感
生成式的世界模型有一个绕不开的痛点:它想得越周全,算得就越慢。而机器人控制恰恰是个对延迟极度敏感的任务,抓取的瞬间慢个几百毫秒,物体可能已经滑走了。
ZimaBlue的解法是拆成两个系统。
Slow DiT(慢分支)是一个50亿参数的大模型,负责处理视觉观测、机器人状态、语言指令,同时预测未来的视频画面走向,提取出多层的视觉动态特征,这些特征以Key-Value缓存的形式导出。
Fast DiT(快分支)只有5亿参数,运行频率高得多,它不需要每次都重新理解整个世界要怎么演变,而是直接复用Slow分支导出的视觉特征缓存,结合最新的观测和机器人状态,快速给出下一步动作。
这套架构像什么?
想象一个手术团队,主刀医生(Slow)在术前反复研判整个手术方案,权衡各种可能的并发症和应对策略,这个过程很慢但极其重要;而助手(Fast)在手术台上,根据主刀早已给出的整体方案,结合眼前这一秒钟血管的实际状况,做出高频率的微调操作,不需要每一秒都重新问一遍主刀"接下来该怎么办"。如果没有这种分工,要么让主刀事事亲力亲为,手术台上的反应速度会慢到无法接受;要么让助手完全自主决策,又会丢掉整体规划带来的全局判断力。
这个设计带来的效果非常直接。论文的实验数据显示,单独用Slow系统跑,端到端推理延迟是449.6毫秒;引入异步的Slow-Fast双系统后,延迟降到145.6毫秒,提速3.1倍;再叠加扩散步数蒸馏和Torch编译优化,最终延迟压到33毫秒,总加速比达到13.6倍,而且任务成功率不降反升,从63.9%提升到77.8%。
这里要多说一句扩散步数蒸馏这个技术
扩散步数蒸馏(DMD):生成式模型原本需要反复去噪多次(比如8步)才能生成一个清晰结果,蒸馏技术训练一个学生模型,用更少的步数(比如2步)去逼近多步去噪的效果,大幅减少计算量而尽量不损失质量
这就好比一个老师傅炒菜需要反复颠八次勺才能让食材均匀受热,而通过训练,一个学徒学会了用两次更精准的颠勺动作,达到和师傅八次颠勺差不多的效果。步骤少了,速度自然就快了。
数据规模一路涨,效果跟着一路涨
论文里最直观、也最有说服力的一组实验,是在12个真实机器人零样本任务上做的对照。
这12个任务被分成两组:8个标准任务(比如叠碗、选杯子、开空气炸锅抽屉),4个扰动任务(同样的任务,但加上了动态强光、闪烁灯光、陌生桌布、干扰物品这些视觉干扰)。
结果是这样的:
只用目标机器人自己的数据训练,标准任务成功率46.7%,扰动任务只有15.0%,综合36.1%。
加上6000小时的跨具身机器人动作数据,标准任务57.9%,扰动任务22.5%,综合46.1%。这一步主要提升的是精确执行能力,比如关微波炉门这个任务,从0/10直接跳到9/10。
再加上6万小时的第一视角视频,标准任务82.9%,扰动任务35.0%,综合66.9%。视频数据带来的提升集中在需要追踪多步骤进展的任务上,比如叠碗任务从2/10涨到7/10,运送面包从4/10涨到10/10。
最后把视频量翻倍到12万小时,标准任务87.9%,扰动任务57.5%,综合77.8%。有意思的是,从6万到12万小时,标准任务只涨了5个百分点,但扰动任务猛涨了22.5个百分点。
这个现象值得琢磨一下。为什么视频数据对"干扰环境下的表现"帮助这么大?
一个合理的解释是,视频数据的核心价值不在于教会机器人某个具体动作,而在于让它见过足够多样的视觉世界,知道"哪怕光线变了、背景变了、桌上多了些陌生物体,任务的本质进展应该是什么样的"。这种能力,在干净实验室环境里显不出来,因为环境本身就没什么变化需要适应;但一旦真实世界的复杂性涌进来,这种从海量视频里学到的"见多识广"就成了救命稻草。
论文里还专门做了一个对照实验,把慢系统单独跑和用双系统跑做比较。双系统在需要频繁视觉反馈、及时修正的任务上表现更好,比如打开抽屉的空间定位任务从6/10涨到10/10,关微波炉任务从6/10涨到9/10。这说明双系统架构不只是加速工具,它本身在某些任务上还带来了真实的性能提升,因为快分支能更及时地响应最新的观测画面,而不用等大模型跑完一整轮推理。
在标准基准测试上的表现
除了自建的12项真实机器人测试,论文还在三个业内公认的仿真基准上做了系统评测。
在LIBERO-Plus
LIBERO-Plus:一个专门用来测试机器人策略在七种扰动下(摄像机视角、机器人初始状态、语言指令、光照、背景、传感器噪声、物体布局)是否依然稳健的基准测试集
这个基准上,ZimaBlue在零样本迁移设置下拿到86.7%的成绩,超过此前最强的InternVLA-A1.5的85.8%;在针对性微调后进一步提升到92.0%,超过第二名CAC-VLA的90.1%。有意思的是,微调带来的提升主要来自摄像机视角这一项,从58.1%飙升到95.4%,说明视角适应能力很大程度上依赖训练数据是否覆盖了足够多的视角,这也给未来指出了一个明确的扩展方向。
在RoboTwin 2.0这个双臂操作基准上,ZimaBlue在干净环境下拿到94.7%,随机化环境下94.3%,平均94.5%,超过此前最强的世界动作模型ABot-M0.5。更值得注意的是,干净环境和随机化环境之间的差距只有0.4个百分点,说明这个模型在面对环境剧烈变化时几乎没有性能损失。
在RoboCasa365这个覆盖365种日常任务、2500种厨房环境的大型基准上,ZimaBlue排在所有世界动作模型里的第一名,总体49.5%,只输给了用了10万小时真实机器人数据的Xiaomi-Robotics-1(57.4%),而ZimaBlue只用了6000小时的动作标注数据。在最考验泛化能力的"未见过的组合任务"这个类别上,ZimaBlue拿到16.5%,是第二名ABot-M0.6的7.9%的两倍还多。
论文里给了一个特别生动的失败案例对比:一个需要"把装鸡腿的容器放到冰箱第二层、把装蔬菜的容器放到最上层"的复杂任务,没有经过视频预训练的模型,直接把鸡腿本身当成了抓取目标,而不是装鸡腿的容器,抓取失败后还傻乎乎地进入了下一步动作,完全没意识到自己搞错了对象。而ZimaBlue准确识别出了两个容器,正确完成了整个多步骤放置流程。
这个例子挺能说明问题的,语言理解和物理执行之间,隔着的不只是"听懂指令"这一层,还有"准确对应到真实世界里的哪个物体、失败了要不要重来"这些更深的判断,而这些判断力,很大程度上来自见多识广的视频预训练。
Q&A
Q1:ZimaBlue是什么?
A:ZimaBlue是一个通过大规模视频预训练来学习通用机器人操作能力的世界动作模型框架,核心思路是先用超过12万小时的人类和机器人第一视角视频训练视觉动态理解,再用跨具身机器人数据对齐动作,最后针对目标机器人做专项适配。
Q2:ZimaBlue为什么要用Slow-Fast双系统架构?
A:因为生成式世界模型预测越周全速度越慢,而机器人控制对延迟极其敏感。Slow分支负责理解世界如何演变,Fast分支复用Slow的特征高频输出动作,这样既保留了大模型的泛化能力,又把闭环延迟从449.6毫秒压到了33毫秒。
Q3:视频预训练数据规模对机器人任务成功率影响有多大?
A:影响非常大。只用目标机器人数据训练成功率是36.1%,加入6000小时跨具身机器人数据后是46.1%,再加入6万小时视频后是66.9%,最终加到12万小时视频后达到77.8%,尤其在环境受到干扰的任务上提升最明显。
相关阅读
-
康希通信(688653.SH):拟推2026年限制性股票激励计划
,格隆汇 -
焦点精选!康特隆(01912.HK):要约截止 要约人及一致行动人士持股比例达约76.34%
康特隆(01912.HK)及要约人ZhuangyanInvestmentInternationalLimited联合公布,要约已于2026年9月11日(星期五)下午四时正截止,且要约不获要约人进一步修 -
焦点资讯:中国海防:朱宏光先生辞去公司第十届董事会董事职务
中国海防:朱宏光先生辞去公司第十届董事会董事职务每经AI快讯,中国海防(SH600764,收盘价:19.55元)9月11日晚间发布公告称,近日,中国船舶重工集团海洋防务与信息对抗股份有限公司董事会.. -
【独家焦点】女足队长:金球奖就是每年颁发给梅西的那个!
女足队长:金球奖就是每年颁发给梅西的那个!,足球,女足,金球奖,斯嘉丽,世界杯,里奥梅西,候选名单,利昂内尔·梅西 -
2026年新手买保险如何评估渠道服务?五个维度自查
“新手买保险,如何评估渠道服务能力?”这是目前初次投保者较为关心的问题当前保险销售渠道主要分为专业经纪平台、大厂流量平台、保险公司自营渠... -
报道:斯坦福桥攻坚大考!切尔西遇黑马赫尔城强弱反差体育365暗藏爆冷玄机
斯坦福桥攻坚大考!切尔西遇黑马赫尔城强弱反差体育365暗藏爆冷玄机,黑马,英超,切尔西队,赫尔城队,斯坦福桥,马赫尔城,欧冠联赛阶段 -
ZimaBlue:当机器人学会看120000小时的第一视角视频
ZimaBlue:当机器人学会看120000小时的第一视角视频,动作,机器人,摄像机,转换器,真实世界,zimablue -
跨越十七年的医学回响!一篇论文帮女孩锁定罕见病因|焦点关注
跨越十七年的医学回响!一篇论文帮女孩锁定罕见病因 -
半全场分析:吉达联合强势来袭,费萨里或用慢节奏守住平局
半全场分析:吉达联合强势来袭,费萨里或用慢节奏守住平局,吉达,对阵,费萨里,东京绿茵 -
膘肥畜壮出栏忙 西乌珠穆沁旗秋季牲畜出栏迎来高峰
金秋时节,乌珠穆沁大草原牧草丰盈,经过夏季的放牧滋养,各类牲畜膘情达到最佳水准。眼下,西乌珠穆沁旗秋季牲畜出栏工作全面铺开,各个活畜交易市场内购销火热,屠宰加工 -
原奶价格筑底回暖 乳业龙头盈利弹性释放-快资讯
CFi.CN讯:数据显示,2026年上半年乳企收入温和恢复:伊利营收643.31亿元(4.13%),蒙牛448亿元(7.8%),新乳业低温奶收入55.4亿元 -
今天跌了,我只想说三句话
首先,对于回调不要恐惧,养殖板块的上涨趋势一旦确立,那么就不会以任何方式改变。除非底层逻辑变化,但是目前不可能。其次,也不要没有耐心,对于养猪与养鸡这里,回调一 -
通勤路上也能阅读!贵阳15条公交线路上线公益阅读服务
近日,“云上贵图·书香高原”数字阅读综合服务平台正式进驻贵阳B1路、B2路、237路、311路、26 -
今日热门!丙烯腈商品报价动态(2026-09-11)
交易商品牌/产地交货地最新报价丙烯腈国标优级品;丙烯腈质量分数≥99.5%山东君烽新材料有限公司国产山东省/济南市7000元/吨山东君烽新材料有限公司科鲁尔山东省/济南市7400元/吨济南金日和化工有 -
9月11日14点快评:市场午后震荡走低,上证指数领跌
市场午后震荡走低,三大指数中上证指数领跌,其中,上证指数下跌1.12%,深证成指下跌1.08%,创业板指下跌0.63%。两市成交量较前一交易日同期放量2860亿元,预测全天成交额约1.94万亿元。被动 -
粤超八强赛鏖战四起,主场捍卫还是绝地翻盘?
粤超八强赛鏖战四起,主场捍卫还是绝地翻盘?,深圳队,梅州队,广州队,佛山队,东莞队,粤超八强赛 -
观察:前湖人队友3月退役,40岁冠军中锋霍华德复出去格鲁吉亚打球
前湖人队友3月退役,40岁冠军中锋霍华德复出去格鲁吉亚打球,湖人,nba,格鲁吉亚,约翰·霍华德,德怀特·霍华德,勒布朗·詹姆斯 -
【独家】可孚医疗:截至2026年9月10日,公司股东总户数约1.5万户
证券之星消息,可孚医疗(301087)09月11日在投资者关系平台上答复投资者关心的问题。 -
每日热文:广州市花都胜昌包装材料厂(个体工商户)成立 注册资本0.1万人民币
天眼查App显示,近日,广州市花都胜昌包装材料厂(个体工商户)成立,法定代表人为梁家洪,注册资本0.1万人民币,经营范围为纸制品销售;塑料制品销售;纸制品制造;。 -
动态:午间涨跌停股分析:25只涨停股、11只跌停股,绿色电力概念活跃,闽东电力3连板,江苏新能涨停
9月11日午间,A股半日下来共有25只涨停股、11只跌停股。绿色电力概念活跃,闽东电力3连板,江苏新能涨停。连板股方面,瑞尔特4连板,众泰汽车4天3板,新农开发3连板,三孚股份、武汉凡谷4天2板,凯盛
热点
-
王府井海垦广场引进京东MALL海南首店
-
2026年首次投保必读:正规渠道三步走,避免“踩坑”
-
大家人寿上海分公司:真诚理赔暖人心 快速响应显担当
-
丝路果香,慧聚一堂——Juno Markets乌鲁木齐交易技术峰会圆满收官
-
御享双星,同行致远|泰康“御享”系列高铁专列正式启程
-
中文之旅 “邮”我守护 第25届“汉语桥”世界大学生中文比赛收官
-
三高人群能买百万医疗险吗?腾讯微保月费 10.6 元起
-
“公益兜底+商业保障”:泰康在线构建女性健康防护新样本
-
GN16让分红险“素颜出镜”,2026年8月最推荐普通家庭关注「世代悦享3」的四大均衡硬指标
-
2026年8月最推荐香港分红险榜单:GN16历史兑现率全公开,均衡型产品如何守护普通家庭钱袋子?





