
导语:年夜语言模子学会了猜测“下一个词”,在是有了会写代码、会做题、会对于话的ChatGPT、DeepSeek、Qwen。视频天生模子学会了猜测“下一帧”,在是有了愈来愈 年夜语言模子学会了猜测“下一个词”,在是有了会写代码、会做题、会对于话的ChatGPT、DeepSeek、Qwen。视频天生模子学会了猜测“下一帧”,在是有了愈来愈传神的图象及视频天生模子,例如Seedance、Sora。具身模子学会了猜测“下一个动作”,在是呆板人最先能完成愈来愈繁杂的使命。而悟界·RoboBrain Orca的方针是做一件更底层的事:让AI于“脑海中”形成一个表征,该表征是对于当前世界状况的高度“浓缩”,基在该表征,AI可以或许建模向前及向后世界状况的蜕变。这就是悟界·RoboBrain Orca作为“多模态表征世界模子”的焦点哲学:The World is in Your Mind。 悟界·RoboBrain Orca:从猜测“下一个详细模态输出”,走向猜测“下一个世界状况”。 悟界·RoboBrain Orca于看到一段视频、一张图、一个指令、一段事务描写后,先于内部形成一个同一的世界潜于表征空间。这个世界潜于表征空间就像AI的“脑海中的世界”,它把视觉、语言、事务、使命用意等多模态的旌旗灯号构造起来,进修物体怎样运动、场景怎样变化、动作会带来甚么后果、事务之间有甚么因果瓜葛;当前状况怎样走向将来状况;甚至于某些前提下,世界会不会朝另外一个标的目的演化。悟界·RoboBrain Orca的焦点变化:从Next Token/Next Frame/Next Action,走向Next State Prediction。 悟界·RoboBrain Orca的技能哲学:先使用多模态世界旌旗灯号进修世界表征,再做好一切使命 悟界·RoboBrain Orca把世界进修拆成为了两条互补路径:无心识进修及成心识进修。 婴儿会看到工具失落,会看到人走动,会看到门被推开,会看到球滚到桌子下面。这些经验不是经由过程标签进修的,而是经由过程持续不雅察天然世界得到的。悟界·RoboBrain Orca的无心识进修也是云云,它客不雅地看世界,经由过程海量真实世界的视频,让它先学会“世界本身怎么动”。悟界·RoboBrain Orca的成心识进修,即主不雅地交互世界,就是用语言描写的事务、使命指令及VQA问答,帮忙模子进修稀少但有详细意义的状况转移。 12.5万小时视频,1.6亿条事务标注,且预练习连续Scaling。 悟界·RoboBrain Orca跟着练习数据的增长,下流使命能力可随之晋升,且具有连续Scaling的潜力。悟界·RoboBrain Orca学到的表征可经由过程多种解码器读出。于文本读出上,悟界·RoboBrain Orca更擅长状况转移的理解及动态运动的推理;于图象读出上,悟界·RoboBrain Orca更能揭示真实场景的交互猜测能力;于动作读出上,悟界·RoboBrain Orca没有于预练习中进修动作标签,也能帮忙下流呆板人更好地泛化。 悟界·RoboBrain Orca所代表的世界进修范式有可能从具身智能进一步走向科学发明、繁杂体系建模以致更广漠的认知界限。它是多模态表征世界模子的一个初期版本,但有可能成为通用世界基础模子的一块主要基石。