近年来,具身智能领域的竞争正逐渐升级,从硬件的比较转向大脑的竞争。谷歌的Gemini Robotics 2提出“一种大脑适用于各种机器人”的理念,英伟达的Jim Fan声称“VLA已死,世界动作模型当立”。在此背景下,宇树科技正在推动这一技术的发展。其最新的人形机器人基础模型UnifoLM-WLA-1.0亮相,具备6B参数和约2500小时的真实训练,成功实现了7项开源SOTA示范,某些空间理解能力甚至超过了GPT-6 Astra。同时,宇树还宣布将开放模型、代码及数据集。
对于机器人而言,模型的能力必须能在实际任务中体现。人形机器人何时能进入更多的实际场景,成为“通用劳动力”,是宇树所关注的重要问题。UnifoLM-WLA-1.0集成了64项任务执行能力,从折叠毛巾、收纳餐具到铺床、倒垃圾、将衣物放入洗衣机,验证了其广泛的模型适应能力。
此前的演示大多集中在单一任务和场景,极为定制化,不易推广。而一个能够处理多种任务和场景的模型,是机器人实现普及的重要一步。宇树的努力旨在使国产厂商成为“具身智能大脑”的引领者。 千亿球友会
首先,UnifoLM-WLA-1.0在空间理解和推理方面表现出色,其基于UnifoLM-ER-1-4B的推理基础模型在多模态感知与理解评估中有7项指标超越了其他开源模型,其中在空间理解任务上的表现已接近甚至超过许多封闭源模型,如在Where2Place和EmbSpatial基准测试中,UnifoLM-ER-1-4B的得分分别为82.0和88.9,高于GPT-6 Astra的成绩。
再看执行能力,UnifoLM-WLA-1.0整合了感知、推理、未来预测与动作生成,涵盖64项任务,其桌面操作包括折叠衣物和整理铅笔盒等,全身操作如倒垃圾和铺床也都支持。宇树正在尝试将“具身智能大脑”的理念转化为可验证的模型体系,力图在开源生态中占据一席之地,类似于“安卓”在手机领域的作用。
其次,宇树在推动这一成果方面不遗余力,提出的方案让机器人在执行动作前能够预判未来变化,克服了以往“看图做动作”的局限。其模型通过光流分析实现动作前后图像对比,为机器人提供动态环境的变化预测。 千亿球友会
在此过程中,宇树注重对“变化位置”的学习,成功将“哪里会发生变化”这一重要元素纳入模型,使得机器人能更好地理解动作所引起的空间变化。这一过程将变化区域转化为一系列固定长度的离散Token,简化了模型的预测任务。
在动作生成方面,机器人需要处理比自然语言更为复杂的操作。宇树通过将运动轨迹分拆成末端执行器的位置、关节和下肢关节三部分,使用RVQ将其离散为Token,以便同步处理。这样一来,机器人关于“怎么动”的响应变得可控和明确,完成各类复杂任务时将显得更加高效。