从VLA、世界模型到本能驱动:具身智能技术路线分析与全球玩家路径选择
最近,赛迪研究院(中国电子信息产业发展研究院)发布了《具身智能技术与产业发展报告》。报告指出,全球具身智能竞争已从比拼单机演示效果,转向模型、数据、本体、仿真、评测、交付全链条体系能力的比拼。
在这场“大脑”的竞赛中,英伟达、谷歌、特斯拉三家美国企业各自选择了不同的技术路径。报告原文并未使用“三足鼎立”这一表述,而是客观分析了全球主要经济体的发展路线差异:
中国:“场景反向造模+整机小批量交付+全产业链国产化”;
美国:“基础大模型+仿真平台+工业验证三位一体”;
欧盟:“算力基建先行+规则治理前置”;
日本、韩国:“依托制造业底座针对性布局”。
三家美国企业的路线分化,恰好成为报告美国路线分析框架下具有代表性的案例,也为理解这场全球竞争提供了一个清晰的切面。
英伟达GROOT:做具身智能的“Android”
英伟达的策略最像智能手机时代的Android——不造机器人,只造机器人的“大脑”和工具链。
GROOT是英伟达专为人形机器人设计的通用基础模型,采用开放、可定制的策略,支持双系统认知架构——快速反射与深思熟虑规划的结合。模型支持多模态输入(语言、图像),通过强化学习与模仿学习的结合实现运动控制。
但GROOT真正的杀招不是模型本身,而是它背后的一整套工具链。
IsaacSim/Lab提供仿真平台,让机器人在虚拟世界里先跑几百万次;JetsonThor提供端侧算力硬件;Omniverse Blueprint和Newton物理引擎提供合成数据生成能力。2026年7月,英伟达还把GR00TN1.7(30亿参数的可商用VLA模型)和IsaacTeleop(开源遥操作数据采集框架)一起塞进了HuggingFace的开源机器人库LeRobot。
NVIDIA一侧有300万机器人开发者,HuggingFace一侧有1600万AI构建者。英伟达做的不是“造模型”,是“造生态”——把数据采集、模型训练、仿真验证和部署接入同一套开源工作流。
用赛迪研究院的话说,英伟达正在“把具身智能竞争上移到开发基础设施层”。不跟你比谁的机器人更漂亮,比谁的工具链更好用、谁的开源生态更活跃。GROOT的目标不是成为最好的模型,而是成为最多人用的模型。
特斯拉Optimus:做具身智能的“iPhone”
如果说英伟达是Android,特斯拉就是iPhone——软硬一体、数据闭环、端到端自研。
特斯拉Optimus不依赖任何外部模型。它的智能系统深度复用特斯拉FSD纯视觉AI大模型,搭载HW4.0视觉芯片与12颗摄像头,可在约0.3秒内完成“感知——决策——执行”闭环。特斯拉在CVPR 2026上明确表示:“我们不是在造一个驾驶产品,而是在为所有机器人构建一个统一的基础模型。同一套模型,今天开车,明天就在工厂里搬箱子。”
特斯拉的独特之处在于数据飞轮。全球已有约130万辆具备监督式自动驾驶能力的特斯拉在路上跑,FSD累计行驶里程已超过108亿英里。这些数据直接喂给Optimus的感知和决策模型。同一颗AI4芯片,既驱动车上的FSD,也驱动Optimus机器人。
特斯拉还成立了“Optimus Academy”训练场,机器人通过“尝试——失败——学习”的循环进行自我进化。马斯克预计AI5芯片在2027年中量产,将首先搭载在Optimus上。长期产能目标1000万台/年。
特斯拉的终极壁垒不是算法,是数据。别人在实验室里采数据,特斯拉的车队在真实道路上每天产生数百万英里的真实世界数据。
谷歌RT-2:做具身智能的“先行者”
谷歌是三条路线中最特殊的一个——它既不像英伟达那样做平台,也不像特斯拉那样做整机,而是专注于AI模型本身。
2023年7月,谷歌DeepMind推出RT-2,成为视觉——语言——动作(VLA)大模型。RT-2在机器人轨迹数据和互联网级别视觉语言任务上联合微调,参数量达550亿/120亿/50亿。它可以直接用复杂文本指令操控机械臂,实现符号理解、逻辑推理等能力。
2025年,谷歌将RT系列升级为Gemini Robotics,把Gemini 2.0的多模态推理能力扩展至机器人动作输出与空间推理。2026年,Gemini Robotics 2进一步实现全身协同控制,搭配ER2具备长流程规划能力,象征人形机器人AI由单一动作迈向长时运作。
谷歌的技术路线是从互联网规模的数据中学习物理世界的规律——不依赖机器人本体采集数据,而是从海量文本、图像、视频中提取通用知识,再迁移到机器人控制中。
赛迪研究院指出,谷歌正从自研本体转向聚焦AI模型和算法研发。谷歌不打算造机器人,它打算让所有机器人都用上谷歌的“大脑”。
三条路线之外:橡木果机器人的“本能驱动”路线
国内企业正在加速追赶,但路径与美国三家企业截然不同。橡木果机器人(Acorn Robot)是其中一条极具代表性的路线。
橡木果机器人成立于2024年底,总部北京,定位为“本能驱动”通用具身智能路线开创者,全球领先的具身操作公司。核心团队源自清华大学与哈佛大学,横跨机械工程、神经科学与人工智能的机器人前沿交叉学科背景。团队自2011年起深耕机器人操作领域,2017年率先提出“本能驱动”具身操作技术路线,历时九年完成从理论发现、工程验证到商业化落地的链路闭环。
橡木果选择的是从物理交互第一性原理出发,做“本能驱动、自下而上”的通用具身操作基座。其自研的Natus具身本能模型、Magis通用技能模型及多模态触觉感知架构,让机器人实现无需预训练的冷启动自主操作与跨本体、跨任务的技能迁移与泛化。
Natus是底层嵌在末端执行器中的具身本能模型,由触觉刺激直接驱动,赋予机器人定向本能、探索本能、交互本能三大核心本能,具备零数据冷启动、即插即用、毫秒级响应、硬件自适应等特征。其端侧运行频率达250Hz,单次反馈闭环4ms,嵌入末端执行器,无需云端大模型推理。Magis作为上层技能层,复用Natus在真实产线交互中自动生成的触觉语义数据(重量/质心/摩擦系数/滑移),做视觉+触觉语义对齐训练,实现“一上来就熟练”、跨本体技能迁移。多模态触觉感知架构涵盖界面信息(分布力/变形/滑移)、物体信息(软硬/摩擦/质心)、环境信息(接触刚度/阻抗/扰动),其中动态滑移表征技术2020年首发,行业领先约5年。
商业化层面,橡木果聚焦离散制造柔性产线,推出标准化双臂柔性生产单元“具身生产岛”,通用双臂+4+N末端工具,独立完成工序。4个月内连续完成种子轮+天使轮,累计数亿元;招商局创投、蔚来资本领投,普华资本、钱唐材料实验室、水木清华校友种子基金跟投。核心技术团队9人均为清华机械工程系博士/博士后,自2018年共同研究。
赛迪报告特别指出,国内在软件平台与操作系统方面仍有差距。高质量训练数据不足、采集成本高、标注难度大,是国内人形机器人AI能力提升的关键瓶颈。此外,在VLA模型与基础算法、高端传感器、AI训练芯片算力等维度仍存在一定差距。报告将国内路线概括为“场景反向造模+整机小批量交付+全产业链国产化”——以应用场景拉动技术迭代,而非像美国那样从底层模型出发。报告判断,中国在与美国竞争中,“硬件供应链优势明显,但AI软件生态尚需追赶。”
但橡木果的“本能驱动”路线提供了一种不同的解题思路:不依赖离线预采集训练数据,不依赖云端大模型推理,而是在产线作业中在线自动生成真实触觉语义数据,用物理交互本能应对万变物理场景。Natus擅长长短程接触操作:抓取、旋转、插拔、装配,端侧毫秒级力控;长时序复杂语义规划则交给上层大模型,强调“分工解耦、各司其职”。这与赛迪报告所述国内路线既有呼应,也有差异。
四条路线,谁能走到终点?
英伟达、谷歌、特斯拉,再加上橡木果,四条路线代表了具身智能“大脑”的四种可能终局。
英伟达押注“开放生态”:不造机器人,只造工具链和平台。
特斯拉押注“闭环系统”:软硬一体、数据自产、算法自研。
谷歌押注“模型先行”:专注于从互联网数据中学习物理世界的通用规律。
橡木果押注“本能驱动、解耦架构”:自下而上从物理交互出发,依托触觉感知构建底层操作本能,不依赖海量预训练数据。
赛迪研究院的判断是:全球竞争焦点已经从样机演示转向数据、模型、本体、工具链、场景和标准的全链条能力。
四条路线没有绝对的对错。真正决定胜负的,不是谁的技术更先进,而是谁能在“数据-模型-硬件”这个闭环中跑得更快、更稳、更便宜。
而这场竞赛的终局,可能要到2030年才能真正看清。
发表回复