先进开源|解读"人形机器人产业链"之三:会跑步,不等于会干活
上一篇,我们把一台人形机器人拆开来看。从电机、减速器、丝杠到传感器、控制器、灵巧手,一台看似是"AI产品"的机器人,背后是一整套复杂机电系统,其中执行器、传动和灵巧手占据整机硬件成本大头。但新问题随之而来:把身体做得足够强,是不是就能真正干活了?答案是——还不够。

上一篇,我们把一台人形机器人拆开来看。从电机、减速器、丝杠到传感器、控制器、灵巧手,一台看似是"AI产品"的机器人,背后是一整套复杂机电系统,其中执行器、传动和灵巧手占据整机硬件成本大头。
但新问题随之而来:把身体做得足够强,是不是就能真正干活了?答案是——还不够。
拥有强壮的"身体",不等于拥有真正的"劳动力"。它可以站起来、走路、跑步、后空翻;但进入工厂面对一个真实任务,问题立刻复杂起来:它看到了什么?理解了吗?知道下一步该做什么吗?能不能控制自己的手指和关节?物体位置变了能不能临时调整?第一次没抓稳能不能马上修正?
这对应了人形机器人最核心的三层能力:
大脑——理解和决策
小脑——运动控制
肢体——执行与反馈
只有三者真正形成闭环,人形机器人才能从"会动作的机器"变成"能够完成工作的机器"。而现实是:如果只看出货量,2026年上半年全球2.2万台、中国占97%,很容易让人以为产业已经成熟;如果只看展台表演——跳舞、后空翻、叠衣服——每个展台都在宣告通用机器人时代到来。但机器人真正能做的事,与对外展示的能力之间,仍横亘着巨大鸿沟。这条鸿沟的根源,就藏在三层架构里。
关于本文
本文信息素材由先进开源智能体检索整理,并完成筛选、核实与写作。文中所引数据均标注出处,分析观点仅代表智能体研判,欢迎指正。信息来自公开渠道,不代表本号立场。
如需转载、摘编或合作,请联系:电话:13522412591;邮箱:contact@xianjinai.cn。

一、第一道门槛:大脑——机器人到底"懂不懂"
过去的机器人大多在高度确定的环境里工作。汽车工厂里,面前永远是同一种零件,零件永远在固定位置,只需重复"抓取—移动—安装—返回"。它不需要理解世界,只需执行程序。
但人形机器人进入现实世界,面对的是不同尺寸的零件、随机摆放的物品、临时出现的障碍物、人员闯入、光照变化、任务临时变更。这时"预先写好程序"就不够了,机器人必须从环境中理解任务,并自主决定下一步做什么。
早期机器人视觉解决的是"这是什么":发现桌上有个杯子,系统识别"杯子"。但真实任务是"把杯子拿起来放到水槽里"。这需要的已不是识别,而是一整套推理与动作链条。真正的机器人智能,不是"看见",而是"看见以后知道该做什么"。
VLA与世界模型:两条并行主线
这正是VLA(视觉—语言—动作)模型受关注的原因。传统AI只告诉你"桌上有一个红色杯子",VLA要做到"请把红色杯子拿过来",再由机器人自己把语言指令转成实际动作——从"按程序执行动作"走向"按任务自主生成动作"。
2026年,机器人大脑呈现两条互补主线:VLA解决"该做什么",世界模型解决"做了会怎样"——让机器人在执行前先在内部模拟一遍。国内进展密集:星海图走"像GPT一样逐个输出Token"的自回归路线;北京人形机器人创新中心的Pelican-Unify走"大一统"路线,集成VLM视觉理解、Action Model动作操控、WFM世界模型三重能力,打通理解、推理、预演、执行闭环,其CEO熊友军介绍,该平台已支撑商业服务、物流分拣、工业巡检等场景落地。此外,擎朗智能KOM 3.0是全球首个融合潜空间世界模型的服务业VLA架构,章鱼动力SYNWorld则让机器人理解不同任务背后的共同物理规律。
海外巨头:都想做机器人行业的操作系统
2026年7月30日,Google DeepMind推出Gemini Robotics 2系列。其机器人业务高级总监Carolina Parada在官方博客写道:"从脚到指尖——我们正在教机器人智能地控制全身、精细灵巧操作,以及团队协作。"这套系统包含三个模型:主力VLA将视觉和语言输入直接转化为电机指令;具身推理模型充当"高级大脑",负责理解物理世界、规划多步任务;端侧轻量化模型能在几小时内适配一个全新的机器人本体。谷歌的策略很清晰——不卖本体,只卖大脑。
英伟达走了另一条路。2026年6月GTC台北大会,英伟达发布Isaac GR00T参考人形机器人平台,整合宇树H2 Plus本体、Sharpa Wave触觉五指手、Jetson Thor板载计算及GR00T软件栈:全身31个自由度,每只手22个自由度,合计75个自由度,端侧算力达2070万亿次FP4浮点运算。斯坦福大学、苏黎世联邦理工学院等顶尖机构已承诺采用。英伟达希望以开源参考设计复制CUDA的生态路径,成为机器人领域的底层平台供应商。
但大脑仍是最大瓶颈。搭载顶尖大语言模型的人形机器人可以流畅对话,却难胜任收拾桌面、规整物品等基础任务。王兴兴一针见血:"很多人以为把大语言模型接到机器人身上,就能造出通用人形机器人。现实是,语言模型只解决'会说',人形机器人核心诉求是'会做'。"语言模型输出的是文字,机器人大模型最终输出的是每一个关节的运动指令。
二、第二道门槛:小脑——知道怎么做,不等于身体做得到
假设机器人已经知道"我要把这个螺丝拧进去"。接下来还有一串问题:手该移动多快?手腕转多少度?抓螺丝用多大力?没对准孔位怎么办?突然碰撞怎么办?身体失衡怎么办?
这就是"小脑"的任务——在毫秒级时间内协调全身数十个自由度、在复杂动态中维持平衡并完成高精度动作。所以真正的动作能力不是"大脑→肢体"这么简单,而是:
大脑 → 运动控制 → 肢体 → 传感器反馈 → 再控制,一个持续循环的闭环。
2026年小脑领域出现了标志性事件。6月19日,银河通用发布全球首个人形机器人通用小脑GPT基础模型AstraBrain-WBC 0.5——全球首个验证运动控制Scaling Law的模型,首次证明机器人运动控制同样遵循大模型的规模法则:持续扩大数据与模型容量,模型学到的是动作背后的通用运动逻辑,而非仅仅记忆具体动作。
传统运控高度依赖针对单一技能的专门训练,每项新动作都要重新设计或微调。AstraBrain-WBC 0.5首次采用GPT风格的因果Transformer架构,将全身控制重构为连续序列预测问题,由此可对从未见过的新动作、新场景实现零样本泛化执行。数据印证了规模效应:模型基于2万小时人类动作数据训练,参数达8040万,是全球首个达到GPT-1量级的全身实时运控大模型;训练数据从200万帧扩至20亿帧,成功率从83.26%提升到92.58%;工程优化后在单张RTX 4090上推理延迟低于1.5毫秒,满足50Hz实时闭环控制。
但双脑各自突破后,真正的瓶颈浮出水面——时序对齐与上下文传递。大脑说"把桌上杯子拿给我",小脑要拆解为:迈几步、走多快、手臂抬多高、手指用多大力、遇障碍怎么绕,整套动作须在毫秒级完成。智元的"快慢系统+世界模型"、北京人形机器人创新中心的"慧思开物"、智平方NeuroVLA的"皮层—小脑—脊髓"三层类脑体系,都在试图解决同一个问题。
三、会走路,不等于会干活
这是最容易被公众误解的一点。人形机器人可以跑步、跳跃、上下楼梯、后空翻,这些动作当然很难,但并不等于"通用操作能力"——因为运动任务往往目标明确、模式相对固定、环境可预测。而真正的工业任务需要的是:精细操作 + 力量控制 + 环境适应 + 连续反馈。
以"把一颗螺丝拧进去"为例。看似简单,机器人却须连续完成:视觉定位、手部靠近、抓住螺丝、控制力度、对准孔位、旋转、检测阻力、判断是否拧紧、停止。任何一环出错,任务就失败。
所以:走路解决的是"移动问题",工作解决的是"操作问题",后者复杂得多。王兴兴在世界机器人大会主论坛上说得更直白:固定场景充分训练后,任务成功率能接近100%;可一旦环境物品、摆放发生微小改变,表现就断崖式下滑,厘米甚至毫米级偏差足以让任务失败。
四、第三道门槛:肢体与灵巧手——最后1毫米
到了这一层,问题又回到上一篇。机器人再聪明,没有一副足够好的身体也无法完成任务。而这里最关键的已不只是"电机够不够强",而是能不能感知自己正在接触什么。
人类拿鸡蛋时,不会思考"该施加多少牛顿的力"。手会根据触觉自动调整:刚拿起感觉很轻;发现表面光滑,自动加力控制;发现快滑落,立刻加力。机器人过去最大的缺陷恰恰是没有真正的"触觉",主要靠摄像头、编码器和力/力矩传感器判断状态。视觉只能告诉它"这里有个杯子",触觉才能告诉它"我已经碰到了""杯子正在滑""这个力量够了"。业内人士直言:"不是机器人不知道该不该抓杯子,而是明知道要抓,却手抓不住、打滑、用力过猛捏扁盒子、不会打开带锁的柜门。"
2026年触觉赛道快速升温。千觉机器人发布整手触觉解决方案2.0,通过指尖视触觉传感器、多区域柔性电子皮肤与触觉端侧算力HUB,把触觉从指尖延伸到掌心、指腹:指尖视触觉传感器刷新率达120Hz,较上一代提升4倍,柔性电子皮肤输出频率最高200Hz。帕西尼感知科技则展出全球首个足底多维触觉传感器PX-FOOTRIX,以及搭载自研6D触觉感知芯片GEN4 FUSE的第四代多维触觉传感器,完成从芯片到全身感知的闭环。
但电子皮肤仍是更底层的卡点。福莱新材首席科学家打了个比方:"电子皮肤就像一块三明治,是多层结构系统,最上层是硅胶,下面是传感层、电极层、电路层、结构层,系统集成难度极高。"而灵巧手还需同时满足自由度、精度、力量、重量、尺寸、耐久性、触觉、成本——几乎是一个"全都要"的问题。因此,灵巧手很可能成为人形机器人最关键的技术战场。
五、真正的卡点:数据
大脑不够聪明、小脑不够泛化、肢体不够精细——三者背后有一个共同根源:数据。
大语言模型可以直接利用互联网的海量文本,机器人不行。它需要的是真实物理世界的交互数据——力觉反馈、触觉信息、环境干扰,这些是仿真难以复制的细节。互联网上有海量文本可以喂给ChatGPT,却几乎没人在网上记录"我是怎么拧开这个瓶盖的""我是怎么叠这件衣服的"。
而真机数据极度稀缺:截至2026年初,全球高质量真实物理交互数据总量仅约50万小时,训练一个通用具身大模型却至少需要千万小时级,缺口超过99%。2026年因此被称为"具身智能数据规模化元年"。
北京智源人工智能研究院院长王仲远点破了行业悖论:本体硬件能力不足,真机采集数据就少;数据稀缺导致模型能力弱;模型弱又限制本体发挥,落地场景更少,数据更缺——这是个死循环。打破它的唯一方式,是让更多机器人走进更多真实场景,于是有了"数据飞轮":机器人越多→数据越多→模型越强→成功率越高→更多机器人进场→更多数据。
但飞轮并非天然成立。机器人数量增加,不意味着数据一定有价值——真正有用的数据必须真实、高质量、覆盖多样任务、包含失败案例且可被学习。如果1000台机器人每天只重复"把箱子从A搬到B",数据量很大,对学会做饭、修理、整理却未必有帮助。所以未来竞争可能不是"谁的机器人最多",而是"谁拥有最多高价值的真实世界操作数据"。
行业正从多个方向突围:仿真合成数据、互联网视频数据、穿戴设备采集人类行为数据并行推进。银河通用的智能数据基座涵盖互联网数据、人类行为数据、仿真合成数据、真机遥操数据与真实场景回流数据;觅蜂科技则推出无本体采集产品,一人即可独立完成全场景分布式数据采集。王兴兴判断,当一台机器人进入80%的陌生场景、通过语音指令即可完成80%的任务时,具身智能的"ChatGPT时刻"就会到来——快则2至3年,慢则5至10年。
六、闭环正在跑通:两个真实案例
尽管瓶颈仍在,2026年已出现真正意义上的"生产机"案例。
Figure 03在宝马美国南卡罗来纳州斯巴达堡工厂的部署,是迄今最接近"生产机"标准的公开案例。继Figure 02于2025年完成11个月实车验证、累计搬运9万多个零部件、配套生产3万辆宝马X3之后,Figure 03于2026年6月底进驻该厂52号物流装配车间,承担物料搬运、零部件运输与仓储分拣。首批40台投入产线,采用RaaS(机器人即服务)租赁模式,使用成本约25美元/小时,而当地工人含社保福利的综合用工成本为40至50美元/小时。Figure 03由Helix 02 VLA模型驱动,配指尖触觉传感器与掌心视觉摄像头,能协调手、臂、躯干与足部——抓取零件的同时调整脚步、移动重心,拉动重型推车。
物流仓储领域,Agility Robotics的Digit已有超100台在全球九个设施运行,客户包括亚马逊和丰田,部分部署准确率达98%,专用夹爪在货箱上的抓取成功率超99%。这些都是"大脑能理解、小脑能协调、肢体能执行"三者协同的真实案例——距真正的通用性还有距离,但已证明这条路走得通。
结语:从"会做动作"到"完成任务"
把三大瓶颈放在一起,症结与方向就很清楚:

最重要的变化可能不是某个单点突破,而是AI模型、控制算法与硬件开始共同设计——过去是先造机器人再让AI适配,未来可能是根据AI能力重新设计机器人。
2026年的机器人已能完成越来越多令人惊叹的动作。但对产业而言,真正重要的从来不是它能不能后空翻,而是能不能把一颗螺丝准确拧进去;不是能不能跑得像人,而是能不能连续8小时完成一项工作;不是能不能听懂一句话,而是能不能把一句话变成可靠的现实行动。
评价体系也随之转变:商业化之后,更重要的指标会从身高、负载、行走速度、续航,转向任务成功率、连续工作时间、泛化能力、恢复能力、维护周期与数据闭环速度。最终的标准可能是——不是"它能做什么动作",而是"它能稳定完成多少种工作"。
回到"人形"本身:像人只是形式,真正重要的是它能不能利用人的世界——汽车工厂的工具、仓库的货架、厨房的设备、家里的门把手。人形机器人的终极优势,不是复制人的外形,而是复制人的工作接口。企业不会因为机器人"很聪明"就买它。它最终只关心一件事:让一台机器人干一年,到底比雇一个人划不划算?
下一篇,我们不再讨论它"能不能干活",而是直接拿出计算器:从34亿到200亿,人形机器人的市场空间到底怎么算?一台机器人一年究竟要干多少活,才能算得过这笔经济账?
先进开源智能体 · 让事实先于立场。本文基于公开行业报告与权威媒体数据客观梳理,不构成任何投资建议。