来源:巨潮WAVE
2026-09-09 22:16:51
(原标题:扔掉遥控器,是具身智能的终极关卡)
文|谢泽锋
编辑|杨旭然
细心的观众能发现,无论是赛跑、障碍赛、跳高还是举重和跳远,机器人背后总是会站着一两个操作员,他们手里拿着遥控器,给机器人下达指令。
去年的机器人马拉松大赛上,几乎都需要人拿着遥控器在后面跟着跑,每台机器人甚至需要三名工程师“陪跑”,一度被诟病为“遥控车大赛”。
“人为遥控”的真实存在,会打破机器人公司漂亮demo带来的完美滤镜,也可以让人们看到更多关于中国具身机器人的真实情况。
但如果因此就将机器人完全等同于遥控玩具——很多人在网络上也是这样玩梗或者评论的,显然是对于机器人产业的理解有些过于简单化了。
理解机器人的“遥控”争议之后,人们才能对具身智能产生更多了解。
本文是来自《巨潮WAVE》内容团队的深度价值文章,欢迎您多平台关注。
进化
竞技赛事是推动AI技术进步的重要平台。
无论是和柯洁对战的AlphaGo,还是美国国防部高级研究计划局(DARPA)主办的DARPA自动驾驶挑战赛,人工智能和智能驾驶都起到了重要作用。
国内的机器人体育赛事也有类似作用。这种大型活动不仅能产生热搜话题、吸引国内外众多厂商参与,更可在极限环境中验证机器人的性能、算法、续航等能力。
以机器人半程马拉松赛为例,第一届20支人形机器人队伍角逐,但最终只有6支队伍完赛。“天工Ultra”以2小时40分夺冠。这个成绩并不算优秀,而且“天工Ultra”还需要一名领跑员,以及工程师背着“电池”为其护航。
第一届机器人半程马拉松,天工夺冠。
第二届马拉松,荣耀齐天大圣队自主人形机器人选手“闪电”在比赛中冲线。
到了今年第二届机器人半程马拉松,赛事分为自主导航与遥控赛队,两组成绩分别按1.0与1.2的加权系数进行核算,并统一排名。
最终,荣耀绝影赤兔队遥控机器人“闪电”以48分19秒率先冲线,但由于1.2倍的加权规则,成绩相应“加长”。来自荣耀的齐天大圣队自主导航机器人“闪电”随后以50分26秒(净用时)的成绩夺得桂冠。
这一成绩不仅相比上一届的冠军缩短了将近1小时50分钟,还打破了人类57分20秒的半程纪录。
今年机器人半马比赛中,40%的机器人都是自主导航、自主奔跑,前三名(齐天大圣队、雷霆闪电队、星火燎原队)也都是机器人自主完成。
赛制设置的1.2倍加权时长,目的就是鼓励参赛队伍使用真正的自主机器人。
遥控组的拐弯、避坑、绕障碍全部是人来操作,机器人只负责执行,速度上更快;自主导航组,机器人要独立识别坡道、弯道、坑洼,自己规划路线、躲避障碍。
毫无疑问,自主机器人才是产业希望看到的终局。
同样,在第二届世界人形机器人运动会,30个竞技赛项中,23项明确要求“全自主”,而去年,多数赛项允许“遥控、半自主、全自主”三选一。
变化的背后,是产业技术的进步。过去一年,人形机器人最大的进步集中在感知与定位,去年机器人靠摄像头识别跑道,容易串道;今年,参赛队伍在头部加装激光雷达,赛前建立“冰丝带”的三维地图,通过雷达与地图匹配实现厘米级全局定位,帮助机器人自主完赛。
100米障碍、400米障碍赛由于难度大,可以允许使用遥控,但最终成绩要乘以1.2的时长加权,也可以报全自主组,系数为1.0。
从这两项备受关注的机器人大赛来看,“遥控”的戏份已经有所降低,机器人的自主能力已经在肉眼可见地提升。
过渡
虽然一年来机器人加速进化,但那些自主参加比赛的机器人,也需要操作员用遥控发出启动指令。
即便使用遥控的400米障碍赛,因为跨栏、过弯涉及对未知空间的实时判断,机器人在复杂环境中遭遇干扰,就可能立刻导致宕机“思考人生”。
这同时也是机器人运动会最大的反差——成绩单上可以超越人类,产品的真正落地却还无法很快同步。
但所有的机器人企业、从业者都会告诉公众,遥控机器人不等于遥控玩具。
传统遥控车,手柄上有前进、后退、向左、向右、转弯等按钮,玩具车能作出怎样的动作,完全取决于操作者的手艺,它没有任何自主“智慧”,不会避障,更不会主动思考。
相比之下,人形机器人并不是“提线木偶”。首先,人类的手速、反应再快,也根本不可能同时操作几十个毫米级的瞬时动作。
其次,工程师只是通过遥控,发出前进、切换模式、指定目标等高层指令,至于怎么迈腿、怎么调整重心、怎么越过障碍,都完全由机器人自主完成。
操作员相当于“布置战术的主教练”,具体怎么踢球,还得球员自主思考和决策。
操作人形机器人的遥控动作,本质是在“任务层”布置任务。操作员相当于“大脑总指挥”的角色,决定去哪里、做什么动作,不会参与具体的运动执行。
目前人形机器人还不能完全摆脱遥控,甚至很多宣称自主的机器人,并非已经完全像人一样理解物理世界,而是提前预设动作脚本。一旦遇到突发事件和复杂环境,任务失败率会肉眼可见地提升。
遥控机器人并非“大号玩具”,绝非“产业骗局”,但机器人仍处于产业初级阶段也是不争的事实,其核心卡点就是王兴兴所说的泛化能力不足。
何小鹏把人形机器人的智能化水平按自动驾驶的方式分成L1—L5五个等级,这一观点被业内广泛引用。
如今市面上的人形机器人基本处于L2初期,要想进入真正的商业化阶段,必须要达到L3的能力,也就是手、脚、嘴、眼、大脑能够全项融合。进入2026年,机器人正迎来量产的关键节点(L3)。
有自媒体分享称,其联系宇树科技员工了解产品情况,被告知9.99万元的G1标准版不支持二次开发,只能用于展示和玩具,本质仍是遥控,处于L1-L2阶段。
真正面向科研、高校和开发者的G1 EDU版,价格跳到20万~40万元,如果想要拥有完整解决方案,定制开发成本极为昂贵。
相比DeepSeek、豆包等已经开始普及的AI应用,人形机器人如今还处于小学阶段。为了保证安全、避免突发意外情况,或在处理复杂任务时遥控不可或缺。
操作员手里的遥控器,完全可以不必回避,它恰恰是机器人迈向真正自主的必经之路,它是机器人智慧水平提升的过渡产物。
终局
无论是使用遥控器,还是类似于《环太平洋》里通过神经感知和脑机接口操作机甲,这些都还不是机器人的终局。
自主智能才是产业发展的最终形态,丢掉遥控器才是具身智能的成人礼。
如上文所述,当前具身智能卡在L2-L3的关键节点,最大瓶颈就在于泛化能力不足。多数机器人在固定场景中经过充足训练,任务成功率能接近100%,然而一旦进入新的环境,成功率就明显下跌。
王兴兴就此提出了“双80%”标准,即把机器人带到80%的陌生场景中,通过语音或文字指令,它能够顺利完成约80%的任务。那么具身智能就真正来到了通用化、产业大爆发的临界点。
他认为,“快的话2到3年,慢的话5到10年,机器人就可能来到ChatGPT时刻”。
在这条进化的路径上,有三个清晰的发展节点。
其一是从需要操作员,到操作员最终退场。
L1阶段需要操作员全权操控每一个动作,L2向L3过渡,则是操作员发出任务指令,机器人完成执行;模仿学习控制是L3到L4,操作员示范一次,机器人学会后即可独立执行;L4到L5则是终极形态,人们只要给出指令,比如说一句“把水端过来”,机器人自主完成细节。
当下的主要瓶颈是上层意图理解与下层运动执行之间的鸿沟。底层大模型能直接驱动几十个关节协同完成一个复杂动作,是未来3到5年最需要突破的技术攻关方向。
其二是数据驱动的自主学习循环正在形成。
遥控并非辅助手段,而是支撑自主能力演进的基础设施。每一次人为操控,其实都在产生真实世界的训练数据,而每一条数据,都在喂养机器人大脑的进化。
当数据飞轮转起来,机器人自主能力将出现线性的跃升。本次机器人运动会就积累了2500小时的真实场景操作数据,分别对应12个应用场景、44项作业以及百余项技能。这些宝贵的真机数据,将成为下一轮具身大模型训练的关键“养料”。
本次运动会中的天工Omni采用了很特别的摆臂动作,被网友称作“娇羞机器人”。研发团队介绍,“捂脸害羞”姿态并不是工程师设定的,也不是遥控,而是机器人自主训练学出来的步态。
这从侧面印证了,机器人真正进行自我学习与进化的可能性。
其三是标准化评测认知观念开始成型。
运动会倡导“去遥操化”的评价体系,正推动这一理念走向大众。明年的第三届运动会将进一步扩增场景赛,未来“是否全自主”极有可能成为硬性打分指标,届时那些只会展示完美Demo的厂商就会被观众“祛魅”。
这也会直接推动机器人产业从技术验证阶段迈入商业落地。
丢掉遥控器,并不是单纯的一个加分项,而是具身智能走向产业化的必经之路。虽然这条路想要真正走过去,仍然需要不少时间。
写在最后
1988年,莫拉维克写下了一部启示后人的巨著《智力后裔》,他在书中提出这样一个观点:对人类来说很难的任务(如逻辑推理、下棋),AI反而容易解答;而对人类来说很简单的物理动作(如走路、抓取物体),对AI来说,却难如登天。
这一问题后来被业界总结为“莫拉维克悖论”,让机器人推理、解题轻而易举,但让它像婴儿一样感知物理世界却极为困难。
理解“遥控”就理解了当前机器人产业的核心难题,硬件(机器人躯壳)其实早在十多年前就已经准备就绪,后续只是在优化,而真正卡脖子的是机器人大脑。
当泛化难题(Generalization)彻底解决的那一天,遥控器就将彻底沦为历史。
格隆汇
2026-09-09
观点
2026-09-09
观点
2026-09-09
观点
2026-09-09
观点
2026-09-09
观点
2026-09-09