来源:蓝鲸
媒体
2026-09-28 17:15:45
(原标题:对话|觅蜂科技董事长姚卯青:具身智能数据采集转向众包)
图源:视觉中国
蓝鲸新闻9月28日讯(记者 翟智超)“百万小时,已经不够了。”具身智能行业的数据需求正从一万小时、二十万小时迅速跳到百万小时。
近日,觅蜂科技在上海发布“觅蜂派”,并称其为全球首个全品类高质量物理AI数据众包服务平台。董事长姚卯青在接受蓝鲸科技等媒体采访时表示,其接触到的头部客户已经开始按千万小时提需求。
但比数字更棘手的是场景:家庭叠衣服的数据已经泛滥,修水管、修车、理发、美甲等专业技能数据反而稀缺。集中式采集靠打电话找场景,效率低;姚卯青想用众包解决。
按官方说法,觅蜂派面向社会开放物理AI数据采集任务,用户通过觅蜂派App领取任务,佩戴MEgo设备在零售、仓储、制造、家庭等真实场景中完成指定操作,并根据审核通过的有效数据时长获得相应报酬,从而成为“机器人训练师”。
将采集任务交给大众,听起来能快速铺开场景,但具身数据采集并不像手机拍视频那么简单:双目、SLAM、深度、腕部相机、毫米级空间精度、时间同步、标注,都构成专业门槛。众包要解决的不仅是数量问题,还有场景丰富度、有效数据率、隐私脱敏、极端场景激励和规模化交付。
姚卯青在采访中判断:百万小时级别的数据积累已让基础质量相对标准化,现阶段场景丰富度最关键;客户正从广撒网转向独家定点;这一赛道真正的门槛在于运营和交付,未来大概率会出现整合。
以下是蓝鲸科技等媒体与姚卯青的对话内容,经编辑在不改变原意的情况下有所删减:
具身数据采集拼完数量拼场景
提问:你们在已有的两万台设备和百万小时数据后,为什么现在要进入众包?是真正要突破的是数量、场景多样性还是有效数据率?
姚卯青:首先,对于2026年底来讲,这个数字已经无法满足我们现在市面上对于数据的所有需求了,因为大家可以看到很多单个模型和具身智能公司都在使用百万级小时数据,而且不少公司都已经到达这个需求量了,这就是为什么我们要开启数据获取的新的增长曲线。
其次,我们之前也提到,大家不是简单地去堆量,而是越来越往一些细分的赛道、专业的技能上面去获取,比如过去大家都在做家庭场景,都在叠衣服,叠衣服数据已经泛滥了,不需要了,大家可能需要更专业的,哪怕你是修水管、你是去修车,你去理发、美甲这些可能反而需要一个个需要点亮、解锁技能,这些技能靠集中式以我们自己的力量打电话,跟人家说,你能不能让我采,肯定是一个相对比较困难,效率也低的过程,我们希望能够通过众包方式,更加灵活、更加便利地去进入到这些场景里面,因为我觉得很多行业的发展都证明了全民参与。
最后才是质量最高的,包括自媒体每个人上传自己的生活片段才是最精彩、质量最高的,我们觉得数据的事情也是一样的,你集中去搞它肯定也能做一些场景,但是可能没有发挥我们各行各业,每个个体最精彩的职业技能。
提问:真正要突破的数量还是场景丰富度?
姚卯青:现在阶段场景丰富度肯定是最关键的,因为质量是基础,属于我们已经在前面过程中,百万小时积累过程中已经打磨相对比较成熟了,现在整个MEgo硬件设备,采回来的数据无论是原来集中式的还是现在分布式的上到MEgo Engine的处理都是标准化的,可以保证它的基础质量。
提问:每个厂商他们的数据用法以及数据需求可能不尽相同,有些可能用了更高维数据,有些可能直接拿了互联网视频做预训练,进一步说Ego数据需求量到底有多大?它能够支撑我们众包形式走多远?
姚卯青:现在还是很少人去用互联网数据做预训练了,现在大家都有这么大的量级Ego centric、UMI这些数据,互联网那些数据基本上原来就是训多模态大模型VRM本身的时候大家会去用,现在做具身、原生的预训练很少有人再去用低质量,或者是效率比较低,没什么帮助的这些数据了。
长远来看,众包市场仍存在巨大缺口。正如本次会议提到,不少客户的需求规模已经达到千万小时级别。此前行业还在宣传大模型训练消耗百万小时算力,如今需求已经跨过百万小时门槛,迈向千万小时。对比当前市场供给,需求缺口十分显著。
此外,需求变化不只体现在数据体量上,对场景细分度与专业度的要求也明显提升。行业已告别过去粗放式、有什么用什么的阶段,进入全新周期,需要依靠众包模式,快速覆盖各类差异化、多样的行业场景。
具身数据采集路线已收敛,客户从广撒网转向独家定点
提问:在隐私方面,我们如何去做脱敏处理?
姚卯青:第一,关于脱敏环节。我们采用的是自动化脱敏方案,而非由后台员工手动对人脸逐帧打码,因此原始数据不会经过人工处理,不存在被后台员工看到的风险。
第二,关于大众化采集。这一环节同样可控 —— 我们会在任务大厅中以认领制发布任务,一旦任务被足额认领,后续便不会再重复采集,从机制上避免了过度采集的问题。
提问:一些比较极端化、极限化的数据,如何采集?
姚卯青:针对部分极端困难的采集场景,正如智富总刚才提到的,我们会设置与任务场景挂钩的专项补贴,通过激励机制引导人员进入这些较难覆盖的场景
提问:我们看到现在行业也是从VLA向世界模型和世界推理模型演进,随着模型的泛化和推理能力增强,模型会更少地依赖数据,还是说会对数据质量和密度提出更高要求?
姚卯青:现在的趋势是,行业对数据的依赖越来越大,并且在不断向更大规模快速推进。去年上半年,很少有人提几十万小时的规模,大多还在一万小时左右;到去年年底,已经有人做到20万小时;今年很快就有不少人提到100万小时,而我们实际接触到的用户,已经在提千万小时级的需求。
因为随着AI进入下一阶段,必须进入物理世界进行闭环决策,刚才也提到了,这就需要真实世界里的闭环场景数据。而且各大AI公司在AI基础设施上的支出,可以看到是越来越大,数据还只是其中很小的一部分。
我们看到的需求是:越快越好、越多越好、越丰富越多样化越好,这是他们的核心诉求。
成本方面,我觉得对很多头部公司来说反而是次要的考虑因素。质量当然是基础,刚才提到的语义标注、空间精度、画质,以及双目、分辨率、帧率、时间同步、标定精度等等,这些都有很强的专业性,这也是为什么细看下来,市面上数据在格式上也发生了一些变化。
早期可能大家也见过很多拿手机绑在头上、用单目运动相机采集的,这些已经没人再买了。现在都需要像 MEgo 这样前面带专业双目摄像头的方案:一方面便于做 SLAM,提取高精度空间信息进行标定;另一方面也可以做深度提取,整体都在往专业化方向发展。标注层面则要求毫米级的空间精度,还需要加腕部相机来捕捉手部细节等等,都是朝着更加专业、更加定制化的方向在发展。
提问:觅蜂在真机还有无本体以及仿真方面都有布局,那您认为现在在具身数据的采集和处理方面它的技术路线有没有收敛以及收敛到了哪个程度?
姚卯青:采集路线短期来看目前还比较收敛,就是我们现在提供的这几个 SKU 品类,但需求量确实会随时间有一些波动。比如 UMI 类数据出现得比较早,之后有一段时间 —— 大概上半年 ——ego-centric 数据的需求量激增,大家都对这个非常感兴趣。
然而最近一段时间,反而是 UMI 类数据和真机类数据的需求在快速上升,特别是 UMI,好像很多人都在试图获取这类数据。往后我们也看到一个趋势:年初的时候,一些客户会抱着广撒网的心态,去市面上找各家获取数据拿过来评估试一试,多的可能几十家同时要数据,试图把它们都训到一个模型里面去。
现在我们已经发现,头部客户这几个月已经绝对不会干这样的事了,很多都是独家定点给单一供应商。因为他们觉得那么多数据过来,质量各方面其实也非常痛苦,对他们的后端管线来说,清洗、转换格式的负担很重;训模型的时候,如果好的、坏的缠在一起也是有毒的,训不出好模型。所以他们会在经过一段时间的试用评估之后,重点转向集中甚至单一的供应商来提供数据。这背后其实蕴含的就是供应商本身的技术质量能力,以及运营上快速响应交付的能力。
具身数据采集,真正的门槛是运营和交付
提问:具身数据采集赛道玩家已有近百家,涵盖觅蜂派这类头部、机器人厂商、独立服务商、国企平台及初创公司。请问:这个赛道真正的门槛是什么?
姚卯青:从今年上半年年初开始,确实伴随着需求的增长,有很多初创团队陆续出现。但我们观察下来有几个特点:普遍来讲是以技术背景创业为主,会在早期快速做一些原型数采设备,其中以相机为主的原型设备比较多、比较快。
不过,如果真正要进入到规模化以及盈利的状态,其实是非常看重运营能力的。运营能力主要包括以下两点:
一、是否能快速去规模化运营人和场景,满足市场的需求。因为我们刚刚说了,像觅蜂派以及觅蜂整个公司还是以需求为主导驱动的,我们是以销定产 —— 收到什么需求再去采集,而不是盲目采集、要很多人很多场景,你需要精确去对应你的需求。
二、在运营过程中去做成本优化、效率提升以及商业上的一些创新。这其实是具身数据采集在产品和技术之外非常重要的一个环节。
同时,这还是一个需要较多资金前期投入的行业。无论是采集设备的生产制造、人员的雇佣、费用的结算,再到数据后面处理的整套流程,以及云端的基础设施建设、海量的存储和计算设备 —— 我们为应对今年 1000 万小时的数据,固定资产投入是大几个亿。这确实不太适合几个人出来创业、融了几百万或一千万就能把这个事的规模干起来。
提问:您觉得未来各类玩家,长期会走向一个什么样的形态?大家会合并、整合还是说有些玩家会陆续淘汰?
姚卯青:出现行业整合,我觉得是必然的,因为这就是一个 "六边形战士" 的行业:既要技术很好,做出来的产品还能在技术上领先;又要搞定供应链和生产制造,从保供、产能、BOM 成本再到质量,都是按照消费电子以上的非常高的标准去构建的;同时你还要重资产投入这些算力和存储。
所以我认为,后面逐步发展的话还是会出现一些行业分工,不会说大家都干整个链条、都是端到端的形式。可能有些产品如果真的能进入到量产,也会提供一些数据采集的能力,但运营又是通过其他的公司、其他团队使用他们的设备去完成;最后可能还有一些公司,在某些环节做数据的后处理加工、分发这些偏技术型的后端服务。整体应该是会出现整合的趋势。
提问:现在对于具身数据行业来说,它除了规模需要突破,还有哪些问题是比较迫切需要解决的?
姚卯青:现在的量已经是百万、千万小时级别了,市面上几乎没有什么初创公司团队能够拿得出来。很多你给他一千小时的数据订单让他交,他交一个月都不一定能交得出来 —— 手里就几套手搓的 3D 打印设备,也没有什么运营资源,你再怎么让他去弄也需要很长一段时间。
但头部客户都是一周要交5万、10万的量,你没有足够的资源支撑很难做到这一点。所以我觉得后面的趋势就是,你的质量和运营都是核心竞争力。
蓝鲸
2026-09-28
蓝鲸
2026-09-28
蓝鲸
2026-09-28
蓝鲸
2026-09-28
蓝鲸
2026-09-28
蓝鲸
2026-09-26
证券之星资讯
2026-09-28
证券之星资讯
2026-09-28
证券之星资讯
2026-09-28