机器人的数据生意:真需求,还是自循环?

日期:2026-09-21 18:08:49 / 人气:1



梅卡曼德创始人邵天兰一条朋友圈,把具身智能行业那层心照不宣的窗户纸捅破了:部分高估值具身企业靠关联交易、数采中心和地方资源把营收“做出来”,再拿去冲IPO。他点名银河通用,后者只回了一句“不参与口水战,专注研发落地”。

但话头一旦打开,就收不回去了——《金融时报》8月那篇《谁在买中国机器人?》里写的链条被重新翻出来:机器人企业跟地方共建数采中心,地方买机器人、数采中心采数据、再把数据卖回机器人企业。设备转一圈,数据转一圈,钱也转一圈。

这不是某家公司的问题,是行业到了一个尴尬阶段:模型还没学会走路,财报先要学会跑步。

一、中国具身智能卡在哪:不是摄像头开得不够久,是真实世界见得太少

物理AI数据创业者黄大荣算过一笔账:

• OpenAI 原始数据:千万小时级

• 海外供给机构单月采集量:百万小时

• 国内简智、光轮也有单月百万小时能力,但愿意买 Ego(第一视角人机交互)数据的客户:寥寥无几

为什么?不是大家不想买,是钱不够。一套采集设备两三千元,人工按全球均价约 15 美元/小时,乘到千万小时级别,就不是“多开几个工位”能解决的事。

更难的还不是钱,是广度。

机器人得见过菲律宾铁皮房、柬埔寨茅草屋、中国老破小厨房、北美便利店排班动线,才知道人类不是都住标准化公寓。广度数据做完,还要进具体市场做深度数据:中国家庭要懂油烟机、拖鞋、药盒;北美咖啡厅要懂排队、纸杯、小费台。顾客进进出出没法逐一授权,这类数据最贵也最难拿。

而“采了多少小时”本身是个失真指标。印度手工作业现场赤脚围坐,手、脚、旁人动作全进画面,模型先得猜哪个是手;国内数采员讲清楚规范后,只在完成规定动作时开设备——同样挂机 12 小时,有效数据可能只有 2–5 小时。

洗完、标完,还得有算力吞下去。很多国内企业连十万小时都喂不动,不是数据没处理好,是数据管道、算力、能同时懂模型和数据的团队全缺。OpenAI 的优势不是“数据多”,是“有数据+有算力+有治理能力”的闭环。

所以地方共建数采中心成了补充设备和采集力的方式,也成了争议源头:机器人卖给数采中心,数据再买回来,这到底是为训练,还是为流水?

设备数、工位数、累计时长都好展示;模型成功率有没有涨,要很久才看得出来。当“模型行不行”说不清时,订单数、项目规模、估值、上市进度就被当成成熟度替代品。

上市只是获得继续烧钱的机会,不是上岸。  

真正上岸,是被客户重复采购——像工业机器人、像洗碗机、像扫地机,而不是像融资PPT。

黄大荣的判断是:中国家庭场景(养老、做饭、提醒用药、取送)可能比高端工业更早有真实付费意愿;几十万一台的人形,劳动密集型工厂根本不缺这点自动化。

数采不该先堆小时数再找用途,而该先问:机器人进哪、服务谁、解决什么事。

二、数采行业的真矛盾:高质量数据供小于求,低质量数据供大于求

中瞳数融总经理孙浩把话讲得更直白:

一边企业喊“缺数据”,真实供应可能不到需求 1%;另一边数采中心摆满设备,采回来的数据没买家。供需错位——缺的是能解模型问题的数据,过剩的是为凑时长生产的同质化数据。

一个拿水杯的动作,角度、抓位、臂高、力度稍变就是一条新轨迹。“拿不稳—调整—重新抓起”的失败轨迹,有时比一次成功更有价值。但动作偏离、手被挡、设备空转,留下的就是垃圾。

所以他们做的事是“翻译”:把模型企业的训练任务拆成动作、场景、交付标准,再派到城投/交投的数采中心执行。散单里 60%–70% 是定制:熨衣服、故障恢复、复杂地形、特殊工艺。

模型企业不会一上来买十万小时,先买几百、几千小时;训完看任务成功率,再补采,再买。第一次买是试用,第二次第三次买才是验证。

可现在能形成这种闭环的订单太少。各地却已经提前建好数采中心了——长期需求是真的,但短期订单接不上。等订单的过程中,数采中心只能让人数“采容易的动作”,时长疯涨,目标模糊,“为了采而采”就这么长出来的。

场景又不肯随便开:家庭涉隐私,精密厂涉工艺机密。能拿到工厂部分流水线授权的数采中心是少数,剩下那些采了一堆通用动作卖不出去,就只能关联方购回——循环融资由此坐实。

孙浩给了一套更靠谱的评判标准:

- 有效数据比例
• 场景覆盖度

• 模型任务成功率提升多少

• 边际效益还在不在

• 有没有独立第三方买

• 复购率和复购量

而不是:多少台机器人、多少个工位、累计多少小时。

未来分工他也画清楚了:大厂留内部数采部门做敏感数据;第三方做公共、标准化、可复用数据;中小数采公司别拼规模,去电力、矿山、航空、数据清洗、标注、评测、资产平台里找缝隙。数采员会从“做动作的人”变成“任务设计师、评测工程师、长尾案例设计师”。

数采成熟的标志,不是又建了多少中心,而是能答出一句:这批数据,让机器人学会了什么。

三、触觉数采:一片蓝海,但第一步不是堆小时

视觉卷成红海时,超维传感创始人李炎炎把赌注压在触觉。

视觉能告诉机器人“杯子在那”,触觉才告诉它“拿稳了没有”。举个数:拿起 300 克水瓶恰好要 5N。不同传感器记成 4N、5N、6N,模型就学成“4到6N都行”——可现实里 4N 拿不起来,6N 把瓶子捏瘪。

触觉数采的第一步不是堆数据,是统一标尺。 材料、印刷、算法、贴合、标定,任一环偏一点,力值就偏一点。同动作不同手套出不同结果,采一万小时只是把偏差放大一万倍。

反过来,传感器一致了,触觉的有效时长比视觉好判:没接触就是 0,真接触且规范,8 小时就是 8 小时有效数据。

但“有效”不等于“丰富”。同一条毛巾、同一种材质、同一种叠法采一千次,模型学到的是单一。得换材质、换光、换姿态、换折叠方式——在统一标准下制造变化,才是高质量数采。

所以触觉数采既要“做动作的人”,也要“设计动作的人”。短期数采员先增后减,长期留下来的是懂模型要什么的人。

触觉手套现在几千块一副,模型厂先买 10–20 套验证,跑通才上千分。设备扩不扩,不看硬件多牛,看模型任务有没有真完成。

李炎炎的判断和前两位形成合流:工业会先于家庭形成稳定触觉需求——抓什么、放哪、用多大力都能定义清楚。家庭空间大,但成本、隐私、泛化都还没到。

而合成触觉数据要能跑起来,也得等真实触觉数据先积到拐点。就像生成式视频能造假,是因为真实视频先被学过一遍。真实数据是锚,仿真是放大镜,顺序不能反。

四、收口:别把“数据流水”当成“模型进步”

把三位从业者的话拼起来,具身数采这门生意的底层逻辑很清楚:

1. 真实数据不可替代,但真实数据不是“设备开机时长”,是“场景—动作—反馈—标注—进模型—任务成功率提升”的闭环。
2. 数采中心本身没错,错在“先建产能、再编用途、最后用关联交易填订单”。
3. 机器人企业的真成熟度 = 真实场景被重复采购;不是融资额、不是工位数、不是发布会视频多顺。
4. 视觉、Ego、触觉 三条线都指向同一件事:先有统一标准,再有规模;先有模型问题,再有采集任务。
5. 行业会从“少→多→少”:早期人人建数采中心,中期洗掉只采通用动作的,后期留下能进特殊场景、有标准、有复购、有模型反馈的。

邵天兰的朋友圈之所以扎人,不是因为他骂了谁,而是他说破了一句没人敢写进招股书的话:

机器人还没学会干活,财报已经学会跳舞。  

但模型不会看财报——它只看你给它的是什么世界。

数采这门生意是不是自循环?  
设备订单可以是真的,数据交易也可以是真的,但“真交易”不等于“真需求”。  
判断标准只有一个:把这批数据喂进去,机器人下次在现实里,是不是少摔了一次。

要不要我顺着这篇再写一版《具身智能避坑清单:怎么看一家机器人公司的数采中心是在做模型,还是在做流水》?

作者:安信14娱乐平台官网




现在致电 xylmwohu OR 查看更多联系方式 →

COPYRIGHT 安信14注册登录娱乐中国站 版权所有