互联网

数据“打工人”的隐秘江湖:谁在喂养AI的物理世界?

来源:网络    作者:      2026年09月04日 11:55

导语:

深圳龙华的出租屋里,28岁的数据采集员李威每天的工作是穿着布满传感器的背心,在客厅里反复完成“打开冰箱门—取出饮料—关上冰箱门”的动作。每完成一组,他的手机App上就会多出一笔入账。

他不知道这些数据最终会流向哪家机器人公司,但他知道,自己正在做的事,半年前还需要一个机械工程师全程操控一台价值几十万的人形机器人才能完成——而那台机器干8个小时,能用的数据只有1个小时。

“现在好了,”他晃了晃身上的采集设备,“这玩意儿轻便,我一天能录几十组不同场景的动作。”

这个变化,折射出AI数据采集行业正在经历的一次剧烈转向。

数据的尽头,是人海战术

过去一年,大模型从“卷参数”走向“卷应用”,一个共识逐渐清晰:想让AI真正理解物理世界,光靠互联网上那些文本和图片远远不够。机器人需要知道怎么拧瓶盖、叠衣服、在拥挤的货架间穿行;大模型需要理解不同地域的商铺招牌长什么样、不同时段的商场人流如何流动。

这些数据,仿真环境给不了,实验室给不了,只能去真实场景里“捞”。

但“捞数据”这件事,比想象中复杂得多。京东的一位高管前段时间透露,早前行业普遍依赖遥操作——工程师远程操控机器人本体,一帧一帧地记录动作数据。效率低到什么程度?8小时有效数据产出1小时。算上人力、设备、场地,成本高得离谱。

于是,一个更原始、也更高效的办法被重新捡了起来:众包。

把任务拆碎,分发给成千上万个像李威这样的普通人,让他们在真实的家里、超市里、仓库里完成采集。成本降下来了,场景多元了,数据也“活”了。觅蜂科技的CEO算过一笔账,随着采集设备量产,真实场景数据的成本未来甚至可能低于仿真数据。

这个逻辑听起来顺理成章,但真正能跑通的企业,翻来覆去就那么几家。原因很简单:众包不是拉个群、发个任务那么简单,它背后是一整套关于怎么快速召集人、管理人、怎么控质量、怎么保合规等等的复杂体系。没有几年甚至十几年的打磨,根本玩不转。

十年前,有人已经开始了

把时间拨回十年前,那时“AI”还是个生僻词,“大模型”更是无人听闻。但已经有人开始琢磨一件事:能不能让普通人用手机帮企业采集线下的位置数据?

这个念头后来催生了一批公司——

数据堂,2011年成立,建立了众包模式,为企业提供AI数据服务,包含语音、图像、文本等多模态数据采集与标注,客户覆盖国内外主流科技公司。

不性感,但致命

在今天的AI叙事里,最受追捧的永远是那些炫酷的、颠覆性的故事——大模型参数突破、机器人丝滑的后空翻、融资额一轮高过一轮。相比之下,数据采集这个行当显得过于“脏活累活”。他们很少出现在头条新闻里,却在行业内部被视为不可或缺的合作方。它们手里握着的,是时间换来的壁垒。

但恰恰是这些“脏活累活”,构成了AI产业真正的底座。没有真实场景的数据,大模型就是空中楼阁,机器人就是花架子。而真实场景数据的采集,没法靠烧钱速成,只能靠日复一日地磨、一个点一个点地跑、一个人一个人地积累。

十几年前启动众包,意味着什么?意味着当别人还在纠结“要不要做”的时候,他已经把“怎么做”跑通了;意味着当别人开始抢人、拼设备的时候,他已经有了一张覆盖全国、持续运转的网络;意味着当客户提出一个全新的采集需求时,他能在几天之内调度足够规模的众包资源,而不是从头开始搭建。

这种能力,外人很难看到,但在那些急需数据的AI公司眼里,价值连城。

数据管道,从未如此重要

物理AI的爆发,让数据采集这个行业迎来了第二春。过去是为地图和商业分析采数据,如今是为机器人和大模型服务。场景在变,需求在变,但底层逻辑始终如一:真实世界的数据,只能从真实世界里来。

而真实世界的采集,说到底离不开“人”。那些穿着传感器背心的“李威”们,在千家万户、街头巷尾、仓库车间里,一遍遍重复着枯燥的动作,却汇成了AI理解物理世界的燃料。

他身后的屏幕上,弹出了新任务:“模拟超市理货员补货,报酬80元/组。”发布方是他从未听过的公司,而那背后,可能是一条静默运行了十几年的数据管道,正持续把真实世界翻译成AI能懂的语言。


(文章为作者独立观点,不代表艾瑞网立场)
  • 合作伙伴

  • 官方微信
    官方微信

    新浪微博
    邮件订阅
    第一时间获取最新行业数据、研究成果、产业报告、活动峰会等信息。
     关于艾瑞| 业务体系| 加入艾瑞| 服务声明| 信息反馈| 联系我们| 合作伙伴| 友情链接

Copyright© 沪公网安备 31010402000581号沪ICP备15021772号-10

扫一扫,或长按识别二维码

关注艾瑞网官方微信公众号