夜雨聆风学习资料网

ARTICLE · 1138125

人类指望劳动对冲AI倒计时了

人类指望劳动对冲AI倒计时了
机器人的新粮食2026-10-02

花1500万美元雇全世界干家务 · 机器人的新粮食,是人

美国Figure的Index众包平台,与中国版觅蜂派:一场从人手里抢数据的军备竞赛,拆给你看。

DOODLE

机器人要学的第一课,不是数学题,是叠衣服。而老师,是全世界正在干活的普通人。

机器人数据中美对比

EDITOR'S NOTE

—— 惑者

最近硅谷有家公司干了一件特别“损”的事:花钱请全世界的普通人做家务——铺床、叠衣服、洗碗,边做边录,传上去就按分钟给钱。这家公司叫 Figure(音译过来就是“finger”),平台叫 Index。

惑

我是惑者,专注电商财税,也研习资产科学,欢迎关注。

电商财税 + 资产科学 · 本期内刊

VOL.01

01

PART

什么是Index:一台“人形机器人数据工厂”

FIGURE × INDEX

Figure 是美国人形机器人公司,估值390亿美元,Brett Adcock(就是口播里的“斌哥”)创立。2026年8月25日,它宣布了一个叫 Index 的App:普通人下载注册,拍自己做家务、在餐厅收拾桌子、在仓库补货的视频,上传审核通过就按有效时长拿美元报酬。

听着像兼职外快,其实是一台隐形的数据工厂。它收集的不是“内容”,是机器人缺的“默会知识”——那种没人写成文字、没人拍成视频的动手能力。

02

PART

为什么非得真人拍:互联网上不存在“手的百科”

DATA DOESN'T EXIST

斌哥一开始也想直接买。结果发现供应商根本达不到他要的多样性——因为机器人要学的动作数据,在互联网上根本不存在。

文字有百科,图片有社交平台,但“人是怎么用手干活的”,没人系统拍过。叠一件衬衫有十种叠法,每个家庭的厨房布局都不一样,这些长尾细节实验室拍不出来,外包公司也造不出来。干脆自己建:下载App,成为创作者,按时长拿钱。

模式简单粗暴,但逻辑非常清楚 ——数据不是从服务器里跑出来的,是从千千万万干活的人手里找出来的。

03

PART

四个月的成绩单:这笔账怎么算

4 MONTHS

官方口径,四个月:26.4万次下载,覆盖108个国家,累计收到超1600万段视频,向创作者支付了1500万美元,4.4万名周活跃贡献者。

有个数字特别震撼:平台每秒钟收到约30分钟的新视频。折算一下——30分钟/秒乘以86400秒,等于每天43200小时,相当于每天记录下大约4.9年的人类劳动。这个量级,没有任何实验室、任何供应商做得出来。

粗算单价:每段不到1美元,这是错觉 ——1500万美元除以1600万段,但钱是按审核后的有效时长给的。审核、运营、反欺诈的成本还没算,更别说未来12个月要在数据和算力上再砸超10亿美元。

04

PART

钱不是白给的:五道工序

5-STAGE PIPELINE

Index 的数据管线有五道工序,1600万条视频里真正能进模型的,才是有效数据。

 过滤 

筛掉技术、视觉、语义不达标的视频,第一道质检闸门。

 反欺诈 

人工抽检,专治刷量、造假、钻审核漏洞的创作者。

 去重 

相似度算法删掉重复镜头,省算力、防模型“偏科”。

 再平衡 

按任务配额补数据,不能让叠衣服堆成山、擦桌子没人拍。

 标注 

给动作、物体、环境打标签,让模型看得懂每一帧。

它还能反着用:用户可以花钱在App上雇一名创作者上门帮你干活,顺便录下来——服务者赚钱,数据也赚了,两头通吃。

05

PART

长尾才是上限:实验室拍不出来的猫砂盆

LONG TAIL

Figure 披露过一个数据:每1000小时Index数据,平均包含373个不同任务、1146个操作对象、116种环境。

想象一个画面:一个陌生厨房,一个人戴着设备擦猫砂。这个场景实验室一辈子拍不出来,但恰恰是这些长尾场景决定了机器人的上限——机器人在工厂能搬箱子,不等于它进了你家会叠衣服。

谁能把“第一千种意外情况”喂给机器人 ,谁才配谈通用。

06

PART

未来12个月再投10亿美元:数据生意刚开始

DATA IS THE MOAT

所以结论很清楚:这条赛道的胜负手不在芯片,不在本体,在数据。Figure的Helix 2.5模型,就是直接用Index的1600万条人类视频预训练的,测试口径是在30个从没去过的湾区家庭零样本干活,420次全任务试验成功237次,约56%。

56%当然不够看,但方向已经锁死了:未来12个月,Figure要在数据和算力上花掉超过10亿美元。数据,正在成为比GPU更稀缺的资产。

07

PART

中国版来了:觅蜂派,以及背后的四层生态

MIFENG PAI

中国也在跑,但跑法完全不同。最像Index的是觅蜂派——2026年9月23日在上海发布,直接被媒体叫“中国版Index”。它背后站着智元机器人:智元持股70.92%,CEO姚卯青同时是智元联合创始人。觅蜂派让普通人领任务、戴自研MEgo设备(头戴+腕部双视角、二指夹爪)照常干活,按审核后的有效时长秒结提现,设备租金39元/天、推广期19元。

目前覆盖22大类场景、5000多个任务、5万多个真实环境,2万套设备已下线(第2万套交付京东),累计沉淀约100万小时可用数据。平台配了1亿元补贴:5000万任务补贴、2000万设备补贴、3000万线下服务网络、200万设备保险。

维度
Index(美国)
觅蜂派(中国)
定位
服务自家Helix
服务多家厂商
规模
1600万段视频·108国
2万套设备·100万小时
硬件
手机/头戴自拍
MEgo三件套
弹药
12个月超10亿美元
1亿元补贴
结算
按分钟·美元
按有效时长·秒结

但中国不是一个App在跑,是四层生态一起跑:

 草根众包 

觅蜂派之外,张家界龙誉大数据在招“居家数据采集员”,宝妈在家拍叠衣、擦桌,报道口径月入约3000元。

 公司自建/开源 

智元9处采集中心+开源AgiBot World;宇树开源340小时/189万条轨迹;银河通用走仿真合成。

 数据商 

光轮智能成全球首个具身数据独角兽(估值超150亿),无问智科数亿元A轮,江苏箸境做成全国首单具身数据集交易。

 通用众包 

腾讯搜活帮、阿里众包、百度众测这些老平台,机器人视频只是边缘任务。

数据行情也摆在这:国内真机数据报价约500-1000元/小时,专业驻场采集员月薪8000-1.5万元。2026上半年国内具身智能赛道融资935亿元,其中数据赛道半年吸金约170亿——资本已经用脚投票。

08

PART

最新动态:F.04锁定设计,施瓦辛格把机器人送进熔炉

F.04 × ARNOLD

这两天Figure的新闻特别密,有两件事值得单独拎出来。

第一件:Figure 04 锁定设计

10月1日,Brett Adcock官宣——F.04完成关键设计评审、全面设计锁定,开始发运零部件,并称之为“历代之间最大的飞跃”。但注意:规格、价格、量产时间表、整机照片,官方全部还没公布。任何“F.04参数曝光”的说法目前都不可信。

第二件:施瓦辛格把F.02送进熔炉

网传“施瓦辛格给Figure 04拍广告”,准确说法是——他参与的是Figure 02的退役大片(9月30日发布)。起因是Figure总部堆不下退役的F.02了,Adcock在网上征集处置方案,施瓦辛格留言:“你应该熔了它们。”结果Figure真干了:把退役机器人送到芬兰一座75吨电弧炉前,专门训练AI特技模型让机器人自主后空翻跳进千度钢水,复刻《终结者2》结尾T-800沉入钢水的画面,施瓦辛格本人到场见证,配文“Hasta la vista, F.02.”。

这不是给F.04拍广告,而是一场代际交接的营销——F.02谢幕、F.03登台、F.04踏火而来。

09

PART

惑者支招|财税视角:数据生意里藏着三笔账

FINANCE & TAX

聊完热闹,说点跟咱们做电商做企业的相关的。这波“机器人的数据生意”,有笔账值得算清楚。

第一笔账:单条视频的成本是错觉

1500万美元除以1600万段,看着每段不到1美元,但结算口径是“审核后的有效时长”——无效视频白录。任何生意只要带“审核后结算”,实际单位成本就要按有效产出率重算:你一小时录了60分钟,通过审核只有40分钟,那你的时薪是40分钟的钱,不是60分钟。

第二笔账:先投入后回报,现金流才是命

数据采集、广告投放都是“先付后赚”:钱先花出去,回报要等审核、等回款。只看利润表不看现金流,就会“账面盈利、现金枯竭”——做跨境电商的朋友,这句话对广告费同样成立。

第三笔账:补贴不是利润

觅蜂派1亿元补贴是获客成本,不是持续收入。测算任何平台的可持续收益,都要把补贴剔除再看——这对研究平台经济的咱们是常识,但很多人栽在这。

税务上三点提醒:第一,个人当“机器人训练师”的收入属于劳务报酬或经营所得,劳务报酬预扣率20%-40%,经营所得累进5%-35%,记得留存平台结算记录,年度汇算清缴合并计税。第二,企业采购数据要合规列支:发票、合同、验收记录三件套归档,数据集可以按无形资产处理,具体口径以主管税务机关解释为准。第三,跨境数据交易涉及服务贸易和外汇申报,别裸奔——这块我后面找一期专门讲。

 支招一·建有效产出率台账 

录了多少、通过多少、结算多少,三列分开记——判断一个众包平台值不值得干的唯一依据。

 支招二·兼职收入分类归档 

平台结算记录按月下载,备注收入性质(劳务报酬/经营所得),汇算清缴不抓瞎。

 支招三·数据支出单列科目 

AI和数据相关的每一笔钱单独记账,验收单据和凭证一一对应,汇算清缴被问询才有底气。

 支招四·补贴单列口径 

别把补贴摊进主营收入,你的毛利率才不会说谎。

10

PART

一图读懂:机器人的数据生意

MINDMAP

一图读懂:机器人的数据生意

11

PART

生僻词小词典

GLOSSARY

  • 具身智能(Embodied AI):让AI有身体、能在真实世界动手干活的智能,机器人是它的载体。
  • VLA模型:视觉-语言-动作三合一大脑——能看图、能听懂话、能指挥手脚,Figure的Helix就是这类。
  • 数据飞轮:数据越多→模型越强→产品越好→用户越多→数据更多,越转越快的循环。
  • 众包:把任务发包给一大群普通人完成,外卖众包、数据众包一个逻辑。
  • 有效数据时长:不是录多久算多久,平台审核通过的那部分时长才计酬。
  • 去重:用算法删掉内容几乎一样的重复视频,省算力、防偏科。
  • 再平衡:按任务配额调控数据比例,防止某类任务数据泛滥、某类稀缺。
  • 长尾数据:数量少但极关键的罕见场景,比如陌生厨房、猫砂盆、换机油。
  • 零样本(Zero-shot):模型从没练过某场景也能直接干,像第一次进别人家就会叠衣服。
  • 遥操作:人远程操纵机器人演示动作,再把过程录成训练数据。
  • 无本体数据:不经过机器人本体、直接用人或设备采集的动作数据,便宜量大。
  • RaaS(Robot-as-a-Service):机器人按服务订阅出租,类似SaaS但卖的是“劳动力”。
  • 电弧炉:用电弧熔化金属的工业炉,75吨级的能把整台机器人化成钢水。

12

PART

如果让三位智者看这件事

THREE PERSPECTIVES

苏格拉底:先问什么是公平

他大概不会急着夸这生意聪明,只会用一连串问题把人问住:那些录视频的人,知道自己正在为取代自己的机器人供粮吗?按分钟付费,买走的是动作,还是动作背后的劳动与生活?欺骗比掠夺更可怕——掠夺让你看见敌人,欺骗让你连受害的事实都不知道。

机器人学会叠衣服的那天,第一个叠衣服的阿姨,也许正拿着不到一美元的报酬看这条新闻。被替代者,首先是不知道自己正在被替代的人。

毛泽东:抓住主要矛盾

这场戏的主要矛盾不是某家公司的营销,而是“真实世界数据荒”与“通用机器人落地需求”之间的供给矛盾。没有调查就没有发言权——Figure愿意花10亿美元收数据,是因为它知道数据墙不拆,什么算法都是纸上谈兵。

分散的个体劳动者对抗不了资本的数据机器,但数据生产本身是分散的:谁把千千万万劳动者组织进规范的生产体系,谁就握着下一个时代的生产资料。矛盾存在,解决路径也必然存在。

马斯克:回到第一性原理

拆掉“拍视频挣钱”这层壳,最底层的事实是:机器人缺的不是视频,是“动作与意图之间的因果”。1600万段视频里,有多少段真正教懂了模型?

与其堆数据,不如想清楚数据里到底什么是知识、什么是噪声——把这件事做成可验证的,比多买1000万段视频有用。市场会奖励把数据透明度做成卖点的后来者,就像它当年奖励特斯拉把续航做成诚实数字。

CLOSING

数据不是从服务器里跑出来的,是从千千万万干活的人手里找出来的。美国买的是多样性,中国买的是组织度——谁先跑出商业化闭环,谁就定义了下一个十年。

我是惑者,喜欢就关注、点赞、转发,有任何问题都可以私信或在评论区讨论,我会一一仔细回复。

惑惑者 · 电商财税 & 资产科学

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见

赞
在看
收藏

THANKS FOR READING

相关学习资料