現象:一窩蜂與花活頻出
2025 年 7 月至 2026 年 7 月短短一年間,中國具身資料採集領域湧入近百家公司,融資總額達 44.7 億元。這些公司用足了巧思:有的在中國移動營業廳掛牌「具身資料採集 5S 店」、讓顧客邊做家務邊採集數據;有的把採集包裝成 VR 遊戲;有的提供上門免費保潔服務;還有的搭建「雲操控」平台讓採集員遠端遙控機器人。
這些「花活」層出不窮,表面上看是創意十足,實際反映了一個更深的問題:沒人真正知道機器人需要什麼資料、採集到什麼品質的資料才有用、願意花多少錢買。
信息不對稱的三個層面
第一層:需求的隱匿
OpenAI、Google DeepMind、特斯拉等 AI 公司需要高品質的具身資料訓練機器人,但他們對「高品質」的定義往往是黑箱。採集廠商只知道「機器人缺資料」這個訊號,卻不知道: - 採集的 100 萬小時資料中,多少小時真的能用於訓練? - 機器人做家務、做工業控制、做醫療護理,需要的資料特徵完全不同,但採集廠商往往一套通用流程應付所有客戶。 - 未來三年 AI 公司還會買資料嗎?還是他們自建採集團隊?
第二層:品質的難以驗證
資料品質不像商品有明確的規格。同樣是「人類操控機械臂做家務」的 1 小時資料,可能因為: - 攝像頭角度差異 - 背景複雜度 - 動作的多樣性 - 標註的精準度
而產生天壤之別的訓練價值。但採集方無法事前知道自己採的資料是 A 級還是 C 級,直到賣給 AI 公司、被用於訓練後才知道。
第三層:價格發現的缺失
目前市場上沒有統一的具身資料定價。不同公司、不同用途、不同品質的資料,價格浮動極大。有的公司按小時收費、有的按幀數、有的按任務難度。這導致: - 採集公司不知道自己的報價是高是低 - AI 公司不知道應該建立自有團隊還是外包採集 - 資本無法判斷這門生意的真實利潤率
經濟學診斷:檸檬市場(The Market for Lemons)
Akerlof 的經典論文指出:當買賣雙方對商品品質的了解程度存在明顯落差時,低品質商品會驅逐高品質商品(劣幣驅逐良幣)。具體表現為:
1. 過度篩選:不確定性讓 AI 公司降低對採集資料的報價預期,畢竟他們無法事前驗證品質。 2. 過度供應:看到融資潮、創業者一擁而上,卻不清楚真實市場規模。97 家公司爭奪一個還沒被精準界定的市場,必然導致產能過剩。 3. 過度創新:當無法通過正常的價格機制競爭時,企業改用「花活」——免費保潔、VR 遊戲、遠端遙控——這些都是信號,試圖向採購方傳遞「我們不一樣」。但這些花活本身不產生資料價值,只是增加了成本。 4. 逆向選擇:最有耐心、最願意理解客戶真實需求的採集公司,反而因為不肯「燒錢做花活」而被市場淘汰。
為什麼這次不一樣(也許)
具身資料不完全是檸檬市場,因為有三個因素可能打破不對稱:
因素 1:技術可追蹤 如果 AI 公司願意公開「用這個資料採集公司的資料、模型性能提升 X%」,就產生了信號。但目前他們沒這樣做。
因素 2:長期關係 一旦 AI 公司與採集公司建立長期合作,雙方會逐漸減少不確定性。但這需要時間、且高度依賴首批客戶的耐心投資。
因素 3:標準化努力 如果行業協會或大型採購方(如特斯拉)發布「具身資料採集規範」,等同於降低了信息不對稱。但目前還沒有全球通行的標準。
現實推演
歷史上檸檬市場的結局有三種:
1. 市場萎縮:品質問題無法解決,買家逐漸退出,產業規模縮小到只有「信譽建立成本極高」的大公司能存活。 2. 信息解構:出現獨立的品質認證方(如檢測機構、評級機構),降低買賣雙方的信息落差。 3. 縱向整合:大型 AI 公司(特斯拉、Google)放棄外包、自建具身資料採集團隊,完全內化數據供應鏈。
目前,特斯拉已在做第 3 條路——自建 Optimus 機器人的資料採集基礎設施。這或許預示著:44.7 億融資流入的 97 家獨立採集公司,最終的生存空間會被大幅壓縮。