事件
紐約 AI 新創 General Intuition 在實體智能浪潮中提出一個看似迂迴但根本的轉變:放棄用網際網路文字訓練物理系統,改向電玩遊戲引擎挖資料。共同創辦人暨執行長 Pim de Witte 在 Podcast 節目《Equity》中揭示,他們正把電子遊戲內的互動數據當作機器人訓練的主要燃料。
傳統瓶頸:資訊維度的不對等
目前大型語言模型的標準流程是「次單位預測」(next-token prediction)——對著互聯網級規模的文字語料庫,訓練到幾十億參數規模。這套方法在語言理解上近乎無敵,但放到機器人領域就開始漏水。
核心原因:文字是「時間與空間的壓縮與抽象」。
當一篇文章寫「機器人左臂向前伸展 30 公分、轉向 45 度角、施力 5 牛頓」時,讀者腦海中浮現的是一個連貫的動作軌跡。但神經網路看到的只是離散符號序列,它必須在沒有任何視覺回饋、沒有物理約束反應、沒有失敗懲罰的情況下,憑空推斷「30 公分轉 45 度」在三維空間中的實際含義。文字資料本質上已經把運動學、動力學、視覺感知、時間序列等關鍵維度都濾掉了。
機器人的任務恰恰相反——它必須在連續的三維空間中、在毫秒級時間解析度下、根據實時的視覺與力反饋做決策。訓練資料如果缺少這些維度,模型就像用平面圖紙去學游泳。
General Intuition 的視角轉換
General Intuition 的洞察是:電子遊戲恰好保留了文字扔掉的東西。
現代遊戲引擎(Unity、Unreal Engine)內建完整的物理模擬、視覺渲染、時間步進。當一個遊戲角色在 3D 環境中執行動作時,產生的資料包含:
1. 視覺觀測:每幀都是高解析度影像、包含深度與法線資訊 2. 時間連貫性:動作分解成 60-120 Hz 的微步進、而非文字的離散符號 3. 物理約束:重力、碰撞、摩擦全自動計算,模型無法違反物理 4. 動作反饋循環:執行動作後立刻看到結果,形成因果關係訓練信號 5. 失敗案例:角色失手、滑落、卡住時產生的「負例」資料
換句話說,遊戲資料的特徵空間與「實體機器人的感知與執行空間」有近乎同構的結構。從遊戲資料訓練的模型,遷移到真實機器人時(Sim2Real Transfer),維度對齐、失敗案例已被訓練過、物理常識已內化。
資料域適配性的普遍原則
這個故事指向一個更深的洞察:資料域適配性是比規模更先驗的問題。
換到其他領域驗證:
- **金融交易**:用新聞文章訓練交易模型 vs. 用市場微觀結構資料(bid-ask spread、訂單簿變化)訓練。後者包含即時反饋,前者是事後敘述。
- **自動駕駛**:用交通規則文字 vs. 用影片+慣性測量單元資料訓練。前者缺時間動態,後者有完整。
- **醫療診斷**:用醫學論文 vs. 用大量去識別化的患者影像與病歷序列。論文是知識總結,影像資料是原始訊號。
在每個例子裡,規模都不是主要限制因素。瓶頸在於:資料裡有沒有編碼應用領域的核心動作維度。
深層洞察:標籤的政治經濟學
General Intuition 的做法還暗示另一個層面:如果資料域不對齐,光靠增加資料量、加大模型參數都無法補救。必須要有人工標籤。
網際網路文字的優勢在於「自然標籤」——它本身既是資料又是標籤(因為語言就是描述)。但機器人動作沒有自然標籤。每一幀遊戲畫面、每一次機械臂的關節角度變化,如果要讓模型學到「這是抓取、這是推、這是避障」,都需要人工標註。
General Intuition 用遊戲資料的一個隱含優勢是:遊戲引擎本身已經「自動標籤」了——每一幀的物理狀態、碰撞資訊、物體屬性都在引擎裡被記錄。用遊戲資料訓練,等於獲得「免費標籤」的機器人資料集。
這就是為什麼他們沒選 YouTube 影片(需要人工標籤動作)、而是選電玩資料(引擎自動提供標籤)。
應用的邊界
General Intuition 的策略對「有高度結構化模擬環境」的任務特別有效:組件組裝、精密操控、導航。但對於「完全沒有模擬環境的領域」(例如社會科學、經濟政策)仍然無能為力。