新聞背景
General Intuition 是一家矽谷機器人新創,最近宣布用數百萬小時的遊戲視訊數據訓練物理智能基礎模型。他們的核心論點很簡潔:真實機器人數據極其昂貴且難以規模化;但遊戲引擎(Unity、Unreal Engine)可以在幾秒內生成無限逼真的虛擬場景、動作、物理碰撞。
為什麼這重要?過去十年,機器人學界被一個瓶頸卡住:要訓練一個視覺導向的操作臂執行複雜任務,需要數千甚至數百萬次的真實嘗試。每次失敗、每次碰撞、每次掉落,都是真錢的損失。所以大多數機器人要麼只會固定任務、要麼需要大公司(谷歌、波士頓動力)的巨大資金投入。
問題:為什麼模擬不是早就被用過了?
這是個好問題。模擬環境訓練機器人的概念根本不新——1990年代就有人在試。但過去的模擬往往過於簡化:遊戲引擎的物理引擎不夠精確、光影渲染太假、動作看起來不自然。當機器人從虛擬環境學出來的策略、套到真實世界的機械臂時,常常崩潰——業界稱這叫「現實鴻溝(reality gap)」。
General Intuition 的賭注是:這個鴻溝在過去 5-7 年內已經被現代遊戲引擎(光線追蹤、物理精度、逼真材質)收窄到可以接受的水準。換句話說,不是模擬訓練本身有問題、而是過去遊戲引擎不夠逼真。
模式識別:ChatGPT 時刻的三個特徵
通常當業內人說「某領域要有 ChatGPT 時刻」,他們指的是三件事同時發生:
1. 規模(scale)驟然可行:生成數據的成本從 $1000/小時 降到 $0.01/小時。 2. 通用性(generality)浮現:在任務 A 訓練的模型、可以用最小微調遷移到任務 B,而不是每次都從頭來。 3. 可及性(accessibility)民主化:不再需要谷歌等巨頭才能建優秀機器人,創業公司也可以競爭。
General Intuition 正在押注的就是:遊戲引擎現在可以同時解決這三個問題。
為什麼用遊戲數據特別聰明?
遊戲引擎的數據有三個超能力:
多樣性內建:一個遊戲場景庫包含數千種光照、材質、物體、布局。機器學習的經驗法則說:多樣的數據比多量的同質數據更有助於泛化。遊戲引擎天然提供這個。
可標註性自動:現實世界錄製的機器人視訊,需要人工標註「物體位置」「碰撞狀態」「執行結果」。遊戲引擎中,每個像素的標籤都是自動生成的(深度圖、語義分割)。這就像從「需要人工核對的數據」跳到「自動化可信標籤」。
反差利用:機器人學習的本質是學習「行動 → 結果」的映射。如果訓練數據中有 1000 種「推東西、它掉下來」的變化,機器人對「推東西的後果」的直覺就會非常堅實——即便那些都是虛擬的。
DNA 鏈推理中的關鍵假設
這個故事有一個隱藏的假設,值得拆開:
假設1:現實鴻溝已經足夠小。 遊戲引擎的物理引擎精度、碰撞檢測、材質反射,現在是否真的逼真到「只需 1% 真實數據微調」?這需要實驗驗證。
假設2:任務多樣性可以遷移。 操作臂在廠房環境學會「分類零件」,是否真的能用最小微調遷移到「整理廚房雜物」?物理原理是通用的,但工程細節(機械靈敏度、負載限制)可能差異巨大。
假設3:演算法本身沒問題。 即便數據充足、標籤完美,神經網路學習「從虛擬到現實的映射」本身是否有本質困難?這是未知數。
歷史遠景:技術成熟曲線
如果我們看半導體的歷史,模擬訓練 → 晶片設計領域在 1990 年代發生過類似的轉變:從「全靠專家手工設計」跳到「用 EDA 軟體模擬、再量產」。當時的「現實鴻溝」也很兇——模擬的晶片往往實際跑不出預期速度。但隨著工具精度提升、這個鴻溝逐漸消失。今天的晶片設計 99% 都是虛擬模擬完成。
機器人可能正在重演同樣的故事。
如果這個故事成真,會改變什麼?
短期(2-3 年):期望看到 10-15 家新創機器人公司、用遊戲引擎+少量真實數據、做出專用機器人(倉儲、製造、家務)。成本結構會從「需要融資 5000 萬才能養研發隊伍」降到「融資 1000 萬可以試」。