事件
一家新創公司 General Intuition 聲稱:訓練通用人工智慧(AGI)的關鍵不是更大的互聯網語料庫、而是遊戲引擎生成的合成數據。
為什麼遊戲引擎勝過互聯網
互聯網數據的詛咒很隱密。爬蟲抓下的數百億網頁、看起來資訊豐富、實際上卻充滿了虛假相關性。一篇食譜網頁旁邊的廣告、一張貓咪圖片旁邊的標題、這些「共現」讓模型學到的是社群媒體的敘述邏輯、而非物理世界的因果。
換到遊戲引擎。Unreal Engine 或 Unity 中的每一個物體移動、都遵循牛頓定律。當一個球從 10 米高掉下來、它的速度、軌跡、碰撞都能精確計算。模型看 10 萬次這樣的「掉球」、學到的不是「掉球」這個標籤、而是重力加速度的不變性。
訊號密度的差異
互聯網一萬字的文章、可能有 100 個真實信號、9900 個噪音。遊戲引擎一秒的幀序列、50 幀、每幀 50 個像素、因果連鎖完整。信號密度差至少 100 倍。
這不是「更多數據」的問題、而是「更高質數據」的問題。吳恩達(Andrew Ng)長期強調「數據品質 > 數據量」、但業界為了追求規模經濟、往往忽略。
應用場景:具身 AI(Embodied AI)
OpenAI 的 GPT 系列之所以無法直接控制機械臂、因為它沒在因果環境中訓練過。它背會了「抓住杯子」這個詞、卻沒看過真實或擬真的物理 trajectory。
反觀、讓 AI 在遊戲引擎中與環境交互 1000 小時、它會學到: - 物體的質量影響運動速度 - 碰撞的反作用力 - 重心與翻倒臨界角
這些都是 ChatGPT 無法從「杯子」這個詞推導出來的。
為什麼現在才出現
遊戲引擎進化速度在過去 5 年飆升。Unreal Engine 5 的物理模擬逼真度已足以迷惑人眼。同時、雲端算力成本下降、讓「大規模渲染模擬」成為經濟可行。
更深層的原因是:互聯網數據的「免費紅利」已在 2020 年達頂。想從 10 萬億詞元再進步到 100 萬億、邊際成本指數上升、收益卻遞減。反而、合成數據的 marginal cost 是常數(只要算力不漲)。
反方視角
「合成數據的真實性會被 AI 過度擬合。」遊戲引擎永遠不會完全等於真實世界。AI 在完美物理中訓練、到現實卻摔跤。(domain transfer problem)
「規模還是王。」互聯網有 1000 億人類產生的多模態信息。遊戲引擎生成的數據、再逼真也只是程序員想像。
啟示
這則新聞揭示的不是「遊戲改變 AI」、而是一個更廣泛的原則:當自然數據的品質瓶頸顯現、設計者會轉向構造環境。從實驗室的對照組設計、到製藥的高通量篩選、再到現在的合成訓練數據——人類一直在用這招擊敗噪音。