事件背景
2023 年,Om AI 團隊在一次無預期的實驗中發現:一個通用多模態模型在完全陌生的監控場景上的表現,竟然超越了在該領域訓練多年的垂直小模型。這看起來違反直覺——專用模型應該在自己的領地更強。但三年後回頭看,這個「意外」演變成了 VLX(全球首個端側流式多模態模型系列),成為 Om AI 對「物理 AI 架構方向」的核心賭注。
為什麼會發生這件事?
關鍵不在模型參數,而在架構設計的起點不同:
舊邏輯(垂直小模型):從「監控資料豐富嗎?」開始。答案是「豐富」——成千上萬小時的安防錄像。所以策略是「蒐集更多監控資料、優化監控特定特徵」。這是 scale-through-data 的邏輯。但問題隨之而至:模型過度擬合到監控影像的視覺統計特性(光線、角度、幀率),在新場景面前脆弱得像紙糊的。
新邏輯(多模態流式):Om AI 從一開始就設計給「端側算力嚴格受限」的場景。端側意味著沒有無限 GPU、沒有實時回傳雲端、必須在邊界設備上(手機、攝像頭、機械人)本地處理。這種約束強制設計師問一個更根本的問題:「我能用最少資源、最高效流程,從視覺流中萃取『持續感知 + 精準定位 + 行動決策』的完整邏輯嗎?」
約束激發了設計創新:流式架構(streaming)。不是一次性吃掉整個影像,而是像人眼一樣,邊看邊決策、邊決策邊調整注意力。這種架構本質上是在學習「怎樣有效地在開放世界(不是精心標註的監控資料庫)中做決策」。一旦這個架構學會了,它自然就有泛化能力——因為它沒有對任何特定場景的視覺假設,只有對「如何在不確定中感知」的通用邏輯。
為什麼這很重要?
AI 產業正在一個十字路口:數字 AI(大語言模型、圖像生成)已經被 OpenAI、Google、Meta 等巨頭定義,競爭往「規模與資料」的方向走。物理 AI(機械人、自駕車、無人機在真實世界的決策)才剛開始,路線還沒收斂。業界同時探索多條路:
- **VLA 路線**(以語言為中心):讓模型理解「去廚房煮個蛋」這樣的自然語言指令,輸出機械人行動
- **視頻生成路線**(以像素為中心):直接生成未來幀,推導行動
- **仿真路線**(以 3D 結構為中心):學習物理規則
- **視覺表徵路線**(JEPA):學習自我監督的特徵空間
Om AI 的賭注是:架構優先於規模。在資源受限的端側環境,「正確的資訊流設計」會比「更大的參數」更接近物理 AI 的真問題。
歷史類比
這不是第一次發生。Unix 的成功、Linux 的爆發、HTTP 協議的優雅——都遵循同一個模式:在約束下設計架構、反而激發了最大的泛化性和長期生命力。iPhone 也是:不是因為硬體最強(當時 Android 機的配置更高),而是因為 iOS 的架構設計圍繞「有限的硬體、極致的互動邏輯」展開。
相反,許多「堆砌資源」的產品(臃腫的企業軟體、過度參數化的模型)往往在新場景面前崩潰。
對產業的啟發
如果 Om AI 的方向被市場驗證,物理 AI 競爭的焦點就不會是「誰能蒐集最多機械人訓練資料」(這是規模戰),而是「誰能設計最聰明的架構來學習物理世界的泛化規則」(這是工程與哲學之戰)。這對初創團隊有利——因為架構創新不需要 Meta 級別的資料中心,只需要對問題的深刻理解。