事件背景
2026 年上半年,物理 AI(機器人、自動化系統的智能化)進入產業加速期。英偉達執行長黃仁勋在拉斯維加斯消費電子展(CES)上宣布「物理 AI 的 ChatGPT 時刻已經來臨」,並在演講中 17 次強調「物理 AI」。同期全球融資額創紀錄——僅 2026 年第一季就超過 64 億美元,包括 AMI Labs 10.3 億美元種子輪、World Labs 10 億美元融資、國內千尋智能 45 億元人民幣四輪融資等。
與此同時,技術方案逐漸成熟:視覺語言動作模型(VLA)、視覺語言模型(VLM)與世界模型(World Model)三條路徑聚合,構成完整的決策框架——世界模型生成合成訓練數據、VLM 負責長期規劃「慢思考」、VLA 直接將指令與感知轉化為動作。
核心轉變:雲端 vs 端侷
過去數年,AI 的主戰場在「屏幕裡」——GPT 系列堆砌參數創造驚人語言能力、Sora 用視頻生成震撼世界。這些系統典型特徵是:
- **決策中樞在雲端**:所有複雜計算在大型數據中心,設備充當輸入輸出終端
- **延遲容許相對寬鬆**:文本對話允許 500 毫秒級延遲,用戶可接受
- **集中優化成本效率**:算力摊平到百萬用戶,單位成本極低
物理 AI 的根本不同在於:實時性需求無法妥協。機器人在現實環境中執行任務——抓取、导航、协作——延遲 500 毫秒就可能跌倒或傷害周圍物體。物理世界不容許對話時的「想想再回」。
因此,真正的物理 AI 系統必須從架構根本做出不同假設:
### 端侷原生架構的三個核心設計
1. 感知-決策-動作的閉環在邊界設備完成
不是「感知上雲 → 決策 → 指令下發」,而是設備本身成為自主決策單位。視覺輸入在機器人上進行特徵提取,VLA 模型在邊界晶片上推理,指令直接轉化為馬達控制——整個迴圈可在 50 毫秒內完成。
這帶來的產業影響:邊界 AI 晶片需求爆炸。不只是 GPU 供應商受惠,專門為機器人優化的推理晶片成為新戰場(如 NVIDIA Jetson、高通、寒武紀等)。
2. 訓練數據工厂重新定位
在雲端 AI 時代,訓練數據是「靜態資產」——互聯網爬蟲一次性搜集,建檔。物理 AI 無法這樣做,因為現實環境千變萬化。
新架構引入「世界模型」作為後台工廠:它不是用來直接執行任務,而是生成無窮無盡的虛擬環境與合成軌跡,供 VLA 訓練。這意味著:
- 訓練變成**連續過程**,不是一次性事件
- 每台機器人的現場經驗反饋回全球模型,形成數據生成迴圈
- 成本結構從「數據獲取成本」轉向「模型蒸餾與優化成本」
3. 商業邏輯的重新組織
雲端 AI 時代:一家公司訓練好一個模型,所有客戶共享。邊際成本趨近零。
端侷原生時代:每個應用場景(倉庫自動化、製造業、建築)需要定制化的 VLA 與世界模型。這造成:
- **垂直整合加強**:光訓練通用模型不足,還要能快速適應客戶現場
- **數據護城河重新評估**:不是「誰的爬蟲最強」,而是「誰的機器人在現場積累的數據最多」
- **硬體與軟體的重新綁定**:晶片、機器人本體、推理框架、訓練系統不再完全解耦
產業格局的新變數
這場轉變為什麼那麼引人注目?因為它打破了過去 3 年「誰的 GPU 最多、誰贏」的簡單邏輯。
在雲端 AI 時代: - OpenAI、DeepSeek 等基礎模型公司掌握話語權 - 英偉達透過 GPU 壟斷實現利潤最大化 - 應用層創業公司要麼被收購,要麼模式單薄