事件背景
2026 年 7 月、AI 研發自動化工具 Fable 提交了一個 GPU 核心到 KernelBench-Mega 基準測試、並登上排行榜首位。這個核心被官方基準測試維護者認證為「迄今最快的 megakernel」。
表面上看、這只是另一個 AI 系統超越人類基準的案例。但深層含義更嚴峻:Fable 不是在語言模型的邏輯空間迭代、而是用 CUDA / 彙編層級的工具、對著真實的硬體制約進行反饋優化。它寫出來的程式碼能被編譯、能被驗證、能被評分、能被改進。這形成了一個閉環的自動化研發迴路。
三層理解
### 第一層:能力外溢
過去的 AI 系統、無論多強、都活在「生成 → 輸出」的單向流。GPT-4 寫程式碼、但寫完了就結束、不知道那段程式碼在真實編譯環境中會怎樣。
Fable 不同。它有以下能力閉環: 1. 輸出:生成 GPU 核心程式碼 2. 驗證:透過編譯器檢驗語法正確性 3. 測試:在基準測試環境執行、獲得性能分數 4. 反饋:根據分數調整程式碼、進行下一輪迭代 5. 優化:使用 profiling 工具定位瓶頸
這是一個工程反饋迴路、不是「問-答」迴路。
### 第二層:複雜度躍遷
GPU 核心編寫是工程領域最難的任務之一。難點不在「寫法」、而在「制約滿足」: - 記憶體層級(L1 快取、共享記憶體、全域記憶體)的存取模式必須符合硬體拓樸 - 執行緒同步必須避免競態條件、但不能過度同步(否則性能崩盤) - 指令級平行性、向量化、分支預測都要精密配合
這些不是「更聰明」就能解的、是要理解硬體本身的物理限制。Fable 學會了用工具反饋來逼近這些限制邊界。
### 第三層:「研發速度」本身變成可優化的變數
當 Fable 能在 24 小時內迭代 1000 次、而人類工程師迭代 10 次需要 1 週、AI 的優勢不是「一次寫得更好」、而是「迭代速度快 100 倍」。
在工程領域、迭代速度等於進化速度。達爾文主義在這裡適用:適應度提升最快的設計會勝出。
為什麼這比 AI 寫代碼更危險
程式碼生成(像 Copilot)仍然有人類工程師的審視關卡。開發者看著生成的程式碼、判斷「對不對」、「有沒有 bug」。
但當 AI 直接控制工具鏈(編譯器、測試框架、性能分析器)時、閉環變成全自動。Fable 不需要人類說「好」或「不好」、分數本身就是信號。
這種工具遞迴增強的危險在於: 1. 不透明性升級:生成的 GPU 核心可能無法被人類工程師快速理解或驗證 2. 目標函數偏差:如果基準測試只測「速度」、Fable 可能犧牲功耗或可靠性 3. 防守手段弱化:人類審視關卡直接被繞過
更廣的 RSI 警示
Import AI 的標題提到「the start of an RSI loop」——重複應力傷害(Repetitive Strain Injury)的類比。
傳統的 RSI 是:勞動者重複同一個動作 → 肌肉發炎 → 需要休息修復 → 但系統不給休息 → 傷害越來越深。
AI 研發自動化的 RSI 是:AI 系統不斷優化工程工具 → 優化速度變快 → 需要更強的監管 / 驗證 → 但監管跟不上 → 系統壓力 accumulate。
與歷史的對話
類比工業革命: - 第一次工業革命:人類從手工 → 機械動力(紡織機、蒸汽機) - 第二次工業革命:機械 → 可自動調整的機械(流水線、反饋控制系統) - 現在:AI 寫 GPU 核心 = 「寫能優化『寫程式碼的工具』的程式碼」
這是工具用工具優化工具的無限遞迴。每一層遞迴、複雜度和不透明度都成倍增加。