S2E63 Sakana Fugu 不訓練模型改當指揮官,效能直逼 Anthropic Fable 5?
Sakana AI 是來自東京的日本 AI 新創,以 7B 指揮官模型調度 Claude Opus、GPT-4 Turbo、Gemini 三大前沿模型協同完成任務,旗艦產品 Fugu Ultra 宣稱效能媲美 Claude Fable 5,但實測揭示速度極慢、token 消耗極高,輸出品質未達 Fable 5 水準。
本頁摘要由 AI 自動生成,著作權屬原節目創作者;可能存在錯誤或遺漏,建議收聽 原節目《矽谷輕鬆談》 以獲取完整資訊。
重點摘要
- Sakana AI 是罕見的日本 AI 新創(總部東京),創辦人包含前 Google Brain 研究員 David Ha(CEO)與 2017 年 Transformer 論文八位共同作者之一的 Llion Jones(CTO)
- 公司核心策略:不自行從頭訓練大模型,而是以「演化與集體智慧」組合現有前沿模型,繞開與美中 AI 大廠在算力上的直接競爭
- Fugu Ultra 以一個 7B 參數、強化學習(RL)訓練的指揮官模型,將請求拆解為多個子任務,依模型特長分配給 Claude Opus(程式碼與自然語言)、GPT-4 Turbo(數學推理)、Gemini(事實查詢與科學研究)執行
- 自家 Benchmark 顯示 Fugu Ultra 部分指標追平 Claude Fable 5,但實測結果「又慢、又貴、品質仍不如 Claude Fable 5」——主持人儲值 20 美元,輸入一個 prompt 後費用立即耗盡,最終輸出甚至不及 Claude Opus 4.8
- 主持人預測 Sakana AI 作為公司可能很快被市場淡忘,但「組合現有模型提升能力」的概念具有長期生命力,各大模型開發商也可能採用類似架構
詳細內容
Sakana AI 是誰,為何值得關注?
Sakana AI 於 2023 年成立,總部位於東京,在 AI 公司幾乎清一色來自美國或中國的格局下顯得罕見。CEO David Ha 曾在 Google Brain(2016—2022 年)擔任研究員,後赴 Stable Diffusion 開發商 Stability AI 擔任管理職;CTO Llion Jones 則是 2017 年 Google 劃時代論文「Attention Is All You Need」(奠定現代大型語言模型基礎的 Transformer 架構)的八位共同作者之一。主持人特別提到,DeepMind 執行長 Demis Hassabis 與同事 John Jumper 因 AlphaFold 研究共同獲得 2024 年諾貝爾化學獎,但 Jumper 近期也已離職,顯示 AI 頂尖人才正在大規模流動。
核心策略:組合而非自訓,繞開算力軍備競賽
Sakana AI 明確放棄「砸錢買 GPU、累積算力、訓練更大模型」的路線。創辦人在公開訪談中坦言:身為日本公司,資源先天受限,若走傳統路線「本質上是最後一定會輸的」。其替代策略是利用演化演算法與集體智慧,把 Claude Opus(Anthropic)、GPT-4 Turbo(OpenAI)、Gemini(Google)等已有的前沿模型組合起來,試圖讓整體能力超越任何單一模型。中國開源模型(如 Zhipu AI 的 GLM 系列)同期表現已直逼美國頂尖基礎模型,Sakana AI 的定位是在美中 AI 對抗的夾縫中走第三條路。
Fugu Ultra 的運作原理:7B 指揮官 + 多模型協作
Fugu Ultra 採用兩層架構:
指揮官模型(7B 參數,強化學習訓練):接收使用者請求後,生成一套工作流程,具體決定三件事——任務要拆成哪些子步驟、每個子步驟交給哪個模型執行、以及每個執行模型可參考前面哪幾步的輸出。指揮官輸出的是自然語言 prompt(非程式碼),屬端到端訓練。獎勵函數設計較簡單:格式錯誤得 0 分、格式正確但答案錯得 0.5 分、答案正確得 1 分。
執行模型(依特長分配):GPT 系列負責數學推理、Claude Opus 系列負責程式碼與自然語言、Gemini 系列負責事實查詢與科學研究。對於複雜任務,可多層遞迴——在某個子任務中再嵌入一個指揮官,持續往下拆解,理論上可無限延伸。整個流程的 API 格式與 OpenAI 相容,使用者無需修改現有程式碼即可切換。
實測結果 vs. 官方 Benchmark
Sakana AI 自家 Benchmark 顯示 Fugu Ultra 在部分指標超越 Claude Fable 5,並全面超越 Opus、GPT、Gemini 的單一模型——邏輯上「用三個模型組合」確實應優於任一個別模型。但主持人指出,當前多數 Benchmark 已被針對性優化而失去參考價值。
主持人與社群的實際使用結果:
- 速度極慢:需整合多個模型的回應再統整,等待時間明顯偏長
- 費用極高:主持人儲值 20 美元,輸入一個 prompt 後費用立即耗盡
- 輸出品質不如預期:最終輸出結果甚至不及 Claude Opus 4.8,遠不及 Claude Fable 5 上市時明顯的品質躍升感
- 社群回饋:「概念方向正確」,但實際體驗是「又慢、又貴、還沒更好」
長期展望:概念比公司更耐久
主持人認為 Sakana AI 這間公司可能很快被市場淡忘,更深層的風險在於:若 6 個月後前沿模型能力大幅躍升,現有的整套「模型調度工程」架構可能需要從頭重新設計,因為新模型可能不再需要這些組合機制就能直接達到目標。不過「組合現有模型提升能力」的概念具有長期生命力,各大模型開發商也可能以類似方式整合自家不同規模的模型。
精選語錄
如果他們跟大家一樣,去砸錢,去買 GPU,去買算力,去用更多的 Data,想辦法去蓋出更強的模型,這件事情本質上是最後一定會輸的。
Fable 5 當時一使用的時候就說,這個顯著的好,你體感上就感覺到這個 Fable 5 有一個值的提升,你看得出來這個畫面是更好的……可是 Fugu Ultra 聲稱它的 benchmark 上的表現是跟 Fable 差不多的,但我們自己實測的感覺是,其實沒有。
我就先儲值 20 塊美金去用一個 prompt 去產生,結果 20 塊已經燒完了,結果他還在 debug,然後我把這個半成品開起來,發現這個畫面真的是不太行。
時間軸
- 開場:介紹 Sakana AI 推出 Fugu 模型,在美中 AI 大廠夾縫中殺出的日本新創
- 中前段:Sakana AI 公司背景、創辦人介紹(David Ha / Llion Jones)、選擇「組合模型」路線的原因
- 中段:Fugu 與 Fugu Ultra 的差異;Fugu Ultra 運作原理詳解(指揮官模型架構、強化學習、獎勵函數)
- 中後段:Benchmark 表現說明與侷限性分析;各模型特長分工說明
- 後段:主持人實測結果、社群回饋彙整
- 結尾:主持人對 Sakana AI 長期發展的觀點,以及「模型調度被下一代模型能力取代」的風險
同節目更多集數
- 訂了 24 小時內出發的機票!現場看世界盃的魅力在哪?🇪🇸 vs 🇦🇷 決賽賽後分析矽谷輕鬆談 · 2026-07-25
- 史上最精彩的四強?阿根廷 7 分鐘逆轉,西班牙碾壓法國!賽後分析與冠軍預測矽谷輕鬆談 · 2026-07-18
- 誰能擋得住法國?2026 世界盃四強全解析!史上第一次 FIFA 前四強全數歸位矽谷輕鬆談 · 2026-07-14
- S2E64 連續押中 Facebook、Uber 成功出場,與矽谷大神聊聊選公司的眼光、創業與 AI feat. Jarsy 創辦人秦漢矽谷輕鬆談 · 2026-07-12
- S2E62 Fable 5 vs Opus 4.8 正面對決:誰的皮卡丘 Flappy Bird 比較好玩?(封禁前最後實測)矽谷輕鬆談 · 2026-06-21
相關主題
- EP168. 【黃仁勳三部曲 3】ChatGPT 來之前,他就準備好了,「我們不瓜分市場,我們創造市場」|VK 科技閱讀時間VK科技閱讀時間 · 2026-07-15
- EP167.【黃仁勳三部曲 2】股價跌八成、投資人逼他下台,「當你把籌碼推進去,你知道它會成功」|VK 科技閱讀時間VK科技閱讀時間 · 2026-07-08
- EP166. 鐵達尼號該搶救生艇還是拆門板?AI 時代必學的「問對問題」思考訓練 feat. 李佳達VK科技閱讀時間 · 2026-07-04
- 【天下零時差07.02.26】日圓驚見162,現在該換好換滿嗎?專家:看懂2關鍵抓換匯時機聽天下:天下雜誌Podcast · 2026-07-02
- EP165. 【黃仁勳三部曲 1 】:他希望你承受磨難,9 個月現金、押在一台冰箱大機器上的豪賭|VK 科技閱讀時間VK科技閱讀時間 · 2026-07-01