Claude Fable 5 號稱同模型新版本,實測表現「驚喜欠奉」
人工智能公司 Anthropic 昨日低調發佈 Claude Fable 5,但官方技術報告一句「基於與上一代完全相同的底層模型」旋即引爆討論。這款被內部稱為「最令人興奮的發佈」的產品,在基準測試中僅有 2-3% 的微幅提升,有研究員直言「這不過是把同一部引擎重新噴漆」。
官方自爆底層不變
Anthropic 在發佈博客中承認,Fable 5 並未像外界猜測那樣換上更大參數量的新架構,而是沿用 Fable 4 的核心模型,僅在對齊微調(RLHF)與系統提示工程上做了調整。公司聲稱「透過更好的數據配方與推理鏈路優化,同樣的底層模型可以釋放更高潛能」。
然而,這種說法在 AI 社群引起反彈。史丹福大學基礎模型研究中心主任 Percy Liang 在社交平台 X 上貼文:「如果底層完全一樣,那麼任何性能差異只能來自 prompt 工程或評估集過拟合。這不是模型進步,而是 tuning 的幻覺。」他的留言獲得超過 1.2 萬個讚好。
基準測試升幅微小,用戶反饋兩極
根據官方公佈的數據,Fable 5 在 MMLU 上得分較 Fable 4 提高 1.8%,在 HumanEval 提高 2.3%,在 GSM8K 提高 2.1%。這些漲幅均在統計誤差範圍內。獨立評測機構 LMSYS 的 Chatbot Arena 排行榜上,Fable 5 的 Elo 分數僅上升 12 分,遠低於業界通常認為「顯著改進」的 50 分門檻。
一位不願具名的早期測試者向本報表示:「我在寫 code 和長文本摘要上反覆測試,Fable 5 和 Fable 4 的輸出幾乎無法區分。唯一感覺是它更『聽話』了,但也更『模版化』。」不過也有開發者指出,Fable 5 在遵循複雜指令方面確有改善,尤其當指令包含多步邏輯約束時。
市場策略還是技術誠實?
Anthropic 此舉被解讀為兩種可能:一是公司研發進度滯後,被迫用舊模型包裝新版本以維持市場熱度;二是刻意彰顯「模型能力不只取決於規模」的技術哲學。Anthropic 聯合創辦人 Daniela Amodei 在發佈會上說:「我們不想陷入『越大越好』的軍備競賽。Fable 5 證明了,更好的對齊可以讓現有模型做得更好。」
但投資者似乎不買單。消息公佈後,Anthropic 的估值傳聞近期有所回落。一位匿名風投合夥人告訴記者:「如果開源社群用 Llama 4 做微調就能達到同樣效果,我們為何要為一個『換皮』模型支付更高 API 價格?」目前 Fable 5 的 API 定價與 Fable 4 完全相同,但 Anthropic 暗示未來可能根據使用量調整。
同行對比更顯尷尬
在 Fable 5 發佈同一周,OpenAI 公佈了 GPT-5 turbo 的早期評測,在 MMLU 上領先 Fable 5 超過 10 個百分點;Google DeepMind 的 Gemini 2.0 也展示了多模態推理的突破。相比之下,Anthropic 的「同底層換代」策略顯得相當保守。
AI 分析師 Ethan Mollick 在部落格中寫道:「Claude Fable 5 是『更好的 Claude』,但不是『更好的 AI』。它讓人想起手機廠商每年推出的『S』代產品——硬體不變,只更新軟體。但問題是,AI 模型不是手機,用戶期待的是一年一度的代際飛躍。」
記者觀察:誠實變成公關災難
若從公關角度審視,Anthropic 的坦誠反而釀成反效果。過去業界默認「新版本就是新模型」,即使底層架構僅有微調,也不會主動承認。Anthropic 開了先河,卻被外界解讀為「心虛」。一位資深 AI 記者形容:「他們誠實得不是時候。當競爭對手都在吹噓十倍性能提升時,你站出來說『其實差不多』,這不是美德,是自殺。」
截至截稿,Anthropic 沒有進一步回應。Fable 5 已在官網開放測試,但用過的開發者普遍表示「等 Fable 5.5 再升級」。
「最好的模型不是跑分最高的,而是你最常使用的。但如果你分不出 4 和 5 的差別,那 5 的意義在哪裡?」——AI 開發者社群 Hacker News 高讚評論