Claude Fable 5 重新開放公測 編程能力拋離 GPT-4 Anthropic 押注自我進化路線
經歷三個月內部調整,Anthropic 旗下 Fable 系列模型終於重新向公眾開放。香港時間昨日(9 日)凌晨,該公司正式推出 Claude Fable 5,為首個向一般用家開放的 Mythos 級別人工智能模型,在關鍵軟件工程基準測試 SWE-bench Pro 中得分 80.3%,大幅拋離自家旗艦 Claude Opus 4.8 的 69.2%,以及 OpenAI GPT-4 的 58.6%。
代號「Capybara」的新層級
今年三月,Anthropic 因人為錯誤導致近 3,000 份內部文件外洩,揭示公司正秘密研發名為「Claude Mythos」的新一代模型,並設有名為「Capybara」的內部能力層級。文件洩漏後,外界質疑 Mythos 級模型的安全防護能否跟上其暴漲的能力,Fable 的公開發佈亦一度暫緩。
如今 Fable 5 重新開閘,意味 Anthropic 有信心讓公眾接觸這頭猛獸。公司堅持分級開放策略:今次同步發佈的 Claude Mythos 5 仍只限 Project Glasswing 合作夥伴及美國政府相關用戶使用,Fable 5 則充當面向開發者及企業的「馴化版」先鋒。
安全分類器設定保守 官方稱會逐步鬆綁
為管控風險,Fable 5 內置的安全分類器初期設定較為保守,部分無害請求可能被錯誤攔截。Anthropic 向本報透露,目前分類器僅在 少於 5% 的使用時段觸發,隨着持續測試,限制將逐步放寬。這與早前文件顯示的「安全與能力平衡」策略一致。
每日消費上限 US$2,000 企業月費計劃料搶客
定價方面,Fable 5 的 API 輸入每百萬 token 收費 10 美元,輸出則為 50 美元,不便宜,但對比其展現的代碼生成效率,仍具吸引力。付費用戶每日兌換上限設定為 2,000 美元,變相限制高強度連續使用,惟企業客戶可另洽專屬方案。有業界人士分析,Anthropic 五月企業採用率已達 34.4%,首度超越 OpenAI 的 32.3%,今次 Fable 5 挾編碼優勢登場,勢必進一步搶奪商業市場。
一日完成兩個月程式碼遷移 生命科學成下個金礦
早前測試顯示,Fable 5 協助支付平台 Stripe 在 一日內完成 5,000 萬行程式碼遷移,原本團隊預計至少要花兩個月。這類案例是 Anthropic 搶客的殺手鐧。公司亦明言,生命科學已被確立為繼編碼之後的核心戰略領域,目標是「在生物學及生命科學所有領域達到或超越人類專家表現」。在前期試驗中,模型針對 14 個靶點成功生成 9 個優質候選藥物,效率驚人。
全力押注遞歸自我改進,剛發表的官方博客《When AI Builds Itself》描繪了讓 AI 透過循環迭代自行提升能力的技術路線圖。這條路一旦走通,下一波模型將不再單純依賴人類工程師。
安全與能力的永恆角力
三個月前,洩密文件令外界窺見 Mythos 的野心;三個月後,Fable 5 重新開放公測,用實測分數證明能力。只是,安全分類器那「低於 5%」的觸發比例,究竟是防護得宜,抑或把閘開得太寬?在自我進化的競賽中,這個問題恐怕會反覆被問起。