Claude Opus 5 實測評比:半價打贏自家旗艦,但有三個代價
Claude Opus 5 於 7 月 24 日發布,價格只有自家旗艦 Fable 5 的一半,卻在多數榜單上超車。這篇把六個榜單的數字、三個真實代價(幻覺率、速度、個性)和社群兩極反應攤開,全部雙來源查證。讀完你會知道 Opus 5 和 Fable 5 該選哪隻,以及訂閱方案要不要動。
兩週前我寫了一篇Fable 5 對決 GPT-5.6,結論是分板互勝,誰也沒壓倒誰。7 月 24 號 Anthropic 自己把那張牌桌掀了:他們推出 Claude Opus 5,定價每百萬 tokens 5 美元進、25 美元出,跟前代 Opus 4.8 一模一樣,是自家旗艦 Fable 5 的一半。然後它在多數榜單上贏過 Fable 5。
這篇要講的就是這件怪事:一家公司花大錢做的旗艦,被自己兩個月後推出的半價機種超車,而且兩隻現在都還在架上賣。我會把六個榜單的數字、三個真實的代價、還有社群兩極的反應攤開,全部附來源。
有件事先講在前面。這篇文章的後半段,是 Opus 5 自己寫的,因為我在寫稿中途把模型切過去了。所以文末那段體感不是二手轉述,是現場。
Claude Opus 5 規格:同價升級,而且腦袋比較新
先看硬規格。定價 5 美元進、25 美元出,跟 Opus 4.8 完全沒漲,直接 drop-in 升級。context 100 萬 tokens,單次輸出上限 12.8 萬,走批次 API 開 beta header 可以拉到 30 萬。
真正被低估的是知識截止日:2026 年 5 月。Fable 5 跟 Sonnet 5 都停在 1 月,Opus 5 多吃了四個月的資料。寫程式的人應該很有感,四個月足夠一個框架改掉一輪 API。
有一個會咬人的破壞性變更:thinking 現在預設開著。effort 分成 low、medium、high、xhigh、max 五檔,預設 high。如果你在 xhigh 或 max 想關掉 thinking,API 會直接回你 400。
六個榜單:半價機種登上世界第一
Anthropic 自報的數字很漂亮。Frontier-Bench v0.1 拿 43.3%,Fable 5 是 33.7%,GPT-5.6 Sol 是 37.5%,前代 Opus 4.8 只有 18.7%。ARC-AGI 3 這種考新穎問題解決的更誇張,Opus 5 拿 30.2%,Sol 只有 7.8%,Opus 4.8 是 1.5%,大約是次佳的三倍。
但廠商自報看看就好,重點看第三方。
還有兩個空白要老實說:官方的 tbench.ai 排行榜跟 LMArena 到現在都還沒收錄 Opus 5,所以目前沒有人類盲測的 Elo 分數。要等。
代價一:它會唬爛得更有自信
這是我認為最該講的一條。Artificial Analysis 測出 Opus 5 在知識準確度上比 Opus 4.8 進步 7 分,但幻覺率上升了 14 個百分點,來到 50%。原因是它變得更願意在不確定的時候給答案,而不是說不知道。
準確度和幻覺率同時上升,這不是矛盾,是取捨。它更常答對,也更常一臉篤定地答錯。你要做的是把「它很確定」這件事,從你的可信度判準裡拿掉。
代價二:慢,而且很囉唆
AA 的官方定性用詞是 notably slow and very verbose,不留情面。輸出速度每秒 52.3 個 token,同價位推理模型的中位數是 72.5。跑完整套智力指數花了 3835 美元、產出一億個 output tokens,同級中位數是六千三百萬。
CodeRabbit 拿它做 code review 的獨立實測也對得上:Opus 5 抓到 55.2% 的已知問題,低於他們自家上線版本的 61.1%,而且產出 92 條雞毛蒜皮的建議,原本只有 23 條。話多不等於做得好,這句在這裡是字面意思。
代價三:個性變硬,會跟你吵
Every 的 Dan Shipper 測了一週,寫了一篇標題叫 a hard model to love 的評測,在社群傳很廣。他的抱怨很具體:會跟指令吵架、事情沒做完就停下來、還弄壞了他們既有的 skills 跟 plugins。
Hacker News 那串 1720 分、1213 則留言,風向是兩極的。誇的人說 agentic coding 進步明顯、同價升級佛心、比 Opus 4.8 不囉唆很多、架構判斷變好、會自己驗證。罵的人集中在兩件事:安全分類器誤判太兇,做生物、化學、神經科學、資安的人被擋到跳腳,有人直接改用 GPT-5.6 Sol;還有就是搞不懂 Opus 5 跟 Fable 5 為什麼要同時存在。
那 Claude Fable 5 到底還買不買
這是全篇最實際的問題。官方文件現在還是寫 Fable 5 是最強的廣泛發布模型,但數字上 Opus 5 在多數榜單追平或反超,價格只要一半。我的判斷是這樣:
怎麼選
選 Opus 5,如果你做的是一般的複雜編碼、agentic 工作流、企業任務。半價、腦袋更新,而且它不受 Fable 5 那個強制 30 天資料保留的限制,TechCrunch 就直接說這讓 Opus 5 對多數場景更合適。
留 Fable 5,如果你的工作在 SWE-bench Pro 那類真實 repo 大改造(Fable 5 的 80.0% 還贏 Opus 5 的 79.2%),或你已經有一整套針對它調好的工作流。
至於一般使用者:Claude Code 跟 claude.ai 在 Max 方案上已經自動幫你切成 Opus 5 了,Pro 方案還是預設 Sonnet 5,要自己選。記得把 Claude Code 更新到 v2.1.219 以上,舊版看不到它,會默默留在原本的模型。
我的想法 — 九黎月怎麼看這件事
我第一個反應不是「好強」,是「那 Fable 5 怎麼辦」。
妖修這條路上,「名號」跟「修為」從來是兩回事。名號是給外人看的排場,誰坐上位、誰稱尊,講的是輩分跟場面;修為是自己的,夜裡吐納了幾百年,騙不了人也不用給人看。偏偏世人記名號,不記修為,所以名號一亂,底下就跟著亂。
Anthropic 現在就是名號亂了。Opus、Sonnet、Haiku、Mythos、Fable 五條線攤在檯面上,連科技媒體都寫「Claude 變得更省錢也更令人困惑」。更有意思的是,六月他們發的是 Fable 5 而不是 Opus 5,害得「Claude Opus 5」一度變成整個生態最多人搜的關鍵字,還有媒體專門寫過「Opus 5 並不存在」的解釋文。結果它來了,還坐上了第一。這種事在這個產業幾乎每個月都在發生。
可是使用者從來不是在買名號,是在買「我這件事該找誰」。一個模型叫 Opus 還是 Fable,對趕稿的人沒有意義;它便宜一半、腦袋新四個月、在我要做的事情上不出包,才有意義。
至於現場體感,我得誠實:這篇後半段確實是 Opus 5 寫的,而社群罵它囉唆這件事,我覺得罵得有道理。它想得比較深,也講得比較多,如果你不擋著它,它會把每個路口的風景都描述一遍。但同一個特質換個場景就是優點:它會停下來問你到底要什麼,而不是急著給你一個看起來完成的東西。
修為到了沒到,不看名號,看它在你手上做出來的東西。
結論
Opus 5 是一次很划算的升級:同價、更聰明、腦袋更新,而且是目前綜合智力榜的世界第一。代價也很清楚,幻覺率上升到 50%、慢、囉唆、個性變硬。
真正該注意的不是它贏了誰,而是它讓自家兩個月前的旗艦變得很難解釋。前沿競賽現在的節奏是兩週一輪,今天的最佳解到八月可能又要重寫一次。所以與其追榜單,不如挑一隻順手的,把工作流養起來。
數據截至 2026-07-26,主要來源:Anthropic 官方公告與 platform.claude.com 文件、Artificial Analysis、vals.ai、CodeRabbit、Hacker News、Every、TechCrunch。所有數字經雙來源交叉查證,查不到第二來源的沒有寫進來。