知識庫
AI工作流
10 min

GPT-6 Astra 數據拆解:官方喊最強,獨立榜單卻顯示原地踏步、還貴 2.5 倍

OpenAI 在 9 月 3 日發布 GPT-6 Astra,官方稱它是最聰明也最對齊的模型,甚至有媒體說這是敢把「AGI 時代」講出口的第一隻。但獨立榜單一出來,故事不太一樣:通用智慧分數跟前代打平、落後 Claude Fable 5.1 五分,價格卻是 2.5 倍。這篇把官方數字和第三方數據攤開對照,包括那個 99.9% 分數背後的星號。

OpenAI 在 9 月 3 日丟出 GPT-6 Astra,先給受信任夥伴限量預覽,隔天開放給付費的使用者。官方的說法很大:世界上最聰明、也最對齊的模型,甚至有媒體寫說,這是 OpenAI 第一次敢把「AGI 時代」講出口的模型。

然後第三方數據出來了,故事就不太一樣。在目前唯一一份獨立的通用智慧綜合榜上,Astra 跟它要取代的前代打成平手、落後 Claude Fable 5.1 五分,而價格是前代的 2.5 倍。

這篇把「官方公布的數字」和「第三方量出來的數字」擺在一起對照,包括那個 99.9% 分數背後、我覺得最該講清楚的星號。

官方版本:規格、宣稱,和那句「AGI 時代」

先看 OpenAI 自己的說法。Astra 被定位成電腦操作、瀏覽、軟體工程、科學與專業工作的主力模型,主打更強的對齊、更快完成任務,還有 Codex 新的上下文保留。規格上,脈絡長度 105 萬 token,單次輸出上限 12.8 萬。推送到 ChatGPT 的 Plus、Pro、Business、Enterprise,以及 API、Azure、AWS Bedrock。

官方公布的分數(以下都是廠商自己跑的):

ARC-AGI-399.9%,前代大約只有 7.8%。這個數字有星號,下面專門講
GPQA Diamond96.0%,目前公布的最高分
FrontierMath Tier 497.6%,對比 Claude Fable 5.1 的 87.8%
DeepSWE v1.174.1%(前代 72.7%)。同週 Meta 的 Muse Spark 1.3 是 75.4%,Gemini 3.8 Flash 與 Opus 5 公開榜約 74%
其他Terminal-Bench 4.0 約 57.7%、OSWorld 2.0 72.6%(比前代少花 47% 時間)、ExploitBench 100%

有個容易被忽略的重點:這次開放的是限制版,會拒絕部分資安領域的提問,而且分階段推出,OpenAI 資安計畫的參與者優先拿到。這是它安全定位的一部分,不是 bug。

獨立榜單版本:跟前代打平,落後 Claude

Artificial Analysis 的智慧綜合指數(第 4.1.1 版,九個評測的綜合,9 月 3 日)量到的結果,跟官方敘事有落差:

GPT-6 Astra61(最高努力設定)
GPT-5.6 Sol(前代)61,跟 Astra 打平
Claude Fable 5.165.7,領先 Astra 約 5 分
Claude Opus 563

白話講:換代了,但在這份中性的綜合分上,它沒有往前走。而且 Humanity's Last Exam 這項也是 Fable 5.1 勝出。

這裡要誠實補一句:模型才發布幾天,目前還沒有可引用的 LMArena 或 SWE-bench 正式條目,第三方數據還在陸續補。現在下的任何結論,都可能隨新數據修正。

那個 99.9% 背後的星號

ARC-AGI-3 從前代的約 7.8% 跳到 99.9%,看起來像世代跳躍,這也是這次最搶眼的數字。但它有條件。

這個成績用的是改過兩個設定的 Responses API harness,標準的無狀態 API 呼叫分數低很多。另外有媒體在同一項寫 98.6%,推測就是不同的 harness 設定所致。更精確的說法來自 ARC Prize 基金會的 Greg Kamradt:Astra 是在 96% 的關卡達到人類水準,而不是「解決了通用智慧」。

這不是說 OpenAI 造假。是說 benchmark 的「跑法」會大幅影響數字。看到跨代暴漲的分數,第一件該問的事永遠是:這是用什麼條件測出來的、跟對手是不是同一把尺。

它真的變強的地方,別只看壞的

把話講平衡:這一代有幾個進步是實在的。

幻覺率砍半AA-Omniscience 上,最高推理設定的幻覺率從前代的 92% 降到 51%,準確率也上升。51% 仍然高,但這是這代最有感的改善
數學是真的贏FrontierMath Tier 4 拿 97.6%,對比 Fable 5.1 的 87.8%,這塊差距明顯
寫程式是平手不是輸Coding Agent Index 在 Codex 環境 67,大約等於 Claude Opus 5 與 Fable 5 在 Claude Code 的水準
token 效率在 Coding Agent Index 上比前代省 70% token,等於同樣水準下每個任務更便宜

定價:2.5 倍,還有一個 272k 的陷阱

這代最痛的是價格。每百萬 token 從前代的 $4 輸入、$20 輸出,全面漲到 $10 輸入、$50 輸出,是 2.5 倍。Artificial Analysis 算過,雖然輸出 token 比前代少約 10%,但在最高努力設定下,每項任務比前代貴約 75%。

還有一個很多人會踩的陷阱:超過 272,000 個輸入 token 的請求,輸入與快取以 2 倍計、輸出以 1.5 倍計,而且是整個請求都套用,不是只算超過的部分。換算下來是每百萬 $20 輸入、$75 輸出。它的脈絡長度雖然有 105 萬,但超過大約 26% 就開始翻倍。

白話:別因為「有百萬脈絡」就無腦把整包資料塞進去。真的要塞,先算一下這筆會不會直接變兩倍價。

我的想法 — 九黎月怎麼看這件事

這一代最有趣的其實不是模型,是「官方數字」和「第三方數字」之間的那道落差。

妖狐看人,從來不看他說什麼,看他在沒人盯著的時候怎麼做。benchmark 也是同一回事:廠商自己跑、用自己調過的條件跑出來的分數,跟中性第三方在同一套條件下跑出來的,是兩種東西。前者是說給你聽的,後者才是做給你看的。

AI 圈現在最缺的不是更高的分數,是同一把尺。當每家都能挑一個對自己有利的 harness,分數就會慢慢變成行銷素材。真正有用的判斷,是看獨立、跨模型同條件的綜合榜,再加上你自己手上那件真正在做的事。

所以別為了榜單換工具。拿你每天真的在做的活去測,那個結果才是你的 benchmark。我在上一輪 Fable 5 對決 GPT-5.6也是同一個結論:分板互勝,看你的工作型態。

結論:誰該換、誰先別急

可以考慮升級做研究級數學、吃重科學推理(GPQA)、需要電腦操作與瀏覽自動化的人
可以觀望純寫程式的人。它跟 Claude 打平,差別在你的工作流在哪個環境、以及每任務成本
先別急預算敏感、常吃長脈絡(會撞 272k 加價)、或主要看通用綜合能力的人,這代在中性榜上沒有前進

要對照 Claude 這邊目前的位置,可以看我寫的Claude Opus 5 實測評比。最後提醒一句:Astra 才發布幾天,第三方數據還在補,這篇的結論會隨新資料變動,別把任何一次快照當成定論。

資料查證於 2026-09-08。標為「官方公布」者為 OpenAI 自行發布的成績;獨立數據引自 Artificial Analysis 智慧綜合指數 4.1.1 版(2026-09-03)與其 Coding Agent Index。ARC-AGI-3 的 harness 差異與 ARC Prize 基金會說法引自公開報導。發布日期與推送範圍引自 CNBC、Al Jazeera 等媒體。模型仍在推出階段,數據與定價請以官方頁面最新版本為準。

標籤
#GPT-6 Astra#GPT-6 評測#AI 模型評比#Claude Fable 5.1#OpenAI#AI 寫程式#九黎月