跳至主要內容
CITY DESK
科技 設計評論

那個 4.2% 先被改成了 2%:GPT-6 Astra 的基準分數,是一頁可以編輯的介面

從 GPT-6 Astra 發布頁上幻覺率 4.2% 降到 2% 又回滾的快照軌跡看起,觀察一份 AI 基準分數如何在版面、數字與時間差之間被設計成可編輯的信任介面。

SHAO MEDIA 新聞中心 閱讀約 6 分鐘

這件事發生在 2026 年 9 月 3 日,一篇被 Fortune 重新翻出來追蹤的舊帳。回頭看它,重點已經不在 OpenAI 那天遲到了兩小時的發布頁面,而在頁面上一組數字在三個小時內的往返軌跡。

先從最小的細節看起:一個百分比。

美東時間 9 月 3 日下午 2 點 23 分,Wayback Machine 抓下了 GPT-6 Astra 公告部落格的首版快照。在那個版本裡,Astra 的幻覺率寫著 4.2%,自家前一代的 GPT-5.6 Sol 是 12.2%,對手 Anthropic Fable 5.1 的數學分是 87.8%。到下午 5 點 20 分的第六份快照,Astra 的幻覺率變成 2%,GPT-5.6 Sol 降到 9.4%,Fable 5.1 的數學分跌到 78%。接下來幾天,這些數字又一個個回到首版的原值。

同一個網址,同一片版面,數字來回走了三趟。

數字在版面上的三種表情

一張 AI 發布頁的基準表格,視覺語言其實相當固定:模型名稱靠左,一列百分比靠右,自家的模型用較粗的字重或品牌色標出,競品排在下方以較淡的灰呈現。讀者的眼睛被訓練到不需要讀表格標題,掃過去就知道誰贏了。這種排版之所以成立,前提是數字是死的,一旦印上去就動不了。

9 月 3 日那天,這個前提失效了。

幻覺率從 4.2% 到 2%,在版面上的視覺效果完全不同。4.2% 和 12.2% 並排,差距是三倍,讀者的印象是「新模型明顯比較不會胡說」。降到 2% 之後,差距變成六倍,同一片表格瞬間從「有進步」變成「世代跨越」。數學分那邊也一樣,Fable 5.1 從 87.8% 跌到 78%,落後幅度在視覺上被拉開了一個量級。表格的結構一個字都沒改,改的只是儲存格裡的數值,整頁的敘事力道就換了一檔。

更值得看的是 ARC-AGI-3 那一格。發布前的草稿寫 98.6%,最終頁面是 99.99%。這 1.39 個百分點的差距,在一般評測裡接近雜訊,但在 98% 以上的區間,它把成績從「頂尖」推到了「近乎滿分」,兩者在讀者心裡是完全不同的東西。99.99% 這個寫法本身也值得琢磨,四個 9 加一個 9,在版面上自帶一種機房等級的潔癖感,跟 98.6% 那種還留有餘裕的數字,氣質截然不同。

回滾,比修改更耐人尋味

如果只有單向的修改,這就是一則常見的「廠商潤飾數據」故事。但快照鏈顯示的軌跡更複雜:數字改過之後,又被改了回去。

幻覺率回到 4.2%,Fable 5.1 的數學分回到 83%(不是最初的 87.8%),GPT-5.6 Sol 的數學分走完 83% 到 80.5% 再回到 83% 的全程。內部網路安全評測 ExploitBench 裡,GPT-5.6 Sol 的成績也從 5.5% 被大幅上調,只是後續值沒有完整留在公開快照裡。

雙向波動意味著,這不是一次簡單的「往好裡改」。它更像一份還在編輯中的文件,有人在下午的某個時點決定換一組數據,又在之後的某個時點決定換回來或換到第三個版本。讀者最終看到的那一頁,只是這條編輯歷史的最後一格。

OpenAI 對 Fortune 的回應是,這些修改反映模型版本、推理級別、工具配置與測試運行條件的差異,「是技術細節的調整,而非數據的隨意篡改」。這句話在技術上站得住。幻覺率確實對溫度參數和重採樣策略敏感,數學分跟思維鏈的開啟與推理深度有關。同一個模型換一套配置,跑出不同的分數,這在工程上是日常。

問題出在版面的時間性。業界慣例是發布時固定配置並聲明參數,修改就重新標版本號,讓每一次變動都留下可指認的節點。GPT-6 Astra 的頁面沒有這一層。分數漂移發生在同一個網址、同一片表格裡,沒有版本號,沒有更新說明,唯一的變動紀錄存在 Wayback Machine 的快照序列裡。對一般讀者來說,那頁面在 9 月 3 日下午和 9 月 10 日看起來是同一份文件,只有事後比對快照的人知道它動過。

這跟其他被反覆編輯的公共資訊頁面有相似的結構。先前我們觀察過武漢大學那則姍姍來遲的通報,官方回應的信任感往往在時間差與措辭變動之間被磨掉。基準分數的處境一樣:介面上看不出編輯痕跡,但編輯痕跡存在於第三方快照裡,於是「有沒有被改過」本身變成了另一個需要考證的題目。

榜單這種介面,靠什麼成立

基準測試本質上是一種設計出來的閱讀介面。它把一個模型的複雜能力壓縮成幾個百分比,配上固定的榜面格式,讓不具備評測能力的讀者也能在十秒內形成判斷。這種壓縮的兌換率,靠的是「分數不可編輯」這條默契。

數字一旦可以被靜默修改,受害的並非只有 OpenAI 一家的信譽。讀者下次看任何一家的發布頁,都會多一分遲疑:這個 2% 是測出來的,還是改成 2% 的?這跟我們在日經 225 那組下跌數字的排版觀察裡談過的邏輯相通,數字在版面上的權威感來自它的固定性與可追溯性,小數位、字級、更新時間戳,每一項都是信任的承重牆。

這也是為什麼這次事件裡最關鍵的行為者,反而是 Wayback Machine。快照鏈把一次靜默編輯變成了可閱讀的歷史,讓「頁面曾經長什麼樣」成為公共財。沒有那個下午每隔幾分鐘一次的自動抓取,4.2% 到 2% 的往返就不存在於任何紀錄裡,只剩一羣人的印象之爭。

從這個角度看,未來的基準頁面設計大概會長出一些新的元件:配置參數的聲明欄、分數旁的版本標記、頁面更新的時間戳與 changelog。這些東西在軟體發布頁早就標配,在 AI 評測頁卻長期缺席,因為過去大家默認分數是定稿。9 月 3 日之後,這個默認不再免費。

收在一個具體的判斷上

GPT-6 Astra 那天真正發布的,或許不是模型,而是一個被看穿的排版事實:基準分數和任何網頁文字一樣,是可以被編輯的物件。

OpenAI 的技術解釋沒有錯,配置不同,分數本來就會動。但一個成熟的介面設計,責任正是把這種變動顯性化,讓讀者知道眼前這個數字是在什麼條件下、於什麼時間點被寫下的。把編輯藏在同一片版面之下,再合理的技術原因都會在快照比對那一刻失去說服力。榜單的權威從來建立在分數的不可動搖上,而這件事提醒所有人:不可動搖是需要被設計出來的,不能只是被假設。

#openai基準測試與數據設計#gpt-6astra資訊視覺化#ai榜單排版與信任機制