Vanilla Lab

← 回文章列表

Astra 很強,但先別急著相信「AGI 時代」

2026-09-07

一場發表會,兩種解讀

OpenAI 發布 GPT-6 Astra,總裁 Brockman 說「歡迎來到 AGI 時代」。上線兩天,社群刷屏的是 3D 建模、粒子網頁、互動 demo,配文都是「代差」、「完勝前代」。

這些 demo 確實漂亮。但漂亮和 AGI 之間,隔著幾個需要說清楚的事實。這篇文章不唱衰 Astra——它真的有進步——只是把宣傳和實際,分開來看。

事實一:跑分第一的背面

Astra 的官方數字確實亮:ARC-AGI-3 拿 99.9%(前代 7.8%)、FrontierMath 97.6%。

但兩個細節值得知道。ARC-AGI-3 的 99.9% 是 OpenAI 自家工具環境跑出來的,官方註腳承認調整過設定;獨立評測機構 Artificial Analysis 用自己的綜合指數給 Astra 55 分——全站第二,輸給 Anthropic 的 Fable 5.1 兩分。
另外在 Humanity's Last Exam 這個測試上,Astra 拿 57.2%,低於前代 Sol 的 65.0%。

不是說 Astra 不強。是說「第一」和「最強」之間,還有別家。

事實二:粒子網頁的代差,來自哪裡

社群實測「同一個提示詞,Astra 和前代 Sol 各生成一個粒子網頁」,Astra 版確實更好:真 WebGL 著色器、101 行輕量代碼、完整的無障礙標籤和載入失敗提示,連文案都是自創的而非照抄需求。

但把代碼拆開看,這個「品味」有跡可循:拋開框架殼、原生 WebGL、分層渲染、減少動態效果的系統設定支援——這些全是前端開發社群近幾年整理出來的成熟設計守則。

換句話說,這個代差比較像是「把設計準則寫進了訓練」,而不是模型突然長出了設計靈魂。好消息是這代表能力提升是真的;另一個好消息是——這類準則是公開知識,其他實驗室補上這層只是時間問題。事實上,獨立開發者早就在做一模一樣的事:把自己的設計偏好寫成規則集,餵給開源模型,產出同樣水準的作品。差別只在 OpenAI 把它做成了產品然後收費。

事實三:3D 建模強,跟 AGI 沒有關係

AGI 的定義是通用、自主、可靠的跨領域智力。3D 建模是單一垂直領域的生成能力——再漂亮也是工具,不是通用智力。

宣傳的技巧在於把兩者放在同一句話裡:3D demo 配「AGI 時代」,觀眾自然划上等號。但檢驗通用智力的考試上,Astra 自己的成績就有起伏。真正接近這個目標的信號反而低調得多——OpenAI 自己公告內部 agent 每貢獻 3.1 個工作日就伴隨人類 1 個工作日的監督,而且超過一半的長任務需要人工介入。這是「好用的助理」,離「自動研究員」還有距離,OpenAI 自己也寫了「我們還不知道如何安全地走到完整自動化研究」。

事實四:額度是體感,定價是本質

上線兩天,最多用戶回饋的不是能力,是「額度一下就用光」。有實測指出 Codex 中 Astra 的實際消耗是 API 牌價的 1.4-1.6 倍——因為它是重推理模型,每個回答背後有大量思考 token,全部按輸出計費(每百萬 $50)。

這不影響「Astra 強」的結論,但影響「AGI 普及」的敘事:連 OpenAI 內部自己的研究員,一個月的 agent 推理費都是數十萬台幣起跳。強,和人人用得起,目前還是兩件事。

事實五:估值需要故事,帳單不需要

就在最近,Anthropic 的估值($9,650 億)超過了 OpenAI($8,520 億),而 AI 模型的獨立評測榜第一名正是 Anthropic 的產品。模型榜位次和資本定價的關聯,比以往任何時候都直接。

在這個背景下,每次「體感級」的病毒傳播——3D demo、粒子網頁、完勝截圖——對 OpenAI 十月 IPO 的敘事都有實際價值。這不是說 demo 是假的(它們是真的),而是說傳播的動機值得納入閱讀:你看到的熱度,同時也是財報故事的一部分。

平民的算法

最後給一個對照,不帶立場,只有帳單:

  • 同樣的 agent 工作負載(多任務並行、每日數億 token),用 DeepSeek V4 Flash 這類開源模型,實測月費約 NT$3,500-10,000(高重複性任務吃到快取折讓可更低)

  • 同等工作量若按 Astra 牌價計算,月費以百萬台幣計

智商差距 20-28%,價格差距兩個數量級。對多數開發者的日常任務,這道算術比「AGI 時代」的標題更貼近現實。

結論

  • Astra 是真的進步:前端生成的設計品味、長任務的可靠性都有實質提升,獨立榜單全站第二

  • 「AGI 時代」是行銷框架:3D demo 屬於單點能力,通用智力考試上它有輸前代的項目,OpenAI 自己也承認距離完整自動化還遠

  • 體感與帳單要分開看:額度消耗是牌價結構的體感版;同等工作負載,開源模型的成本是旗艦的數百分之一——工具選擇取決於任務價值,而不是發表會的音量

Astra 值得尊重,也值得付費 —— 在你真的需要它的那一刻。
至於AGI 時代嘛
讓子彈再飛一會 ...

౨ৎ Anthony 不負責任編輯 ~

留言 (0)