
網上梗圖上三條龍,ChatGPT 與 Claude 都是凶的,Gemini 是那條伸舌頭的傻龍。
9 月 30 日這條龍醒了:Google 發布 Gemini 4 Argon,Artificial Analysis 當天給 53 分,與 GPT-6 Astra 打平、只比 Opus 5.5 少 5 分,衝上全榜第 8。
憋了幾個月的 Google,一次把牌打回來。
跳級發布:Gemini 3.5 Pro 死了,Gemini 4 活了
這顆模型原本有個沒死成的前身:Google 先前承諾 6 月推出的 Gemini 3.5 Pro,因為表現不佳在內部數度延期,最終沒有發布,這才有了直接跳級的 Gemini 4 Argon。
戰績面,它在 18 項基準裡 13 項榜首或並列:DeepSWE v1.1 拿 77.9%,把 Claude Opus 5.5 的 74.2% 與 GPT-6 Astra 的 74.1% 甩在後面;Vals Index 68.9% 也高於 Astra 的 63.1% 與 Opus 5.5 的 67.0%;AutomationBench 51.3% 排第一,長影片理解 LVBench 91.7%。
工程上最實在的一條是輸出上限從 64K 拉到一百萬 token,一次跑完過去要切十幾段的長活。
誠實面也要寫:財訊快報點出它在 FrontierSWE v2 與 Terminal-Bench 4.0 上略遜 Astra 與 Opus 5.5,AA 的綜合分也停在 53、沒進前五。分數很亮眼,但不是屠榜。
安全的第二種用法
Argon 最特別的不是分數,是發布方式,而且它正好是同一週另一件事的對照組:OpenAI 的 GPT-6.1 Astra 因為測試中的欺騙與越權問題取消 10 月發布,安全第一次當掉了旗艦的商業化;Google 這邊,安全變成產品本身。
Argon 走 Fairwind 計畫分階段放行:第一階段只給受信任的網路安全防禦人員,公司同時參與美國政府的自願預發布存取流程,之後才輪到付費 API 與 AI Ultra 訂戶。更關鍵的是,對這些防禦者,Google 直接不帶網路安全護欄釋出,讓它拿出完整能力去自主發現、驗證、修補漏洞:子公司 Wiz 用它掃描醫院使用的醫療軟體,抓到一項前代前沿模型漏掉的嚴重個資風險;在衡量修補漏洞能力的 CWE-bench v1 上,它以 68% 與 GPT-6 Astra 並列第一。
同一週、同一道閘門,一邊用它擋下模型,一邊用它當發行策略:最危險的能力先給審過的人,其餘的人排隊。這比「安全 vs 進步」的口水戰務實得多。
牌價很甜,每題很貴
價格要分兩段看。推廣價輸入 2 美元、輸出 10 美元,快取再打 95% 折,正好與 OpenAI 上週剛發的 GPT-6.1 Sol 正式價一模一樣;但 Google 在腳註寫明推廣期結束後回到 4 美元與 20 美元,等於翻倍,到時候是 Sol 的兩倍。而且別忘了那把已知的尺:牌價相同不代表帳單相同。AA 測出來它每題成本 1.99 美元,是 6.1 Sol(0.72 美元)的 2.8 倍、MiMo Pro(0.13 美元)的 15 倍、GPT-6 Luna(0.07 美元)的 28 倍,只比 Astra(3.26 美元)便宜四成。原因寫在同一頁上:智商測試它吐了 110M token,比中位數多三成。
牌價對齊中階、開銷貼著旗艦,這就是上週 Sonnet 5.5 教的那件事的反面教材:比價要看 per-task,不是 per-token。
三條龍同週歸位
把這兩週排在一起,格局其實很清楚:OpenAI 把中階砍到五分之一並賣速度、Anthropic 牌價不動靠省 token 降每任務、Google 用跳級加資安特攻回歸前沿,連 DeepSeek 都在同一天開源了昇騰整包。傻龍不傻了,但它的帳單也沒有變便宜:53 分是入場券,1.99 美元的每題成本才是使用者最後會付的那個數字。分數決定它能不能上桌,per-task 決定誰會天天用它。
結論
Gemini 4 Argon(9/30 發布)AA 53 分平 Astra、榜第 8,DeepSWE 77.9% 與 Vals 68.9% 都是新高;前身 Gemini 3.5 Pro 因表現不佳未發布,這是一次跳級補位
發布方式是亮點:Fairwind 分階段先給資安防禦者、對他們不帶網路安全護欄,Wiz 掃出前代漏掉的醫療漏洞、CWE-bench v1 68% 與 Astra 並列第一;與同週 GPT-6.1 Astra 死在安全測試互為鏡像
推廣價 2/10 美元與 6.1 Sol 同價、期滿翻倍到 4/20;但每題 1.99 美元是 Luna 的 28 倍、囉唆多三成,比價口徑照舊:看 per-task,不看牌價
౨ৎ Anthony 不負責任編輯 ~
留言 (0)