AI 模型熱門

Gemini 4 Argon 登場:Google 新旗艦模型一次看懂

Google 端出新一代旗艦模型 Gemini 4 Argon,帳面數據確實有明顯躍進。但幾乎沒有人現在就能用,而且獨立評測的分數比官方部落格保守得多。

陳柏宇陳柏宇
熱度:1,250
Gemini 4 Argon 登場:Google 新旗艦模型一次看懂

Google 端出新一代旗艦模型 Gemini 4 Argon,帳面數據確實有明顯躍進。但幾乎沒有人現在就能用,而且獨立評測的分數比官方部落格保守得多。

Google 端出的 Gemini 4 Argon 是什麼

9 月 30 日,Google 正式揭曉 Gemini 4 Argon。它是 Gemini 4 系列的第一款模型,也是 Google 自 2 月 Gemini 3.1 Pro 之後,首度真正意義上的旗艦。官方部落格把它稱為「下一個前沿智慧時代」,主打的工作都是耗時又瑣碎的類型:軟體工程、法律與財務研究、內容寫作,以及資安防禦。

它是一款推理模型,意思是它會先把問題一步步想過再回答,而不是脫口而出。Google 說它能記住一百萬個詞元的上下文,單次回應也能寫到一百萬個詞元。相較之下,早期的 Gemini 模型輸出上限大約只有 6.4 萬個詞元。

這個輸出上限的差別,用過 AI 寫長文件的人最有感。請它草擬一份長報告,卻在中途突然停住,這種事比多數人想像的還常發生。一百萬詞元的天花板,比較像一條很長的跑道,而不是一道隨時會撞上的牆。

命名方式也換了。過去的 Gemini 用 Pro 和 Flash 區分版本,Argon 這種代號式的名字,反而更接近 OpenAI 替自家模型取名的做法。至於 Gemini 4 家族其他成員叫什麼、什麼時候報到,Google 還沒說。

現在誰能用 Gemini 4 Argon

對大多數人來說,這裡有個不太痛快的事實:你用不到。

Argon 上線時,只先開放給一群經過審核的資安防禦人員,管道是 Google 的 Fairwind 計劃。背後的盤算是,先讓一款特別擅長揪出軟體漏洞的模型,落到負責修補漏洞的人手上,再考慮全面釋出。Google 也說,正在跟美國政府進行發布前的安全評估。

接下來排隊的是付費 API 客戶和 Google AI Ultra 訂閱者,但兩個都沒有確切日期。目前也還沒有公開的 API 模型 ID,代表你連自己的程式都無法指向它。

如果你是一般 Gemini 使用者,結論很單純:今天什麼都不會變。Argon 是一場針對少數資安族群的預覽,不是給所有人的更新。

在 Google 內部,Argon 已經開始做粗活

Google 不只拿它跑基準測試,還直接讓它進公司內部幹活,而這些例子是整場發表會裡最具體的部分。

在自家的資料中心,Argon 被派去找出釋放記憶體的方法。Google 說,這個模型找到的最佳化做法,讓公司在沒有添購任何新硬體的情況下,多擠出數百 TB 的記憶體。量子運算的研究人員也拿它來處理自己的題目。

釋放記憶體聽起來不炫,但這正是模型有沒有用的試金石:要嘛幫上忙,要嘛只是浪費大家時間。數百 TB 的記憶體被回收,是可以量測的成果,不是一場示範秀。

Google 自選的 Gemini 4 Argon 基準成績

Google 自家的數字很漂亮。公司說,Argon 在一項貼近真實的軟體工程基準中刷新紀錄,在資安項目並列第一,並在另一項橫跨金融、法律與其他專業任務的測試裡領先。

在 Google 跑過的 18 項基準中,Argon 有 12 項居冠、1 項並列。這是實打實的成績,也和「這是一款認真的前沿模型、而非過渡產品」的說法吻合。

但要記得資料是誰給的。這些基準是 Google 挑的,也是 Google 自己跑的。在自家計分板上拿到的領先與並列,是起點,不是定論。

為什麼獨立評測給出不同版本的故事

故事在這裡變得模糊,也是值得放慢腳步細看的一段。

獨立評測機構 Artificial Analysis 會把各家模型放在一起對打。它給 Gemini 4 Argon 的智慧指數打了 53 分,早期部分評測則落在 52.6。這比 Gemini 3.1 Pro 的 30 分是明顯進步,但仍落後 Claude Opus 5.5 的 57.6,大致與 GPT-6 Astra、Claude Fable 5.1 打平。

在個別測試上,這種分歧繼續存在。Argon 在一項要求很高的程式基準 DeepSWE v1.1 拿下 77.9%,也登上 Vals 指數榜首。但 Claude Opus 5.5 在測試命令列操作的 Terminal-Bench 4.0 上以 66.4% 勝過 Argon 的 57.4%,GPT-6 Astra 則在 FrontierSWE v2 以 65.5% 領先 Argon 的 55.0%。

有一項獨立發現對 Argon 有利:Artificial Analysis 測得它的幻覺率是同級模型裡最低的。對曾被 AI 一本正經胡說八道坑過的人來說,這可能是這裡最實用的一個數字。

Gemini 4 Argon 領先之處

  • DeepSWE v1.1 拿下 77.9%,是高難度程式基準
  • Vals 指數與 LMArena 文字競技場雙雙第一
  • 幻覺率為 Artificial Analysis 測過的最低
  • Google 自家計分板 18 項中領先 12 項

Gemini 4 Argon 落後之處

  • Artificial Analysis 智慧指數 53,低於 Claude Opus 5.5 的 57.6
  • Terminal-Bench 4.0:57.4%,輸給 Opus 5.5 的 66.4%
  • FrontierSWE v2:55.0%,輸給 GPT-6 Astra 的 65.5%
  • 彭博報導 Google 內部對實際寫程式能力存疑

彭博報導,部分 Google 員工認為 Argon 在真正的寫程式工作上其實吃力,與基準數字對不上。這屬於未經證實的內部看法,但對照一份只挑勝場來講的發表文,是很有用的平衡。廠商的讚美與外部的結果不必一致,而在這裡,它們確實不一致。

Gemini 4 Argon 的價格怎麼算

Google 以優惠價推出 Argon:每百萬輸入詞元 2 美元、每百萬輸出詞元 10 美元,快取輸入則是每百萬 0.1 美元。

等於打了對折。標準價是 4 美元與 20 美元,與 Claude Opus 5.5 對齊。Google 沒說優惠到什麼時候結束,所以這個便宜價是一段上市窗口,不是長期定價。

對在 API 上開發的人來說,這件事有份量。今天用便宜價測試的模型,明天可能成本翻倍,而且不會有太多預警。編預算時請以標準價為準,把折扣當成限時的好康。

Gemini 4 Argon 與更大的一場競賽

這場發表,就在執行長 Sundar Pichai 於白宮與其他科技領袖一同簽署自願性 AI 安全協議的隔天。Google 說,希望在正式發布前,先就資安的四個面向擴大防護機制,包括濫用與提示注入。

Argon 的登場方式本身就有一種矛盾。它是 Google 想奪回前沿地位的出手,卻先交給一小群資安人員,也沒有公開時程。對於一家曾經把模型一次開放給所有人的公司來說,這次的姿態相當謹慎。

那讀者真正該帶走什麼?如果你是開發者,Argon 值得追蹤,因為價格和上下文視窗確實有競爭力,而且開放存取終究會來。如果你是一般使用者,這一週什麼都不會變。如果你在追基準大戰,請把兩張計分板分開看:Google 自家的 18 項領先 12 項,以及把 Opus 5.5 排在更前面的獨立指數。兩者同時為真。

分享這則新聞

來源

相關 AI 新聞

寫程式的 LLM 怎麼選:四種開發情境的實測建議
評測

寫程式的 LLM 怎麼選:四種開發情境的實測建議

寫程式的模型評比光看總分沒用。這篇依日常小功能、真實專案重構、長時間代理、預算敏感四種開發情境,分別給出模型建議,並說明背後依據與社群實測的心得。

熱度:1,250
2026 年最強 AI 模型盤點:前沿陣營的六款代表
AI 模型

2026 年最強 AI 模型盤點:前沿陣營的六款代表

2026 年的前沿模型市場已從一超多強變成多強並立。這篇盤點 Claude、GPT-6、Gemini、Grok 與開源陣營的代表模型,說清各自的主場與適用場景,也提醒你分數背後的三大陷阱。

熱度:1,300
Claude 與 Grok 與 Gemini 用在校園該選哪一款?價格、文獻與時效的取捨
比較

Claude 與 Grok 與 Gemini 用在校園該選哪一款?價格、文獻與時效的取捨

Claude、Grok 與 Gemini 用在校園,判斷標準跟專業場景完全不同。本文比較三者的學生方案、長文件處理、文獻整合與寫作表現,並提醒引用與學術誠信的分寸。

熱度:1,090
Grok、ChatGPT 與 Gemini 該選哪一款?新鮮度、廣度與整合的取捨
比較

Grok、ChatGPT 與 Gemini 該選哪一款?新鮮度、廣度與整合的取捨

Grok、ChatGPT 與 Gemini 的評測差距已縮到極窄,選擇的關鍵變成貼合度而非純實力。本文比較即時搜尋、功能廣度、Google 整合與三種不同價格,幫你挑出對上日常的那一款。

熱度:1,180