Google 今(1)日發布最新部落格文章,宣布推出 Google 最新的前沿模型 Gemini 4 Argon。Gemini 4 Argon 在多項複雜工作流程中展現先進表現,涵蓋真實世界的軟體工程、法律與金融等企業知識工作,以及網路安全防禦。
重點如下:
程式開發:在專門評估「真實世界長期軟體工程任務」的 DeepSWE v1.1 測試中,Gemini 4 Argon 取得了 77.9% 的優異成績,創下業界最先進的紀錄。
知識型工作:Gemini 4 Argon 在 Vals Index 評測中穩居領先地位;該指標主要依據對美國 GDP 的貢獻度加權,衡量金融、程式開發、法律與稅務等專業工作的經濟影響力。
網路安全防禦:在衡量模型修補安全漏洞能力的 CWE-bench v1 測試中,Gemini 4 Argon 以 68% 的高分拿下並列第一。
Google 內部應用:數千名 Google 員工已在日常的專業程式開發與研究中使用 Gemini 4 Argon。它不僅協助將多個核心程式庫的 C/C++ 程式碼遷移至 Rust,還能自動找出並套用資料中心的記憶體最佳化方案,目前已釋放超過 300 TiB 的記憶體空間。
本文作者:Koray Kavukcuoglu,Google DeepMind 資深副總裁暨 Google 首席 AI 架構師
今天,我們正式宣布推出全新的前沿模型 Gemini 4 Argon,並透過我們的 Fairwind 計畫,率先開放給一批受信任的網路安全防禦專家。Argon 是專門打造來在複雜、長期的工作流程中維持深度的推理而,已經徹底改變我們在 Google 工作與開發的方式。它在實際軟體工程、如法律與金融等企業知識,以及網路安全防禦等複雜的工作流程中,都展現了先進且出色的效能。
要安全地釋出此等級的先進能力,必須採取分階段的策略。在逐步擴大使用範圍的同時,我們也主動配合美國政府的自願性計畫,在模型正式發布前,先開放權限供相關單位評估。在我們盡快將 Argon 提供給開發者、企業與消費者之前,我們將持續收集早期測試者的回饋,並不斷迭代,同時改善安全防護機制。
Argon 將以優惠價推出:每百萬輸入詞元(Token)為 2 美元,每百萬輸出詞元為 10 美元;快取輸入詞元的價格則比一般輸入詞元便宜 95%。
改變 Google 的工作與開發方式
Gemini 4 Argon 已經開始支援我們的內部工作流程,數千名 Google 員工表示 Argon 在專業程式編寫任務、執行深度研究以及寫作品質上都具有優勢。它已經協助各團隊加快開發速度、突破工程生產力的極限,並加速以下領域的突破:
量子演算法最佳化: 在複雜的量子運算中,某些特定程序往往會拖慢整體的執行速度。Argon 正協助我們的研究團隊突破這些「效能瓶頸」,大幅優化運算所需的時空資源(量子位元 × 邏輯閘)。在一個實際案例中,Argon 僅花了短短幾分鐘,就交出了比現有公開文獻還要好上 40% 的成績。
記憶體效率:一組 Argon 代理分析 Google 資料中心整體系統的效能分析數據,自主辨識並套用記憶體最佳化方案。全面部署後,已釋放超過 300 TiB 的記憶體,預估整體可節省約 500 TiB 至 1 PiB 的記憶體容量。
大規模程式碼庫遷移與最佳化: Argon 代理程式已經在把 Google 內部的 C/C++ 程式碼庫遷移至 Rust。規模從 re2、libgav1 等核心函式庫的數萬行,涵蓋至 Fuchsia Zircon 核心的 80 多萬行。考量到許多系統的關鍵性,這類大規模重寫在投入生產環境前,都會經過嚴格的自動與手動稽核、模擬測試及審查。
以 Google 的影片解碼開源軟體 libgav1 為例,Argon 代理程式接手了現成的 Rust 移植版本,並成功替換掉高達 3.2 萬行的 SIMD 程式碼。在此過程中,Argon 反覆進行效能測試、分析編譯器的輸出結果,最後自動寫出安全的 Rust 程式碼,讓編譯器能自動完成向量化處理。最終的成果是打造出一個具備記憶體安全優勢的影片解碼器。它不僅產出的影片與原本完全相同,執行速度更比原本的 Rust 版本快上 2.7 倍,效能表現已非常逼近經過高度最佳化的 C++ 版本。
為你解決最複雜的難題
為了讓 Gemini 4 Argon 能勝任更長、更複雜的使用情境,我們將模型的輸出詞元上限,從先前的 6.4 萬個詞元大幅擴增至業界領先的 100 萬個詞元。當模型有足夠的餘裕進行深度思考,並能在單次推演中生成數十萬個詞元時,就賦予了它全新層次的深度推理能力,使其能一次到位地解決各種棘手的難題。
運用前沿模型,推動跨領域程式編寫與企業工作流程
Gemini 4 Argon 在程式編寫、邏輯推理與多模態處理上展現了強大能力,並能穩定執行耗時且多步驟的任務,這讓它在應對各種企業工作流程時都能游刃有餘。
事實上,Google 工程師已將 Argon 應用於日常工作中,涵蓋一般除錯、大規模程式碼庫遷移,以及演算法設計。在專門評估「真實世界長期軟體工程任務」的 DeepSWE v1.1 基準測試中,Argon 以 77.9% 的優異得分,創下了業界最先進的新紀錄。
除了程式編寫,Argon 在處理專業知識領域同樣處於領先地位。在衡量金融、程式開發、法律與稅務等工作經濟影響力的 Vals 指數中,Argon 穩居榜首。我們在其他特定領域的評估也看到了同樣亮眼的表現,例如多步驟金融研究(Vals Finance Agent v2)以及法律研究與草擬(Harvey’s Legal Agent Benchmark)。此外,在 Zapier 測試企業核心業務「全端執行能力」的 AutomationBench 基準測試中,Argon 也以 51.3% 的高分名列第一。
當知識型工作需要視覺理解時,Argon 更展現了獨特的強大優勢。它能執行專業的圖表分析、辨識長影片中的關鍵細節,並根據一連串的文件內容採取行動。舉例來說,在專門測試長影片理解能力的 LVBench 評測中,Argon 以 91.7% 的高分,展現了業界最頂尖的水準。
引領防禦性網路安全
為了讓網路防禦專家能更好地應對網路攻擊的新紀元,我們將 Gemini 4 Argon 訓練為具備極高網路防禦能力的模型。Argon 能自主尋找、驗證並修補關鍵的軟體漏洞。針對受信任的防禦專家與 Google 的內部團隊,我們將發布未設網路安全防護限制的 Argon 版本,讓他們能充分發揮其先進等級的網路安全防禦能力。
Wiz 已經透過「Scan for Good」計畫將 Argon 用於網路安全防禦。這項計畫致力於透過尋找並修補高風險漏洞,免費保護關鍵公共基礎設施。在一次早期的影響力示範當中,Argon 發現了一個關鍵漏洞,會洩露全球醫院使用的醫療保健軟體中的敏感個人資訊,成功識別出先前其他先進模型未能發現的嚴重風險。
在評估模型修補安全漏洞能力的 CWE-bench v1 測試中,Argon 以 68% 的最高分並列第一,延續了 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表現。
Gemini 4 Argon 在漏洞識別能力上,相較於 3.8 Flash Cyber 展現出顯著提升:
在 Google 內部全方位的漏洞基準測試中,Argon 成功揭露了涵蓋 20 種程式語言、複雜程式碼庫中的廣泛安全風險。
在 Wiz 的內部黑箱滲透測試,用以評估模型在無原始碼狀況下分析即時網路系統能力的基準中,Argon 在攻擊面探測、漏洞識別以及產生驗證用的概念驗證(PoC)方面,表現均優於 3.8 Flash Cyber。
在廣泛推出前強化前沿安全防護機制
在把 Gemini 4 Argon 推送給更多人之前,我們將持續從四大面向強化關鍵的前沿安全防護機制:
防禦濫用行為:為了防止有心人士將 Argon 用於網路攻擊,或發動化學、生物、放射性與核能(CBRN)攻擊,我們遵循《先進安全框架》(Frontier Safety Framework),將模型設計為會主動拒絕有害請求,同時允許合法的軍民兩用科學研究。為了這次的發布,我們正進一步提升防護機制的韌性,包含改良監控模型內部運作狀態的技術,以便更精準地揪出濫用行為。這些防禦機制都已交由內部與外部的紅隊(Red teams),透過結合手動與自動化的攻擊手法,完成了嚴格的壓力測試。
防禦提示注入攻擊:針對利用惡意指令或上下文來挾持模型行為的「間接提示注入攻擊」,Argon 是我們目前防禦力最強的模型。這類攻擊非常複雜,需要我們時刻保持警戒並部署多層防禦。透過自動化的紅隊測試與對抗性訓練,Gemini 4 Argon 在 Gray Swan 的間接提示注入(IPI)基準測試中,展現了領先業界的強大防禦力。
監控未對齊(Misalignment)行為:為了防止 Argon 在執行任務時越界或偏離使用者的原本意圖,我們部署了專屬的緩解機制,隨時監控 Argon 的思維鏈(chain-of-thought)與行動,並在必要時直接中止其執行。我們也運用類似的系統來監控訓練過程,一旦發生異狀就會向專屬的事件應變團隊發出警報。同時,我們非常謹慎地避免將這些監控結果直接回饋到訓練中,以免 Argon 學會改變推理方式來「規避」我們的監控。隨著模型能力大幅躍進,我們也面臨著對齊風險的關鍵挑戰。我們強烈呼籲整個業界應保持模型推理的透明度,讓模型的「思考過程」能持續幫助我們找出並修正未對齊的行為。
系統強化:隨著前沿模型的能力日益強大,我們需要同樣與時俱進的安全環境,才能進行安全的測試。配合我們的 AI 代理控制藍圖,我們正進一步強化沙盒環境的安全性:在展開高風險的訓練或評估前,我們就會先將沙盒環境隔離並徹底封鎖。我們承諾會與合作夥伴分享這些代理程式安全性的最佳實務,共同提升整個生態系的安全防護標準。
即將推出
我們賦予了 Gemini 4 Argon 在程式開發、知識型工作、網路安全防禦以及創意寫作上的先進能力,期盼能成為開發者、專業人士與企業在解決最棘手難題時的得力夥伴。我們非常感謝首批網路防禦專家與受信任的測試人員,他們在真實環境下的評估與回饋,將幫助我們在正式向開發者、企業與廣大消費者發布之前,進一步強化我們的系統。Gemini 4 Argon 將率先開放給付費 API 客戶與 Google AI Ultra 訂閱者使用。
更多三立新聞網報導
. Sony 80週年經典產品再現?限量復刻小物登場 這樣就入手
. 行動電源不是故障才換!PHILIPS首創365保值換新計畫
. 全球市佔突破20%!HUAWEI推WATCH GT 7系列
. HONOR首款旗艦摺疊Magic V6售價出爐!購機好禮近6萬元