2026.09.07 02:10 臺北時間

OpenAI最強模型!Astra這項目狂拿99.9%

mm-logo
時事
OpenAI最強模型!Astra這項目狂拿99.9%

 

OpenAI於4日推出最強模型GPT-6 Astra,其在ARC-AGI-3測試奪99.9%高分,海放對手。(圖/翻攝自OpenAI官網)
OpenAI於4日推出最強模型GPT-6 Astra,其在ARC-AGI-3測試奪99.9%高分,海放對手。(圖/翻攝自OpenAI官網)

 

 

OpenAI於9月4日正式推出新一代旗艦模型「GPT-6 Astra」,官方稱其為目前最聰明、最一致的模型,總裁布羅克曼(Greg Brockman)更形容這是一次「世代級跨越」,暗示AI技術正式跨入AGI門檻。其中最受矚目的,是衡量AI應對陌生任務能力的「ARC-AGI-3」測試,Astra一舉衝上99.9%的高分,相較GPT-5.6 Sol僅個位數的表現,落差相當懸殊。

OpenAI後於9月5日表示,Astra現已開放給ChatGPT Work與Codex的Pro、Enterprise、Business Premium用戶,API也同步上線,Plus與一般Business用戶則預計在數天內跟進。開發者可透過API或亞馬遜雲端服務(AWS)呼叫Astra,標準定價為每百萬輸入token 10美元、輸出50美元,換算約新台幣320元與1,600元,若切換到處理速度更快的Fast模式,價格則直接翻倍。

Astra最大亮點在於電腦操作能力,不需透過API或MCP,就能直接看懂螢幕畫面、找按鈕、打字,處理Excel、Power BI甚至電路板設計等工作,OSWorld測試任務完成率達72.6%,優於前代GPT-5.6 Sol的65.7%。資安能力同樣大幅提升,在ExploitBench拿下滿分100%,並在測試中挖出兩項先前未知的零時差漏洞,已觸及OpenAI「準備框架」中的資安關鍵風險門檻,因此進階漏洞驗證功能暫時只開放給受核准的資安人員。

官方公布的成績單相當亮眼:測試困難數學推理能力的FrontierMath Tier 4,Astra拿下97.6%,優於Claude Fable 5.1的78.0%與GPT-5.6 Sol的80.5%;測試多步驟商業流程自動化能力的AutomationBench,Astra也以41.4%的完成率創下新高,遠優於Fable 5.1的31.4%與GPT-5.6 Sol的18.1%。OpenAI官方更表示,在測試AI代理應對陌生互動任務學習能力的ARC-AGI-3項目當中,Astra拿下99.9%的高分,不只遠勝過GPT-5.6 Sol的7.8%與Anthropic Claude Opus 5的30%,形同不同世代的產品,還遠優於人類的48%平均分。

不過獨立評測機構ARC Prize發現,這個成績是在rovider Adapter特殊測試環境下測出來的,允許模型跨請求保留隱藏推理狀態;換成一般標準環境,分數會直接腰斬到62.7%。同時ARC Prize坦言,這是把基準測試刷到飽和,不足以證明AGI。另一家機構Artificial Analysis給出的智力指數同樣保守,僅61分,跟前代GPT-5.6 Sol打平,還落後Claude Fable 5.1與Muse Spark 1.3各5分。分析認為,Astra真正站得住腳的進步在於效率:完成同樣的寫程式任務,token用量只要GPT-5.6 Sol的三分之一,幻覺率也從92%降至51%。

三立新聞網提醒您:

內容僅供參考,投資人於決策時應審慎評估風險,並就投資結果自行負責。
投資一定有風險,基金投資有賺有賠,申購前應詳閱公開說明書。

更多三立新聞網報導
男大生看女友每日做1事 崩潰直呼形象崩壞!眾人傻眼:你適合單身
AI失控網攻內幕曝!自行發展「三代文明」 甚至攻入OpenAI?
性價比為王!Google、Meta、Mostik拚誰家AI代理「最省錢」
省了一輩子存6000萬!老翁因「1心態」遭兒絕交 晚年心酸結局曝光

點按看下一則延伸閱讀文章
更新時間|2026.09.07 04:00 臺北時間
延伸閱讀

更多內容,歡迎 鏡週刊紙本雜誌鏡週刊動態雜誌了解內容授權資訊

獨家深度分析報導

線上閱讀

更多內容,歡迎 鏡週刊紙本雜誌鏡週刊動態雜誌了解內容授權資訊

獨家深度分析報導

線上閱讀