mirrormedia
時事

CP值為王!巨頭搶推最省錢AI

發佈時間2026.09.06 02:10 臺北時間

更新時間2026.09.06 05:00 臺北時間

隨著AI進入代理時代,科技巨頭競爭焦點從模型能力轉向成本效率。Google推出Gemini 3.8 Flash,以高CP值搶攻軟體工程代理任務;Meta隨即發布Muse Spark 1.3,透過優化推理鏈與減少工具呼叫次數提升效率;新創Mostik則嘗試讓AI模型以數學語言直接溝通,省去自然語言轉換成本。這些技術突破皆指向「智能單位成本」的快速下探。若AI推理成本能進一步降低,將促使代理經濟從實驗室走向主流應用,讓原本不具經濟效益的複雜自動化任務,成為未來企業導入AI的關鍵商業契機。

 

AMP不支援此功能,請 點擊連結觀看完整內容
科技巨頭掀起 AI 代理高性價比大戰,Google、Meta 與新創 Mostik 各展奇招搶攻最省錢模型寶座。(示意圖/PIXABAY)

 

 

隨著AI進入代理時代,科技巨頭之間的競爭也從「誰家模型能力最強」,變為「誰家模型最省錢」。Google於週四(3日)凌晨推出Gemini 3.8 Flash,號稱是最強的推理與寫程式模型,並延續前代的優惠價格;但才過幾個小時,就遭到Meta的Muse Spark 1.3以更高的編碼測試成績打臉。同時,AI新創Mostik另闢蹊徑,讓不同模型直接用「自己的語言」溝通,省去了轉換成「自然語言」的Token成本。

短短6週之內,Google從Gemini 3.6 Flash到3.7 Flash,再到3.8 Flash,每一個都比上一代更小、速度更小,但價格更低,定位也從單純比拚速度與價格,轉向支援長時間軟體工程與多步驟推理的代理(Agent)任務。

在講求真實任務表現的「DeepSWE v1.1」測試中,Gemini 3.8 Flash拿下約74%成績,一度登上排行榜首位;這項測試要求AI代理直接進入真實程式碼庫理解問題、搜尋修改檔案並執行測試,往往需要數十甚至上百個步驟才能完成。其API價格維持每100萬輸入Token 0.75美元(約新台幣23元)、輸出3.75美元(約新台幣118元),官方將此列為限時優惠,至少維持到2026年底。

以DeepSWE測試估算,Gemini 3.8 Flash完成單一任務平均成本約2.36美元(約74元新台幣),遠低於Anthropic「Claude Opus 5」(74%能力)的11.84美元(約新台幣373元),以及OpenAI「GPT-5.6 Sol」(73%)的6.46美元(約新台幣203元)。能力相近之下,完成同一項軟體工程任務,成本竟可能出現數倍差距,一旦代理連續執行上百步驟,差距只會被快速放大。

 

AMP不支援此功能,請 點擊連結觀看完整內容
Gemini 3.8 Flash以74%高分勇奪DeepSWE榜首,軟體工程任務成本遠低於競爭對手,展現極高CP值。(圖/翻攝自Google官網)

 

Google發表新模型沒過多久,Meta Platforms(META-US)隨即推出「Muse Spark 1.3」,在DeepSWE v1.1拿下75.4%,超越Claude Opus 5的74.0%與GPT-5.6 Sol的72.7%;相較上一代Muse Spark 1.2的59.3%,單次更新就拉高約16個百分點。不過真正關鍵在於效率:Meta表示,新模型完成代理任務時,工具呼叫次數減少約20%,Token消耗降低約25%。

Meta透露,Muse Spark 1.3強化了辨識模糊任務、主動詢問、卡關時求助等能力,避免模型在錯誤方向上一路走到底、白白耗費運算資源。訓練上也導入「thought compression」概念,對過度冗長的推理鏈施加懲罰,讓模型逐漸學會用更精簡步驟完成同樣任務。

不過,Muse Spark 1.3部分成績屬於Meta在自家Muse Code環境下公布的數據,尚未經第三方排行榜完整驗證,企業實際導入前仍需以自身工作負載重新測試,數字僅供參考。

 

AMP不支援此功能,請 點擊連結觀看完整內容
Meta推出 Muse Spark 1.3,以 75.4% 的 DeepSWE 表現登頂,主打步驟精簡與省 Token 高效率。(圖/翻攝自Meta官網)

 

如果Google與Meta都在研究如何用更少Token完成任務,AI新創「Mostik」的方向更為激進:讓不同模型直接交換內部數學表示,跳過轉譯成自然語言的步驟。《WIRED》報導,Mostik由執行長Sasha Malysheva領軍,首席科學家則是日內瓦大學教授、2010年菲爾茲獎得主Stanislav Smirnov。

團隊嘗試在模型之間搭建一座「橋樑」,讓彼此直接傳遞latent representation,而非先產生大量文字再讓另一個模型重新理解。實驗中,Mostik將參數規模達7530億的「GLM-5.2」與僅40億參數、可在手機執行的「Qwen 3.5」橋接,混合系統能力落在兩者之間,推理成本卻僅為完整GLM-5.2的約1/20。

Smirnov坦言,學界目前甚至還缺乏足夠成熟的數學語言,去描述不同模型間可能共享的內部表示,這項實驗結果雖然亮眼,距離大規模商用仍有相當距離。

 

AMP不支援此功能,請 點擊連結觀看完整內容
AI 新創 Mostik 研發模型橋接技術,跳過自然語言直接傳遞內部數據,大幅砍下推理成本。(圖/翻攝自Mostik官網)

 

《鉅亨網》分析,Google、Meta與Mostik看似走在不同路線,實則共同指向同一個方向:AI的「智能單位成本」正快速下探。Google壓低高階模型的價格,Meta減少完成任務所需的運算量,Mostik則試圖從根本上省去模型間溝通所耗費的Token。

這項變化對代理商業化格外重要。當一項任務仍需花費數十美元,許多應用便缺乏經濟效益;但若成本降至幾毛美元,原本不划算的服務可能一夜翻身。同樣邏輯也適用於多Agent系統,現階段企業難以讓數十個AI代理全天候圍繞單一使用者運作,成本正是主要障礙,一旦推理費用再下探一至兩個數量級,這種架構就可能從實驗室走向主流產品。

三立新聞網提醒您:

內容僅供參考,投資人於決策時應審慎評估風險,並就投資結果自行負責。
投資一定有風險,基金投資有賺有賠,申購前應詳閱公開說明書。

更多三立新聞網報導
省了一輩子存6000萬!老翁因「1心態」遭兒絕交 晚年心酸結局曝光
員工勝訴!Meta考績不看AI用量
宣判AI死刑?美參議員提案「封殺超級AI」 違反恐關20年、勒令停業
Fed鷹派大將轉鴿!9月升息與否看「他」關鍵一票?

你可能也喜歡這些文章