Google與SpaceXAI接連端出新模型,目標都指向程式開發、知識工作與可連續執行多步驟任務的AI Agent。Google於8月13日發布Gemini 3.7 Flash,並形容是目前最聰明的工作型模型;SpaceXAI則在8月12日推出Grok 4.6,建立於Grok 4.5之上,聚焦長時間運作的Agent,以及更複雜的互動與視覺工作。
兩款模型採用不同評測方式,尚無法直接判定效能高下;Google與SpaceXAI公布的資料均聚焦程式開發、AI Agent與API價格。
Google將Gemini 3.7 Flash的優惠價格訂為每百萬輸入token 0.75美元、每百萬輸出token 3.75美元,優惠期到2026年底;而Grok 4.6在提示詞未達20萬token時,每百萬輸入token為2美元、輸出token為6美元;快速版本價格為兩倍。Google採取限時折扣,SpaceXAI維持既有價格並提高能力,兩家公司均將程式開發、知識工作與Agent工作流程列為主要應用場景。
Gemini 3.7 Flash以優惠價鎖定程式開發與Agent
Google表示,Gemini 3.7 Flash著重軟體工程、知識工作與網頁開發流程。相較Gemini 3.6 Flash,新模型在GDP.pdf(檢驗模型處理複雜文件的評測)的成績從22.0%提高至34.0%。
Gemini 3.7 Flash的優惠價為Gemini 3.6 Flash原始定價的一半,且同一優惠費率也適用於Gemini 3.6 Flash。較低單價可降低大量呼叫模型時的預算門檻。
Google於8月13日發布的Gemini 3.7 Flash(圖/翻攝自Google)Grok 4.6維持定價 強化長時間Agent任務
SpaceXAI表示,Grok 4.6將長時間運作的Agent列為升級核心,並強化互動與視覺工作能力。官方指出,Grok 4.6在多項Agent程式開發與知識工作評測中達到前沿水準,在相應推理設定下,Grok 4.6 High在Artificial Analysis Intelligence Index獲得61分,與GPT-5.6 Sol Max持平。這項指標整合九項評測結果。
Artificial Analysis的獨立分析指出,Grok 4.6比Grok 4.5在Intelligence Index提高5分。GDPval-AA v2取得1,753 Elo。Grok 4.6在GDPval-AA v2取得1,753 Elo,僅落後Claude Opus 5。Artificial Analysis表示,該成績與Claude Fable 5、Qwen3.8 Max的信賴區間重疊。
SpaceXAI將產品定位放在研究、規劃、程式碼修改與反覆驗證等多步驟任務。(圖/翻攝自SpaceXAI)模型比較納入任務成本與執行效率
兩款新模型的資料同時呈現價格、能力與部分工作流程表現,模型比較不再只看單一評測分數。Gemini 3.7 Flash採用限時優惠價;Grok 4.6則維持相較前代的定價。兩家業者公布的評測各自採用不同比較組合與執行設定,尚不能據此判定哪一款模型全面領先。
Google的優惠價格將在2026年底結束,Grok 4.6則需注意提示詞達20萬token以上的長上下文請求與快速版本的計費差異。Google與SpaceXAI的新模型發布,讓模型單價之外的任務效率與實際使用成本,成為開發者比較的重要條件。
评论 (0)