SpaceXAI 推出 Grok 4.6:性能達標並與 GPT-5.6 Sol Max 並列全球第三

Elon Musk 旗下的人工智能公司 SpaceX AI 近日發布了新一代前沿模型 Grok 4.6,該模型主要針對長時間運行的智能體、編程及知識工作場景,並採用了更具競爭力的定價策略,以降低這些工作負載的運行成本。在第三方評測機構 Artificial Analysis 的智能指數中,Grok 4.6 得分 61,超越了開源模型 Kimi K3,並與 OpenAIGPT-5.6 Sol Max 持平,相較上一代 Grok 4.5 提升了 5 分。

目前榜單前兩名分別由 Anthropic 的 Claude Opus 5 和 Claude Fable 5 佔據,Grok 4.6 與 GPT-5.6 Sol Max 並列全球第三。

編程及智能體能力是 Grok 4.6 升級的重點。在 DeepSWE v1.1 基準測試中,其得分從 54% 躍升至 65.9%;APEX-Agents 智能體基準從 47.1% 升至 57.5%,提升 10.4 個百分點,略超過 GPT-5.6 Sol Max 的 56.7%;Terminal-Bench v3.0 得分也從 15.7% 提升至 26%。不過在後兩項測試中,Claude Fable 5 Max 仍保持領先,這顯示出 Grok 4.6 雖然進步顯著,但尚未實現對競爭對手的全面壓制。

Grok 4.6 在定價和性能上展現競爭力

在定價方面,Grok 4.6 的 API 起始價為每百萬輸入 token US$2 (約 HK$16)、每百萬輸出 token US$6 (約 HK$47),處於前沿模型的中檔價位,價格不到 GPT-5.6 Sol 標準模式的一半。該模型支持 50 萬 token 的上下文窗口,當提示詞低於 20 萬 token 時按上述價格計費,達到 20 萬 token 後費率將上調。根據 SpaceX AI 的介紹,Grok 4.6 今日起已在 Grok Build 中上線,並同步登陸其收購的 AI 編程公司 Cursor,合作方還包括 OpenRouter、

Vercel 和 Cloudflare 等。

在訓練層面,SpaceX AI 表示,相較 Grok 4.5,Grok 4.6 進行了更長時間的訓練,並針對通用編程、知識工作、內核優化、網頁開發及計算機輔助設計等智能體環境加強了強化學習。測試中,Grok 4.6 在長序列任務中展現出更強的自我測試及驗證能力。從成本效率來看,Artificial Analysis 的數據顯示,Grok 4.6 完成 AA-Briefcase 工作負載平均僅需約 53 輪交互及 5 億輸入 token,而 Claude Opus 5 Max 約需 103 輪及 20

億 token,前者的效率優勢相當明顯。

Henderson
Henderson

Henderson 是 The Base Principle 的編輯,負責 AI 與工程科技報道的選題與編輯,並監督本站的自動化編譯流程。關注範圍包括大型語言模型、半導體與運算、太空與能源工程。

The Base Principle 是一個繁體中文(香港)科技媒體,專注報道人工智能與工程前沿。我們持續追蹤 OpenAI、Anthropic Claude、Google Gemini、Grok(xAI)、Meta AI、DeepSeek 等主要 AI 模型與公司,並涵蓋電動車與工程技術趨勢,每日精選與分析。

友情網站:手機・開箱・評測 → TechRitualTechNippon 日本語版