馬斯克旗下人工智能公司 xAI 今天在官方博客中宣布,正式推出 Grok-1.5 大語言模型。
Grok-1.5 具有改進的推理能力和 128k 的上下文長度,其中最顯著的改進之一是其在編碼和數學相關任務中的表現。Grok-1.5 将在未來幾天内在 平台上向早期測試人員和現有的 Grok 用戶推出。
在官方測試中,Grok-1.5 在 MATH 基準上取得了 50.6% 的成績,在 GSM8K 基準上取得了 90% 的成績,這兩個數學基準涵蓋了廣泛的小學到高中競賽問題。此外,它在評估代碼生成和解決問題能力的 HumanEval 基準測試中得分爲 74.1%。IT 之家附測試對比表如下:
長上下文理解方面,Grok-1.5 能夠在其上下文窗口内處理多達 128k tokens 的長上下文。這使得 Grok 的内存容量增加到之前上下文長度的 16 倍,從而能夠理解更長文檔中的信息。
據介紹,Grok-1.5 構建在基于 JAX、Rust 和 Kubernetes 的自定義分布式訓練框架之上。自定義訓練協調器可确保自動檢測到有問題的節點并将其從訓練作業中剔除。xAI 還優化了檢查點、數據加載和訓練作業重新啓動,以最大限度地減少發生故障時的停機時間。