据最新基准数据,Grok 4.6 今日在 GDPVal-AA v2(1753)、AA-Briefcase(1577)和 Harvey LAB(15.8%)基准测试中排名第一。该模型还在 CursorBench(69.9%)、FrontierCode(61.3%)、APEX-Agents(57.5%)和 APEX-SWE(56.4%)中排名第二,在所有测试类别中均超越 Grok 4.5 High。

Grok 4.6 在 Artificial Analysis 智能指数中获得 61 分,与 GPT-5.6 Sol Max 持平。上线 Cursor 和 Grok Build 后的首周,其使用量翻了一番。