新闻

Grok 4

1 分钟阅读
Grok 4.6 发布即登顶性价比榜:智能指数追平 GPT-5.6 Sol,定价却便宜 60% 以上 xAI 正式发布 Grok 4.6,在 AI 智能指数上获得 61 分,追平 GPT-5.6 Sol(Max),仅次于 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。这一成绩使 Grok 4.6 一举跻身全球前沿模型第一梯队,与 OpenAI、Anthropic 的旗舰产品正面掰手腕。模型在 Grok 4.5 基础上扩展训练,核心改进包括使用模型生成的精选数据进行推理和高级技术概念训练,结合高质量工程数据和改进的优化器。 训练方法上的关键变化在于数据闭环:Grok 4.5 被用于重新生成监督微调轨迹,涵盖推理、代理工具使用以及 STEM、软件工程和知识工作等领域。模型还在广泛的代理强化学习任务上接受训练,包括知识工作、通用编码、内核优化、网页开发和计算机辅助设计,这一策略明显瞄准了"智能体时代"的核心工作负载。 Agent 基准全面飙升,长周期任务省力惊人 在智能体类基准测试中,Grok 4.6 表现尤为亮眼。GDPval-AA v2 达到 1753 Elo,仅次于 Claude Opus 5;DeepSWE v1.1 提升至 65.9%,较 Grok 4.5 的 54% 大幅跃升;APEX-Agents 从 47.1% 飙升至 57.5%;Terminal-Bench v3.0 也从 15.7% 涨到 26%。此外在 CursorBench v3.2 上获得 69.9%,在 FrontierCode v1.1 上获得 61.3%,编码与代理能力均实现显著突破。 更值得关注的是成本效率优势。Grok 4.6 定价维持在每百万输入 token 2 美元、每百万输出 token 6 美元,比 Claude Opus 5(5 美元 /25 美元)和 GPT-5.6 Sol(5 美元 /30 美元)低 60% 以上。在 AA-Briefcase 长周期知识工作基准中,Grok 4.6 平均仅用 53 个回合和约 5 亿输入 token 完成