新闻
Google 發佈 Gemini 4 Argon 多項跑分超 Astra 及 Fable 5.1
1 分钟阅读
Google 發佈新一代前沿模型 Gemini 4 Argon ,標榜這是「前沿智能的新時代」,專為「跨複雜、長流程工作負載的深度推理」而設。新模型採用全新命名方式,接續早前取消 Gemini 3.5 Pro、集中發展 3.8 Flash 的路線,目標是在編程、知識工作、網絡安全防禦及創意寫作方面提供「前沿級能力」。 輸出上限升至 100 萬 Token Gemini 4 Argon 的輸出 Token 上限由 64K 大幅提升至 100 萬,以支援更長、更複雜的使用情境,並同時擴大編程、推理及多模態能力。Google 指出,當模型有足夠空間深入思考,並在單一軌跡中生成數十萬個 Token,即可一次過處理艱難問題,令推理深度達到新層次。 DeepSWE 測試領先同級模型 在基準測試方面,Google 稱 Gemini 4 Argon 於 DeepSWE v1.1 取得 77.9%,高於 Claude Opus 5.5 的 74.2%,以及 GPT-6 Astra 的 74.1%。在評估模型修復安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分並列第一。 Google 表示,Gemini 4 Argon 在網絡安全防禦方面「能力極高」,表現較 3.8 Flash Cyber 有明顯躍進。模型將在「不設網絡安全護欄」的情況下,提供予受信任的防禦人員及 Google 內部團隊,讓他們「發揮完整的前沿級網絡安全防禦能力」。除編程以外,Argon 在其他特定領域評估中同樣有領先表現,例如 Vals Finance Agent v2(多步驟財務研究)及 Harv