新闻
“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价
1 分钟阅读
来源:zhidx.com
智东西 编译 | 王涵 编辑 | 心缘 智东西9月3日消息,昨晚,谷歌发布其 迄今为止最强的推理与编程模型 Gemini 3.8 。 在保持低成本的同时,Gemini 3.8在 定量及专业领域 以及 端到端自主解决复杂工程问题 方面,有了进一步提升。 谷歌DeepMind研究员姚顺宇说:“(这次模型发布)对模型来说是一小步,对RSI(递归自我改进)来说却是一大步。” 新推出的Gemini 3.8包含两款模型: Gemini 3.8 Flash :主力模型,上下文窗口为 100万个token ,在软件工程、智能体任务以及专业领域中的关键多步推理等方面,相较3.7 Flash均有明显提升。 Gemini 3.8 Flash Cyber :网络安全模型,在漏洞检测和自动修补方面达到前沿水平,将通过全新的Fairwind计划向受信任的防御者开放。 两个模型共享同一套基础智能,由 长时运行的Agentic loop 进一步加速。这类loop用于递归评估和优化底层模型,使该共享核心的编程、推理能力获得显著提升。 基准测试方面,Gemini 3.8 Flash在14项测试中有 8项成绩排名第一 , 超过了Claude Opus 5和GPT-5.6 Sol ,分别是金融分析测试Vals Finance Agent v2、法律工作流测试Harvey Legal、终端代码测试Terminal-bench 2.1、复杂图表推理CharXiv、长视频理解LVBench以及跨学科专家难题HLE-Verified、生物学真实科研任务LABBench2。 在Artificial Analysis智能指数上,