新闻
DeepSeek V4 Pro正式版反转:真的很强 满血性能被束缚了
1 分钟阅读
快科技8月15日消息,DeepSeek V4 Pro正式版发布已经三天了,目前的争议依然很多,尤其是官方测试性能直追Fable 5,但网友实测没有那么强,尽管比预览版确实提升了。 再加上DeepSeek的API大涨价,缓存命中价格最多涨了11倍,整体使用成本大增,一时间口碑严重下滑,梁圣之名已经没了。 但是这两天又出现了新的研究,显示DeepSeek V4 Pro正式版的真实性能确实是很强的,不仅能达到官方所说的水平, 甚至可以复现7月份灰度测试中那种让人惊艳的能力,可以说满血回归了。 DeepSeek V4 Pro正式版的性能之所以有很大差异,是跟它的思维链有重要关系,网上测试出现了we need、let me等几种情况,不同思维链的性能波动很大。 开源社区验证之后表示V4 Pro正式版严重依赖首轮工具瞄定,所以解决办法也是有的,开源社区做了个dsh-anchored-standard插件,该方案采用“首轮锚定 + 动态晋升”策略——首次请求仅暴露 2 项核心工具以锚定优质推理轨迹,一旦模型发起首次 Tool Call,立即在后续轮次解锁全部 25 项标准工具。 经过验证,在 Windows原生Project2测试中, 该方案连续跑出98、99的高分,成功进入 Fable等前沿模型分数带。 该实验表明V4 Pro的核心能力并未丢失,但可能在强化学习(RL)后训练阶段对特定的 Harness脚手架与工具暴露环境存在显著过拟合。 目前这个插件已经开源,地址在 这里 ,详细的说明也可以参考 开源社区 的记录,里面的分析很全面,感兴趣的可以了解下。 此外,V4 Pro正式版的表现跟他