新闻
实测云知声U2-Flash:18分钟速搓Agent、打造超写实大型滑梯
1 分钟阅读
来源:zhidx.com
智东西 作者 | 毕伟豪 编辑|漠影 一款模型“好不好”,究竟该如何定义? 显然, Agent正在改变人们评价大模型的方式 。过去,判断模型强不强,往往看参数规模、Benchmark成绩和上下文长度。 而在Agent时代,一款能够 又快又好地解决问题、完成任务,且token花得起 的模型,才是很多用户眼中的好模型。 顶级模型固然能力更强,但往往思考和执行时间长、 成本高昂 ,而快速模型生成token很快,却 容易走错路 、反复尝试,甚至需要人工接手,任务完成速度根本没快多少。 用更少的计算和无效尝试,更快更好地完成任务,是如今用户对Flash级别模型的期待,也让Flash级别模型逐渐从旗舰模型的轻量版本,走向一条独立的产品路线: 在能力、速度和成本之间寻找新的平衡 。 与此同时,一个新的衡量维度随之浮现—— 智能密度 ,即让有限的激活参数承担更多有效工作。 云知声刚刚发布的 新一代主力模型U2-Flash ,正是围绕这一方向训练的。它采用稀疏MoE架构,总参数约266B,激活参数仅10B,最快输出速度 达到300tokens/s , 首字响应平均3秒以内 ,其能力可以覆盖编程、Agent、推理、指令遵循等多类任务。 从评测结果来看,U2-Flash的提升也不只体现在速度上。在考察代码生成与软件工程任务的DeepSWE v1.1中, U2-Flash取得64.6分 ,较上一代模型U2实现翻倍式增长;在考察复杂软件工程问题解决能力的SWE-Bench Pro中取得61.6分, 较前代提升10.5分 ;在考察终端环境下Agent自主执行能力的TerminalBench 3.0中, 得