新闻

Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差

1 分钟阅读
来源:36氪
文 | 李炤锋 编辑 | 张雨忻 “长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。” 过去一年,Coding与Agent能力不断改写大模型的排名,也成为AI最快兑现商业价值的场景之一。与此同时,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。 今年1月,OpenAI发布的一份企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。 随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用正在逐步进化:它不再只是用户交给模型的一张图片,也开始成为模型检查工作、发现错误和调整行动的反馈。 刚刚过去的7月,月之暗面发布Kimi K3。这款总参数2.8万亿、支持100万token上下文的MoE(混合专家模型),在Coding和长程Agent能力之外,出色的原生多模态能力是K3的另一个标签。 所谓原生多模态,是让图像、文字等数据从预训练或持续预训练阶段就共同塑造主模型,并在后训练中继续优化,最终参与Agent(智能体)的感知与决策。 K3发布后曾以1679分登顶Arena Frontend Code榜单。该榜单由用户盲选模型生成的可交互网页进行排名,评判的不只是代码能否运行,也包括页面的最终效果。 浏览器开发平台Puter曾在测试网页中制造5处视觉偏差,K3对照目标页与运行页截图,全部找出且没有误报。得益于出色的原生多模态能力,K3能够看懂代码运行后的视觉问题,为下一轮修改提供依据。Ki