新闻
智元全模态大模型,登顶全球第一!力压谷歌英伟达,跑赢大厂
1 分钟阅读
来源:zhidx.com
智东西 作者 | 江宇 编辑 | 漠影 当一台机器人站在多人交谈的展厅里,它能不能从嘈杂声中听出谁在和自己说话,判断一句话是否需要回应;能不能在对方停顿时接过话头,被突然打断后自然续上;还能不能一边回答,一边配合语气做出恰当的手势和表情? 这些看似寻常的交流细节,是具身智能的核心能力,也是机器人跨越自然交互门槛时最难补齐的一环。 长久以来,机器人行业困在一个尴尬的悖论里:单项能力不断突破,把“ 看、听、说、动 ”揉成一个连贯的、像人一样的整体,始终差着一口气。 这道鸿沟的本质,是 交互 能力跟不上——感知、推理、语音、动作各跑各的,始终没有在同一个时间轴上协同起来。 近日,智元自研的全模态大模型WITA-Omni Preview给出了一份有分量的答卷。 在行业公认的具身全模态理解权威榜单DailyOmni上,它以85.21分的综合成绩登顶榜首,超越千问、Gemini、豆包、英伟达等国内外领先模型,八项细分指标中六项拿下第一。 在“看懂环境、听懂声音、边听边想、边说边动”这条核心交互能力主线上,一家专注具身智能的企业,跑到了通用大模型厂商的前面。 此前,智元自研世界模型Genie Envisioner-Sim 2.0已在WorldArena“世界模型感知与动作响应”赛道拿下总分第一 。此次WITA-Omni又在全模态理解榜单登顶,两项成绩分别对应机器人理解物理世界、模拟物理世界以及与物理世界交互的关键能力。 这也让外界观察到,智元在造机器人本体之外,正同步构建出“交互-作业-运动”三位一体的自研AI版图。 一、一场“声画对位”的大考:DailyOmni凭什么检验真正的全模态能力