新闻

对比与生成:抖音SOTA多模态表征模型DME

1 分钟阅读
来源:aixq.cc
抖音搜索多模态团队联合中国人民大学高瓴人工智能学院,发布抖音多模态表征模型 DME(Douyin Multimodal Embedding),在多模态表征权威评测榜单 MMEB-v2(78 个数据集,覆盖图像、视频、视觉文档三大域)上,DME 模型在 2B、9B 两个参数量级下均取得对应规模 SOTA,整体得分分别达到 74.8(2B)、78.4(9B),视频与视觉文档检索的优势尤为突出。DME 的技术已部署进抖音线上系统:内部离线评测集整体相对提升 2.92%;线上 A/B 实验验证核心业务指标 0.1% 的 L