新闻

SpaceXAI 推出 Grok Voice Transcribe 2

1 分钟阅读
SpaceXAI 推出 Grok Voice Transcribe 2.0:错误率砍半、价格纹丝不动,流式语音识别登顶榜单 当地时间9月18日,SpaceX 旗下的人工智能部门 SpaceXAI 放出了新一代语音转文本模型 Grok Voice Transcribe2.0,最狠的一招是:在把错误率压低约一半的同时,定价一分没涨。 它扎根于 Grok Voice 底层的音频基础模型,而这套底座如今已经深度嵌入真实业务:每天接住数万通客服电话、转录数百万小时的视频旁白,还驱动着实体硬件里的各类语音智能体,其中就包括特斯拉车机上的 Grok 助手。换句话说,它不是实验室里跑分的模型,而是已经在一线被海量真实语音反复打磨过的产物。 在 Artificial Analysis 的公开榜单上,Grok Voice Transcribe2.0在全部32款流式模型里准确率排到第一,把同赛道对手甩在身后。SpaceXAI 还不满足于公开基准,从自家线上业务里抽样了四个内部数据集做系统评测,涵盖客服电话录音、和 Grok 的日常英语对话、口述的电话号码邮箱地址这类结构化信息,以及多语种短指令——四个数据集上2.0版对1.0版实现了全面碾压。 真正让开发者动心的是价格。批量转录仍是每小时音频0.10美元,实时流式转录每小时0.20美元,和1.0完全相同;更关键的是,说话人分离、精确时间戳和自定义关键词这几项能力已经全部打包进基础价,不再单独收费。等于用旧版的价格,买到了错误率近乎减半、还多了功能的新模型——在语音识别这个价格敏感、调用量巨大的赛道里,这种"加量不加价"的打法,往往会比单纯刷榜更能撬动落地。 via AI新闻资讯 (author: AI Base)