新闻
口语转录,一步到位!全国产算力语音识别模型,听得懂上下文了
1 分钟阅读
来源:zhidx.com
智东西 作者 | 杨京丽 编辑 | 李水青 智东西9月24日报道,昨日,科大讯飞推出最新 语音识别大模型Spark-ASR-2.0 。该模型基于 讯飞语音基座大模型Spark-Audio-1.0-Preview 构建,重点提升 通用识别、复杂声学场景识别、上下文识别和文本流畅规范性 。 值得注意的是,语音基座大模型Spark-Audio-1.0-Preview和语音识别模型Spark-ASR-2.0均 基于全国产算力展开训练 。讯飞正在以多年积累的智能语音技术和国产算力平台大模型训练经验为基础,持续推进语音基座模型、专用模型等技术迭代。 尽管大多数语音识别模型在日常使用中基本能够准确转写,但在 嘈杂环境 中输入、 中英文混合 输入,或者 对专业会议进行转录 时,仍可能出现错字、漏字; 语气词、重复和临时改口 ,也常让转写结果需要二次整理。目前大部分语音识别模型的目标还停留在单纯的精准识别转写上。 为了验证Spark-ASR-2.0能否解决上述问题,智东西围绕 通用识别、复杂声学场景识别、上下文识别、文本流畅规范性 四个方向展开实测。 实测中,Spark-ASR-2.0整体识别表现较为稳定,能通过 上下文修正部分歧义表达,减少口头语和重复内容 ,让语音转写结果更接近一段 可以直接使用 的文本。 Spark-ASR-2.0已陆续上线 讯飞输入法 ,并且通过讯飞开放平台提供 API服务 ,也开放了体验链接。后续还将逐步应用到 讯飞AI眼镜、智能办公本和讯飞听见 等产品上。 一、方言、芯片术语轻松识别,悄悄话也能听清 首先来看通用识别能力,我们用河南话对Spark-ASR-2.0进行了