News

告别卡顿与机械感:OpenAI 推出全双工语音模型 GPT-Live-1 在目前的 AI 语音交互中,传统的级联式架构常常因为语音转文字、模型推理以及文字转语音等步骤的串联而产生明显延迟

1 min read
告别卡顿与机械感:OpenAI 推出全双工语音模型 GPT-Live-1 在目前的 AI 语音交互中,传统的级联式架构常常因为语音转文字、模型推理以及文字转语音等步骤的串联而产生明显延迟。为了彻底解决这一痛点,OpenAI 近日正式在 API 中推出了全新的全双工语音模型 GPT-Live-1,将类人般的流畅语音交互体验直接带给广大开发者。 传统语音智能体在应对复杂的对话场景时,往往容易在停顿、打断或转换话题时显得非常脆弱。而 GPT-Live-1采用单一模型同时处理输入与输出音频,在架构设计上实现了颠覆性的简化。它不仅支持即时响应打断,还能将深层推理以及工具调用无缝委派给后端的文本模型,让对话在后台持续进行的同时保持高度的灵活性。 在实际性能表现和应用场景上,该模型带来了多项核心优势。首先是卓越的中断处理能力,在早期测试中,语言学习平台 Speak 发现它将思考停顿期间的中断减少了近80%。其次,开发者可以通过系统提示词来定制智能体的语气、节奏与对话风格,并能完美处理背景噪声和静默上下文,非常适合用于电话客服、餐饮预订以及长会话交互。在基准测试中,其搭配中等推理强度的 GPT-6Astra 后表现名列前茅。 目前,GPT-Live-1已在 API 中全面可用,前端语音层的定价为每分钟0.05美元。多位行业合作伙伴如 Yelp、Intercom 等均表示,该模型大幅提升了轮次切换的准确性,让 AI 语音支持真正走出了走走停停的节奏,实现了如真人面对面般自然流畅的全新体验。 via AI新闻资讯 (author: AI Base)