OpenAI 构建无轮次实时语音 AI

OpenAI News··作者 OpenAI News

关键信息

该系统被描述为使用无轮次语音模型和低延迟架构,这意味着它可以在对话进行中处理并响应,而不是等待严格的轮流发言。OpenAI 的说明还暗示,这种设计旨在保留基于文本流水线中可能丢失的语音细节。

资讯摘要

OpenAI 发布了一篇题为《How we built a realtime system for responsive voice AI in six months》的文章,介绍 GPT-Live 这一连续语音交互系统。公司表示,GPT-Live 使用无轮次语音模型,使 AI 不必依赖严格的“你一句我一句”式对话流程。它还强调采用了低延迟架构,以便让响应足够快,更接近日常自然交流。

根据该条目提供的一句话摘要,GPT-Live 的目标是支持与 AI 的连续语音对话。这个定位说明,它更关注实时响应,而不是常见的“语音转文字、由模型推理、再转文字转语音”的语音流水线。搜索结果中引用的 OpenAI 说明也提到,speech-to-speech 模型可以直接处理音频,既能保留转写可能丢失的细节,也能更快地做出回应。

这项公告之所以重要,是因为语音 AI 的关键在于时延:如果系统反应太慢,对话就会显得生硬、不自然。OpenAI 强调只用了六个月就完成构建,也在传递一个信号,即只要模型与系统设计配合得当,实时语音基础设施可以在较短时间内搭建出来。整体来看,GPT-Live 的目标是让口语交互变得更即时、更流畅,也更像真正的对话。

资讯正文

GPT-Live 通过无轮次语音模型和低延迟架构实现与 AI 的持续语音交互,从而让对话更快、更自然。

来源与参考

  1. 原始链接
  2. How we built a realtime system for responsive voice AI in six months

收录于 2026-08-04