OpenAI 近日宣布,其最新推出的 GPT-Live-1 模型已正式接入 API,为开发者构建实时语音交互应用提供了全新解决方案。该模型突破了传统语音交互的局限,支持全双工对话模式,能够同时处理语音输入与输出,并在对话过程中智能识别打断、停顿及背景噪声,确保交流的流畅性。
针对电话场景的复杂需求,GPT-Live-1 特别优化了全双工语音智能体的性能,可广泛应用于餐厅预订、客户服务等场景。开发者可通过将其与 Codex 等工具集成,或利用 OpenAI Presence 框架,构建能够查询企业系统、执行审批操作并在必要时无缝转接人工的语音工作流。这种设计显著提升了语音交互的实用性和灵活性。
技术架构方面,GPT-Live-1 将语音理解与生成功能整合至单一模型,避免了传统“语音转文字—大语言模型—文字转语音”三阶段处理带来的延迟问题。同时,模型将复杂推理和工具调用任务交由后端文本模型处理,进一步优化了响应速度。开发者可通过系统提示词自定义语音输出的语气、语速和对话风格,并灵活配置后端模型、工具及智能体框架。
在功能扩展上,该模型支持原生语音识别转写与文本回复,并具备字母数字识别、关键词优先级调整及对话轮次检测等能力。这些特性使其能够精准处理专业术语、数字信息及多轮对话场景,满足金融、医疗等高精度需求领域的应用要求。
实际应用效果已得到验证。语言学习平台 Speak 引入 GPT-Live-1 后,学习者思考停顿期间的误打断次数较传统轮次系统减少近 80%,显著提升了学习体验。医疗服务平台团队则通过集成该模型,删除了约 2.3 万行代码,将代码量缩减 80%,大幅降低了系统维护成本。
性能评测数据显示,GPT-Live-1 在 Full Duplex Bench 测试中表现优异,得分较前代模型 GPT-Realtime-2.1 提升 30 个百分点。在搭配 GPT-6 Astra 中等推理强度时,该模型在 Tau3 端到端语音智能体任务测试中位居榜首,展现了其在复杂语音交互场景中的领先优势。
商业化方面,GPT-Live-1 已通过 API 向开发者开放,前端语音层定价为每分钟 0.05 美元(按当前汇率约合人民币 0.34 元)。以每小时 60 分钟计算,单纯语音层费用约为 3 美元(约合人民币 20.2 元),后端模型及智能体工具费用需另行计算。这一定价策略为不同规模的企业提供了灵活的选择空间。
为丰富语音交互的个性化体验,OpenAI 同时扩充了实时语音选项库,新增 Quartz、Ripple、Vesper 等 12 种声音,并计划在未来数月内持续增加语音类型和语言支持。这一举措将进一步满足全球化应用场景中多样化的语音需求。











