OpenAI推出GPT-RealTime语音模型，升级功能并降价，语音大战再升级

时间：2025-08-31 20:59:02 来源：ITBEAR编辑：快讯团队 IP：北京 发表评论无障碍通道

在AI技术日新月异的今天，OpenAI再次引领潮流，于近日凌晨正式推出了专为开发人员设计的语音转语音模型——GPT-RealTime。与此同时，OpenAI还对其API功能进行了全面升级，新增了远程MCP服务器支持、图像输入功能以及SIP电话呼叫支持。

据OpenAI官方介绍，GPT-RealTime是其迄今为止最先进的语音合成模型，该模型在遵循复杂指令、精确调用工具以及生成自然、富有表现力的语音方面取得了显著进步。GPT-RealTime不仅能够流畅地朗读重复的字母和数字，还能无缝切换语言，甚至能够捕捉到笑声等非语言信号，为用户带来更加真实、生动的对话体验。

除了技术上的突破，OpenAI还为用户带来了两个全新的语音选项——Cedar和Marin，这两个语音将在Realtime API中独家提供，为用户带来更多样化的选择。

在定价方面，OpenAI也展现出了极大的诚意。通用版Realtime API和全新的GPT-RealTime模型即日起向所有开发者开放。GPT-RealTime的定价策略为每百万token音频输入32美元，缓存输入每百万token仅需0.4美元，而每百万token音频输出的价格为64美元。相较于之前的gpt-4o-realtime-preview版本，GPT-RealTime的价格下调了20%，这无疑将吸引更多开发者加入到GPT-RealTime的应用开发中。

OpenAI此次还增加了对对话上下文的细粒度控制，允许开发者设置智能token限制，并一次截断多个回合，这一改进将显著降低长会话的成本，为开发者提供更加灵活、高效的开发环境。

自去年10月OpenAI发布Realtime API公开测试版以来，已有数千名开发者使用该API并提出了宝贵的建议。此次GPT-RealTime的推出，无疑是对这些开发者反馈的积极回应。

然而，尽管GPT-RealTime受到了广泛关注和期待，但也有一些开发者对其表现提出了质疑。有用户认为，虽然GPT-RealTime在语音合成方面取得了显著进步，但其声音仍然带有一定的机械感，且旧的语音角色在表现力上只是略有提升。

为了提升GPT-RealTime的性能，OpenAI在音频质量、理解用户指令以及遵循指令等方面进行了大量改进。GPT-RealTime能够产出更自然的高质量语音，并能遵循细粒度的指令，如“快速专业地说话”或“用法国口音富有同情心地说话”。同时，该模型还能捕捉笑声等非语言线索，在句子中切换语言，并调整语气，为用户提供更加愉悦的对话体验。

在构建语音转语音应用时，开发者通常需要向模型提供一系列行为指令。OpenAI此次专注于改进模型对这些指令的遵循程度，使得即使是微小的指令也能为模型传递更多信息。这一改进将使得GPT-RealTime在处理复杂的多步骤请求时更加得心应手。

OpenAI还改进了异步函数调用功能。长时间运行的函数调用将不再中断会话流程，模型可以在等待结果时继续流畅地对话。这一功能的提升将使得GPT-RealTime在处理需要等待外部响应的场景时更加自然、流畅。

与传统将语音转文本和文本转语音的多模型链式流程不同，Realtime API通过单个模型和API直接处理和生成音频。这一创新的设计减少了延迟，保留了语音中的细微差别，并使得其响应更加自然、富有表现力。同时，Realtime API还新增了远程MCP服务器支持、图像输入功能以及SIP电话呼叫支持等实用功能，为开发者提供了更加便捷、高效的开发体验。

为了防止实时语音对话被滥用，Realtime API包含了多层安全防护和缓解措施。OpenAI对Realtime API会话采用主动分类器进行监控，一旦检测到有害内容，将立即中止对话。开发者还可以使用Agents SDK添加自己的额外安全防护措施，确保对话的安全性和合规性。

未来，专委会将着力聚集产业生态各方力量，联合开展智能终端的技术标准生态研究，共同探索在专委会技术标准生态下的新技术、新模式和新机制，推进技术、产业与应用研发，开展试点示范，广泛开展产业合作，形成智能终端生态的…

小米官方很快就出来辟谣了说从来没跟富国银行有过任何合作连接触都没有过。富国银行这种国际大行真要有这种业务往来不可能一点公开信息都没有。但换个角度想雷军作为小米的创始人真要转移资产的话有必要搞得…

尽管电影《三毛流浪记》已超过著作权保护期，但漫画《三毛流浪记》仍在著作权保护期内，出版电影版《三毛流浪记》图书应经著作权人张乐平子女的许可，未经许可出版同名电影版图书，侵犯了著作权人就漫画《三毛流浪记》所享…

在这场至关重要的转型之战中，以京东、拼多多、华润万家为代表的众多零售巨头，犹如无畏的骑士，为外贸企业提供了坚实的支持与助力。曾被美国引以为傲的“技术壁垒”，在中国市场却沦为了笑柄。一款智能手表，为适应国内…

回首烽火岁月，民族危亡之时，位于东江流域的坪山区，是中国共产党领导的广东人民抗日武装的发源地之一和重要战斗区域，也是东江纵队司令员曾生将军的故乡。作为东江纵队的主要领导人之一，曾生从这里走出，投身抗日救亡…

一款型号为“PLK110”的一加新机近日出现在 GeekBench 跑分数据库中，引发了业界关注。存储组合方面，消费者可选择12+256GB、12+512GB、16+256GB、16+512GB 以及 1…

频谱虽然越来越广，但也带来一系列的问题，那就是宽频率下的信号传输技术，而近日，国内的科学家们，在6G上有了大突破。所以中国科学家的这种光电整合技术，让信号有了自动换道的可能，可以为未来6G网络提供更灵活、…

不知道是否在召回范围内的小伙伴可以先查看产品背面显示的具体产品型号。如果是PB2030MI型号，但没有在召回范围内的产品，小米表示该型号充电宝采用的是不同厂家供应商电芯，少量产品使用了相关电芯2.0版本，…

【CNMO科技消息】近日，小米服务发布关于PB2030MI型号部分充电宝主动召回的售后服务政策公告，宣布召回部分充电宝产品。如果大家在使用小米充电宝，可以核对是否是在召回范围。公告表示，受上游供应商电芯来料…

AI与即时零售，是目前阿里重视最多、投入最大的两个方向，为此阿里的组织也重新调整，从“六大业务集团”重整为“中国电商、国际商业、云智能”三大板块+其他，战略重心与边缘业务被重新划分。可以说，许多业务都在淘…

活动与坪山区多个主流商圈联动，推出系列促消费活动，包括益田假日世界“七夕浪漫节”、悦阾SPACE“夏日狂欢・文化潮玩季”、龙坪天虹“暑期造趣”、坪山天虹“开学季”以及凤凰安荟邻“坪山首届金秋消费季”等，形成…

本网站LOGO小熊标志受版权保护，版权登记号：鲁作登字-2015-F-025467，未经ITBEAR官方许可，严禁使用。
声明：本网站是公益性科普网站，为网友提供科技类资讯内容，无障碍技术由太阳湾捐增，为阅读障碍用户提供内容听读服务。如本站内容侵犯了您的权利，请通知我们及时删除。
中国（山东）自由贸易试验区鲁ICP备11015305号-1 商业合作入口
Copyright © 小熊科技资讯 2007-2024 ITBEAR.COM.CN All rights reserved.