ITBear旗下自媒体矩阵:

OpenAI新转录模型登场:听懂语境降错误率,Whisper被远远抛离

   时间:2026-07-29 11:14:29 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

OpenAI近日正式推出两款新型语音转录模型——GPT-Live-Transcribe与GPT-Transcribe,并通过API向开发者开放调用。这两款模型突破了传统语音转文字工具的局限,不仅能够精准识别语音内容,还能深度理解上下文信息,包括口音差异、专业术语、数字表达以及背景噪音中的有效信息,显著提升了复杂场景下的转录准确性。

两款模型针对不同应用场景进行了差异化设计。GPT-Live-Transcribe专为实时转录优化,以低延迟特性支持需要即时反馈的场景,如会议记录、直播字幕等,其每分钟0.017美元的定价(约合人民币0.12元)体现了对高频使用需求的考量。而GPT-Transcribe则聚焦于异步处理,擅长批量转录已有音频文件,每分钟0.0045美元的成本(约合人民币0.03元)使其成为处理大量录音资料的性价比之选。

在技术突破方面,新模型对语境的解析能力尤为突出。测试数据显示,GPT-Transcribe在接入上下文信息后,语义准确率从基础模式的41.6%提升至45.2%,展现了根据对话背景动态调整理解逻辑的能力。例如,同一词汇在不同语境下的含义差异,或专业领域术语的精准识别,均得到显著优化。

与OpenAI此前发布的Whisper模型相比,新模型在多语言场景下表现卓越。在Common Voice数据集覆盖的22种语言测试中,GPT-Transcribe将转录错误率从Whisper的40.37%降至19.27%;在真实录音的九种语言基准测试中,其错误率更进一步压缩至8.98%,仅为Whisper(15.21%)的59%。这一优势在嘈杂环境或专业领域对话中尤为明显,例如医疗、法律等场景下的术语识别准确率大幅提升。

行业观察人士指出,这两款模型的推出标志着语音交互技术向实用化迈出关键一步。随着机器对复杂语音场景的理解能力增强,语音助手、智能客服、无障碍沟通等应用领域有望迎来新一轮创新,此前因噪音干扰或专业术语导致的交互障碍将得到显著缓解。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version