ITBear旗下自媒体矩阵:

OpenAI推出两款转录模型:低延迟实时转录与高精度异步转录双突破

   时间:2026-07-29 16:05:27 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

OpenAI公司近日正式推出两款全新转录模型——GPT-Live-Transcribe与GPT-Transcribe,现已开放API接口供开发者调用。这两款模型在转录精度、多语言支持及复杂场景适应性方面实现显著突破,尤其针对口音差异、专业术语及背景噪音等传统技术痛点进行优化。

根据技术文档披露,GPT-Live-Transcribe专为实时场景设计,通过动态流式处理技术将延迟控制在极低水平,适用于直播字幕、会议记录等需要即时响应的场景。其收费标准为每分钟0.017美元(约合人民币0.12元)。另一款模型GPT-Transcribe则聚焦于异步处理,可高效完成录音文件批量转录任务,定价为每分钟0.0045美元(约合人民币0.03元),在成本效益方面具有明显优势。

在性能验证环节,第三方基准测试显示显著提升。Context Aware ASR测试中,引入上下文感知功能后,GPT-Transcribe的语义准确率从41.6%提升至45.2%。针对多语言场景的测试更凸显其技术优势:在Common Voice平台涵盖的22种语言测试集上,该模型将转录错误率从Whisper模型的40.37%大幅降至19.27%;在真实音频录制基准测试的九种语言样本中,错误率进一步压缩至8.98%,较Whisper模型的15.21%实现近半数降幅。

技术团队透露,模型训练阶段采用了创新的多模态数据增强策略,通过引入超过5000小时的带噪语音样本和300万组专业术语对,显著提升系统对复杂声学环境的适应能力。特别在医疗、法律等垂直领域,模型对专业术语的识别准确率较前代产品提升37%,数字与符号的转录错误率降低至1.2%以下。

开发者文档显示,API接口支持包括MP3、WAV在内的12种主流音频格式,单次请求最大可处理3小时时长的音频文件。针对企业级用户,OpenAI提供定制化微调服务,允许客户上传特定领域语料库进行模型优化,进一步提升专业场景下的转录质量。目前已有超过200家机构参与早期测试,覆盖在线教育、金融服务、智能客服等多个行业。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version