ITBear旗下自媒体矩阵:

Meta推出Muse Voice Transcribe模型:实时转写支持20余人分轨,70余种语言覆盖

   时间:2026-09-02 09:56:31 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

meta公司近日正式发布了其首个实时音频感知模型——Muse Voice Transcribe,为语音转写领域带来了突破性进展。该模型通过整合流式自动语音识别、说话人分离和端点检测技术,实现了用户说话时文字的同步输出,无需等待录音结束后再处理。

在功能设计上,Muse Voice Transcribe展现了强大的多场景适应能力。它能够从包含20余名说话者的录音中精准分离不同发言者,并通过端点检测技术自动识别说话结束的边界,为会议记录、访谈整理等场景提供了高效解决方案。模型支持超过1小时的长音频处理,并允许在句内或句间自然切换语言,目前已覆盖70余种语言,其中25种在发布时已完成验证。

技术层面,meta创新性地引入了自适应延迟机制。该系统不会对所有词语采用统一的识别速度,而是根据语音清晰度动态调整决策策略:对于简单词汇快速输出结果,对发音模糊、专业术语或复杂语境的词汇则调用更多前后文信息进行分析。这种设计在保持实时响应的同时,显著提升了复杂场景下的识别准确率。

开发者可通过meta Model API调用这项服务,定价为每1000分钟音频3美元(约合人民币20.2元),折合每小时0.18美元(约合人民币1.2元)。在第三方评测中,该模型已登顶Artificial Analysis流式语音转文本排行榜首位,其性能表现获得行业认可。

针对特定使用场景,开发者还可通过语言偏好、关键词优化和上下文提示等功能,进一步提升模型在专业术语或特定场景下的识别效果。这一特性使其在医疗、法律、科研等对术语准确性要求较高的领域具有广泛应用潜力。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version