ITBear旗下自媒体矩阵:

谷歌Gemini 3.5 Transcribe发布:语音转文本突破,开启“理解式转写”新纪元

   时间:2026-08-27 06:43:52 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

谷歌近日推出了一款名为Gemini 3.5 Transcribe的新型语音转文本模型,该模型在语音识别领域实现了重大突破,不仅提升了识别精度,还具备理解说话人意图并自动整理输出结果的能力。这一创新标志着语音识别技术正从简单的逐字记录向更深层次的语言理解迈进。

与传统语音识别工具相比,Gemini 3.5 Transcribe能够智能识别说话人的自我修正,自动过滤掉“um”“uh”等口头禅,并将非结构化的口语内容直接转换为格式化的文本。例如,当用户说“周二——不,周三见面”时,模型能够准确识别出这是一次自我修正,而非将两种表述全部记录下来。

谷歌宣称,Gemini 3.5 Transcribe是其迄今为止“最精准”的语音转文本模型。该模型已集成到Android版Gboard和Mac版Gemini应用中,同时通过Gemini API向开发者开放预览功能,为开发者提供了将语音识别能力嵌入自有应用的便捷途径。

此次发布的Gemini 3.5 Transcribe与Gemini 3.5 Live及Gemini 3.5 Live Experimental共同构成了谷歌新的Gemini Audio系列。这一系列产品的推出,进一步丰富了谷歌在语音交互领域的产品线。

在语言支持方面,Gemini 3.5 Transcribe表现出色,支持超过85种语言,具备自动语言识别能力,并能处理多语言混说的复杂场景。谷歌还允许用户添加自定义词汇,使模型能够更准确地识别专业术语、特殊拼写以及订单号、邮编等字母数字组合。对于预录音频,该模型还支持说话人识别和逐词时间戳功能。

在面向开发者的能力开放层面,Gemini 3.5 Transcribe已通过Gemini API进入预览阶段,支持实时语音流和录制音频文件两种处理场景。根据谷歌官方文档,文件转录最长支持1小时,实时转录则面向低延迟应用场景。开发者可以调用低延迟转录、自定义词汇及智能格式化等功能,将语音识别能力无缝嵌入到自有应用中。

在产品端,Gemini 3.5 Transcribe已经落地于Android平台的Gboard Rambler语音输入功能以及Mac版Gemini应用。谷歌还计划将其引入Chrome浏览器,届时用户可以在网页文本输入框内直接通过语音输入内容,涵盖回复消息、撰写帖子以及向Gemini发出指令等多种场景。

分析人士指出,随着语音入口在谷歌旗下Chrome、Gboard等高频产品中的加速渗透,语音交互有望逐步取代键盘输入,成为用户与AI系统的主要连接方式。谷歌正系统性地推进Gemini的“语音入口”战略,将Gemini的能力从文本和图像进一步延伸至实时对话、语音翻译和语音输入等场景。

从商业化角度来看,语音转文本正从单纯的后台基础能力演变为AI应用的重要交互入口。随着模型具备“听懂—理解—整理—执行”的一体化能力,用户与AI的交互方式有望发生根本性变化。对于谷歌而言,将Gemini 3.5 Transcribe嵌入到Chrome、Gboard、Docs、Gmail等高频产品中,将有助于进一步扩大Gemini在日常生产力场景中的渗透深度,并在语音交互这一新兴入口上巩固其竞争地位。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version