协同办公领域迎来一项重要突破,钉钉在其最新版本中正式推出智能语音输入功能,成为业内首个实现全场景AI语音输入支持的协同平台。该功能依托阿里自主研发的语音识别大模型Qwen-Audio-3.0-ASR-Flash-Message构建,标志着国产AI技术在办公场景的应用迈入新阶段。
技术层面,Qwen-Audio系列模型在国际权威评测中展现出显著优势。根据全球AI评测平台Artificial Analysis最新数据,该模型以1.7%的字符错误率刷新行业纪录,在语音识别精度上超越GPT-Realtime-2等国际主流模型,成为当前全球准确率最高的语音识别系统之一。这一突破为中文语音输入的商业化应用提供了坚实的技术支撑。
功能应用方面,钉钉此次升级实现了跨场景覆盖。用户不仅可在千问办公、即时通讯、搜索栏、文档编辑、AI表格等钉钉内部高频场景中使用语音输入,还能在外部浏览器、桌面智能体平台等第三方环境中无缝调用该功能。这种全场景适配能力显著提升了办公效率,特别适用于会议记录、多任务处理等复杂工作场景。
行业观察人士指出,此次升级标志着协同办公平台从传统文字交互向智能语音交互的范式转变。随着AI技术的持续演进,语音输入的准确率和响应速度将进一步提升,未来可能催生更多基于语音交互的办公新形态,推动整个行业向更智能化、人性化的方向发展。










