谷歌发布Gemini 3.5 Transcribe,语音转写效率与精度双升级

谷歌今日正式推出全新语音转文本人工智能模型Gemini 3.5 Transcribe,其处理速度相较前代Chirp 3提升约70%,在实时语音识别任务中展现出更强的响应能力。

错误率下降至5.5%,多说话者场景表现优化

该模型在真实环境下的实时语音识别错误率已降至5.5%,优于Chirp 3的7.32%。系统具备智能过滤功能,能自动移除“嗯”“呃”等口语填充词,并支持对已生成内容进行即时修正,提升输出流畅性。

覆盖85种语言,支持三人以内音频解析

Gemini 3.5 Transcribe兼容85种语言,适用于跨语言沟通场景。同时,其能够有效分离并识别最多三位发言者的语音内容,适用于会议记录、访谈整理等复杂音频处理需求。