谷歌发布Gemini 3.5 Transcribe,语音转写效率与精度双升级
谷歌今日正式推出全新语音转文本人工智能模型Gemini 3.5 Transcribe,其处理速度相较前代Chirp 3提升约70%,在实时语音识别任务中展现出更强的响应能力。
错误率下降至5.5%,多说话者场景表现优化
该模型在真实环境下的实时语音识别错误率已降至5.5%,优于Chirp 3的7.32%。系统具备智能过滤功能,能自动移除“嗯”“呃”等口语填充词,并支持对已生成内容进行即时修正,提升输出流畅性。
覆盖85种语言,支持三人以内音频解析
Gemini 3.5 Transcribe兼容85种语言,适用于跨语言沟通场景。同时,其能够有效分离并识别最多三位发言者的语音内容,适用于会议记录、访谈整理等复杂音频处理需求。
声明:本站所有文章内容,均为采集网络资源,不代表本站观点及立场,不构成任何投资建议!如若内容侵犯了原著者的合法权益,可联系本站删除。
币安 Binance
币安交易所是全球加密货币交易所,注册奖励 500 U
