谷歌发布Gemini 3.5,AI语音转文字进入Chrome

谷歌发布Gemini 3.5,AI语音转文字进入Chrome

当地时间8月26日,科技媒体Ars Technica报道,谷歌正式发布Gemini 3.5 Transcribe,这是其AI语音转文字技术的最新迭代。该模型将不再局限于Gboard输入法中的Rambler功能,而是以系统级能力向更多谷歌产品开放,首个受益者便是Chrome浏览器。此举标志着谷歌正试图将AI语音交互从移动端延伸至桌面端网页生态。

从Rambler到系统级服务

早在2025年,谷歌就在Gboard中输入法内悄然上线了Rambler语音引擎,利用端侧Gemini模型实现低延迟实时转写。然而,当时的Rambler更像是一个实验性功能,仅服务于安卓/iOS的文本输入场景。如今,Gemini 3.5 Transcribe则是将该能力抽象为统一的跨平台服务,可被Chrome、Google Docs、Meet等应用直接调用。Ars Technica援引谷歌产品总监Evan Matthews的话说:“语音转写不应被锁在输入法里,它应该成为浏览器原生交互的一部分。”

“我们正在进入一个所有界面都能‘听懂人话’的时代。”谷歌产品总监Evan Matthews表示。

技术升级:端云融合与上下文记忆

Gemini 3.5 Transcribe最大的技术突破在于“端云协同的上下文感知转写”。与上一代仅依赖声学模型不同,新版本融合了多模态语义记忆模块,能够在转写时结合用户当前的浏览内容、历史交互记录甚至网页中的图表信息,从而大幅降低同音词错误率。谷歌内部测试显示,在嘈杂环境中,其词错误率(WER)较上一代降低约42%,在专业领域术语场景下提升尤为明显。

同时,该模型默认开启“隐私优先模式”,音频数据可选择完全在本地神经处理单元(NPU)上运行,仅当用户明确授权时才会启用云端增强模型。这对于Chrome浏览器中的会议记录、实时字幕等功能至关重要。

冲击波:浏览器窗口变成语音入口

将Gemini 3.5 Transcribe集成到Chrome,意味着谷歌将语音转写能力直接嵌入到了操作系统的“前台”。用户可以对着网页搜索框说话,自动填充内容;能在视频会议中生成实时双语字幕;更能通过自然语言直接操作网页表单,例如“把价格低于1000元的黑色鞋子筛选出来”。这一功能最早将于Chrome 138版本以实验性标志推出。

业内分析认为,谷歌此举旨在对标OpenAI的Whisper API和微软的Azure Speech,但谷歌的优势在于“端云一体”的Android/Chrome生态覆盖。一旦语音转写成为浏览器默认能力,第三方网站无需集成SDK即可通过标准化的Web Speech API获得体验。

编者按:语音万能?别忽视三个隐忧

尽管Gemini 3.5 Transcribe令人兴奋,但依然存在不容回避的挑战。第一,隐私边界:即便采用端侧处理,浏览器中的语音数据仍可能被网站通过JavaScript间接获取,谷歌如何阻断恶意调用尚不明确;第二,能耗问题:在普通笔记本上持续运行端侧大模型的功耗远超传统语音引擎,续航和发热将成为用户抱怨的焦点;第三,标准碎片化:谷歌将技术捆绑至自家Chrome,可能会拉大与Firefox/Safari的生态差距,不利于Web标准的统一。

总结来看,Gemini 3.5 Transcribe是谷歌在AI语音交互领域一次极其积极的战略卡位。它让“说”比“敲”更自然地融入网页,但能否成为通用范式,还要看隐私、能耗和开放程度之间的平衡。

本文编译自Ars Technica