谷歌发布Gemini 3.5 Live Translate:70多种语言实时同传,说话时就出译文
以后开跨国会议,可能真的不需要那个坐在角落里的同传了。
三个关键信息
谷歌于 6 月 9 日发布 Gemini 3.5 Live Translate,一款语音到语音的实时翻译模型,支持超过 70 种语言、2000 多种语言组合。 它会在你说话的同时自动识别语种并生成译文语音,输出只比说话人慢几秒。谷歌强调这套系统尽量保留说话人的语调、节奏和音高,不是那种机器人念稿的腔调。
它同时铺进了谷歌的多条产品线。 在 Google Meet 里,支持语言从原来以英语为中心的 5 种一下扩到 70 多种,先向部分 Workspace 商业客户开放私测,年内再大范围推开;Google Translate 手机 App 的安卓和 iOS 版都能用;开发者可以通过 Gemini Live API 接入。安卓端还新增了一个"聆听模式",把译文音频直接从听筒放出来,不戴耳机也能私下听翻译。
但有一个明显的空白:谷歌没有公布任何硬指标。 没有基准跑分,没有各语言对的表现数据,没有具体延迟数字,也没有跟竞品的对比。也就是说,"几秒延迟""保留语调"这些说法,目前只能听谷歌自己讲。
王斗视角
"70 多种语言、2000 多种组合"听着像是把联合国同传箱一次性搬进了手机,但谷歌唯独不肯说的那几个数字,恰恰是最要命的:延迟到底几秒,哪几对语言翻得准,翻错了谁负责。实时同传难的从来不是识别和发音,是那"几秒"里要一边听、一边猜完整句意、一边组织译文——中英这种语序颠倒的语言对尤其考验。谷歌把跑分、延迟、语言对表现全部留白,只放了"保留语调"这种听感上很美的宣传点,说明真正的硬骨头它自己心里也没底。真要检验它,等年内在 Meet 里开一场中日德三方会议,看它是顺滑同传,还是在关键那句上卡壳。
来源:Slator · 9to5Google · MultiLingual
