摘要:腾讯9月24日推出Hy翻译App,支持38种语言与方言;谷歌9月23日发布Gemini 3.8 Flash TTS语音模型。多语言AI工具加速场景细分。

腾讯9月24日上线“Hy翻译”App。这款产品支持33种主流语言互译,并覆盖藏语、维吾尔语、蒙古语、哈萨克语、朝鲜语5种少数民族语言或方言,合计38种语言与方言。功能上提供语音、拍照、对话与离线四种翻译方式。用户可在“学术论文”“日常口语”“商业正式”等风格之间切换,使译文适配不同场合的用语习惯。

从定位看,Hy翻译主攻出境游与商务两个场景。产品已在美国、日本、韩国及东南亚市场上线,直面对外交流的高频需求。离线翻译意味着在网络条件不稳定的出境环境中仍可使用,拍照翻译则覆盖路牌、菜单、文件等实物文本。

05_AI工具资讯_多语言工具走向场景化.jpg

谷歌9月23日发布Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS两款模型。TTS(Text-to-Speech,文本转语音)指将文字转换为有声语言的AI技术。两款模型支持100多种语言与方言,提供开箱即用的2000多种现成声音。使用者可用自然语言描述来定制声音,逐句控制语气、语速与口音,也能用30秒音频样本复刻某一声音。其面向角色配音与大规模音频生成,强调批量产出能力。

两款产品虽都围绕“语言”,但分处工具链条的不同位置。Hy翻译解决“看懂、听懂异国语言”的即时需求,落在消费级出境场景;Gemini TTS解决“把文字变成有质感的声音”的生产需求,落在内容与配音的生产场景。前者重覆盖广度与离线可用性,后者重声音的可定制性与规模化。

这种分工反映了多语言AI工具近期的共同走向:从通用大平台转向具体场景。翻译不再只追求语种数量,而追求在特定场合下的用语准确;语音合成不再只追求“能出声”,而追求声音风格可控、可复刻。场景细分让工具更易被具体人群采用。

多语言AI正在降低跨语言交流的门槛。对普通出境者,实时翻译减少了沟通成本;对内容生产者,文本转语音降低了音频制作的人力投入。两款产品相隔一天发布,分别由国内与国外厂商推出,显示了该方向的普遍共识。工具的下沉与细分,最终受益的是需要跨越语言障碍的普通用户。