摘要:8月6日,谷歌Creative Lab开源离线翻译设备Gemma Translator。基于树莓派Pi 5与51亿参数Gemma 4 E2B模型,语音识别、翻译、合成全程本地完成,不依赖网络。零件成本约80美元,源代码与3D打印图纸已上GitHub。端侧AI从实验室走向可DIY的独立硬件。
8月6日,谷歌Creative Lab团队发布了一款离线翻译设备Gemma Translator。硬件是一块树莓派Raspberry Pi 5单板计算机,跑的是谷歌自研的Gemma 4 E2B模型——总参数量51亿、激活参数量23亿。用户对着麦克风说话,设备把语音转写成目标语言,通过扬声器播报译文,同时还能在屏幕上同步展示翻译前后的文本。整套流程全部在本地完成,不联网。
把大模型塞进一块巴掌大的开发板里跑离线翻译,这件事的意义不在于参数有多大,而在于谷歌给出了一条清晰的产品化路径。
硬件底座:80美元,自己攒一台
Gemma Translator的核心硬件是一块树莓派Pi 5(8GB RAM)。除此之外,还需要一块触控屏、麦克风、扬声器、迷你键盘、行动电源。外壳用3D打印。整套零件成本约80美元。
谷歌把源代码和3D打印外壳的STL文件全部开源在GitHub上。任何人下载后都能自己组装一台离线翻译机。
技术栈:三个模型,全部本地跑
Gemma Translator的技术堆叠由三个独立的模型组成,各自负责一个环节。
语音识别(STT)用Moonshine——一个轻量级语音识别引擎,速度最高可达Whisper Tiny的五倍。翻译环节由Gemma 4 E2B模型负责,通过谷歌的LiteRT-LM推理框架在设备端执行。文字转语音(TTS)同样由Moonshine完成。
在树莓派Pi 5的8GB RAM上,Gemma 4 E2B的推理速度约每秒6个token,内存占用低于1.5GB。跟云端API比不算快,但应付实时对话翻译已经够用。语音从输入到翻译输出,全程不经过任何外部服务器。
交互设计:双车道对话,推杆切换语言
Gemma Translator的界面设计成“双车道”模式——屏幕左右两侧各代表一位使用者,每人各自选语言。操作时按住按键说话,松开后系统自动完成语音识别、翻译、合成语音播放。语言切换用“左轮枪”式的旋转界面,方向键就能在不同语言之间轮替。
前端用React和Vite构建,针对480×320的小型手持屏幕做了优化,走复古终端机风格。后端用Python内置的http.server做API服务器。一个启动脚本就能同时启动LLM服务器、Python API和React前端。
为什么这件事值得关注?
市面上大多数翻译App依赖云端处理。Gemma Translator把全部处理流程压缩到本地完成。
这不是第一次有人把大模型塞进树莓派。但谷歌做了一件别人没做的事:把端侧模型从实验室技术演示,封装成了一款插电即用、永不依赖网络的独立成品。代码开源、3D图纸开源、零件成本公开——任何人花80美元就能自己攒一台。
Gemma Translator目前还处于原型阶段。但它的意义不在于产品本身有多成熟,而在于它指明了一个方向:AI不一定要跑在云端。一块80美元的开发板、一个51亿参数的模型、一套全部本地的技术栈——就能实现实时语音翻译。
在没有Wi-Fi、没有蜂窝信号的地方,这套东西能正常工作。对于那些经常出差、旅行、或者单纯不想把对话数据上传到云端的人来说,这个开源项目提供了一个完全不同的选择。
代码在GitHub上,3D打印文件也在GitHub上。剩下的,就看谁愿意花80美元和几个晚上把它焊出来了。
