树莓派离线翻译器

Google Creative Lab 开源了一套树莓派语音翻译方案:语音识别、Gemma 4 E2B 翻译和语音合成都在本地完成,首次安装后无需联网。

✓ 已核实 来源 Android Authority report cross-checked against the google-gemma/gemma-translator repository ⚑ 边缘 AI

60 秒版本

Google Creative Lab 开源了可搭建的树莓派语音翻译器,首次设置后,识别、Gemma 翻译和语音输出全部在本地运行。

要点

  • 当前实现通过 LiteRT-LM 使用 Gemma 4 E2B,纠正了早期报道中的 E4B 说法。
  • 参考设备需要 8GB 内存的树莓派 5、音频输入输出、显示屏,以及模型安装所需的至少 6GB 空间。
  • 完整语音链路支持阿拉伯语、英语、西班牙语、日语、中文和韩语。
  • 代码、部署脚本和外壳 STL 采用 Apache 2.0 开放,但项目不是 Google 正式支持的产品。
  • 项目没有准确率、延迟、功耗或续航基准,关键翻译仍须核验。

结论. 这是一套有说服力的离线边缘 AI 参考方案,但不能据此认定树莓派已经能替代专业口译或成熟云翻译。

一句话一台树莓派跑完整语音链路

项目把树莓派 5 变成双人语音翻译器。模型和依赖首次下载完成后,语音识别、翻译和语音合成都能在本地完成,不再向云端发送正常翻译请求。

它的价值不只是 Gemma 能翻译文字,而是仓库打包了完整链路:麦克风输入、本地转写、Gemma 推理、本地语音输出、小屏界面、部署脚本和 3D 打印外壳。

技术结构三个本地模型分工协作

1. 语音转文字Moonshine 按所选源语言在本地转写麦克风音频。
2. 翻译LiteRT-LM 在树莓派 CPU 上运行指令微调的 Gemma 4 E2B。
3. 文字转语音moonshine-voice 用对应语言的本地声音合成翻译结果。
操作界面React kiosk 提供两条语言通道,协调按住说话、翻译和播放。

语音支持完整链路目前只有六种语言

6当前代码中的语音语言
8 GB参考树莓派 5 内存
6 GB模型导入前检查的最低空间

源码中的前后端映射了阿拉伯语、英语、西班牙语、日语、中文和韩语。Gemma 可能理解更多语言,但只有语音识别和语音合成同时支持,完整语音流程才真正可用。

硬件清单参考设备需要什么

计算设备8GB 内存的树莓派 5。
音频输入麦克风或 USB 音频采集设备。
音频输出扬声器、耳机或其他受支持输出。
显示设备显示器或小型触摸屏,界面针对约 480 × 320 设计。
外壳仓库提供可选的 3D 打印 STL 文件。
储存空间下载缓存与导入模型各约 2.6GB,脚本要求至少 6GB 可用空间。

搭建路径从仓库变成 kiosk 设备

  • 1. 在 Linux、macOS 或树莓派上克隆 `google-gemma/gemma-translator`。
  • 2. 为 `setup.sh`、`download_model.sh`、`start.sh` 和 `deploy-pi.sh` 添加执行权限。
  • 3. 运行 `./setup.sh`,创建 Python 环境并安装 Node 与应用依赖。
  • 4. 联网运行 `./download_model.sh`,下载 Gemma 4 E2B 并导入 LiteRT-LM。
  • 5. 开发时运行 `./start.sh`;在 Raspberry Pi OS 或 Debian 上运行 `./deploy-pi.sh`,部署 systemd 与 Chromium kiosk。

当前界面以键盘为主。横屏模式用 Space 切换说话人、Z 按住说话、方向键切换语言;竖屏模式给两个人各自的按键。实体按钮和旋钮可以映射这些输入,但现有前端尚未启用触摸录音按钮。

离线价值有优势,也有真实代价

连接条件设置完成后,无 Wi-Fi 或蜂窝网络也能执行正常翻译。
数据路径正常使用时,音频、转写、翻译和合成语音都留在本地链路。
使用成本硬件和模型安装后,没有逐次云推理费用。
现实代价设备更大、更耗电,本地模型也可能更慢或不如云端准确。
维护责任使用者必须更新依赖、保护设备,并管理物理访问和本地日志。

证据边界演示能跑,不等于质量已验证

真正使用前,应测试每个目标语言对、口音和噪声环境。姓名、数字、医疗指示、法律术语与应急信息都要重复或独立核验。

实际结论是:它是一套扎实、可复现的边缘 AI 参考设计,也能改造成旅行或野外工具;但应该把源码当平台,不要把演示视频当成质量保证。