# 树莓派离线翻译器

> Google Creative Lab 开源了一套树莓派语音翻译方案：语音识别、Gemma 4 E2B 翻译和语音合成都在本地完成，首次安装后无需联网。

_Source: Android Authority report cross-checked against the google-gemma/gemma-translator repository · 2026-08-08 · 8 min read · Verified against primary sources_

Canonical: https://iyu.app/zh/e/gemma-4-offline-translator-raspberry-pi

## 60 秒版本

Google Creative Lab 开源了可搭建的树莓派语音翻译器，首次设置后，识别、Gemma 翻译和语音输出全部在本地运行。

**要点**

- 当前实现通过 LiteRT-LM 使用 Gemma 4 E2B，纠正了早期报道中的 E4B 说法。
- 参考设备需要 8GB 内存的树莓派 5、音频输入输出、显示屏，以及模型安装所需的至少 6GB 空间。
- 完整语音链路支持阿拉伯语、英语、西班牙语、日语、中文和韩语。
- 代码、部署脚本和外壳 STL 采用 Apache 2.0 开放，但项目不是 Google 正式支持的产品。
- 项目没有准确率、延迟、功耗或续航基准，关键翻译仍须核验。

**结论.** 这是一套有说服力的离线边缘 AI 参考方案，但不能据此认定树莓派已经能替代专业口译或成熟云翻译。

## 全文

> **i** 这是 **Google Creative Lab 的开源实验**，不是 Google 正式支持的产品，也不是新发布的 Google 翻译硬件。仓库明确写有非正式产品声明。


### 一句话 — 一台树莓派跑完整语音链路

项目把树莓派 5 变成双人语音翻译器。模型和依赖首次下载完成后，语音识别、翻译和语音合成都能在本地完成，不再向云端发送正常翻译请求。

它的价值不只是 Gemma 能翻译文字，而是仓库打包了完整链路：麦克风输入、本地转写、Gemma 推理、本地语音输出、小屏界面、部署脚本和 3D 打印外壳。


### 技术结构 — 三个本地模型分工协作

- **1. 语音转文字:** Moonshine 按所选源语言在本地转写麦克风音频。
- **2. 翻译:** LiteRT-LM 在树莓派 CPU 上运行指令微调的 Gemma 4 E2B。
- **3. 文字转语音:** moonshine-voice 用对应语言的本地声音合成翻译结果。
- **操作界面:** React kiosk 提供两条语言通道，协调按住说话、翻译和播放。

> **↯** 早期报道写成 **Gemma 4 E4B**；当前 README 与 `download_model.sh` 使用的是 **Gemma 4 E2B**，搭建者实际下载的也是这个版本。


### 语音支持 — 完整链路目前只有六种语言

- **6** — 当前代码中的语音语言
- **8 GB** — 参考树莓派 5 内存
- **6 GB** — 模型导入前检查的最低空间

源码中的前后端映射了阿拉伯语、英语、西班牙语、日语、中文和韩语。Gemma 可能理解更多语言，但只有语音识别和语音合成同时支持，完整语音流程才真正可用。


### 硬件清单 — 参考设备需要什么

- **计算设备:** 8GB 内存的树莓派 5。
- **音频输入:** 麦克风或 USB 音频采集设备。
- **音频输出:** 扬声器、耳机或其他受支持输出。
- **显示设备:** 显示器或小型触摸屏，界面针对约 480 × 320 设计。
- **外壳:** 仓库提供可选的 3D 打印 STL 文件。
- **储存空间:** 下载缓存与导入模型各约 2.6GB，脚本要求至少 6GB 可用空间。


### 搭建路径 — 从仓库变成 kiosk 设备

- **1.** 在 Linux、macOS 或树莓派上克隆 `google-gemma/gemma-translator`。
- **2.** 为 `setup.sh`、`download_model.sh`、`start.sh` 和 `deploy-pi.sh` 添加执行权限。
- **3.** 运行 `./setup.sh`，创建 Python 环境并安装 Node 与应用依赖。
- **4.** 联网运行 `./download_model.sh`，下载 Gemma 4 E2B 并导入 LiteRT-LM。
- **5.** 开发时运行 `./start.sh`；在 Raspberry Pi OS 或 Debian 上运行 `./deploy-pi.sh`，部署 systemd 与 Chromium kiosk。

当前界面以键盘为主。横屏模式用 Space 切换说话人、Z 按住说话、方向键切换语言；竖屏模式给两个人各自的按键。实体按钮和旋钮可以映射这些输入，但现有前端尚未启用触摸录音按钮。


### 离线价值 — 有优势，也有真实代价

- **连接条件:** 设置完成后，无 Wi-Fi 或蜂窝网络也能执行正常翻译。
- **数据路径:** 正常使用时，音频、转写、翻译和合成语音都留在本地链路。
- **使用成本:** 硬件和模型安装后，没有逐次云推理费用。
- **现实代价:** 设备更大、更耗电，本地模型也可能更慢或不如云端准确。
- **维护责任:** 使用者必须更新依赖、保护设备，并管理物理访问和本地日志。


### 证据边界 — 演示能跑，不等于质量已验证

> **⚑ Caveat:** 仓库没有发布翻译准确率、端到端延迟、功耗或电池续航数据。演示证明链路可以运行，并不能证明达到专业口译或成熟云翻译服务的质量。

真正使用前，应测试每个目标语言对、口音和噪声环境。姓名、数字、医疗指示、法律术语与应急信息都要重复或独立核验。

实际结论是：它是一套扎实、可复现的边缘 AI 参考设计，也能改造成旅行或野外工具；但应该把源码当平台，不要把演示视频当成质量保证。


## Primary sources

- [Android Authority — Google built a portable AI translator that works offline](https://www.androidauthority.com/google-offline-ai-translator-gemma-4-3695674/)
- [Google Gemma — Gemma Translator source repository](https://github.com/google-gemma/gemma-translator)
- [Google AI Edge — LiteRT-LM](https://github.com/google-ai-edge/LiteRT-lm)
- [LiteRT community — Gemma 4 E2B instruction model](https://huggingface.co/litert-community/gemma-4-E2B-it-litert-lm)

---
_Published by iyu (https://iyu.app) — the day's AI news, checked against primary sources and rewritten in plain language. Free to quote with attribution and a link to the canonical URL._
