Raspberry Piのオフライン翻訳機
Google Creative Labは、音声認識、Gemma 4 E2B翻訳、音声合成をRaspberry Pi 5上で実行し、初期設定後はネット接続を必要としない翻訳機を公開した。
60秒でわかる
Google Creative Labは、初期設定後に認識、Gemma翻訳、音声出力をすべてローカル実行するRaspberry Pi音声翻訳機を公開しました。
要点
- 現行実装はLiteRT-LM上のGemma 4 E2Bを使い、初期報道のE4B表記を訂正します。
- 基準構成は8GBのRaspberry Pi 5、音声入出力、画面、モデル導入用の6GB以上の空き容量を必要とします。
- 完全な音声経路はアラビア語、英語、スペイン語、日本語、中国語、韓国語に対応します。
- コード、導入スクリプト、筐体STLはApache 2.0で公開されていますが、正式サポート製品ではありません。
- 精度、遅延、消費電力、電池評価はなく、重要な翻訳は確認が必要です。
結論. 説得力のあるオフラインエッジAI設計ですが、Raspberry Piが専門通訳や成熟したクラウド翻訳を置き換える証拠ではありません。
要点一台のPiで音声経路全体を実行
Raspberry Pi 5を二人用音声翻訳機にするプロジェクトです。モデルと依存関係の初回ダウンロード後は、音声認識、翻訳、音声合成をローカルで実行し、通常の翻訳にネットワーク要求を使いません。
価値はGemmaが文字を翻訳できることだけではありません。マイク入力、ローカル文字化、Gemma推論、ローカル音声出力、小型画面、導入スクリプト、3Dプリント筐体まで一式になっています。
構成三つのローカルモデルが分担
| 1. 音声認識 | Moonshineが選択された入力言語でマイク音声をローカル文字化。 |
|---|---|
| 2. 翻訳 | LiteRT-LMがRaspberry Pi CPUで命令調整済みGemma 4 E2Bを実行。 |
| 3. 音声合成 | moonshine-voiceが言語別のローカル音声で翻訳結果を再生。 |
| 画面 | React kioskが二つの言語レーン、録音、翻訳、再生を調整。 |
音声対応完全な経路は現在六言語
ソースの前後端はアラビア語、英語、スペイン語、日本語、中国語、韓国語を対応付けています。Gemmaが追加言語を理解しても、音声認識と音声合成が両方対応しなければ完全な音声経路にはなりません。
ハードウェア基準構成に必要なもの
| 計算機 | 8GBメモリのRaspberry Pi 5。 |
|---|---|
| 音声入力 | マイクまたはUSB音声入力。 |
| 音声出力 | スピーカー、ヘッドホンなど。 |
| 画面 | ディスプレイまたは小型タッチスクリーン。UIは約480 × 320向け。 |
| 筐体 | 任意の3Dプリント用STLファイルを同梱。 |
| 記憶容量 | 取得キャッシュと導入済みモデルが各約2.6GBで、スクリプトは6GB以上の空きを要求。 |
構築手順リポジトリからkiosk端末へ
- 1. Linux、macOS、Raspberry Piで `google-gemma/gemma-translator` をクローン。
- 2. `setup.sh`、`download_model.sh`、`start.sh`、`deploy-pi.sh` を実行可能にする。
- 3. `./setup.sh` でPython環境、Node、アプリ依存関係を導入。
- 4. オンラインで `./download_model.sh` を実行し、Gemma 4 E2BをLiteRT-LMへ導入。
- 5. 開発は `./start.sh`、Raspberry Pi OSやDebianの常設端末は `./deploy-pi.sh` でsystemdとChromium kioskを構成。
現行画面はキーボード中心です。横向きはSpaceで話者変更、Zで録音、矢印で言語変更。縦向きは二人に別のキーを割り当てます。物理ボタンやノブはキー入力へ対応できますが、現行フロントエンドにはタッチ録音ボタンがありません。
オフラインの意味利点と代償を分けて考える
| 接続 | 設定後はWi-Fiや携帯回線なしで通常翻訳を継続。 |
|---|---|
| データ経路 | 通常利用時の音声、文字化、翻訳、合成音声はローカル経路に残る。 |
| 費用 | ハードウェアとモデル導入後はリクエスト単位のクラウド推論料がない。 |
| 代償 | 端末は大きく消費電力が高く、クラウドより遅い、不正確な可能性。 |
| 保守 | 所有者が依存関係の更新、物理保護、ローカルログを管理。 |
証拠の範囲デモはベンチマークではない
利用前に各言語ペア、アクセント、騒音環境を試してください。人名、数字、医療指示、法的用語、緊急情報は繰り返しまたは別手段で確認する必要があります。
結論として、再現可能なエッジAIの参考設計であり、旅行や現場向けに改造できます。ただしソースコードを基盤として扱い、デモ映像を品質保証にしないことが重要です。