Raspberry Piのオフライン翻訳機

Google Creative Labは、音声認識、Gemma 4 E2B翻訳、音声合成をRaspberry Pi 5上で実行し、初期設定後はネット接続を必要としない翻訳機を公開した。

✓ 検証済み 出典 Android Authority report cross-checked against the google-gemma/gemma-translator repository ⚑ エッジAI

60秒でわかる

Google Creative Labは、初期設定後に認識、Gemma翻訳、音声出力をすべてローカル実行するRaspberry Pi音声翻訳機を公開しました。

要点

  • 現行実装はLiteRT-LM上のGemma 4 E2Bを使い、初期報道のE4B表記を訂正します。
  • 基準構成は8GBのRaspberry Pi 5、音声入出力、画面、モデル導入用の6GB以上の空き容量を必要とします。
  • 完全な音声経路はアラビア語、英語、スペイン語、日本語、中国語、韓国語に対応します。
  • コード、導入スクリプト、筐体STLはApache 2.0で公開されていますが、正式サポート製品ではありません。
  • 精度、遅延、消費電力、電池評価はなく、重要な翻訳は確認が必要です。

結論. 説得力のあるオフラインエッジAI設計ですが、Raspberry Piが専門通訳や成熟したクラウド翻訳を置き換える証拠ではありません。

要点一台のPiで音声経路全体を実行

Raspberry Pi 5を二人用音声翻訳機にするプロジェクトです。モデルと依存関係の初回ダウンロード後は、音声認識、翻訳、音声合成をローカルで実行し、通常の翻訳にネットワーク要求を使いません。

価値はGemmaが文字を翻訳できることだけではありません。マイク入力、ローカル文字化、Gemma推論、ローカル音声出力、小型画面、導入スクリプト、3Dプリント筐体まで一式になっています。

構成三つのローカルモデルが分担

1. 音声認識Moonshineが選択された入力言語でマイク音声をローカル文字化。
2. 翻訳LiteRT-LMがRaspberry Pi CPUで命令調整済みGemma 4 E2Bを実行。
3. 音声合成moonshine-voiceが言語別のローカル音声で翻訳結果を再生。
画面React kioskが二つの言語レーン、録音、翻訳、再生を調整。

音声対応完全な経路は現在六言語

6現行コードの音声言語
8 GB基準Raspberry Pi 5のメモリ
6 GBモデル導入前の最低空き容量

ソースの前後端はアラビア語、英語、スペイン語、日本語、中国語、韓国語を対応付けています。Gemmaが追加言語を理解しても、音声認識と音声合成が両方対応しなければ完全な音声経路にはなりません。

ハードウェア基準構成に必要なもの

計算機8GBメモリのRaspberry Pi 5。
音声入力マイクまたはUSB音声入力。
音声出力スピーカー、ヘッドホンなど。
画面ディスプレイまたは小型タッチスクリーン。UIは約480 × 320向け。
筐体任意の3Dプリント用STLファイルを同梱。
記憶容量取得キャッシュと導入済みモデルが各約2.6GBで、スクリプトは6GB以上の空きを要求。

構築手順リポジトリからkiosk端末へ

  • 1. Linux、macOS、Raspberry Piで `google-gemma/gemma-translator` をクローン。
  • 2. `setup.sh`、`download_model.sh`、`start.sh`、`deploy-pi.sh` を実行可能にする。
  • 3. `./setup.sh` でPython環境、Node、アプリ依存関係を導入。
  • 4. オンラインで `./download_model.sh` を実行し、Gemma 4 E2BをLiteRT-LMへ導入。
  • 5. 開発は `./start.sh`、Raspberry Pi OSやDebianの常設端末は `./deploy-pi.sh` でsystemdとChromium kioskを構成。

現行画面はキーボード中心です。横向きはSpaceで話者変更、Zで録音、矢印で言語変更。縦向きは二人に別のキーを割り当てます。物理ボタンやノブはキー入力へ対応できますが、現行フロントエンドにはタッチ録音ボタンがありません。

オフラインの意味利点と代償を分けて考える

接続設定後はWi-Fiや携帯回線なしで通常翻訳を継続。
データ経路通常利用時の音声、文字化、翻訳、合成音声はローカル経路に残る。
費用ハードウェアとモデル導入後はリクエスト単位のクラウド推論料がない。
代償端末は大きく消費電力が高く、クラウドより遅い、不正確な可能性。
保守所有者が依存関係の更新、物理保護、ローカルログを管理。

証拠の範囲デモはベンチマークではない

利用前に各言語ペア、アクセント、騒音環境を試してください。人名、数字、医療指示、法的用語、緊急情報は繰り返しまたは別手段で確認する必要があります。

結論として、再現可能なエッジAIの参考設計であり、旅行や現場向けに改造できます。ただしソースコードを基盤として扱い、デモ映像を品質保証にしないことが重要です。