ジェマ
無料
Gemma は、Gemini の研究成果に基づいて Google DeepMind がリリースしたオープンソースの軽量
Gemma — Google のオープンソースの軽量大規模言語モデル シリーズ
コアパラメータと統計
| パラメータ | 詳細 |
|---|---|
| 最新バージョン | ジェマ2 (2B/9B/27B) |
| 発売日 | 2024-06-27 |
| ライセンス | Apache 2.0 (商業利用に完全にオープン、月間アクティビティ制限なし) |
| コンテキストウィンドウ | 8192 トークン (ジェマ 2) |
| 技術ソース | Gemini の研究結果に基づいて、知識蒸留技術を使用 |
| リリースチャンネル | HuggingFace、Kaggle、Google Cloud Vertex AI |
| バリアントモデル | CodeGemma (コード)、PaliGemma (ビジュアル言語)、RecurrentGemma |
| 量子化のサポート | GGUF、GPTQ、AWQ およびその他の主流の量子化フォーマット |
| 推論フレームワーク | ハギングフェイストランスフォーマー、llama.cpp、Ollama、vLLM |
| Google Colab サポート | 無料の Colab ノートブック、ブラウザで直接 Gemma を実行 |
Gemma と Llama の主な違いはライセンスです。Gemma は Apache 2.0 (ユーザー サイズ制限がなく、真に完全なオープン ソース) を使用しますが、Llama 3 の Meta Llama ライセンスは月間アクティブ ユーザー数が 7 億人を超えると特別なライセンスが必要になります。成長を続ける商用アプリケーションに対して、Gemma の Apache 2.0 ライセンスはさらに安心な法的保護を提供します。
ユーザーと市場の認識
2024 年 2 月のリリース以来、Gemma は HuggingFace でのダウンロード数が増加し続け、Llama シリーズに次いで 2 番目に人気のあるオープンソース LLM ファミリになりました。 Google の強力な開発者エコシステム (Kaggle、Colab、Google Cloud) は、Gemma に独自の流通チャネルを提供します。多数のデータ サイエンティストと Kaggle コンテスト参加者が使い慣れたプラットフォームを通じて Gemma にアクセスし、急速に成長するユーザー ベースを形成しています。
Gemma 2 27B は、LMSys チャットボット アリーナのブラインド テスト ランキングで GPT-4 Turbo に近いレベルに達しました。このベンチマーク結果は、オープンソース コミュニティで広く注目を集め、パラメータ効率の高い小型モデルが知識の蒸留を通じて予想されるパラメータ数をはるかに超えるパフォーマンス レベルを達成できることを証明しました。 CodeGemma や PaliGemma などのプロフェッショナル版のリリースにより、Gemma エコシステムのアプリケーション シナリオの範囲がさらに拡大します。
コストメリット
| 方法 | 価格 | 主な適用シナリオ | 特長 |
|---|---|---|---|
| ローカル展開 | ハードウェアのコスト (1 回限り) | プライバシー アプリケーション、開発実験 | Apache 2.0、商用制限なし |
| Google Cloud Vertex AI | トークンによる請求 (Gemini 料金システム) | エンタープライズ API の統合 | Google Cloud との緊密な統合 |
| ハグ顔推論 | 無料 (限定) または PRO プラン | 軽量アプリのテスト | 最速で開始でき、ローカル GPU は必要ありません |
| Kaggle ノートブック | 無料 (GPU を含む) | データサイエンス実験 | Kaggle ユーザーはゼロコストでアクセス |
Gemma 2 2B の量子化バージョンは、CPU 上でかろうじて動作し、MacBook (M チップ) または RTX 3060 上でスムーズに動作します。「ラップトップで実行できる AI モデル」の中で最も強力なオプションの 1 つです。 Gemma 2B/9B のハードウェア要件により、A100 を必要とする大規模モデルと比較して開発コストが大幅に低くなります。
主な機能
- Gemma 2 マルチスケール事前トレーニング モデル (ベース): 命令の微調整を行わない基本的な事前トレーニング モデルを提供します。これは、研究者が特定のタスクまたは分野で二次微調整を行うのに適しています。 2B/9B/27B の 3 つのスケールは、端末側の展開から高性能サーバーまで、さまざまなコンピューティング能力シナリオをカバーします。
- Gemma 2 命令微調整バージョン (命令): 命令に従い、安全な調整でトレーニングされた会話バージョン。チャット アシスタントや Q&A アプリケーションでそのまま使用できます。追加の微調整を行わずに、高品質の自然言語対話機能を取得できます。
- 知識蒸留最適化の超高パラメーター効率: Gemma 2 は、より大規模な Gemini モデル (Gemini から蒸留された 27B、27B から蒸留された 9B/2B) からパラメーター効率を取得することにより、同じパラメーター スケールで大幅に優れたベンチマーク テスト結果を達成しました。この「蒸留チェーン」戦略がGemmaシリーズの核となる技術革新です。
- CodeGemma (コード固有のバリアント): コード補完、コード生成、数学的推論に特化して最適化された Gemma バリアント。 2B (コード埋め込み) と 7B (命令バージョン) の 2 つの仕様が提供されます。コードタスクのパフォーマンスは、同じスケールの一般的な Gemma モデルよりも優れています。
- PaliGemma (ビジュアル言語マルチモーダル バージョン): 画像の理解をサポートするマルチモーダル Gemma のバリアント。画像とテキストの混合入力を処理し、画像の説明、視覚的な質問応答、文書理解タスクを実行できます。これは、Google の軽量マルチモーダル オープン ソース モデルの代表的なものです。
- Apache 2.0 無制限商用ライセンス: すべての Gemma モデルは Apache 2.0 ライセンスに従っており、ユーザー数や収入に制限がなく、あらゆるサイズの商用製品で自由に使用、変更、配布することができます。これは、最も自由なオープンソース LLM 商用ライセンスの 1 つです。
- Google Colab のゼロ構成エクスペリエンス: Google は、Gemma 用の公式 Colab ノートブックを提供しています。ユーザーは、ローカル GPU を使用せずに、ブラウザーで直接 Gemma を実行できます。これは、AI 学習者とデータ サイエンティストが Gemma を体験するための最も低いエントリー ポイントです。
- Kaggle エコロジカルな深い統合: Gemma は Kaggle プラットフォームに深く統合されており、Kaggle コンテストへの参加をサポートし、
ノートブックでの直接呼び出しとデータ サイエンス コミュニティ向けの独自の配布チャネルにより、Gemma を他のオープンソース LLM と区別する独自のニッチ市場が形成されます。
モデルとバージョンの進化
| バージョン | 発売日 | 説明 |
|---|---|---|
| ジェマ 1.0 (2B/7B) | 2024-02-21 | Google の最初の Gemma リリース、基本バージョン + コマンド バージョン、Apache 2.0 ライセンス |
| コードジェマ (2B/7B) | 2024-04-09 | コード固有のバリアント、コード充填および生成の最適化 |
| Gemma 1.1 (2B/7B 更新バージョン) | 2024-04-05 | コマンドは品質向上に伴い、バージョン 1.0 でのダイアログの問題を修正しました。 |
| リカレントジェマ (2B/9B) | 2024-04 | 線形再帰アーキテクチャに基づく効率的な推論バリアント、エッジ デバイスに適しています |
| PaliGemma (3B マルチモーダル) | 2024-05 | 画像理解タスクをサポートする視覚言語モデル |
| ジェマ2 (2B/9B/27B) | 2024-06-27 | 第 2 世代、知識蒸留の最適化、パフォーマンスの大幅な向上、27B は GPT-4 Turbo に近い |
| Gemma 2 JetBrains/Ollama | 2024-08 | 主流の IDE とローカル推論ツールは Gemma 2 をサポートしており、エコシステムは拡大し続けています。 |
技術的な利点
知識蒸留チェーンによってもたらされる超高パラメータ効率: Gemma 2 の技術的核心はマルチレベルの知識蒸留です。27B はより大きなジェミニから蒸留され、9B と 2B は 27B から蒸留されます。この蒸留チェーンにより、Gemma 2 モデルの各サイズがパラメーター サイズをはるかに超えるパフォーマンス レベルを達成できるようになります。これは、Gemma 2 9B が HuggingFace Open LLM Leaderboard で Llama 3 70B を上回った技術的な理由であり、モデル圧縮と知識伝達の分野における Google DeepMind の主要な研究結果を反映しています。
Apache 2.0 の最も緩い商用ライセンス: Llama の Meta Llama ライセンス (7 億 MAU を超えるには特別な許可が必要) と比較して、Gemma の Apache 2.0 ライセンスには商用利用に対する制限がありません。開発者や企業は、ビジネスの成長に伴うライセンス制限の発動を心配することなく、あらゆる規模の商用製品に Gemma を統合でき、オープンソース LLM を使用する企業の法的遵守リスクを軽減できます。
Google インフラストラクチャとの緊密な統合: Gemma は、Google Cloud、Vertex AI、Colab、Kaggle のネイティブ サポート モデルであり、これらのプラットフォーム上で最適なアクセスとツール サポートを備えています。クラウド インフラストラクチャに Google Cloud を採用している企業の場合、Gemma を使用すると、Vertex AI の管理された微調整されたモデル レジストリやセキュリティ モニタリング機能など、Google エコシステムとの最も緊密な統合が実現します。
小規模で高性能なエンドサイド展開の価値: Gemma 2 2B は、現在最もパフォーマンスの高い 2B パラメーター スケールのオープン ソース モデルの 1 つです。中程度の構成の Android スマートフォン (Google AI Edge フレームワークを使用) 上でローカルに実行でき、エンドサイド AI アプリケーション (オフライン音声アシスタント、プライバシー保護デバイス側処理など) に実用的なローカル LLM 機能を提供します。これは、Llama (最小 8B) と比較した Gemma の重要な差別化利点です。
使い方
| 入口 | 説明 |
|---|---|
| ハグフェイス | https://huggingface.co/google/gemma-2-9b にアクセスしてアクセスをリクエストし、モデルをダウンロードします。 |
| カグル | GPU アクセラレーションを含む、Kaggle ノートブックで Gemma を無料で使用する |
| グーグルコラボ | ローカル GPU なしで実行するには、Google の公式 Colab ノートブックを使用します。 |
| オラマ (地元) | ollama run gemma2:9b ワンクリックでローカルに展開 |
| 頂点 AI | Google Cloud Vertex AI 経由で Gemma API サービスにアクセス |
一般的な使用手順 (HuggingFace を Gemma 2 に接続):
- https://huggingface.co/google/gemma-2-9b にアクセスし、HuggingFace アカウントにログインし、使用契約に同意します (Apache 2.0、追加の制限なし)。
- 依存関係をインストールします:「pip install Transformers Accelerate」。
- HuggingFace Transformers を使用してモデルをロードします。「from transformers import AutoTokenizer, AutoModelForCausalLM」。
- トークナイザーとモデルをロードするか (9B モデルを実行するには少なくとも 20GB のビデオ メモリが必要です。2B は約 6GB です)、量子化バージョンを使用してビデオ メモリの要件を削減します。
- 推論コードを記述し、
model.generate()を使用してテキストを生成します。 Gemma コマンドのバージョンは、<start_of_turn>user ... <end_of_turn>会話形式に従います。 - 微調整が必要な場合は、パラメーターを効率的に微調整するために HuggingFace TRL + LoRA を使用することをお勧めします。
製品の価格設定
Gemma モデルの重みは完全に無料で、各プラットフォームの使用コストは異なります。
- モデル重量のダウンロード: 完全に無料、Apache 2.0 ライセンス、商用制限なし、HuggingFace または Kaggle から直接ダウンロードでき、特別なアプリケーションは必要ありません。
- ローカル導入: ハードウェアコストのみ。Gemma 2 2B は RTX 3060 (12GB) でスムーズに動作します。9B には RTX 3090 (24GB) またはマルチカード導入が必要です。
- Kaggle ノートブック: Kaggle の無料アカウントでは、限られた GPU 割り当て (週あたり約 30 時間の T4 GPU) が提供され、Gemma 実験を実行してゼロコストで開始できます。
- Google Colab: 無料版では GPU の使用量が制限されていますが、Colab Pro (月額約 10 ドル) ではより多くの GPU リソースが提供され、中規模の実験に適しています。
- Google Cloud Vertex AI: 商用 API サービスはトークンによって課金されます。具体的な料金については、Google Cloud の公式料金ページをご覧ください。エンタープライズレベルのアプリケーションにマネージド推論サービスを提供します。
アプリケーションのシナリオ
-
モバイルおよびエッジデバイスの AI 機能: Gemma 2 2B のコンパクトな設計は、エンドサイドの導入に最適化されています。 Google AI Edge フレームワークを通じて、ミッドエンドからハイエンドの Android デバイス上でローカルに実行できます。オフライン インテリジェント アシスタント、リアルタイム テキスト処理、プライバシー保護のデバイス側 NLP 機能をサポートします。これは、オフライン AI 機能を必要とするモバイル アプリケーションに推奨されるオープン ソース ソリューションです。
-
限られたリソースでの AI 導入: 組み込みシステム、エッジ サーバー、ローコンピューティング クラウド インスタンスの AI アプリケーションは、Gemma 2B/9B 量子化モデルを使用して、限られた GPU メモリ (8 ~ 16 GB) 内で実用的なテキスト生成および質問応答機能を提供します。ハードウェアの条件が限られている場合に、AI の機能を最大化するには理想的な選択です。
-
学生と研究者向けの AI 学習実験: Kaggle ノートブック (無料 GPU) を介して Gemma にアクセスすると、データ サイエンスの学生は完全な LLM の微調整、評価、導入プロセスをゼロコストで体験できます。 Apache 2.0 ライセンスにより、学術研究結果を自由に公開および商業化できることが保証され、AI 教育にとって最もバリアフリーなオープンソース LLM の 1 つとなります。
-
Google Cloud 企業向けの AI 統合: Google Cloud を採用した企業は、Vertex AI 上の Gemma を使用して、Google インフラストラクチャ、マネージド微調整サービスのモデル レジストリ バージョン管理、エンタープライズ グレードのセキュリティ コンプライアンス機能との最も緊密な統合を享受し、オープンソース モデルのコスト上の利点と Google Cloud のエンジニアリングの信頼性を組み合わせます。
-
コード支援ツール開発: CodeGemma 7B を使用して、プライベート化されたコード補完およびコード レビュー ツールを構築し、ローカルまたはイントラネット上に展開し、GitHub Copilot などのクラウド サービスを介したコード送信を回避します。 Apache 2.0 ライセンスにより、コード ツールを自由に商用化できることが保証され、知的財産保護を必要とするソフトウェア会社に適しています。
該当する人
- データ サイエンティストおよび Kaggle コンペティション参加者: Kaggle プラットフォームの緊密な統合と無料の GPU アクセスにより、このグループにとって Gemma は自然な選択となり、既存のワークフローにシームレスに適合します。
- モバイルおよびクライアント側 AI 開発者: デバイス上で LLM を実行する必要がある Android 開発者にとって、Gemma 2B と Google AI Edge の組み合わせが、現在最も成熟したクライアント側 LLM 開発ソリューションです。
- Apache 2.0 ライセンスが必要な企業: Llama の Meta Llama ライセンスに法的な懸念があり、より緩和されたオープンソース ライセンスを必要とする企業に対して、Gemma for Apache 2.0 は安心の商用利用保証を提供します。
- Google Cloud ユーザー: Google Cloud インフラストラクチャをデプロイしたチームは、Vertex AI で Gemma を使用して、最高の統合エクスペリエンスとエンタープライズ グレードのサポートを得ることができます。
- 不適切なシナリオ: 超長時間のコンテキスト処理 (>8K トークン) を必要とするアプリケーション (Gemma 2 コンテキスト ウィンドウは比較的小さいため、Llama 3.1 の 128K がより適しています)。最高のパフォーマンスを必要とする実稼働レベルのアプリケーション (Gemma 27B は同じ規模の競合製品よりも強力ですが、Llama 3.1 405B または GPT-4 と比較するとまだ差があります)。すでに安定した Llama テクノロジー スタックを持っていて、移行する動機がないチーム。
概要と展望
Gemma シリーズは、オープンソース AI の分野における Google の戦略的レイアウトを表しています。Gemini の優れた研究結果をオープン ライセンスの形で開発者コミュニティに公開することで、AI の人気を促進するだけでなく、Google エコシステム (Cloud、Colab、Kaggle) に多数の開発者を惹きつけます。知識蒸留チェーンによってもたらされる超高パラメーター効率は、Gemma の最も重要な技術的差別化ポイントであり、小規模モデルがパラメーター スケールの期待パフォーマンスを超えるパフォーマンスを実現できるようになります。
Apache 2.0 ライセンスの選択は、オープンソース コミュニティに対する Google の真摯な取り組みを反映しています。これは Meta の Llama ライセンスよりもオープンであり、法的コンプライアンスに敏感なエンタープライズ市場において独自の利点を形成します。
フォローアップの焦点: Gemma 3 シリーズのパラメータ スケールの拡張とマルチモーダル機能の強化 (ビジュアル、オーディオ)、PaliGemma ビジュアル言語モデルの機能進化、Google AI Edge のデバイス側展開エコシステムの完成度、および Gemini Nano (デバイス側 Gemini) との差別化されたポジショニングは、オープンソース LLM 競争環境における Gemma の長期的な地位を決定します。
関連ツール: hugging-face、replicate
バージョン情報
- ジェマ2(2B/9B/27B) :Gemma 2 が正式にリリースされ、2B、9B、27B の 3 つのパラメータ サイズが用意されています。知識蒸留テクノロジーを使用して、大規模なモデルの機能を小さなモデルに圧縮します。 LMSys Chatbot Arena などの主流のベンチマーク テストでは、Gemma 2 27B は GPT-4 Turbo レベルに近く、9B バージョンは同規模のすべてのオープンソース モデルを上回っています。すべてのバージョンは Apache 2.0 ライセンスに従い、商用利用は無料です。同時に、HuggingFace、Kaggle、Google Cloud の 3 つの主要チャネルが同時にリリースされるため、アクセスのしきい値が大幅に下がります。
- Gemma 1.1 (2B/7B 更新バージョン) :Gemma 1.1 の更新バージョンがリリースされました。 Gemma 1.0 でユーザーから報告された品質問題に続く指示に対処するために特別な改善が行われ、指示バージョン (Instruct) の対話機能が大幅に改善されました。同時に、CodeGemma (2B/7B コード固有バージョン) と RecurrentGemma (高効率推論バリアント) が正式にリリースされ、Gemma モデル ファミリがコード生成などのプロフェッショナルなシナリオに拡張されました。
- :Google は初めて Gemma オープンソース モデル シリーズをリリースし、事前トレーニング バージョン (Base) と命令微調整バージョン (Instruct) を 2B と 7B の 2 つのサイズでリリースしました。 Gemini モデルの研究結果の蒸留に基づいて、同じパラメーター スケールのオープンソース モデルのベンチマーク テストで優れた結果を達成しました。 HuggingFace、Kaggle、Google Colab の 3 つのアクセス チャネルを提供し、責任ある AI 使用ツールキットをリリースします。
ユーザーレビュー