ジェマ4 12B
無料
Gemma 4 12B は、Google のオープンソース マルチモーダル大規模モデルです。業界初のエンコーダレス統合アーキテクチャを採用し、テキスト、画像、オーディオ、ビデオの理解とエージェント推論をサポートします。 16 GB のビデオ メモリを搭載したラップトップ上でローカルに実行できます。
Gemma 4 12B: Google のオープンソース コーダーレス統合アーキテクチャ マルチモーダル大規模モデル
コアパラメータと統計
| プロジェクト | 仕様 |
|---|---|
| モデル/API名 | ジェマ4 12B |
| 製品タイプ | AIモデル/API |
| 納品形態 | API / クラウド推論 / ローカル展開 |
| コンテキストの長さ | 256K トークン (完全なモーダル アラインメント) |
| パラメータのサイズ | 12B (高密度アーキテクチャ) |
| サポートモーダル | テキスト/画像/音声/ビデオ |
| 価格モデル | 自己展開のための無料/ゼロコスト (Apache 2.0) |
| オープンソースライセンス | アパッチ2.0 |
コアパラメータの解釈: Gemma 4 12B の最大の違いは、エンコーダレスの統合アーキテクチャです。従来のマルチモーダル モデルは、独立したビジュアル エンコーダ (CLIP ViT など) に依存して画像/音声をトークンに変換して LLM に送信しますが、Gemma 4 12B はビジュアルおよびオーディオ データを LLM バックボーンに直接入力するため、エンコーダによって引き起こされる情報ボトルネックと情報損失が排除されます。 256K のフルモーダル コンテキスト ウィンドウは、セグメントを切り詰めることなく、長いビデオ、複数ページのドキュメント、および長いオーディオ セッションをすべて 1 つのパスで処理できることを意味します。 12B Dense パラメータ スケールは、コンシューマ グレードの GPU (16GB VRAM) で実行できます。これは、「ローカルでの可用性」の前提条件です。 Apache 2.0 ライセンスでは、追加条項なしで商用利用、変更、再配布が許可されています。
ユーザーと市場の認識
Gemma 4 12B のリリース後、オープンソース コミュニティや技術メディアですぐに幅広い注目を集めました。その理由は、パラメーター スケールの単純化だけでなく、「エンコーダーレス アーキテクチャ」によるマルチモーダル モデル設計パラダイムの破壊の可能性もあります。 HuggingFace の Gemma 4 シリーズ コレクション ページには、12B バージョンがリリースの最初の週に数十万回ダウンロードされ、同期間のオープン ソース モデル ダウンロード リストのトップになったことが示されています。主要なテクノロジー メディアのレポート (The Verge、TechCrunch、ArXiv コミュニティのディスカッション) は 3 つの方向に焦点を当てています。1 つは、エンコーダレス アーキテクチャが、主張されているパフォーマンス上の利点をより下流のタスクで再現できるかどうかです。 2 つ目は、12B パラメータが消費者向けハードウェアで実際に利用できる推論速度です。 3 つ目は、英語以外の言語 (特に中国語) でのモデルのパフォーマンスです。Google は、多言語ベンチマークで以前の大規模モデルを上回ったと主張しているためです。
開発者コミュニティ レベルでは、GitHub と HuggingFace に関する議論は主に、ローカル展開のハードウェア互換性 (16 GB のビデオ メモリを搭載した RTX 4060/4070 が完全な精度で実行するのに十分かどうか)、Ollama/LM Studio などのローカル推論フレームワークとの統合の進捗状況、および微調整ツール チェーンの成熟度を中心に展開します。 Google が公式に提供する Gemma 4 12B macOS デスクトップ アプリケーションは、非技術ユーザー向けのオープン ソース モデルの業界初のローカル実行ソリューションです。この動きにより、大規模なオープンソース モデルを使用する敷居は下がりますが、同時に「オープンソース モデルをアプリ ストアを通じて配布すべきかどうか」という議論も引き起こされます。
現在の市場の熱狂はまだ 早期採用段階 にあることに注意することが重要です。このモデルは 2026 年 6 月にリリースされる予定で、わずか約 6 週間前です。ベンチマーク テスト データと小規模な検証結果がコミュニティで徐々に明らかになりつつありますが、大規模な運用環境の安定性、ロングテール タスクの機能低下のリスク、コミュニティ エコロジーの完全性 (微調整ツール、定量的ソリューション、展開テンプレート) をテストするにはまだ時間が必要です。
コストメリット
| コスト ディメンション | 説明 |
|---|---|
| モデルライセンス | $0 (Apache 2.0、追加条件なし) |
| クラウド API 呼び出し | Google Cloud Vertex AI またはその他のホスティング プラットフォームを介したトークンごとの課金 |
| 自己展開型ハードウェア | 16GB+ VRAM GPU が必要 (RTX 4060 Ti 16GB などのコンシューマーグレードは約 3,500 円、RTX 4090 は約 13,000 円) |
| 自己展開推論フレームワーク | Ollama、LM Studio、vLLM、TensorRT-LLM はすべて互換性があります |
| 微調整コスト | パラメータを完全に微調整するには 32GB 以上の VRAM が必要です。 LoRA/QLoRAは16GBで完結可能 |
Gemma 4 12B のコスト構造は、従来のクローズドソースのマルチモーダル モデルとは根本的に異なります。 GPT-4o または Claude 3.5 Sonnet を比較してみましょう。クローズドソース モデルはトークンによって請求され、高頻度の通話にかかる月々の支出は数千ドルに達する可能性があります。一方、Gemma 4 12B の限界コールコストは、ハードウェアが適切に設置されている限り、ほぼゼロです。ただし、自己展開モデルでは、ハードウェアの購入コストを総所有コスト (TCO) として償却する必要があります。
TCO 控除 (12 か月):
- オプション A (自己導入): RTX 4090 (13,000 円) + 電気/冷却 (200 円/月 × 12 = 2,400 円) + 運用保守人員 (平均 4 時間/月と仮定 × 200 円/時間 × 12 = 9,600 円) = 25,000 円/年
- オプション B (API 呼び出し): 1 日平均 100 万トークン (入力 + 出力) を想定すると、同様のパラメーター スケール モデルに基づく API 料金は約 0.3 ドル/M トークン、月額料金は約 9 $×12 = 780 円/年 (ただし、サービスの可用性とデータ プライバシーによって異なります)
- オプション C (ハイブリッド): プライバシーと弾力性を考慮した、機密データのローカル推論処理 + 同時実行性の高いタスクのクラウド バッチ処理
重要な決定要因: 1 日の呼び出し量が約 500 万トークンを超えると、自己導入の限界コストが API ソリューションよりも低くなり始めます。データ プライバシーの要件が高くなるほど、通話頻度はより安定し、ハードウェアがすでに存在するシナリオでは、自己展開がより経済的になります。
主な機能
- すべてのモダリティの統一理解: テキスト、画像、オーディオ、ビデオの 4 つのモダリティは同じモデル内で均一に処理されるため、異なるモダリティに対して独立したパイプラインを構築する必要がなくなります。従来の独立したモデルの組み合わせソリューションでは実現できなかった、「チャートを見る→録音を聞く→分析レポートの出力」というクロスモーダルなタスクを 1 回の推論で完了できます。実際の使用では、入力モダリティの複雑さ (特に長いビデオのフレーム処理密度) に応じて推論速度が大きく変動します。
- 256K 超長コンテキスト: 一度に約 200 ページのドキュメントまたは 1 時間を超えるビデオ コンテンツの処理をサポートします。長い文書の Q&A、コード ウェアハウス レベルの理解、複数ラウンドの会議議事録分析などのシナリオでは、256K ウィンドウにより、モデルが会話レベルの一貫性を維持できます。ただし、長いコンテキスト推論の最初のトークンの遅延は (入力長に比例して) 大幅に増加すること、および長いコンテキストにおける「注意力の低下」問題はまだ完全には解決されていないことに注意する必要があります。モデルはコンテキストの最初と最後の内容に焦点を当てる傾向があり、中間部分の情報再現率が低下する可能性があります。
- エージェント推論: このモデルは関数呼び出しと思考連鎖をネイティブにサポートしており、複数ステップのタスク分解と環境対話を独立して完了できます。 LangChain や AutoGen などのエージェント フレームワークとの互換性は、Google の公式サンプルで実証されています。エージェントの機能の主な制限は、単一ステップ推論の成功率にあります。チェーン操作の各ステップでのエラーは蓄積され、複雑なタスク (5 ステップ以上) の実際の完了率は、ユーザーが独自のシナリオで検証する必要があります。
- macOS ネイティブ デスクトップ アプリケーション: Google は初めて、オープン ソース モデルのデスクトップ アプリケーションのワンクリック インストールを提供し、ローカルおよび完全なオフライン操作をサポートします。アプリケーションレベルでは、ダイアログ、ファイルアップロード(画像/PDF/ビデオ)、コンテキスト管理、モデル切り替え機能が統合されています。 macOS バージョンの M シリーズ チップ (M3/M4) は Apple Neural Engine を通じて実装されています
推論を大幅に高速化するために、Intel Mac は基本実行モードのみをサポートします。
モデルとバージョンの進化
| バージョン | 日付 | 主な変更点 |
|---|---|---|
| ジェマ 4 12B v1.0 | 2026年6月 | 最初のリリース、エンコーダレスの統合アーキテクチャ、256K コンテキスト、完全なモーダル サポート、Apache 2.0 |
| ジェマ4シリーズ | 2026-05 | シリーズデビュー (12B Dense + 31B Dense/MoE)、アーキテクチャ検証 |
Gemma 4 12B は、Gemma 4 シリーズの「小さなパラメーターのフラッグシップ」です。12B の高密度アーキテクチャは、シリーズ内の MoE バージョン 31B と補完的な位置付けを形成します。12B はローカル展開と低遅延シナリオに重点を置き、31B はクラウドでの高精度タスクに重点を置いています。 Gemma シリーズの開発の流れを見ると、Gemma 1 (2B/7B、2024-02)、Gemma 2 (9B/27B、2024-06)、Gemma 3 (1B/12B/27B、2025-03)、そして Gemma 4 へのアーキテクチャの移行は、エンコーダレス アーキテクチャという命題に対する肯定的な応答です。 「小さなパラメータで強力なマルチモダリティを実現できる」。以前の Gemma 3 には 12B バージョンがありましたが、独立したビジュアル エンコーダ (SigLIP) とオーディオ エンコーダ (Whisper) に依存していたため、マルチモーダル推論の遅延が大きく、クロスモーダル情報の調整効率が低くなってしまいました。 Gemma 4 12B の推論レイテンシは Gemma 3 12B よりも約 40% 低く (Google 公式データ)、モーダル アライメントの精度は 12 ~ 18 パーセント ポイント改善されています (MMMU および Video-MME ベンチマークに基づく)。
技術的な利点
- エンコーダーフリーの統合アーキテクチャ: これは Gemma 4 12B の中核となる技術革新です。従来のマルチモーダル モデル (LLaVA、Qwen-VL など) は、LLM に送信する前に非テキスト モダリティをトークン シーケンスに変換するために、LLM の前に独立したビジュアル エンコーダー (ViT) とオーディオ エンコーダー (Whisper など) を接続する必要があります。 Gemma 4 12B は、ビジュアルおよびオーディオのトークン化を LLM の入力投影層に直接統合し、エンコーダー リンクを排除します。この設計の直接的な利点は次のとおりです。(1) エンコーダによって引き起こされる情報のボトルネックが解消されます。従来の ViT の解像度とパッチ サイズでは画像の詳細の保持が制限されていましたが、Gemma 4 12B は元の解像度のより多くの情報を保持できます。 (2) モダリティ間のアライメント損失の削減 - エンコーダによって出力されたトークンは、LLM の単語埋め込み分布と一致しません。統一されたトークン化により、この不一致が排除されます。 (3) 推論遅延が減少します - エンコーダ推論リンクが 1 つ減ります。その代償として、トレーニング フェーズではより多くのマルチモーダル アライメント データとより複雑なトレーニング戦略が必要となり、モデルの視覚/音声品質は LLM バックボーンの埋め込み容量によって直接制限されます。
- ハードウェア互換性と推論の最適化: 12B Dense モデルは、FP16 精度で約 24GB のビデオ メモリを占有し、4 ビット量子化 (AWQ/GPTQ など) で約 7GB に圧縮できるため、RTX 4060 (12GB) と Apple M シリーズ チップの両方のユニファイド メモリ上で実行できます。 Google は、最大 30 ~ 50 トークン/秒の推論速度 (4 ビット量子化、RTX 4090) のネイティブ TensorRT-LLM および ExecuTorch 最適化パスを提供します。 macOS バージョンでは、CoreML と Apple Neural Engine によるさらなるハードウェア アクセラレーションが提供されます。
- エージェント ネイティブ サポート: このモデルでは、後の微調整を通じて追加するのではなく、トレーニング前の段階でツール呼び出しと構造化出力トレーニング データを導入します。これは、関数呼び出しと JSON 構造化出力の方が、追加後のソリューションよりも安定しており、形式の一貫性が高いことを意味します。このモデルは、並列ツール呼び出し (並列関数呼び出し) をネイティブにサポートしています。 1 つの推論で複数の外部ツール (検索 + 計算 + データベースなど) を同時に呼び出すことができます。
これは、エージェントのワークフロー実行の効率にとって非常に重要です。
- 生態学的互換性: モデルの重みは、Transformers、vLLM、LLaMA.cpp、Ollama などの主流の推論フレームワークと互換性のある SafeTensors 形式で HuggingFace でリリースされます。 Google は、モデルのダウンロードから推論デプロイメント (Docker イメージや Kubernetes Helm Chart を含む) までの完全なチュートリアルと、Colab および Vertex AI 用のワンクリックのクラウド デプロイメント テンプレートを公式に提供しています。
適応の境界と制限
- 推奨される使用シナリオ: 個々の開発者および学術研究者によるローカル マルチモーダル実験 (コンシューマー グレードの GPU で実行可能)。データプライバシーに敏感なシナリオにおけるローカル推論(医療/法律/財務文書分析)。 Agent/RAG システム用のローカル展開ソリューション。マルチモーダルな長いコンテキスト分析 (長いビデオの理解、複数ページの文書の Q&A、会議議事録の合成)。
- 推奨されません: ミリ秒レベルの応答を必要とするリアルタイムの対話シナリオ (ローカル推論の最初のトークンの遅延は 1 ~ 5 秒のレベルです)。出力形式に厳密なスキーマ制約がある実稼働レベルのデータ パイプライン (構造化された出力の安定性を完全に検証する必要がある)。極めて高い信頼性が必要とされる医療診断や法的文書の作成(大型モデルの幻覚問題は完全には解決されていません)。
- 既知の制限事項:
- エンコーダレス アーキテクチャのビジュアル入力品質は、LLM 埋め込み容量によって制限され、超高解像度画像 (8K+) の詳細を維持する能力は、専用ビジュアル モデル + LLM を組み合わせたソリューションよりも弱くなります。
- 多言語ベンチマークでは中国語の能力は向上しましたが、中国語の文章の品質と文化的背景の理解は、同規模の国内オープンソース モデル (Qwen2.5-14B など) に依然として遅れをとっています。
- オーディオ入力は現在シングル チャンネル (モノラル) のみをサポートしており、デュアル チャンネル/ステレオ シーンではダウンミックス処理が必要です。
- macOS デスクトップ アプリは Apple Silicon (M1+) のみをサポートします。Intel Mac ユーザーはコマンド ライン バージョンを使用する必要があります。
- コミュニティ微調整ツールチェーンはまだ成熟しておらず (2026 年 7 月現在)、公式微調整チュートリアルは LoRA のみをカバーしており、フルパラメーター微調整のリファレンス実装はまだ開発中です。
使い方
| 入口 | 使い方 |
|---|---|
| macOS デスクトップ アプリケーション | Google AI Studio 公式サイト ダウンロード → ダブルクリックしてインストール → 自動モデルダウンロード → 会話モード/ファイルアップロード |
| APIインターフェース(Vertex AI) | Google Cloud コンソールで API → API キーの取得 → REST API の呼び出しを有効にする |
| ローカル展開 (セルフホスト型) | huggingface-cli ダウンロード google/gemma-4-12B → vLLM/Ollama 読み込み → REST API サービス |
| Google AIスタジオ | Web エクスペリエンスは、ローカル ハードウェアを必要とせず、マルチモーダル入力をサポートしますが、サーバー クォータによって制限されます。 |
典型的な API 呼び出しの例 (Python + OpenAI 互換 SDK):
「」パイソン openaiインポートからOpenAI
Vertex AI または自己デプロイされたエンドポイントには、OpenAI 互換インターフェイス経由でアクセス可能
クライアント = OpenAI( Base_url="http://localhost:8000/v1", # vLLM エンドポイントを自己展開します api_key="<あなたのキー>" )
マルチモーダル入力例: 画像理解 + テキスト指示
応答 = client.chat.completions.create( モデル="google/gemma-4-12B", メッセージ=[ { "ロール": "ユーザー", 「コンテンツ」: [ {"type": "text", "text": "この図の技術アーキテクチャを詳細に説明し、考えられる設計上の欠陥を指摘してください"}, {"type": "image_url", "image_url": {"url": "data:image/png;base64,..."}} 】 } ]、 max_tokens=2048、 温度=0.2 ) print(response.choices[0].message.content) 「」
製品の価格設定
| 課金アイテム | 価格 |
|---|---|
| モデル ライセンス (自己展開) | $0 (Apache 2.0) |
| Vertex AI API (ボリューム別) | 入力 $0.15/M トークン、出力 $0.60/M トークン (参考価格、リアルタイム ページの影響を受ける) |
| Vertex AI バッチ推論 | $0.075/M トークンを入力、$0.30/M トークンを出力 (50% 割引) |
| 無料クレジット (AI Studio) | 1 日あたり 100 回の推論、それぞれ最大 4K コンテキスト |
価格情報は、Google Cloud Vertex AI の公式リアルタイム価格ページに準拠します。自己展開モードでは、ハードウェアと電気のコストのみが負担されます。
アプリケーションのシナリオ
- シナリオ 1: ローカル マルチモーダル ドキュメント分析 - 分析者は、50 ページの PDF (図および注釈付きスクリーンショットを含む) を macOS デスクトップ アプリに直接ドラッグし、モデルに「核となる議論を抽出し、構造化された概要を生成する」ように依頼します。 Gemma 4 12B は、256K コンテキスト ウィンドウですべてを一度に処理し、約 30 秒で概要を出力します。対照的に、従来の方法では、OCR でテキストを抽出し、独立した画像理解モデルを使用してグラフを分析し、最後に手動で要約する必要があり、合計で約 1 ~ 2 時間かかります。 検証方法: 出力された概要をページごとにランダムにチェックし、主要なデータ ポイントの引用精度と再現率を確認します。
- シナリオ 2: エージェント主導のコード レビュー自動化 - 自己展開環境でエージェント ワークフローを構築: Gemma 4 12B は推論エンジンとして機能し、コード ウェアハウスの PR イベント トリガーと連携して、「差分を読み取る → リスク パターンを特定する → レビュー意見を生成する → PR でコメントする」という 4 ステップの操作を自動的に実行します。 12B のパラメーター サイズにより、CI/CD の予算リソース (4 vCPU + 16 GB メモリ、GPU なし) で CPU モード (約 3 ~ 5 トークン/秒) で実行でき、1 回の PR レビュー (約 200 行の差分) を 3 ~ 5 分で完了できます。 検証方法: テスト ウェアハウスで既知の問題の PR を 50 回実行し、検出率と誤検知率をカウントします。
- シナリオ 3: 長いビデオ コンテンツのインデックス作成と取得 - 1 時間のトレーニング ビデオ (音声説明とスライドを含む) をモデルに入力して、セグメント化されたインデックス (タイムスタンプ + 各トピック + 主要なスクリーンショット) を生成します。このモデルは、音声転写とビジュアル コンテンツの両方を 1 つの推論で処理し、構造化されたビデオ チャプター タグを出力します。 検証方法: 5 つのランダムなサンプルのタイムスタンプの精度とコンテンツの概要の精度を手動で比較します。
該当する人
- 開発者および AI エンジニア: API またはローカル展開による製品統合を必要とする技術スタッフ。 Transformer の互換性と Agent の機能に焦点を当てます。
- 学術研究者: エンコーダレス アーキテクチャのモデル設計革新、マルチモーダル アライメント技術ロードマップ、および小さなパラメータ モデルによるパフォーマンスのトレードオフに焦点を当てます。
- データに敏感な企業: コンプライアンス要件 (医療データ、財務データ、顧客プライバシー) があり、独自の推論インフラストラクチャを構築したい組織。 Gemma 4 12B の Apache 2.0 ライセンスとネイティブで実行できる機能は、主要な魅力です。
- テクノロジー愛好家: 消費者グレードのハードウェアで最先端のマルチモーダル モデルを体験したい個人ユーザーにとって、macOS デスクトップ アプリケーションはゼロしきい値の入り口を提供します。
競合製品の比較
| 寸法比較 | ジェマ4 12B | クウェン2.5-14B-VL | LLaVA-1.6-13B | GPT-4o (参考) |
|---|---|---|---|---|
| アーキテクチャの種類 | コードレスの統合 | スタンドアロン ViT エンコーダ | スタンドアロン CLIP エンコーダ | クローズドソース、アーキテクチャ不明 |
| パラメータのサイズ | 12B 密 | 14B 密 | 13B 密 | — |
| コンテキストの長さ | 256K | 128K | 8K | 128K |
| マルチモーダルサポート | テキスト+画像+オーディオ+ビデオ | テキスト+画像 | テキスト+画像 | テキスト+画像+オーディオ+ビデオ |
| オープンソースライセンス | アパッチ2.0 | Apache 2.0 (基本) | アパッチ2.0 | クローズドソース |
| ローカル推論のための最小ハードウェア | 16GB VRAM / M1+ 16GB | 16GB VRAM | 16GB VRAM | 利用できません |
| エージェントのネイティブ サポート | はい (事前トレーニング済み) | はい (微調整された追加) | いいえ | はい |
| 中国語能力 | 良い | 素晴らしい | 平均 | 素晴らしい |
| API の価格設定 (参考) | $0.15/$0.60 | 0.5円/0.8円(アリババクラウド) | 無料の自己展開 | $2.50/$10.00 |
概要と展望
Gemma 4 12B は、オープンソースのマルチモーダル大規模モデルの分野でアーキテクチャ レベルで差別化されたソリューションを提供します。エンコーダレスの統合アーキテクチャは漸進的な改善ではなく、「どのようにして小さなパラメータ モデルでマルチモダリティを適切に実行できるか?」という核心的な質問に対する根本的な再回答です。 12B パラメータ + 消費者グレードの GPU 実行機能の組み合わせにより、ローカル マルチモーダル推論が「実験室のおもちゃ」から「実装可能なツール」に変わります。
現在の利点: (1) アーキテクチャの革新によってもたらされるクロスモーダル アライメント効率の向上は、ハードな利点です。 (2) Apache 2.0 ライセンス + ローカル実行機能により、データに敏感なシナリオではかけがえのないものになります。 (3) 256K のフルモーダル コンテキストは、同じパラメータ スケール レベルで先頭の位置にあります。
既知の制限: (1) コミュニティ ツール チェーン (微調整フレームワーク、定量的ツール、展開テンプレート) の成熟度は、LLaMA および Qwen エコロジーの成熟度よりもはるかに低いです。 (2) 中国語能力は前世代より向上していますが、まだギャップがあり、国内ユーザーは自分で評価する必要があります。 (3) 長いコンテキストのシナリオにおける「注意力の喪失」問題は完全には解決されておらず、実際のアプリケーションでは出力品質の検証メカニズムを確立する必要があります。
フォローアップの注意事項: (1) コミュニティ由来のモデル (微調整バージョン、定量バージョン、ドメイン固有バージョン) の出現の速度と質 - これは生態学的健全性の直接的な指標です。 (2) Google の Gemma 4 シリーズの更新頻度とパッチ サポート サイクル。 (3) エンコーダレス アーキテクチャが他のモデル ファミリ (LLaMA、Qwen など) に採用されるかどうか。これは、Gemma 4 12B の長期的な技術ロード競争力に関係します。
潜在的なユーザーは、実稼働環境に導入するかどうかを決定する前に、macOS デスクトップ アプリケーションまたは Google AI Studio の無料割り当てを使用して、出力品質の一貫性、推論速度の許容性、および長いコンテキストのシナリオの情報再現率に焦点を当てて、独自のシナリオで 1 ~ 2 週間のテストと検証を実施することをお勧めします。
関連ツール: hugging-face、replicate
バージョン情報
- Gemma 4 12B 正式版 :Google のオープンソース マルチモーダル大規模モデルは、エンコーダのない統合アーキテクチャを採用しています。 12B パラメータは、テキスト/画像/オーディオ/ビデオの理解とエージェントの推論をサポートします。 Apache 2.0 ライセンス。
- Gemma4シリーズ発売 :Gemma 4 シリーズは、12B Dense バージョンと 31B Dense/MoE バージョンでデビューします。
ユーザーレビュー