AI21ラボ(AI21スタジオ)
無料
AI21 Labs はイスラエルのトップ AI 基本モデル企業です。その AI21 Studio は、Jamba シリーズの大規模モデルの API アクセスとプライベート デプロイメントを提供します。 Jamba は、革新的な Mamba-Transformer ハイブリッド アーキテクチャを使用して、256K の超長いコンテキストで非常に高い推論効率を維持します。 It supports Function Calling, JSON schema, document retrieval and fine-tuning, making it a cost-effective choice for enterprise-level LLM deployment.
AI21 Labs(AI21スタジオ)
コアパラメータと統計
AI21 Labs は、AI21 Studio プラットフォームを通じて Jamba シリーズの大規模モデルへの API アクセスを提供します。 Jamba ファミリの競争力の核心は、その独自の Mamba-Transformer ハイブリッド アーキテクチャにあります。Transformer アテンション メカニズムの高品質を維持しながら、長いシーケンスを処理するために Mamba 状態空間モデル (SSM) を導入し、256K トークンの超長いコンテキスト推論の計算の複雑さを 2 次から線形に軽減し、同じハードウェア条件下でのスループットは純粋な Transformer アーキテクチャのスループットよりも大幅に高くなります。
| 特長 | ジャンバ ラージ (1.7) | ジャンバ ミニ (v2) | ジャンバ 3B (v2) |
|---|---|---|---|
| 合計パラメータ | 398B | 52B | 3B |
| アクティベーションパラメータのサイズ | 94B | 12B | 3B(密) |
| アーキテクチャの種類 | Mamba-Transformer ハイブリッド MoE | Mamba-Transformer ハイブリッド MoE | 高密度トランス |
| コンテキストウィンドウ | 256,000 トークン | 256,000 トークン | 256,000 トークン |
| 最大出力 | 4096 トークン | 4096 トークン | — |
| ナレッジ期限 | 2024-08-22 | 2024-08-22 | 2024-08-22 |
| API エンドポイント | ジャンバ-ラージ |
ジャンバミニ | API 経由では利用できません |
| 価格 (インプット/アウトプット/100 万トークン) | 2ドル / 8ドル | $0.2 / $0.4 | オープンソースの無料ダウンロード |
| サポートされている言語 | 9 (英語、スペイン語、フランス語、ポルトガル語、イタリア語、オランダ語、ドイツ語、アラビア語、ギリシャ語を含む) | 通左 | 通左 |
256K コンテキストの真の価値: 主流モデルの 128K または 8K ~ 32K ウィンドウと比較して、Jamba の 256K は、約 400 ページの PDF ドキュメントまたは中程度の長さの技術マニュアル全体を、シャーディングやスライディング ウィンドウ戦略を必要とせずにシングル パスで処理できることを意味します。線形複雑性のアーキテクチャ特性と組み合わせると、Jamba の遅延増加曲線は、長い文書の要約、完全なコードベース分析、複数ラウンドの会話履歴の取得などのシナリオにおいて、純粋な注意モデルの遅延増加曲線よりもはるかに平坦になります。ただし、タスクが 4K 内のコンテキストのみを必要とする場合、256K ウィンドウは自動的に追加の利点をもたらしませんが、モデルはより長い位置のエンコーディングをカバーする必要があるため、注意力がわずかに低下する可能性があります。これは、非常に長いコンテキスト モデルの一般的なトレードオフです。
パフォーマンスとスループットのリファレンス: AI21 Labs は、正確な TTFT (最初のワード遅延) および TPM/RPM 周波数制御値を公開していません。サードパーティ コミュニティのフィードバックによると、中程度の同時実行環境における Jamba Large の最初のワード遅延は約 500 ~ 1200 ミリ秒であり、Jamba Mini は約 200 ~ 500 ミリ秒です。実際のパフォーマンスは、入力長、出力長、同時実行性の総合的な影響によって影響されます。頻度の制御に関しては、デフォルトの API クォータはパッケージによって変動するため、高頻度のシナリオではカスタム プランによる拡張を適用する必要があります。具体的な値はAI21 Studioの公式リアルタイムページに準じます。
推論強度とコストはオプション: AI21 Studio は、「思考」モードと「ストレート アウト」モードを区別しませんが、出力の確実性と多様性を 2 つのパラメーター「温度」(0.0 ~ 2.0) と「top_p」(0.0 ~ 1.0) を通じて制御します。高い確実性を必要とするエンタープライズ シナリオ (契約条項の生成、データ分類) の場合は、JSON スキーマで temperature=0.1 を使用することをお勧めします。クリエイティブなタスク (コピーライティング、ブレインストーミング) には、「温度=0.7-0.9」が推奨されます。独立した「推論モード」がないということは、複雑なロジック タスクの場合、モデルに組み込まれている深い推論スイッチではなく、CoT (連鎖思考) をガイドするプロンプト エンジニアリングに依存する必要があることを意味します。
ユーザーと市場の認識
AI21 Labs の市場ポジショニングは、「エンタープライズレベルで制御可能な AI」に焦点を当てています。 C エンドの消費者市場での規模効果は追求しませんが、データ主権、コンプライアンス監査、導入の柔軟性に対する厳格なニーズを持つ中規模および大規模組織を深く育成します。
エンタープライズ顧客の浸透度: AI21 Labs が公表している顧客は、金融、医療、国防、テクノロジー小売などの複数の垂直産業をカバーしています。典型的な顧客事例としては、サプライチェーンの文書処理と分析に Jamba を使用している大規模小売業者や、コンプライアンスのレビューとリスク レポートの作成に Jamba を使用している金融機関が挙げられます。防衛および政府の分野では、Jamba のセルフホスティング機能と ISO/SOC2 コンプライアンス認証が主要なセールス ポイントを形成しています。モデルは VPC またはオンプレミスにデプロイでき、トレーニング データはサードパーティによってアクセスされません。
オープンソース コミュニティの影響: Jamba モデルは、Hugging Face でダウンロードできるオープンソースであり、Jamba Large と Jamba Mini の重みは自由に入手できます (AI21 モデルの利用規約に従う)。公開されている Hugging Face データによると、Jamba シリーズのモデルは合計で数百万回ダウンロードされています。これらは、オープンソース コミュニティにおける「注目度は高いがトップではない」という第 2 階層に属しており、Llama や Mistral ほど知名度は高くありませんが、ロングコンテキストの効率性とプライベート展開機能の点で差別化された認識を形成しています。
資金調達と商業化の進捗状況: AI21 Labs は総額 3 億米ドル以上を調達しており、投資家には Google、NVIDIA、Walden Catalyst などが含まれています。2024 年から 2025 年にかけて数ラウンドの大規模資金調達が完了し、評価額は 10 億ドルを超え、イスラエルで最も評価の高い AI 企業の 1 つとなっています。商用化の観点から、AI21 は API サブスクリプションと民営化された導入認可を主な収益モデルとして使用しています。また、Maestro (AI エージェント プラットフォーム) と Wordtune (ライティング アシスタント) を通じて製品ラインを拡大し、「基本モデル + エージェント プラットフォーム + エンド アプリケーション」の 3 層の収益構造を形成しています。
業界ベンチマークの位置付け: Jamba シリーズは、長いテキストの理解と検索の拡張生成 (RAG) シナリオで優れたパフォーマンスを発揮します。256K のコンテキスト ウィンドウと Mamba アーキテクチャの直線的な複雑さにより、大規模なドキュメント処理シナリオでコスト効率の高い大きな利点が得られます。ただし、一般知識の質疑応答、複雑な数的推論、アイデア創出タスクに関しては、Jamba の能力の上限は、同時期の GPT-5、Claude 4、Gemini 3 などのフラッグシップ モデルに比べて低くなります。その核となる競争力は、「絶対的な能力の高さ」ではなく、「制御性、コスト効率、コンプライアンスの総合的なバランス」にあります。
コストメリット
AI21 Labs の価格戦略は、ほとんどの API ベンダーの価格戦略とは異なります。「無料クレジットと多額の投資」による C サイドの顧客獲得には関与しませんが、従量課金制からエンタープライズ レベルの調達のための民営化導入まで、完全なコスト オプションを直接提供します。
C サイド/個人開発者のコスト: AI21 Studio は 10 ドルの無料トライアルを提供しています (7 日間有効、クレジット カードは必要ありません)。試用期間終了後は従量課金制となります。無料のクレジットを提供し続ける OpenAI、Anthropic、その他の戦略と比較すると、AI21 は新規ユーザーにとって敷居が高く、プロトタイプの検証やコンセプト テストには 10 ドルのクレジットで十分ですが、長期的な個人使用をサポートするには不十分です。毎日の Q&A や執筆支援のみを必要とする個人の開発者にとって、Jamba の価格性能比は、より安価な競合他社 (DeepSeek や Groq 経由でアクセスできるオープン ソース モデルなど) ほど良くありません。
API の価格: 徹底した比較
| モデル | 入力価格 (100 万トークンあたり) | 出力価格 (100 万トークンあたり) | コンテキストウィンドウ | 典型的なシナリオの費用対効果の評価 |
|---|---|---|---|---|
| ジャンバ ミニ (v2) | $0.20 | $0.40 | 256K | 長い文書の分類、要約 RAG 取得 - 超長いコンテキストの下で非常にコスト効率が高い |
| ジャンバ ラージ (1.7) | $2.00 | $8.00 | 256K | 複雑な推論、複数ステップのタスク - 主力モデルの中で中程度から低価格の価格設定 |
| GPT-5.5 プロ (リファレンス) | ~$30.00 | ~$180.00 | 128K | — |
| クロード作品 4.8 (リファレンス) | ~$15.00 | ~$75.00 | 200K | — |
| DeepSeek V4-Flash (リファレンス) | ~$0.14 | ~$0.28 | 1M | 非常に長いコンテキストですが、エンタープライズプライベートではありません |
AI21 のトークン価格設定の利点: AI21 は、そのトークン化効率が競合製品よりも約 30% 高い、つまり、同じ量のテキストでも消費するトークンが少なくなると公式に主張しています。これは、実際の「1,000 ワードあたりのコスト」が表面的な比較よりも低い可能性があることを意味します。 Jamba Mini を例にとると、トークンの効率を考慮すると、入力トークン 100 万個あたり 0.20 ドルの実際のコストは、競合製品トークン 100 万個あたり 0.14 ドルに相当する可能性があります。長い文書処理タスクの場合、この差により実際の請求額が 10 ~ 30% 削減される可能性がありますが、これは言語とテキストのコンテンツ タイプによって異なります。中国語テキストでは、英語ほどトークン化の効率向上が明らかではない可能性があります。
エンタープライズ/プライベート展開コスト: Jamba の民営化された展開は、エンタープライズ調達における最大の差別化セールス ポイントです。モデルの重みは独自の VPC またはローカル サーバーにダウンロードでき、推論データは完全に分離されます。コスト要素には次のものが含まれます。
- ライセンス費用: オープンソース モデルの重み自体は無料ですが、商業利用には AI21 モデルの利用規約に従う必要があります (MIT などの緩やかなライセンスではなく、特定の拘束条件を確認する必要があります)。
- インフラストラクチャ コスト: Jamba Large (398B/94B アクティブ化) での推論にはマルチカード GPU クラスター (4 ~ 8×A100-80G を推奨) が必要ですが、Jamba Mini (52B/12B アクティブ化) はシングルカード A100 で実行できます。毎月のインフラストラクチャのコストは数千ドルから数万ドルの範囲です。
- 運用、保守、およびカスタマイズのコスト: 微調整 (完全な微調整、LoRA、QLoRA をサポート)、展開構成、監視、およびバージョンの更新にはチームの投資が必要です。 AI21はエキスパートAIコンサルティングサービス(カスタムプラン)を提供しており、料金は応相談となります。
- 隠れたコスト: モデル バージョンの反復を再検証する必要があります。 Jamba の Mamba アーキテクチャは、主流の推論フレームワーク (vLLM、TGI) の純粋な Transformer モデルほど最適化されていない可能性があり、展開中に追加の調整が必要です。
主な機能
AI21 Studio の API 機能は、「制御可能な出力 + エンタープライズレベルの統合」の 2 つのラインを中心に設計されています。機能の積み重ねを追求するのではなく、本番環境の安定性と監査可能性に重点を置いています。
-
チャットコンプリーション: 標準の OpenAI 互換インターフェイス。「messages」配列 (システム/ユーザー/アシスタント/ツールの役割)、「温度」、「top_p」、「max_tokens」、「stop」、「stream」などの共通パラメータをサポートします。 OpenAI との主な違い: 「seed」パラメータはサポートされていません (出力に決定論的に再現可能な行がないことを意味します)。「n」パラメータは 1 ~ 16 をサポートしますが、「n > 1」の場合は温度を 0 にすることはできません。 「max_tokens」には 4096 というハード上限があり、これは非常に長い出力を必要とするタスク (長いドキュメントの生成など) に制限されています。モデルは非常に長いコンテンツを「読み込む」ことができますが、「書き込む」ことができるのは 4K の長さだけであるため、これは 256K 入力ウィンドウの利点をある程度相殺します。
-
関数呼び出し: カスタム関数定義をサポートしており、モデルはユーザー入力に基づいてパラメーターを呼び出して渡すかどうかを自動的に決定できます。これは、エージェント タイプのアプリケーション (データ クエリ、外部 API 呼び出し、ビジネス システム統合) にとって非常に重要です。 AI21 の実装は OpenAI 互換形式に従っており、移行コストが低くなります。 実装のヒント: Jamba のツール呼び出しの信頼性は、サードパーティの評価では中の上レベルにあり、GPT-4 シリーズよりは低いですが、同じパラメーター数のオープンソース モデルよりは高くなります。ビジネスクリティカルな自動プロセスの場合、呼び出しの精度を向上させるために、プロンプトにトリガー条件と戻り値の制約を明示的に記述することをお勧めします。
-
JSON モード (構造化出力):
response_format: {"type": "json_object"}を通じて、モデルが正当な JSON を出力するように強制します。これは、データ抽出、構造化出力、およびダウンストリーム システム統合シナリオに役立ちます。 注意: JSON モードを有効にすると、モデルは一部のエッジ ケースで空の JSON または不完全な構造を出力することがあります。アプリケーション層でスキーマ検証を実行し、失敗した場合は再試行することをお勧めします。 -
ドキュメント検索: リクエストの
documentsパラメーターをサポートします。複数のドキュメント オブジェクト (コンテンツとメタデータを含む) を渡すと、モデルは意味論的な関連性に基づいてドキュメントを取得し、それを使用して回答を生成します。これは組み込みの RAG (検索拡張生成) 機能であり、追加のベクトル データベースや検索パイプラインを構築する必要はありません。書類の上限や1書類の長さは公文書に準じます。 シナリオの価値: カスタマー サービスのナレッジ ベース、製品ドキュメントの Q&A、コンプライアンス条件のクエリなどのシナリオの場合、ナレッジ ベースのコンテンツを API パラメータを通じて直接転送できるため、RAG システムの構築と保守のコストが大幅に削減されます。 -
ファイル ライブラリ: AI21 Studio はクラウド ファイル管理機能を提供し、ドキュメントのアップロードと API 呼び出しでの参照をサポートします。ファイルはタグ付けして分類できるため、複数のシナリオでの再利用が容易になります。ドキュメント ライブラリ内のドキュメントは、モデルのドキュメント検索によって取得でき、永続的なナレッジ ベース インフラストラクチャを形成します。
-
微調整: フル微調整、LoRA、QLoRA の 3 つの微調整方法をサポートし、完全なパラメータ適応から効率的なパラメータ微調整まで、さまざまなレベルの要件をカバーします。微調整されたモデルにはプライベート API エンドポイント経由でアクセスでき、データが他の顧客と混合されることはありません。 適用可能な境界: 微調整は、シナリオ固有のタスク (ドメイン用語の生成、特定の形式の出力など) に最適です。一般的な能力の向上(推論や創造性の向上など)の場合、微調整の効果は限られており、壊滅的な忘れのリスクをもたらす可能性があります。
-
Maestro Agent Platform: AI21 が提供するエンドツーエンドのエージェント構築プラットフォームは、Validated Output (検証済み出力)、MCP Server 統合 RAG パイプライン ビジュアル オーケストレーションなどの機能を提供します。 Maestro は、Jamba API の上位オーケストレーション層として使用でき、複雑なワークフローと出力検証を必要とする運用レベルのエージェント シナリオに適しています。機能のこの部分は AI21 Studio の独立した製品ラインに属しており、個別に理解する必要があります。
モデルとバージョンの進化
AI21 Labs のモデル バージョンの進化の道筋は明らかです。2024 年初頭の第一世代 Jamba 研究モデルから始まり、2 年未満で「アーキテクチャ検証」から「マルチ仕様製品マトリックス」への移行を完了しました。
Jamba 第一世代: アーキテクチャ検証 (2024-03)
Jamba (1.0) は、2024 年 3 月に AI21 Labs によってリリースされた研究モデルです。Mamba (状態空間モデル) と Transformer アテンション メカニズムが初めて統合されています。核となるイノベーションは、Mamba レイヤーを使用して Transformer レイヤーの一部を置き換えることで、ローカル コンテキスト モデリングにおける Transformer の品質上の利点を維持しながら、長いシーケンス推論の計算の複雑さを O(n²) から O(n) に軽減します。これは、主にハイブリッド アーキテクチャの実現可能性を検証することを目的とした研究指向のリリースです。
Jamba 1.5: 製品化の出発点 (2024-08)
Jamba 1.5 シリーズは、ハイブリッド アーキテクチャを研究プロトタイプから市販の API 製品に変換します。また、ラージ (398B/94B アクティベーション) とミニ (52B/12B アクティベーション) の 2 つの仕様も提供します。 256K コンテキスト ウィンドウがシリーズ全体で標準となります。これは、AI21 Studio の商用 API の中核となる出発点であり、「エンタープライズ レベルのロング コンテキスト」という製品の位置付けを確立します。
Jamba 1.6: エンタープライズ オープンソースの深化 (2025-03)
Jamba 1.6 1.5 をベースとして、命令追従機能、ツール呼び出しの信頼性、および長いコンテキストの安定性がさらに最適化されています。 AI21はこのバージョンを「企業のプライベート展開に最適なオープンソースモデル」と位置づけ、256Kのコンテキストを維持しながら、同じパラメータ数の純粋なTransformerモデルと比べて推論スループットが2~3倍向上していることを強調した。バージョン 1.6 のリリースは、Jamba の「技術的にユニークな」ものから「商業的に実用的な」ものへの変革を示しています。
Jamba Large 1.7: フラッグシップ イテレーション (2025-07)
Jamba Large 1.7 は、現在 API (API エンドポイント jamba-large) を通じて利用できる主力の Jamba Large モデルです。主な改善点は、コマンド追従精度と多言語機能に重点を置いています。バージョン 1.7 では、アーキテクチャに大きな変更は加えられていませんが、高品質のトレーニング データとトレーニング後の最適化を通じて出力品質が向上しています。
Jamba2 シリーズ: 効率と専門化 (2026-01)
Jamba2 シリーズのリリースは、製品ラインのさらなる差別化を表しています。
- Jamba2 Mini (52B/12B アクティベーション): 第一世代 Mini を置き換えるもので、コア API 製品として位置付けられ、価格は 0.2 ドル/0.4 ドルで、高効率と操作性に重点を置き、ほとんどのエンタープライズ ワークフローに適しています。
- Jamba2 3B (3B 集中パラメータ): エンドサイド デバイスおよび軽量エージェント ワークフローの場合、CPU またはエッジ デバイス上で実行でき、Jamba の展開境界を拡張します。
- Jamba Reasoning 3B (2025-10): 3B モデルに基づく「推論機能」の特化を追加し、低遅延とコンパクトなサイズでエンタープライズ レベルの推論品質を提供します。この方向性は注目に値します。これは、AI21 が「推論」の主力モデルの機能をカバーするために特化した小型モデルの使用を検討していることを示しています。
バージョン展開ロードマップ: AI21 では、モデルのアップグレードによる動作の変更を避けるために、API ユーザーがバージョンのないエイリアス (「jamba-large」など) ではなく、バージョン番号を持つエンドポイント (「jamba-large-1.7-2025-07」など) を使用することを推奨しています。バージョン管理されていないエイリアスは最新のスナップショットを指すため、予告なく更新される可能性があり、運用環境でのリグレッションのリスクが生じます。
技術的な利点
Jamba の技術的なルートの選択は、品質を犠牲にすることなく、エンタープライズレベルのロングコンテキストのシナリオで大規模なモデルをより高速に実行し、コストを節約し、より制御しやすくする方法という核心的な問題を中心に展開しています。
Mamba-Transformer ハイブリッド アーキテクチャのメカニズム: 従来の Transformer のセルフ アテンション メカニズムは、シーケンスの長さが増加すると計算が二次関数 (O(n²)) で増加します。256K トークンを処理するための理論上のアテンション マトリックスのサイズは約 256K × 256K で、これはハードウェア メモリをはるかに超えます。 Mamba は状態空間モデル (SSM) に基づいており、その計算複雑さは線形 (O(n)) ですが、長距離の依存関係を必要とする一部のタスクでは、Mamba を単独で使用するのは Transformer ほど優れていません。 Jamba の革新性は、Mamba レイヤーと Transformer アテンション レイヤーの重複使用 (混合レイヤー スタッキング) にあり、これにより、モデルが短距離の関連付けを処理する際のアテンションの精度と、長距離のコンテキストを処理する際の Mamba の線形効率を利用できるようになります。この「階層化された分業」戦略により、Jamba は 256K ウィンドウの下で 8K ウィンドウと同様の推論レイテンシーを維持できます。
MoE ルーティングの高いアクティブ化効率: Jamba Large の合計パラメータは 398B ですが、推論中に 94B のみアクティブ化します (アクティブ化率約 24%)。Jamba Mini の合計パラメータは 52B で、12B をアクティブ化します (アクティブ化率約 23%)。アクティベーション効率が高いということは、各呼び出しが質問に答えるために「関連するエキスパート」のみを使用する一方、「無関係な」エキスパートのパラメータは推論中にストレージのみを消費し、計算を消費しないことを意味します。この設計では推論のコストが大幅に削減されますが、ルーティング戦略による単一の推論でモデルが呼び出すことができる知識の幅も制限されます。複数の専門分野にわたる知識の融合が必要なタスクの場合、ルーティングによって関連する専門家が見逃され、出力の品質が低下する可能性があります。
256K コンテキスト ウィンドウの企業価値: 256K コンテキストは、主流の大型モデルの中でもトップクラスです (これより大きいのは DeepSeek V4 の 1M と Gemini 3 Pro の 2M だけです)。 Jamba の違いは、Mamba レイヤーが長いシーケンス処理の複雑さを O(n²) ではなく O(n) に制御するため、推論レイテンシーの増加曲線が 256K で最も平坦になることです。大量の長いドキュメントを毎日処理する企業 (法的契約のレビュー、財務諸表の分析、技術標準の比較) にとって、これはドキュメントごとの推論コストが削減され、タイムアウトの再試行が少なくなることを意味します。
プライベート展開のための技術アーキテクチャ: Jamba は、vLLM やテキスト生成推論 (TGI) などの主流の推論フレームワークをサポートしています。 Hugging Face から SafeTensors 形式でダウンロードでき、AWQ や GPTQ などの量子化スキームをサポートしてグラフィックス メモリの使用量を削減します。 AI21 は、AWS、GCP、Azure での VPC 導入ガイダンスをカバーするクラウド プラットフォーム導入ドキュメントも提供します。極度のコンプライアンスが必要なシナリオの場合、Jamba は完全にオフラインのオンプレミス展開をサポートします。トレーニング データを企業インフラストラクチャから離れる必要はありません。
コンプライアンスとセキュリティ ベース: AI21 Labs は、SOC 2 認証 ISO 27001/27017/27018 認証に合格しており、完全なトラスト センター (トラスト センター) とセキュリティ ドキュメントを提供しています。金融、医療、政府などの規制業界では、これらの認定は追加の利点ではなく、調達の前提条件となることがよくあります。
使い方
AI21 Studio には、クラウド API (SaaS モード) とセルフホスト型展開 (プライベート化モード) という 2 つの主な入り口があります。前者は迅速な統合に適しており、後者はコンプライアンスに敏感なシナリオに適しています。
| 使い方 | 群衆に適しています | アクセスパス | コストモデル |
|---|---|---|---|
| AI21 スタジオ API | 開発者と企業 | studio.ai21.com でアカウントを登録し、API キーを作成します | 従量課金制 (100 万トークンあたり 0.2 ~ 8 ドル) |
| 自主運営民営化 | 高いコンプライアンス要件を持つ企業 | Hugging Face からモデルの重みをダウンロードし、独自の VPC またはローカルにデプロイします。インフラストラクチャ + 運用 | |
| AI21 スタジオ プレイグラウンド | 評価とテスト | Studio Web UI へのブラウザーからの直接アクセス | 10 ドルのクレジット付きの無料トライアル |
| Maestro エージェント プラットフォーム | エージェントワークフローの構築 | スタジオのマエストロモジュール | 支払い額またはカスタム プラン |
API クイック スタート (Python SDK): AI21 は、pip install ai21 をインストールした後に呼び出すことができる公式 Python SDK を提供します。
「」パイソン ai21 から AI21Client をインポート ai21.models.chat から ChatMessage をインポート
client = AI21Client(api_key="
応答 = client.chat.completions.create( model="jamba-large"、# または "jamba-mini" メッセージ=[ ChatMessage(role="system", content="あなたはプロの財務アナリストであり、回答は提供された文書に基づいている必要があります。"), ChatMessage(role="user", content="この財務報告書の概要に基づいて、会社の収益成長傾向を分析します。") ]、 max_tokens=1024、 温度=0.3、 トップ_p=0.9、 response_format={"タイプ": "テキスト"} )
print(response.choices[0].message.content) 「」
cURL の例:
「」バッシュ カール https://api.ai21.com/studio/v1/chat/completions \ --header "認可: ベアラー $AI21_API_KEY" \ --header "コンテンツ タイプ: application/json" \ --データ '{ "モデル": "ジャンバミニ", "max_tokens": 1024、 「温度」: 0.4、 「メッセージ」: [ {"role": "user", "content": "この契約の重要なポイントを要約します。"} ] }' 「」
主要なパラメータの説明:
温度(0.0-2.0、デフォルトは 0.4): 出力のランダム性を制御します。コーディングおよび事実に基づくタスクには 0.1 ~ 0.3 が推奨され、クリエイティブなタスクには 0.7 ~ 0.9 が推奨されます。top_p(0.0-1.0、デフォルトは 1.0): カーネル サンプリング。温度と連動して動作します。通常、調整できるのは温度のみで、top_p はデフォルトのままです。max_tokens: 出力トークンの最大数。Jamba モデルの上限は 4096 です。超過すると出力は切り捨てられます。stream(ブール値): SSE ストリーミング出力を有効にします。最初の単語の遅延に敏感な対話型アプリケーションに適しています。 「stream=True」の場合、「n」は 1 でなければならないことに注意してください。response_format: JSON モードを有効にするには、{"type": "json_object"}に設定します。システム メッセージで JSON を出力するようにモデルに指示する必要があります。documents: ドキュメント オブジェクトの配列を渡して、組み込み RAG を有効にします。各ドキュメントには、「コンテンツ」 (テキスト コンテンツ) と「メタデータ」 (キーと値のペアのメタデータ) が含まれています。
ネットワーク検索とツールの統合: AI21 Studio は Web 検索ツール (HTTP ツールは Studio で構成可能) と MCP サーバーの統合をサポートしており、モデルが外部 API やリアルタイム データ ソースを呼び出すことができます。これらの機能は、AI21 Studio の Maestro モジュールまたはカスタム ツール構成を通じて実装されます。具体的なアクセス方法については公式ドキュメントを参照してください。
製品の価格設定
AI21 Studioの価格設定は「従量課金制+エンタープライズカスタマイズ」の2層構造を採用。無料の長期割り当てはありませんが、10ドルの短期トライアルにより、ユーザーは効果を検証した後、直接支払いモードに入ることができます。
従量課金制:
- Jamba Mini: 0.20 ドル/100 万入力トークン、0.40 ドル/100 万出力トークン
- Jamba Large: 2.00 ドル/100 万入力トークン、8.00 ドル/100 万出力トークン
- 請求の粒度: トークンによる請求、リクエスト番号または時間による請求はサポートされていません
- 無料トライアル: 新規ユーザーは 10 ドルのクレジットを取得できます。有効期限は 7 日以内で、クレジット カードをバインドする必要はありません。
エンタープライズ カスタマイズ (カスタム プラン):
- 該当するシナリオ: 高頻度通話、民営化された展開、カスタマイズされたモデルの微調整、独占的なサポート
- 含まれるコンテンツ: ボリューム ディスカウント (使用量割引)、プレミアム API レート制限 (高頻度制御)、プライベート クラウド ホスティング (プライベート クラウド ホスティング)、Priority Support (優先サポート)、D dedicated Account Manager (専用アカウント マネージャー)、Expert AI Consultancy (AI 専門家コンサルティング サービス)
- 価格設定方法: オンデマンド見積もりについては営業チームにお問い合わせください。非公開の標準価格
隠れたコストの考慮事項:
- トークン効率: AI21 のトークン化効率は競合製品より 30% 高いと主張されていますが、英語以外のテキストではこの利点が割り引かれる可能性があります。中国語テキストのトークン圧縮率は、従来の BPE 単語セグメンタとあまり変わりません。総コストを評価するときは、実際のテキストを使用してトークン カウンティング テストを実行することをお勧めします。
- 4096 出力上限: 非常に長い出力が必要なシナリオ (数十ページのレポートを自動的に生成するなど) の場合、Jamba の単一出力の長さ制限は、追加のセグメント生成とスプライシング ロジックが必要であることを意味し、開発コストと遅延が増加します。
- 自己展開の全額コスト: 民営化された展開のコストは、GPU サーバーのレンタル/購入、ネットワーク帯域幅、運用と保守の人員、モデルの更新と移行、監視と警報システムなどのライセンス料金をはるかに超えます。これらの隠れたコストは、3 年間の TCO の 70% 以上を占める可能性があります。購入する前に、「API 年間料金と 3 年間の自己展開の総コスト」の完全なベンチマークを完了することをお勧めします。
アプリケーションのシナリオ
Jamba の 256K コンテキスト + 線形複雑性推論 + プライベート化された展開機能により、次の 4 種類のシナリオにおいて明らかな構造上の利点が得られます。
-
企業文書のインテリジェントな処理: 財務コンプライアンス条項のレビュー、保険請求書類の分析、法的契約リスクの特定、技術特許の比較。これらのシナリオに共通する特徴は、入力ドキュメントが非常に長く (数十から数百ページ)、重要な情報を正確に見つける必要があり、データ プライバシーに対する厳しい要件があることです。 Jamba の 256K ウィンドウは、シャーディングを必要とせずに、契約全体または完全な技術仕様を一度に収容できるため、シャーディングによって引き起こされるコンテキストの中断の問題が軽減されます。 実装のヒント: ダウンストリーム システムの統合を容易にするために、JSON モードを有効にして構造化された結果 (用語リスト、リスク レベル スコアなど) を出力することをお勧めします。契約金額や日付などの主要なエンティティについては、追加の定期検証または手動レビューを実行することをお勧めします。
-
検索拡張生成 (RAG) パイプライン: Jamba の組み込みドキュメント検索機能は、API リクエストでドキュメント コレクションを直接渡すことをサポートしており、モデルは関連するコンテンツを自動的に取得し、検索結果に基づいて回答を生成します。これは、エンタープライズ ナレッジ ベース Q&A、製品ドキュメント インテリジェント カスタマー サービス、内部 SOP クエリなどのシナリオの場合、追加のベクトル データベースや検索サービスを構築する必要がないことを意味します。 適用範囲: 組み込み RAG は、少数のドキュメント (数十から数百) を使用するシナリオに適しています。エンタープライズ ナレッジ ベースに数万のドキュメントが含まれており、リアルタイムで更新する必要がある場合は、専用のベクトル データベース (Pinecone、Weaviate など) と Jamba の生成機能を組み合わせて使用することをお勧めします。
-
多言語コンテンツ運用: Jamba は 9 言語 (英語、スペイン語、フランス語、ポルトガル語、イタリア語、オランダ語、ドイツ語、アラビア語、ギリシャ語) をネイティブにサポートし、主要なヨーロッパおよびアメリカの言語市場と中東市場をカバーしています。言語を超えたコンテンツの生成、翻訳、ローカリゼーションの適応を必要とするグローバル企業にとって、Jamba はマルチモデルの切り替えコストを削減できます。 シナリオには適していません: Jamba の東アジア言語 (中国語、日本語、韓国語) のサポートは、9 言語の公式リストには含まれていません。理論上は即時指導による中国語の使用も可能ですが、その効果やトークン効率は正式に検証されていません。東アジア言語が主流の運用シナリオに Jamba を使用することはお勧めできません。
-
エージェントと自動化されたワークフロー: 関数呼び出しと Maestro プラットフォームを通じて、Jamba はエージェント システムの推論エンジンとして機能します。一般的な使用例には、顧客の作業指示の自動処理 (作業指示の読み取り → ナレッジ ベースの呼び出し → 応答の生成 → 作業指示システムの更新)、データ分析エージェント (SQL クエリの受信 → 実行 → 結果の概要を返す)、サプライ チェーンの異常検出エージェント (物流データの読み取り → 異常の特定 → アラート通知の生成) が含まれます。 実装のヒント: エージェントのシナリオは、ツール呼び出しの信頼性と遅延の影響を受けます。 Jamba Mini を使用して MVP を構築し、プロセスの実現可能性を検証してから、複雑さと精度の要件に基づいて Jamba Large にアップグレードするかどうかを決定することをお勧めします。
競合製品との適応境界: Jamba の主な利点範囲は、「長いコンテキスト + コンプライアンス要件 + コスト感度」というエンタープライズ シナリオです。タスクのコンテキストが 8K 以内であり、プライベート展開が必要ない場合は、Mistral や Llama などの競合製品の方がコスト効率が高い可能性があります。トップレベルの推論能力が必要な場合 (数学コンテスト、コード コンテストなど)、GPT-5 または Claude シリーズがより信頼できる選択肢となります。 100 万トークンを超える非常に長いコンテキストで作業する必要がある場合は、DeepSeek V4 の 1M ウィンドウと低価格の方が有利です。
該当する人
AI21 Labs の Jamba モデル ファミリは、複数仕様のバージョンと柔軟な導入オプションを通じて、エッジからエンタープライズ データセンターまでの幅広いユーザーをカバーします。
-
エンタープライズ AI チームとアーキテクト: Jamba のコア ユーザー ベース。データ主権、コンプライアンス監査、展開の制御性に対する厳格な要件を持つ中規模および大規模組織 (金融、医療、国防、法務)。 256K のコンテキスト ウィンドウとプライベート展開機能により、Jamba はエンタープライズ ナレッジ管理、ドキュメント インテリジェンス、およびエージェント ワークフローに推奨されるモデルの 1 つとなっています。 購入前の検証項目: Jamba の 9 言語のカバー範囲が企業のビジネスの地理的範囲と一致するかどうかを確認します。 4096 出力上限がターゲット アプリケーションの出力長要件に影響するかどうかを評価します。実際のビジネスデータに対する完全な精度と遅延ベンチマークテスト。
-
AI アプリケーション開発者およびスタートアップ チーム: API を通じて Jamba Mini に接続し、100 万トークンあたり 0.2 ドル/0.4 ドルという低価格で製品プロトタイプを構築し、製品コンセプトを検証します。ドキュメントの概要、顧客サービスの知識ベース Q&A、多言語コンテンツ処理、その他のアプリケーションの構築に適しています。 不適合な境界: 製品の中核となるセールス ポイントがトップレベルの推論機能または超長い出力 (>4096 トークン) を必要とする場合、Jamba は最良の選択ではない可能性があります。さらに、無料の長期クレジットがないため、プロトタイプから生産まで継続的に支払いが必要になります。
-
データ コンプライアンスおよびセキュリティのリーダー: Jamba の SOC 2、ISO 27001/27017/27018 認証、およびセルフホスティング機能により、規制対象業界 (金融、医療、政府) における AI 調達のコンプライアンス レビューに簡単に合格できます。 コア フォーカス: AI21 モデルの利用規約は、MIT のような緩いオープン ソース ライセンスではありません。企業は、商用利用の条件に含まれるデータの使用、責任の制限、および監査権の条項を慎重に確認する必要があります。データ分離のコミットメントと SLA を調達契約で明確にすることをお勧めします。
-
研究機関および学術機関: Jamba のオープンソースの重みは、NLP 研究、ロングコンテキスト モデリング実験、および MoE アーキテクチャ分析に使用できます。 Mamba-Transformer ハイブリッド アーキテクチャの重みは学術分析に利用でき、研究コミュニティが SSM と注意の融合メカニズムの実際の効果を理解するのに役立ちます。 境界には適していません: Jamba には 2024 年 8 月 22 日という知識期限があり、リアルタイムの知識を必要とする研究指導には適していません。
概要と展望
AI21 Labs は、Mamba-Transformer ハイブリッド アーキテクチャを技術的なアンカーとして使用し、「長いコンテキストの効率的な推論」と「エンタープライズ レベルの制御可能な展開」の 2 つの側面で明確な製品のポジショニングを確立しました。これは、最も多くのパラメーターや最も強力な機能を備えたモデルではありませんが、「コスト × コンテキストの長さ × コンプライアンス」という三角制約の下では最もバランスのとれた選択となる可能性があります。
現在の主な利点: Jamba シリーズの 256K コンテキスト ウィンドウは、Mamba アーキテクチャのサポートの下で線形複雑性推論を実現し、長いテキストの処理効率は、同じハードウェア条件下での純粋なアテンション モデルよりも優れています。 Jamba Mini の 0.2 ドル/0.4 ドルの価格は、長いコンテキストのシナリオではコストパフォーマンスに優れています。 SOC 2 + ISO 3 認証 + セルフホスティング機能により、企業調達のコンプライアンス堀が形成されます。 9 言語のネイティブ サポートは、ヨーロッパ、アメリカ、中東の主要市場をカバーします。 AI21 Labs の 3 億米ドルを超える資金調達と複数の業界の主要顧客の獲得により、商業化の実現可能性が実証されました。
現在の主な制限: 出力長 4096 トークンの上限は、非常に長い生成を必要とするシナリオにとっては厳しい制約となります。一般常識問答や複雑な推理能力は同時期のフラッグシップモデルに比べて劣る。東アジア言語のサポートは公式リストに含まれておらず、世界的な対応範囲には地域的な盲点があります。 API の無料トライアルはわずか 10 ドルで有効期間が短いため、個人の開発者エクスペリエンスの敷居は高くなります。 Jamba の Mamba アーキテクチャは、主流の推論フレームワークの Transformer ほど環境的に最適化されておらず、自己展開シナリオでは追加のチューニング投資が必要です。
今後の観察ポイント: Jamba2 シリーズが大型仕様 (現時点では Mini と 3B のみ) を投入してハイエンド製品ラインを完成させるかどうか。 Jamba Reasoning 3B の推論機能が、特殊な蒸留を通じてより多くのシナリオをカバーできるかどうか。より大きなパラメータ スケール (1T+ など) での Mamba-Transformer ハイブリッド アーキテクチャのスケーラビリティが、純粋な MoE Transformer のスケーラビリティよりも優れているかどうか。 AI21 の Maestro Agent プラットフォームと Jamba API の間の相乗効果が差別化された競争力を生み出すことができるかどうか。
調達と導入のリスク評価: エンタープライズレベルの調達の場合、Jamba は「長文処理 + コンプライアンス重視」シナリオの主要モデルの 1 つとして適しています。まず、社内の重要ではないプロセス (文書分類の事前審査、契約条件のインデックス作成、多言語コンテンツの前処理など) で効果とチームの適合性を検証し、その後、準本番プロセスに拡張することをお勧めします。購入する前に、次のことを確認することが重要です。 AI21 モデルの利用規約における商用およびデータ使用の制限。ターゲット GPU ハードウェア上のプライベート化された展開のスループット ベンチマーク。および 4096 出力上限によるターゲット アプリケーションのカバレッジ。開発者やスタートアップ チームにとって、Jamba Mini の API は長文 RAG シナリオにおいて非常にコスト効率の高いオプションであり、自己展開コストに投資することなく製品コンセプトを迅速に検証できます。ただし、API のモデルバージョンアップにより動作が変更される可能性があることに注意してください。本番環境ではバージョン番号を持つエンドポイントを永続的に使用し、サービスの中断を避けるために AI21 のモデルの非推奨 (Deprecation) スケジュールに注意することをお勧めします。
関連ツール: deepseek、chatgpt
バージョン情報
- ジャンバ2 (ミニ & 3B) :Jamba2 Mini (52B/12B アクティベーション) および Jamba2 3B (3B 密パラメータ) を含む Jamba2 シリーズがリリースされ、どちらも 256K コンテキスト ウィンドウをサポートし、エンタープライズ レベルの信頼性と効率性を重視しています。 Jamba2 Mini API エンドポイント jamba-mini の価格は、100 万トークン (入力/出力) あたり 0.2 ドル/0.4 ドルです。
- ジャンバ ラージ 1.7 :Jamba Large 最新バージョン、合計パラメータ 398B (アクティベーション 94B)、256K コンテキスト ウィンドウ。コマンド追従機能とツール呼び出し機能を強化します。公式の正確な日付はまだありません。
- ジャンバ 1.6 :エンタープライズプライベート展開用のオープンソースモデル。ラージバージョンとミニバージョンを含む、ロングコンテキスト推論の効率と命令に従う機能を最適化します。
- ジャンバ 1.5 :第一世代の Jamba シリーズが正式にリリースされ、Mamba-Transformer ハイブリッド アーキテクチャが導入され、256K コンテキスト ウィンドウがサポートされ、ラージ バージョンとミニ バージョンの両方が提供されます。公式の正確な日付はまだありません。
- ジャンバ(初代) :AI21 Labs は、第 1 世代の Jamba 研究モデルをリリースしました。これは、Mamba (状態空間モデル) と Transformer アーキテクチャを初めて統合し、長いコンテキストのタスクで線形複雑性推論を実現します。公式の正確な日付はまだありません。
ユーザーレビュー