ディープインフラ
DeepInfra は、OpenAI 互換の API インターフェイスを提供し、100 以上のオープン ソース モデル (LLM、ビジョン、音声、画像生成、埋め込みなど) をホストし、プライベート モデルの展開と GPU クラスターのリースをサポートする
ディープインフラ
コアパラメータと統計
DeepInfraはAI推論クラウドインフラとして位置付けられており、OpenAI互換の推論APIを開発者や企業に提供する。これは単一のモデルではなく、テキスト生成、視覚的理解、画像生成、音声認識、埋め込み、並べ替えなどの複数の機能をカバーするモデルのホスティングおよび推論サービス プラットフォームです。
| プロジェクト | 広報 |
|---|---|
| 公式の位置づけ | AI 推論クラウド — OpenAI 互換 API、数百のオープンソース モデル |
| プラットフォームフォーム | 推論API、プライベートモデル展開、GPUクラスターレンタル |
| モデルスケール | 100 以上のオープン ソース モデル (LLM、マルチモーダル、画像、音声、埋め込み) |
| API対応 | OpenAI SDK互換(base_urlを置き換えて使用可能) |
| サービス階層 | 標準 (1x)、優先 (1.5x)、フレックス (0.8x) |
| 同時実行の上限 | デフォルトの同時リクエスト数は 1 アカウントあたり 200 (改善の余地あり) |
| 最初のトークン レイテンシー (TTFT) | 未公開の一般データ。優先レベルは標準よりも大幅に低く、詳細はモデルと負荷によって異なり、実際のテストの対象となります。 |
| トークン スループット (TPM/RPM) | 一般的な周波数制御値は公開されていません。プラットフォームはトークンによって課金され、ハードレート制限はありませんが、200 という同時実行制限により間接的にスループットが制限されます。 |
| コンプライアンス認証 | SOC 2、ISO 27001 |
| データセンター | 米国の 8 か所の自社構築データセンター |
| データ戦略 | 保持率ゼロ |
| 会社設立 | 2022 年 9 月 |
| 累計融資額 | 1 億 700 万米ドル シリーズ B (2026-05) |
| サポートプラットフォーム | Web ダッシュボード、REST API |
サービス レベル メカニズム: DeepInfra の 3 つのサービス レベルは、リクエストのスケジューリング優先度によって区別されます。 Standard はデフォルトのスケジューリングで、Priority は標準トラフィックの前にリクエストをキューに入れて、最初のトークンのレイテンシを短縮します (価格は 1.5 倍)。Flex は、応答が遅く、場合によっては利用不能になる代わりに低価格を提供します (価格は 0.8 倍)。これは、非実稼働または非同期のシナリオに適しています。
対象となるモデル カテゴリ: このプラットフォームは、テキスト生成、ビジョン/OCR、埋め込み/並べ替え、画像生成 (FLUX シリーズ)、音声認識 (Whisper/Voxtral)、ビデオ生成などの複数のタイプのモデルを同時にホストします。それらはすべて 1 つの API キーで呼び出すことができます。
ユーザーと市場の認識
DeepInfra の市場認識は主に、開発者エコシステム、企業顧客、資本市場の 3 つのレベルに反映されています。
開発者の採用: DeepInfra は、OpenRouter 上でホストされているモデルの数が最も多い推論プロバイダーです。このプラットフォームは、OpenAI 互換の API を提供します。開発者は、「base_url」を「https://api.deepinfra.com/v1/openai」に指定するだけで、コードを変更せずに移行できます。 GitHub 組織には、公式 TypeScript/Node SDK、Python SDK (コミュニティで維持)、LangChain 統合 CLI ツール「deepctl」、およびクックブック サンプルの豊富なライブラリを含む 47 のリポジトリがあります。
企業顧客: 公式 Web サイトには、OpenRouter、Quora、Vercel、Adobe、Ubisoft、Meta、ByteDance、LinkedIn、Microsoft、Deloitte、Salesforce、Hugging Face、Rakuten などの著名なユーザーが公開されており、テクノロジー、コンサルティング、金融、ゲーム、その他の分野をカバーしています。これらの顧客は DeepInfra を使用して、AI 製品の生産推論ワークロードを強化します。
Capital Markets: 500 Global と Georges Harik (imo.im の共同創設者) が共同主導し、NVIDIA、Samsung Next、Supermicro、Felicis、Crescent Cove、A.Capital Ventures、Peak6、Upper90 などが参加し、2026 年 5 月に 1 億 700 万ドルのシリーズ B 資金調達を完了しました。トークンの処理量はシリーズ A 以来 25 倍に増加しました。
業界での評価: Nemotron モデルの NemoClaw Agent フレームワークと NVIDIA Dynamo 推論ソフトウェアをサポートするために NVIDIA との初期インフラストラクチャ コラボレーションを確立し、Blackwell GPU を導入した最初の企業となりました。
コストメリット
DeepInfra のコスト構造は、最低契約や長期契約がなく、「実際に使用したコンピューティングに対してのみ支払う」ことを中心に設計されています。
C サイド/個人: DeepInfra は、C サイド向けに直接チャット製品を提供しません (その独立した製品 DeepGPT がこの需要を満たす可能性があります)。個人の開発者は API を通じて使用し、トークンまたは実行時間によって課金され、月額料金のしきい値はありません。埋め込みモデルは、100 万トークンあたり $0.005 から始まります。
API/開発者: LLM は入力/出力トークンごとに個別に請求され、キャッシュ ヒット割引をサポートしています (たとえば、DeepSeek V4-Pro のキャッシュ入力は 100 万トークンあたりわずか 0.10 ドルで、標準入力の 1.30 ドルよりもはるかに低いです)。画像モデルは、生成された解像度と反復回数に基づいて課金されます (例: FLUX-2-dev $0.01 × (w/1024) × (h/1024) × (iters/28))。音声モデルは実行時間に基づいて課金されます。 DeepSeek V4-Flash を例にとると、インプットは 0.09 ドル/100 万トークン、アウトプットは 0.18 ドル/100 万トークンで、オープンソース モデル推論市場では非常に競争力のある価格です。
| モデル例 | コンテキスト | 入力価格 ($/M トークン) | 出力価格 ($/M トークン) |
|---|---|---|---|
| DeepSeek-V4-フラッシュ | 1024k | $0.09 ($0.018 キャッシュ) | $0.18 |
| DeepSeek-V4-プロ | 1024k | $1.30 ($0.10 キャッシュ) | $2.60 |
| クウェン3.6-35B-A3B | 256k | $0.15 | $0.95 |
| ラマ-4-マーベリック-17B-128E | 1024k | $0.20 | $0.80 |
| ジェマ-4-26B-A4B-it | 256k | $0.07 | $0.34 |
| ミストラル-スモール-3.2-24B | 125k | $0.075 | $0.20 |
エンタープライズ/民営化: 2 つの民営化モードをサポートします。 1 つ目はカスタム LLM デプロイメント (カスタム LLM) で、専用 GPU で独自のモデルを実行し、GPU 時間ごとに請求されます。A100 $0.89/h、H100 $2.20/h、H200 $2.69/h、B200 $3.69/h、B300 $4.89/h、分単位で請求され、週単位で請求されます。 2 つ目は DeepCluster 専用クラスターです。 5 年間の B300 クラスターはわずか 1.98 ドル/GPU-h (パブリック クラウドでは 6.50 ドル/GPU-h) で、約 70% 割引です。 Tier 3 データセンターと 99.982% の可用性 SLA を含む 256 ~ 5000 個の GPU が利用可能です。
隠れたコスト: API モデルの隠れたコストには、主に、高頻度呼び出し時の同時実行数制限 (デフォルトは 200 同時実行)、割り当てを超えた後にビジネスに連絡して割り当てを増やすための通信コスト、および優先レベルでの価格の 1.5 倍の増加が含まれます。企業の民営化展開では、コンピューター室のスペース、電力、ネットワーク帯域幅への支援投資も評価する必要があります。
主な機能
DeepInfra の機能は、「すべてのモデルを呼び出す 1 つの API」を中心に設計されています。コア機能には次のものが含まれます。
-
OpenAI 互換推論 API: 100 を超えるオープン ソース モデルのテキスト生成、マルチモーダル理解、埋め込み、並べ替えをサポートします。 OpenAI SDK または互換性のあるクライアントを使用して、呼び出すように「base_url」と「api_key」を変更するだけです。ストリーミング出力 JSON スキーマ、ツール呼び出し/関数呼び出し、コンテキスト キャッシュ、その他の機能をサポートします。
-
マルチモーダルおよび視覚的理解: 画像理解、OCR テキスト抽出、および Gemma 4、Qwen-VL、Kimi K2.6 などのマルチモーダル モデルの文書分析をサポートします。標準のチャット完了 API を介して画像 URL または Base64 を渡すだけです。
-
画像とビデオの生成: FLUX の全範囲 (FLUX-2-dev、FLUX-2-pro、FLUX-2-max など)、安定した拡散などの画像生成モデル、およびテキストからビデオへのモデルをホストします。請求は解像度と反復回数に基づいて行われ、高い柔軟性を備えています。
-
埋め込みと再ランキング: bge、e5、gte、多言語 e5 などの主流の埋め込みモデルと、RAG、セマンティック検索、および情報取得のシナリオに適した再ランキング機能を提供します。最低 $0.005/100 万トークン。
-
音声認識と合成: OpenAI Whisper シリーズ モデルと Voxtral シリーズ音声モデルをサポートし、音声からテキストへの変換およびテキストから音声へのシナリオをカバーします。
-
プライベート モデルの展開 (カスタム LLM): 自動拡張と縮小、およびプライベート エンドポイント分離を使用して、DeepInfra の A100/H100/H200/B200/B300 GPU に独自の微調整されたモデルを展開します。高度なデータ主権要件またはカスタマイズされた推論ロジックを必要とするチームに適しています。
-
GPU クラスター レンタル (DeepCluster): B300 専用クラスターを直接 SSH 接続による 5 年間の長期契約の形で提供し、トレーニング、微調整、または継続的な GPU コンピューティング能力を必要とするその他のシナリオに適しています。
機能的な相乗効果: DeepInfra の本当の製品力は単一の機能ではなく、「単一の API エントリ + 複数のモデル タイプ + サービス レベルの柔軟な切り替え」の組み合わせにあります。開発チームは、画像生成、テキスト推論、埋め込み検索のためにさまざまなサプライヤーと連携する必要がありません。 1 つの統合で複数の AI 負荷をカバーできます。プライベート モデルと GPU クラスターのオーバーレイにより、企業は実験から運用、推論からトレーニングに至る AI ワークロード パッケージ全体を同じプラットフォーム上で完了できます。
モデルとバージョンの進化
継続的な反復更新により、最新バージョンではパフォーマンスの最適化と新機能が導入されます。過去のバージョン情報は公式リリースページで確認できます。 完全な公開バージョンの進化タイムラインはまだありません。機能更新のリズムを理解するには、公式発表に注意することをお勧めします。
技術的な利点
DeepInfra の技術的競争力は、「垂直統合 + 推論最適化」のシステムレベルのエンジニアリング能力にあります。それぞれの機能は、「なぜ高速であるか、より経済的であるか、より安定しているのか」という因果関係を中心に展開します。
独自のインフラストラクチャ -> 中間層の価格上昇とリソース競争の排除: パブリック クラウド (AWS/GCP/Azure) 上に推論層を構築する競合製品とは異なり、DeepInfra は米国の 8 つのデータセンターで GPU ハードウェアを自社で購入して運用しており、チップから API までフルスタックの自動制御を備えています。このアーキテクチャは 3 つのレベルで構造上の利点を生み出します。コストの点では、クラウド ベンダーのマークアップ レイヤーを排除します (DeepCluster B300 を例に挙げます。パブリック クラウドでは 6.50 ドル/GPU 時間と比較して、1.98 ドル/GPU 時間です)。レイテンシーの点では、物理マシンのオーバーブッキングによって引き起こされる変動を回避します。容量の点では、新しいモデルのリリース後、クラウド ベンダーの割り当てに制限されることなく、大規模な導入を迅速に完了できます。 適用可能なシナリオ: 高スループットで継続的に実行されるエージェント推論および運用レベルの LLM サービス。
推論最適化ソフトウェア スタック -> GPU 使用率の向上とトークンあたりのコストの削減: このチームは、NVIDIA TensorRT-LLM と vLLM (どちらも GitHub に公式フォークがあります) のエンジニアリング開発に深く関与しており、NVIDIA Dynamo 分散推論フレームワークとの共同最適化も行っています。これは、DeepInfra がオペレータ レベル (FlashAttendant、PatedAttendant、連続バッチ処理) およびスケジューリング レベル (KV キャッシュ管理、動的バッチ処理) で一般的なクラウド プラットフォームよりも高い GPU 使用率を達成できることを意味します。利用率が高くなるほど、100万トークンあたりの固定費の償却が低くなり、最終的には端末価格の優位性に反映されます。 適用可能なシナリオ: トークン単価に敏感な大規模な推論シナリオ。
NVIDIA エコシステムのディープ コラボレーション -> 誰よりも早く次世代ハードウェアの配当を獲得: NVIDIA のオープン AI エコシステムの初期インフラストラクチャ パートナーとして、DeepInfra は最初に Blackwell B200/B300 GPU を導入し、Vera Rubin アーキテクチャ上の Dynamo を通じて推論コスト効率の 20 倍の向上を達成する予定です。このパートナーシップは、ハードウェア選択における優先順位を意味するだけでなく、より重要なことに、DeepInfra は、GA 後に受動的にフォローアップするのではなく、開発段階にある NVIDIA の次世代推論ソフトウェア スタック (Dynamo、NemoClaw など) の適応と最適化を実行できるということです。 該当するシナリオ: 長期的なコスト最適化のために最新の GPU アーキテクチャの利点を活用する必要がある企業。
自動拡張と縮小 -> アイドル コストゼロ: プラットフォームに組み込まれた自動拡張と縮小メカニズムは、リクエストの負荷に基づいてモデルのコピー数を動的に調整します。トラフィックのピーク時にレプリカを自動的に追加して応答速度を確保し、トラフィックが少ない時間帯にレプリカをリリースしてアイドル状態の GPU の課金を回避します。 Custom LLM の分単位の請求粒度と組み合わせると、ユーザーは実際に使用した GPU 時間に対してのみ支払いを行うことができます。 適用可能なシナリオ: 電子商取引プロモーション、社会分裂など、トラフィック パターンの変動が大きい AI アプリケーション。
サービス レベル スケジューリング -> 差別化されたリソース割り当ては全体のコストには影響しません: 標準/優先/フレックスの 3 レベルのスケジューリングは単純なレート制限ではなく、リクエスト キューの優先順位管理を通じて差別化されたリソース割り当てを実現します。優先度 1.5 倍の価格プレミアムは、ハードウェアの総量の増加によるものではなく、リクエストをキューの先頭に移動することによって発生します。 Flex 0.8 倍の価格割引は、低負荷期間中にリクエストをスケジュールするか、アイドル状態のキャパシティを使用することによって実現されます。この設計により、プラットフォームの総コストを大幅に増加させることなく、コストと遅延に依存しない選択肢がユーザーに提供されます。 該当するシナリオ: マルチロード混合シナリオ (運用トラフィックには優先、バックグラウンド バッチ処理には Flex)。
適応境界: DeepInfra のアーキテクチャ上の強みは、トレーニングではなく推論にあります。DeepInfra は、モデルの事前トレーニング プラットフォームを提供せず、ワンクリックの微調整サービスを直接提供しません (ユーザーは独自の重みを準備し、カスタム LLM を通じてデプロイする必要があります)。ワンストップの「トレーニング + 推論」サービスを必要とするチームの場合、外部トレーニング フレームワークが必要になる場合があります。さらに、現在のデータセンターは米国内で 8 ノードに制限されています。アジア太平洋地域およびヨーロッパのお客様の場合、ネットワーク遅延がボトルネックになる可能性があります。実際に展開する前に、リージョン間の遅延テストを実施することをお勧めします。
使い方
DeepInfra の中心的な使用パスは API 呼び出しであり、モデルの参照、API キーの管理、使用状況の監視のための Web ページ ダッシュボードも提供します。
クイックスタート
- deepinfra.com にアクセスしてアカウントを登録します。
- ダッシュボードで API キー (
https://deepinfra.com/dash/api_keys) を生成します。 - OpenAI SDK を使用するか、HTTP リクエストを直接開始してモデルを呼び出します。
API呼び出しの例
Python OpenAI SDK を使用して DeepSeek-V4-Flash を呼び出します。
「」パイソン openaiインポートからOpenAI
クライアント = OpenAI(
api_key="
応答 = client.chat.completions.create( モデル="ディープシーク-ai/ディープシーク-V4-フラッシュ", messages=[{"role": "user", "content": "こんにちは!deepinfra とは、"}], 温度=0.7、 max_tokens=1024、 ストリーム=真、 ) 応答のチャンクの場合: print(chunk.choices[0].delta.content または "", end="") 「」
カール呼び出しの例:
「」バッシュ
カール -s https://api.deepinfra.com/v1/openai/chat/completions \
-H "認可: ベアラ
サービスレベル設定
API リクエストの「service_tier」パラメータを介してスケジュールの優先順位を指定します。
{
"モデル": "ディープシーク-ai/ディープシーク-V4-フラッシュ",
"メッセージ": [{"ロール": "ユーザー", "コンテンツ": "Hello!"}],
"サービス層": "優先度"
}
「」
オプションの値: 「standard」(デフォルト、価格 1 倍)、「priority」(価格 1.5 倍)、「flex」(価格 0.8 倍、非運用シナリオ)。
|使い方 |人に適しています |特長 |
|---|---|---|
| REST API(OpenAI対応) |開発者/インテグレーター |移行するには「base_url」を置き換えます。SDK は Python、Node.js、LangChain をサポートします。
|ウェブダッシュボード |評価・実験 |モデルの参照、API キーの生成、使用量と請求書の表示 |
|ディープCTL CLI | DevOps/SRE |推論タスクとクラスターのコマンドライン管理 |
|カスタム LLM |エンタープライズ/モデル オーナー |細かく調整されたプライベート モデルをデプロイし、自動的にスケールアップおよびスケールダウンします。
|ディープクラスター |ハイパフォーマンスコンピューティングチーム | B300専用クラスタ、SSH直接接続、5年契約 |
## 製品の価格設定
価格モデルは公式リアルタイム ページに準拠します。通常はフリーミアムやサブスクリプション制が採用されており、基本的な機能は無料で利用できます。
高度な機能や使用頻度が高い場合は有料のサブスクリプションが必要となるため、実際の使用状況に基づいて最適なソリューションを評価することをお勧めします。
## アプリケーションのシナリオ
DeepInfra の一般的な実装シナリオは、個人的な実験から企業の運用までの全範囲をカバーしています。
- **運用レベルの LLM 推論**: 企業は、DeepSeek、Qwen、Llama などのオープンソース モデルを、顧客サービス システム、コンテンツ生成、コード支援などの運用プロセスに統合します。 OpenAI 互換 API により、移行コストがほぼゼロになり、そのメリットは、クローズドソース API からオープンソース モデルに切り替えた後のコスト削減とモデルの自律性の向上に反映されます。
- **RAG と知識検索**: DeepInfra の埋め込みモデル (bge、e5 シリーズ) と並べ替え機能を組み合わせて、検索強化生成システムを構築します。同じ API キーでモデルの埋め込みと生成を呼び出し、テクノロジー スタックを簡素化します。最大トークン制限 (512 または 8K) と、さまざまな埋め込みモデルの多言語適応性に注意してください。
- **画像とビデオの生成**: FLUX シリーズ モデルを使用して、e コマースの製品画像、広告クリエイティブ、コンセプト デザインをバッチ生成します。料金は解像度と反復回数に基づいて決定されるため、画像を頻繁に作成する必要があるチームに適しています。 FLUX-2-kleinシリーズは、より高速かつ低コストで生成できる軽量モデルです。
- **マルチモーダル文書理解**: 請求書認識、契約情報抽出、フォーム OCR には、Gemma 4、Qwen-VL、およびその他のモデルを使用します。ドキュメントのスクリーンショットは Vision API を通じて直接渡されるため、前処理パイプラインは必要ありません。
- **エージェントとツールの呼び出し**: DeepSeek V4-Pro、Claude Fable 5 およびその他のモデルは、AI エージェント アプリケーションの構築に使用できる関数呼び出しとツール呼び出しをサポートしています。優先サービス層により、エージェントの複数ステップの推論の低遅延が保証されます。
- **モデルの微調整とプライベート展開**: 独自の微調整モデルを DeepInfra GPU に展開し、自動拡張と縮小を組み合わせて運用トラフィックに対応します。データ主権要件がある企業、またはモデルの動作をカスタマイズする必要がある企業に適しています。
## 該当する人
DeepInfra の多層サービス フォームは、次の 4 種類のロールをカバーします。
- **AI アプリケーション開発者**: API の互換性、モデルの豊富さ、価格に重点を置き、推論機能を迅速に統合する必要があります。 DeepInfra の OpenAI 互換 API により、コードをほとんど変更することなく OpenAI からの移行が可能となり、モデル選択の検証や本番展開に適しています。
- **DevOps およびインフラストラクチャ チーム**: GPU クラスターの管理と推論コストの最適化を担当します。 DeepInfra の deepctl CLI、プライベート デプロイメント、DeepCluster オプションにより、マネージド API からベア メタル GPU までの完全な段階的な制御が可能になります。
- **AI 研究者と実験者**: 比較評価のために異なるモデルを頻繁に切り替える必要があります。 DeepInfra の 100 以上のモデル ライブラリと統合 API により、マルチモデル評価のエンジニアリング オーバーヘッドが削減されます。
- **エンタープライズ AI プラットフォーム リーダー**: コンプライアンス、セキュリティ、コストに関して推論ベンダーを評価します。 DeepInfra の SOC 2 / ISO 27001 認証、データ保持ゼロ ポリシー、および米国内に自社構築されたデータ センターは、パブリック クラウド API との主な差別化要因です。
**境界には適さない**: DeepInfra は、単一モデル ベンダー エコシステムへの深いバインディングが必要なシナリオ (Azure OpenAI を必要とするエンタープライズ契約など)、グローバルなマルチリージョン展開の差し迫ったニーズ (現在は主に米国のデータ センター)、または非常に低い推論しか必要とせず、遅延の影響を受けにくい個人的な実験シナリオ (この場合、無料または安価な代替手段の方が適しています) には適していません。
## 概要と展望
DeepInfra の核となる競争力は、「オープンソース モデル エコシステム + OpenAI 互換 API + 自社構築推論インフラストラクチャ」の垂直統合にあります。これは、最も安価な推論 API (一部のモデル Flex 層は非常に低コストを実現できる) でもなく、最も機能が豊富な API (モデル トレーニング サービスは提供されない) でもありませんが、運用環境でオープンソース モデルを大規模に使用する必要がある開発チームや企業にとって、互換性、モデルの幅、インフラストラクチャの制御性の間の現在の市場ではまれなバランスを提供します。
**現在の制限**: データセンターは現在米国に集中しており、世界的にカバーできる範囲は限られています。デフォルトの 200 という同時実行制限では、高トラフィックのシナリオでは追加のビジネス通信が必要です。プラットフォーム自体はモデルのトレーニングや微調整サービスを提供せず、推論層のみに焦点を当てています。
**調達/採用リスク評価**: 起業家チームおよび中小規模の開発者の場合は、最初に標準レベル + 従量課金制のプロトタイプを使用してプロトタイプを実行し、API の互換性とモデルの効果を検証してから、実際の使用状況に基づいて優先レベルまたはプライベート デプロイメントが必要かどうかを評価することをお勧めします。企業は購入前に、同時クォータ増加プロセス、データ保持戦略の具体的な条件 (特に入力と出力がサービス向上に使用されるかどうか)、DeepCluster 契約の早期終了条件、米国以外のデータ センターの将来の適用計画などを確認する必要があります。すでに OpenAI API を使用しているチームにとって、DeepInfra はオープン ソース モデルに代わる低移行コストの代替手段ですが、クローズド ソース モデルの完全な代替品とみなすべきではありません。一部のシナリオ (非常に長いコンテキストのロールプレイング、ドメイン固有のクローズド ソース モデルなど) では、依然として複数のベンダーを維持する必要があります。
関連ツール: hugging-face、replicate
## DeepInfra のプラットフォーム バージョンの進化
SaaS プラットフォームとして、DeepInfra には従来の意味でのソフトウェア バージョン番号がありません。その進化は、モデルのサポート拡大、ハードウェアのアップグレード、資金調達のマイルストーンに反映されています。
### プラットフォームの初期段階 (2022 ~ 2024 年)
- **2022 年 9 月**: 元 imo チームによって設立された会社です。
- **2023–2024**: 推論 API の初期バージョンを開始し、オープンソース モデルのサポートを段階的に追加し、米国のデータセンター インフラストラクチャを確立します。
### 高速拡張ステージ(2025年)
- **モデル ライブラリが 100 以上に拡張**: 主流のオープンソース LLM、マルチモーダル、画像生成および音声モデルをカバーします。
- **ハードウェア アップグレード**: H200 および B200 GPU サポートを導入し、推論スループットとエネルギー効率を向上させます。
- **コンプライアンス認証**: SOC 2 および ISO 27001 認証を取得し、データ保持ゼロ戦略を実装しました。
### シリーズ B マイルストーン (2026-05)
- **2026 年 5 月 4 日**: シリーズ B の資金調達で 1 億 700 万ドルを発表、トークン処理量はシリーズ A と比較して 25 倍に増加しました。
- **DeepCluster リリース**: B300 専用 GPU クラスター レンタル サービスを開始しました (5 年契約 $1.98/GPU-h)。
- **新しいモデルへの継続的なアクセス**: Anthropic Claude Fable 5、Claude Sonnet 5、GLM-5.2、Kimi K2.7-Code、Qwen3.6 などの最新モデルはすべて、リリース後すぐにオンラインで入手できます。
バージョン情報
- DeepInfra シリーズ B バージョン :シリーズBの資金調達により1億700万米ドルを調達。トークン処理量はシリーズ A と比較して 25 倍に増加。 DeepCluster B300 クラスターが起動されました。 Claude Fable 5/Sonnet 5、GLM-5.2、Kimi K2.7-Code などのモデルが追加されました。米国では 8 つのデータセンターが運用されました。
- ディープスタート起業家精神計画 :スタートアップ企業向けに 10 億の無料トークン プログラムを開始しました。必要な資金は 250,000 ~ 1,000 万ドルで、設立は 2 年以内です。公式の正確な日付はまだありません。
- シリーズ A のマイルストーン :シリーズAの資金調達を完了。それ以来、トークンの処理量は 25 倍に増加しました。モデルライブラリを100以上に拡張。 SOC2/ISO27001認証を取得。公式の正確な日付と金額はまだありません。
- プラットフォームの初期バージョン :DeepInfraを設立し、AI推論APIの初期バージョンを立ち上げ、推論最適化インフラをゼロから構築しました。
ユーザーレビュー