Infra Profond

-

DeepInfra est une plate-forme qui fournit des interfaces API compatibles OpenAI, héberge plus de 100 modèles open source (LLM, vision, parole, génération d'images, intégration, etc.) et prend en charge le déploiement de modèles privés et la location de clusters GPU. La plateforme dispose d'un centre de données auto-construit, d'une certification SOC 2 / ISO 27001 et d'une stratégie de conservation zéro des données. Finaliser un financement de série B de 107 millions de dollars en 2026.

Infra Profond Interface du produit

InfraDeep

Paramètres et statistiques de base

DeepInfra se positionne comme une infrastructure cloud d'inférence d'IA, fournissant des API d'inférence compatibles OpenAI aux développeurs et aux entreprises. Il ne s'agit pas d'un modèle unique, mais d'une plate-forme de services d'hébergement et d'inférence de modèles, couvrant de multiples fonctionnalités telles que la génération de texte, la compréhension visuelle, la génération d'images, la reconnaissance vocale, l'intégration et la réorganisation.

Projets Informations publiques
Positionnement officiel Cloud d'inférence IA — API compatible OpenAI, des centaines de modèles open source
Formulaire de plateforme API d'inférence, déploiement de modèles privés, location de cluster GPU
Échelle du modèle Plus de 100 modèles open source (LLM, multimodal, image, parole, intégration)
Compatible API Compatible OpenAI SDK (base_url peut être remplacé et utilisé)
Niveaux de service Standard (1x), Prioritaire (1,5x), Flex (0,8x)
Limite supérieure de concurrence Par défaut, 200 demandes/compte simultanés (peut demander une amélioration)
Latence du premier jeton (TTFT) Données générales non divulguées ; Le niveau de priorité est nettement inférieur à Standard, les détails varient en fonction du modèle et de la charge et sont soumis à des tests réels
Débit des jetons (TPM/RPM) La valeur générale du contrôle de fréquence n'est pas divulguée ; la plate-forme est facturée par jeton et il n'y a pas de limite de débit stricte, mais la limite de concurrence de 200 restreint indirectement le débit
Certification de conformité SOC2, ISO 27001
Centre de données 8 centres de données auto-construits aux États-Unis
Stratégie de données Zéro rétention
Création d'entreprise septembre 2022
Financement cumulatif 107 millions de dollars américains, série B (2026-05)
Plateforme d'assistance Tableau de bord Web, API REST

Mécanisme de niveau de service : les trois niveaux de service de DeepInfra se distinguent par la priorité de planification des demandes. Standard est la planification par défaut, Priority met les demandes en file d'attente avant le trafic standard pour obtenir une latence du premier jeton plus rapide (prix 1,5 fois) et Flex propose un prix inférieur en échange d'une réponse lente et d'une indisponibilité occasionnelle (prix 0,8 fois), ce qui convient aux scénarios de non-production ou asynchrones.

Catégories de modèles couvertes : La plateforme héberge simultanément plusieurs types de modèles tels que la génération de texte, la vision/OCR, l'intégration/réorganisation, la génération d'images (série FLUX), la reconnaissance vocale (Whisper/Voxtral), la génération de vidéo, etc. Tous peuvent être appelés avec une seule clé API.

Reconnaissance des utilisateurs et du marché

La reconnaissance de DeepInfra sur le marché se reflète principalement à trois niveaux : l'écosystème des développeurs, les entreprises clientes et le marché des capitaux :

Adoption par les développeurs : DeepInfra est le fournisseur d'inférence avec le plus grand nombre de modèles hébergés sur OpenRouter. La plateforme fournit une API compatible OpenAI. Les développeurs n'ont qu'à pointer « base_url » vers « https://api.deepinfra.com/v1/openai » pour migrer sans aucune modification de code. L'organisation GitHub dispose de 47 référentiels, dont le SDK officiel TypeScript/Node, le SDK Python (maintenu par la communauté), l'outil CLI intégré LangChain « deepctl » et une riche bibliothèque d'exemples de livres de recettes.

Clients entreprises : le site officiel affiche publiquement des utilisateurs connus, notamment OpenRouter, Quora, Vercel, Adobe, Ubisoft, Meta, ByteDance, LinkedIn, Microsoft, Deloitte, Salesforce, Hugging Face, Rakuten, etc., couvrant la technologie, le conseil, la finance, les jeux et d'autres domaines. Ces clients utilisent DeepInfra pour alimenter les charges de travail d'inférence de production pour leurs produits d'IA.

Marchés des capitaux : financement de série B de 107 millions de dollars réalisé en mai 2026, codirigé par 500 Global et Georges Harik (co-fondateur d'imo.im), avec la participation de NVIDIA, Samsung Next, Supermicro, Felicis, Crescent Cove, A.Capital Ventures, Peak6, Upper90, etc. Le volume de traitement des jetons a été multiplié par 25 depuis la série A.

Reconnaissance de l'industrie : établissement d'une collaboration d'infrastructure précoce avec NVIDIA pour prendre en charge le modèle Nemotron NemoClaw Agent framework et le logiciel d'inférence NVIDIA Dynamo, et être le premier à déployer des GPU Blackwell.

Avantage de coût

La structure de coûts de DeepInfra est conçue autour du principe « ne payez que pour l'informatique que vous utilisez réellement », sans minimum ni contrat à long terme.

C-side/individuel : DeepInfra ne fournit pas de produits de chat directement pour le C-side (son produit indépendant DeepGPT peut répondre à cette demande). Les développeurs individuels l'utilisent via l'API, facturés par jeton ou par temps d'exécution, et il n'y a pas de seuil de frais mensuels. Les modèles intégrés commencent à seulement 0,005 $/million de jetons.

API/Développeur : LLM est facturé séparément par jeton d'entrée/sortie et prend en charge les remises sur les accès au cache (par exemple, l'entrée du cache DeepSeek V4-Pro ne coûte que 0,10 $/million de jetons, ce qui est bien inférieur à l'entrée standard de 1,30 $). Les modèles d'images sont facturés en fonction de la résolution générée et du nombre d'itérations (par exemple FLUX-2-dev 0,01 $ × (w/1024) × (h/1024) × (iters/28)). Les modèles vocaux sont facturés en fonction du temps d'exécution. En prenant DeepSeek V4-Flash comme exemple, l'entrée est de 0,09 $/million de jetons et la sortie est de 0,18 $/million de jetons, ce qui est un prix très compétitif sur le marché de l'inférence de modèles open source.

Exemple de modèle Contexte Prix ​​d'entrée ($/M de jeton) Prix ​​de sortie ($/M de jeton)
DeepSeek-V4-Flash 1024k 0,09 $ (0,018 $ mis en cache) 0,18 $
DeepSeek-V4-Pro 1024k 1,30 $ (0,10 $ mis en cache) 2,60 $
Qwen3.6-35B-A3B 256k 0,15 $ 0,95 $
Lama-4-Maverick-17B-128E 1024k 0,20 $ 0,80 $
gemma-4-26B-A4B-it 256k 0,07 $ 0,34 $
Mistral-Petit-3.2-24B 125k 0,075 $ 0,20 $

Entreprise/Privatisation : prend en charge deux modes de privatisation. Le premier est le déploiement LLM personnalisé (Custom LLM), qui exécute ses propres modèles sur des GPU dédiés et est facturé par heures GPU : A100 0,89 $/h, H100 2,20 $/h, H200 2,69 $/h, B200 3,69 $/h, B300 4,89 $/h, facturé à la minute et facturé sur une base hebdomadaire. Le second est le cluster exclusif DeepCluster. Le cluster B300 de 5 ans ne coûte que 1,98 $/GPU-h (contre 6,50 $/GPU-h pour le cloud public), soit une remise d'environ 70 %. 256 à 5 000 GPU sont disponibles, y compris un centre de données de niveau 3 et un SLA de disponibilité de 99,982 %.

Coûts cachés : les coûts cachés du modèle API incluent principalement la limite de simultanéité lors des appels à haute fréquence (concurrence par défaut de 200), le coût de communication pour contacter l'entreprise pour augmenter le quota après l'avoir dépassé et l'augmentation de 1,5 fois le prix au niveau Priorité. Le déploiement de la privatisation des entreprises doit également évaluer les investissements nécessaires dans l'espace des salles informatiques, l'alimentation électrique et la bande passante du réseau.

Fonctions principales

Les capacités de DeepInfra sont conçues autour d'une « une seule API pour appeler tous les modèles ». Les fonctions de base comprennent :

  • API de raisonnement compatible OpenAI : prend en charge la génération de texte, la compréhension multimodale, l'intégration et la réorganisation de plus de 100 modèles open source. À l'aide d'OpenAI SDK ou de tout client compatible, modifiez simplement base_url et api_key pour appeler. Prend en charge le schéma JSON de sortie en streaming, l'appel d'outil/l'appel de fonction, la mise en cache contextuelle et d'autres fonctionnalités.

  • Compréhension multimodale et visuelle : prend en charge la compréhension des images, l'extraction de texte OCR et l'analyse de documents de modèles multimodaux tels que Gemma 4, Qwen-VL et Kimi K2.6. Transmettez simplement l'URL de l'image ou Base64 via l'API standard de complétion de chat.

  • Génération d'images et de vidéos : héberge la gamme complète de FLUX (FLUX-2-dev, FLUX-2-pro, FLUX-2-max, etc.), les modèles de génération d'images tels que Stable Diffusion et les modèles texte-vidéo. La facturation est basée sur la résolution et le nombre d'itérations, avec une grande flexibilité.

  • Intégration et reclassement : fournit des modèles d'intégration courants tels que bge, e5, gte et multilingual-e5, ainsi que des capacités de reclassement, adaptées aux scénarios RAG, de recherche sémantique et de récupération d'informations. À seulement 0,005 $/million de jetons.

  • Reconnaissance et synthèse vocales : prend en charge les modèles de la série OpenAI Whisper et les modèles vocaux de la série Voxtral, couvrant les scénarios de synthèse vocale et de synthèse vocale.

  • Déploiement de modèle privé (LLM personnalisés) : déployez votre propre modèle affiné sur le GPU A100/H100/H200/B200/B300 de DeepInfra, avec expansion et contraction automatiques et isolation des points de terminaison privés. Convient aux équipes ayant des exigences élevées en matière de souveraineté des données ou une logique de raisonnement personnalisée.

  • Location de cluster GPU (DeepCluster) : fournit un cluster exclusif B300 sous la forme d'un contrat à long terme de 5 ans avec connexion SSH directe, adapté à la formation, au réglage fin ou à d'autres scénarios nécessitant une puissance de calcul GPU continue.

Synergie fonctionnelle : La véritable puissance du produit DeepInfra ne réside pas dans une seule fonction, mais dans la combinaison « une seule entrée d'API + plusieurs types de modèles + une commutation flexible des niveaux de service ». L'équipe de développement n'a pas besoin de se connecter avec différents fournisseurs pour la génération d'images, le raisonnement textuel et la récupération intégrée. Une intégration peut couvrir plusieurs charges d’IA. La superposition de modèles privés et de clusters GPU permet aux entreprises de compléter l'ensemble de la charge de travail d'IA, de l'expérimentation à la production, et de l'inférence à la formation, sur la même plateforme.

Evolution du modèle et de la version

Mises à jour itératives continues, la dernière version introduit une optimisation des performances et de nouvelles fonctionnalités. Les informations sur la version historique peuvent être consultées sur la page de version officielle. Il n’existe pas encore de calendrier complet d’évolution de la version publique. Il est recommandé de prêter attention à l'annonce officielle pour comprendre le rythme des mises à jour des fonctionnalités.

Avantages techniques

La compétitivité technique de DeepInfra vient des capacités d'ingénierie au niveau du système d'« intégration verticale + optimisation d'inférence ». Chaque capacité s’articule autour de la chaîne causale « pourquoi elle est plus rapide/plus économique/plus stable » :

Infrastructure propre -> Éliminer les augmentations de prix de niveau intermédiaire et la concurrence en matière de ressources : contrairement aux produits concurrents qui créent des couches d'inférence sur les cloud publics (AWS/GCP/Azure), DeepInfra achète et exploite lui-même le matériel GPU dans 8 centres de données aux États-Unis, avec un contrôle automatique complet, des puces aux API. Cette architecture présente des avantages structurels à trois niveaux : en termes de coût, elle élimine la couche de balisage des fournisseurs de cloud (prenons l'exemple de DeepCluster B300, 1,98 $/GPU-heure contre 6,50 $/GPU-heure pour le cloud public) ; en termes de latence, il évite les fluctuations provoquées par le surbooking des machines physiques ; en termes de capacité, il peut rapidement réaliser un déploiement à grande échelle après la sortie d'un nouveau modèle sans être limité par les quotas des fournisseurs de cloud. Scénarios applicables : services d'inférence d'agent et de niveau de production LLM à haut débit et exécutés en continu.

Pile logicielle d'optimisation d'inférence -> Utilisation plus élevée du GPU et coût par jeton réduit : L'équipe est profondément impliquée dans le développement technique de NVIDIA TensorRT-LLM et vLLM (tous deux ont des forks officiels sur GitHub), et a également une optimisation conjointe avec le cadre d'inférence distribué NVIDIA Dynamo. Cela signifie que DeepInfra peut atteindre une utilisation du GPU plus élevée que les plates-formes cloud générales au niveau de l'opérateur (FlashAttention, PagedAttention, Continu Batching) et au niveau de la planification (gestion du cache KV, traitement par lots dynamique). Plus le taux d'utilisation est élevé, plus l'amortissement des coûts fixes par million de jetons est faible, ce qui se reflète finalement dans l'avantage du prix du terminal. Scénarios applicables : scénarios d'inférence à grande échelle sensibles au prix unitaire du jeton.

Collaboration approfondie avec l'écosystème NVIDIA -> Soyez le premier à obtenir des dividendes matériels de nouvelle génération : en tant que premier partenaire d'infrastructure de l'écosystème ouvert d'IA de NVIDIA, DeepInfra est le premier à déployer des GPU Blackwell B200/B300 et prévoit d'obtenir une amélioration de 20 fois de l'efficacité des coûts d'inférence grâce à Dynamo sur l'architecture Vera Rubin. Ce partenariat signifie non seulement la priorité dans la sélection du matériel, mais plus important encore, DeepInfra peut effectuer l'adaptation et l'optimisation de la pile logicielle d'inférence de nouvelle génération de NVIDIA (telle que Dynamo, NemoClaw) alors qu'elle est encore en phase de développement, au lieu d'effectuer un suivi passif après GA. Scénarios applicables : entreprises qui doivent profiter des derniers avantages de l'architecture GPU pour optimiser les coûts à long terme.

Expansion et contraction automatiques -> Coût d'inactivité nul : le mécanisme d'expansion et de contraction automatique intégré à la plate-forme ajuste dynamiquement le nombre de copies du modèle en fonction de la charge de demande. Ajoutez automatiquement des répliques pendant les pics de trafic pour garantir une vitesse de réponse et libérez des répliques pendant les périodes de faible trafic pour éviter la facturation des GPU inactifs. En combinaison avec la granularité de facturation à la minute de Custom LLM, les utilisateurs ne paient que pour le temps GPU réellement utilisé. Scénarios applicables : applications d'IA avec de grandes fluctuations dans les modèles de trafic, telles que les promotions de commerce électronique, la fission sociale, etc.

Planification du niveau de service -> L'allocation différenciée des ressources n'affecte pas le coût global : La planification à trois niveaux Standard/Priorité/Flex n'est pas une simple limite de débit, mais permet une allocation différenciée des ressources grâce à la gestion des priorités de la file d'attente des demandes. La prime de prix de la priorité 1,5x provient du déplacement des demandes vers le début de la file d'attente, et non de l'augmentation de la quantité totale de matériel. Des remises de prix Flex 0,8x sont obtenues en planifiant les demandes pendant les périodes de faible charge ou en utilisant la capacité inutilisée. Cette conception offre aux utilisateurs des choix indépendants du coût et de la latence sans augmenter de manière significative le coût total de la plateforme. Scénarios applicables : Scénarios mixtes à chargements multiples (Priorité pour le trafic de production, Flex pour le traitement par lots en arrière-plan).

Limite d'adaptation : la force architecturale de DeepInfra réside dans l'inférence plutôt que dans la formation - elle ne fournit pas de plate-forme de pré-formation modèle, ni ne fournit directement des services de réglage fin en un clic (les utilisateurs doivent préparer leurs propres pondérations, puis les déployer via Custom LLM). Pour les équipes qui ont besoin de services uniques de « formation + inférence », un cadre de formation externe peut être nécessaire. De plus, le data center actuel est limité à 8 nœuds aux États-Unis. Pour les clients de la région Asie-Pacifique et européens, la latence du réseau peut devenir un goulot d'étranglement. Il est recommandé d'effectuer des tests de latence entre régions avant le déploiement réel.

Comment utiliser

Le principal chemin d'utilisation de DeepInfra est l'appel d'API, et il fournit également un tableau de bord de page Web pour la navigation dans les modèles, la gestion des clés API et la surveillance de l'utilisation.

Démarrage rapide

  1. Visitez deepinfra.com pour créer un compte.
  2. Générez une clé API (https://deepinfra.com/dash/api_keys) dans le tableau de bord.
  3. Utilisez OpenAI SDK ou lancez directement une requête HTTP pour appeler le modèle.

Exemple d'appel API

Utilisez le SDK Python OpenAI pour appeler DeepSeek-V4-Flash :

depuis openai importer OpenAI

client = OpenAI (
    api_key="<VOTRE_DEEPINFRA_API_KEY>",
    base_url="https://api.deepinfra.com/v1/openai",
)

réponse = client.chat.completions.create(
    modèle="deepseek-ai/DeepSeek-V4-Flash",
    messages=[{"role": "user", "content": "Bonjour ! Qu'est-ce que deepinfra、"}],
    température = 0,7,
    max_tokens=1024,
    flux=Vrai,
)
pour chunk en réponse :
    print(chunk.choices[0].delta.content ou "", end="")

Exemple d'appel Curl :

curl -s https://api.deepinfra.com/v1/openai/chat/completions \
  -H "Autorisation : Porteur <YOUR_DEEPINFRA_API_KEY>" \
  -H "Type de contenu : application/json" \
  -d '{
    "model": "deepseek-ai/DeepSeek-V4-Flash",
    "messages": [{"role": "user", "content": "Bonjour!"}],
    "température": 0,7,
    "max_tokens": 1024,
    "stream": vrai
  }'

Paramètres de niveau de service

Spécifiez la priorité de planification via le paramètre service_tier dans la requête API :

{
  "model": "deepseek-ai/DeepSeek-V4-Flash",
  "messages": [{"role": "user", "content": "Bonjour!"}],
  "service_tier": "priorité"
}

Valeurs facultatives : "standard" (par défaut, 1x prix), "priority" (1,5x prix), "flex" (0,8x prix, scénario hors production).

Comment utiliser Convient aux personnes Caractéristiques
API REST (compatible OpenAI) Développeur/intégrateur Remplacez base_url pour migrer, le SDK prend en charge Python, Node.js, LangChain
Tableau de bord Web Évaluation/Expérimentation Parcourez les modèles, générez des clés API, affichez l'utilisation et les factures
CLI deepctl DevOps/SRE Gestion en ligne de commande des tâches d'inférence et des clusters
LLM personnalisés Propriétaire d'entreprise/modèle Déployez des modèles privés affinés et augmentez et réduisez automatiquement
DeepCluster Équipe Calcul Haute Performance Cluster dédié B300, connexion directe SSH, contrat 5 ans

Prix des produits

Le modèle de tarification est soumis à la page officielle en temps réel. Habituellement, un système freemium ou d'abonnement est utilisé et les fonctions de base peuvent être utilisées gratuitement. Les fonctions avancées ou l'utilisation à haute fréquence nécessitent des abonnements payants, et il est conseillé aux utilisateurs d'évaluer la solution optimale en fonction de l'utilisation réelle.

Scénarios d'application

Les scénarios de mise en œuvre typiques de DeepInfra couvrent tout le spectre, depuis les expériences personnelles jusqu'à la production en entreprise :

  • Inférence LLM au niveau de la production : les entreprises intègrent des modèles open source tels que DeepSeek, Qwen et Llama dans les processus de production tels que les systèmes de service client, la génération de contenu et l'assistance au code. Les API compatibles OpenAI rendent les coûts de migration presque nuls, et les avantages se traduisent par une réduction des coûts et une autonomie accrue des modèles après le passage des API fermées aux modèles open source.

  • RAG et Knowledge Retrieval : combinaison des modèles d'intégration de DeepInfra (séries bge, e5) et des capacités de réorganisation pour créer un système de génération d'améliorations de récupération. La même clé API appelle l'intégration et la génération de modèles, simplifiant ainsi la pile technologique. Faites attention à la limite maximale de jetons (512 ou 8K) et à l'adaptabilité multilingue des différents modèles d'intégration.

  • Génération d'images et de vidéos : utilisez les modèles de la série FLUX pour générer par lots des images de produits de commerce électronique, des créations publicitaires et des conceptions conceptuelles. La facturation est basée sur la résolution et le nombre d'itérations, ce qui convient aux équipes qui doivent produire des images fréquemment. La série FLUX-2-klein est un modèle léger qui peut être généré plus rapidement et à moindre coût.

  • Compréhension des documents multimodaux : utilisez Gemma 4, Qwen-VL et d'autres modèles pour la reconnaissance des factures, l'extraction des informations contractuelles et l'OCR des formulaires. Les captures d'écran des documents sont transmises directement via l'API Vision, éliminant ainsi le besoin d'un pipeline de prétraitement.

  • Appel d'agent et d'outil : DeepSeek V4-Pro, Claude Fable 5 et d'autres modèles prennent en charge l'appel de fonction et l'appel d'outil, qui peuvent être utilisés pour créer des applications d'agent IA. Les niveaux de service prioritaires garantissent une faible latence pour le raisonnement en plusieurs étapes de l'agent.

  • Réglage précis du modèle et déploiement privé : déployez votre propre modèle de réglage fin sur le GPU DeepInfra, combiné à une expansion et une contraction automatiques pour servir le trafic de production. Convient aux entreprises qui ont des exigences en matière de souveraineté des données ou qui ont besoin de personnaliser le comportement du modèle.

Personnes concernées

Le formulaire de service multicouche de DeepInfra couvre les quatre types de rôles suivants :

  • Développeurs d'applications IA : nécessité d'intégrer rapidement des capacités d'inférence, en se concentrant sur la compatibilité des API, la richesse des modèles et le prix. L'API compatible OpenAI de DeepInfra permet de migrer depuis OpenAI avec presque aucune modification de code, ce qui la rend adaptée à la vérification de la sélection de modèles et au déploiement en production.

  • Équipe DevOps et Infrastructure : Responsable de la gestion du cluster GPU et de l'optimisation des coûts d'inférence. La CLI deepctl, le déploiement privé et les options DeepCluster de DeepInfra lui confèrent un gradient complet de contrôle, depuis les API gérées jusqu'aux GPU nus.

  • Chercheurs et expérimentateurs en IA : nécessité de basculer fréquemment entre différents modèles pour une évaluation comparative. La bibliothèque de plus de 100 modèles et l'API unifiée de DeepInfra réduisent les frais d'ingénierie liés à l'évaluation multimodèle.

  • Enterprise AI Platform Leader : évaluez les fournisseurs d'inférences en termes de conformité, de sécurité et de coûts. La certification SOC 2/ISO 27001 de DeepInfra, sa politique de conservation zéro des données et ses centres de données auto-construits aux États-Unis sont des différenciateurs clés des API de cloud public.

Ne convient pas aux limites : DeepInfra n'est pas adapté aux scénarios qui nécessitent une liaison profonde à un écosystème de fournisseur de modèle unique (tels que les contrats d'entreprise qui nécessitent Azure OpenAI), aux besoins immédiats de déploiement multirégional mondial (actuellement principalement des centres de données américains) ou aux scénarios d'expérimentation personnelle qui nécessitent une très faible inférence et ne sont pas sensibles à la latence (dans ce cas, des alternatives gratuites ou bon marché sont plus adaptées).

Résumé et Outlook

La principale compétitivité de DeepInfra réside dans l'intégration verticale de « l'écosystème de modèles open source + API compatible OpenAI + infrastructure d'inférence auto-construite ». Il ne s'agit pas de l'API d'inférence la moins chère (certains niveaux de modèles Flex peuvent atteindre un coût très faible), ni de la plus riche en fonctionnalités (aucun service de formation de modèles n'est fourni), mais pour les équipes de développement et les entreprises qui ont besoin d'utiliser des modèles open source à grande échelle dans des environnements de production, elle offre un équilibre rare sur le marché actuel entre compatibilité, étendue du modèle et contrôlabilité de l'infrastructure.

Limites actuelles : les centres de données sont actuellement concentrés aux États-Unis, avec une couverture mondiale limitée ; la limite de simultanéité par défaut de 200 nécessite des communications professionnelles supplémentaires pour les scénarios à fort trafic ; la plate-forme elle-même ne fournit pas de services de formation ou de réglage de modèles et se concentre uniquement sur la couche d'inférence.

Évaluation des risques d'approvisionnement/d'adoption : pour les équipes entrepreneuriales et les développeurs de petite et moyenne taille, il est recommandé d'utiliser d'abord le prototype de niveau Standard + paiement à l'utilisation pour exécuter le prototype, vérifier la compatibilité de l'API et les effets du modèle, puis évaluer si un niveau de priorité ou un déploiement privé est nécessaire en fonction de l'utilisation réelle. Avant d'acheter, les entreprises doivent confirmer : le processus simultané d'augmentation des quotas, les termes spécifiques de la stratégie de conservation des données (en particulier si les entrées et les sorties sont utilisées pour l'amélioration du service), les conditions de résiliation anticipée du contrat DeepCluster et les futurs plans de couverture pour les centres de données non américains. Pour les équipes utilisant déjà l'API OpenAI, DeepInfra est une alternative à faible coût de migration aux modèles open source, mais ne doit pas être considérée comme un remplacement complet des modèles fermés - certains scénarios (par exemple, un jeu de rôle à très long contexte, des modèles fermés spécifiques à un domaine) nécessiteront toujours de retenir plusieurs fournisseurs.

Outils associés : hugging-face, replicate

Evolution de la version de la plateforme de DeepInfra

En tant que plateforme SaaS, DeepInfra ne dispose pas de numéro de version logicielle au sens traditionnel du terme. Son évolution se reflète dans l'expansion du support des modèles, les mises à niveau matérielles et les étapes de financement.

Phase initiale de la plateforme (2022-2024)

  • Septembre 2022 : Création de la société, fondée par une équipe ex-imo.
  • 2023-2024 : lancement de la version initiale de l'API d'inférence, ajout progressif de la prise en charge des modèles open source et établissement de l'infrastructure du centre de données aux États-Unis.

Étage d'expansion à grande vitesse (2025)

  • Bibliothèque de modèles étendue à plus de 100 : couvrant les modèles LLM open source grand public, multimodaux, de génération d'images et de parole.
  • Mise à niveau matérielle : introduction de la prise en charge des GPU H200 et B200 pour améliorer le débit d'inférence et l'efficacité énergétique.
  • Certification de conformité : obtention des certifications SOC 2 et ISO 27001, et mise en œuvre d'une stratégie zéro conservation des données.

Jalons de la série B (2026-05)

  • 4 mai 2026 : Annonce d'un financement de série B de 107 millions de dollars, avec un volume de traitement de jetons augmentant de 25 fois par rapport à la série A.
  • DeepCluster Release : lancement du service exclusif de location de cluster GPU B300, contrat de 5 ans à 1,98 $/GPU-h.
  • Accès continu aux nouveaux modèles : Les derniers modèles tels que Anthropic Claude Fable 5, Claude Sonnet 5, GLM-5.2, Kimi K2.7-Code, Qwen3.6, etc. sont tous disponibles en ligne rapidement après leur sortie.

Informations de version

  • Version DeepInfra série B :Le financement de série B a permis de lever 107 millions de dollars ; Le volume de traitement des jetons a été multiplié par 25 par rapport à la série A ; Le cluster DeepCluster B300 a été lancé ; Claude Fable 5/Sonnet 5, GLM-5.2, Kimi K2.7-Code et d'autres modèles ont été ajoutés ; 8 centres de données américains étaient exploités.
  • Plan d'entrepreneuriat DeepStart :Lancement d'un programme d'un milliard de jetons gratuits pour les start-ups, nécessitant un financement de 250 000 à 10 millions de dollars américains et établi il y a à peine 2 ans. Il n’y a pas encore de date officielle précise.
  • Jalons de la série A :Financement de série A complété ; depuis lors, le volume de traitement des jetons a été multiplié par 25 ; bibliothèque de modèles étendue à plus de 100 ; a obtenu la certification SOC 2/ISO 27001. Il n’y a pas encore de date et de montant officiels précis.
  • Version initiale de la plateforme :DeepInfra a été créé, a lancé la version initiale de l'API d'inférence IA et a construit une infrastructure d'optimisation d'inférence à partir de zéro.

Avis des utilisateurs

  • Chargement des avis...