Briques de données
Databricks est un entrepôt de lacs de données unifié et une plateforme d'IA fondée par l'équipe fondatrice d'Apache Spark. Il fournit des fonctionnalités complètes allant de l'analyse SQL d'ingénierie des données à la formation ML et au réglage fin LLM. Ses produits principaux incluent Databricks MLflow, Feature Store, Model Serving et Mosaic AI.
Databricks
Paramètres de base et statistiques de Databricks
Databricks se positionne comme une plateforme unifiée « données + IA », plutôt que comme un simple framework de formation ou entrepôt de données. Il place l'entrepôt de lacs de données (Delta Lake), l'analyse SQL, le suivi des expériences ML et la formation de grands modèles sous le même système de gouvernance, et la forme de livraison principale est une plate-forme d'hébergement au niveau de l'entreprise.
| Projets | Informations publiques |
|---|---|
| Positionnement officiel | Plateforme unifiée Données + IA |
| Formulaire de base | Entrepôt de lac de données + plateforme ML + déploiement d'inférence IA |
| Chemin de déploiement | Hébergement multi-cloud (AWS, Azure, GCP), pas encore de version autonome |
| Composants de base | Delta Lake, MLflow, Unity Catalog, Mosaic AI, Model Serving, Serverless SQL |
| Projets open source | Intégration Apache Spark, Delta Lake, MLflow, Apache Iceberg |
| Valorisation boursière | Environ 43 milliards de dollars américains (2024), et un nouveau cycle de financement en 2025 serait évalué à plus de 60 milliards |
| Acquisitions clés | MosaicML (2023, 1,3 milliard de dollars), Tabular (2024, montant non divulgué), Arcion (2024) |
| Clients entreprises | Plus de 10 000 entreprises clientes dans le monde (divulgation officielle en 2025) |
L'essence de l'intégration de Mosaic AI : après l'acquisition de MosaicML en 2023, Databricks a acquis non seulement le cadre de formation LLM, mais également la série MPT de pondérations de modèles open source et une équipe d'ingénieurs ayant une expérience dans les réunions au sommet MLSys. Cela a permis à Databricks d'achever le passage d'une « société d'entrepôt de lacs de données » à une « société de plateforme de données + IA » dans le paysage concurrentiel, formant directement une concurrence croisée à trois niveaux avec Snowflake, AWS SageMaker et Google Vertex AI.
Coûts cachés de la stratégie multi-cloud : bien que la prise en charge multi-cloud soit revendiquée, la disponibilité du service sur chaque cloud est incohérente : le moteur Photon sur AWS est le plus optimisé, Azure est profondément intégré à Active Directory, GCP est le dernier à démarrer et certaines fonctionnalités avancées sont retardées dans la sortie. Lors de la sélection d'un modèle, les entreprises doivent confirmer l'exhaustivité des fonctions sur le cloud cible pour éviter de sous-estimer le coût réel de la migration en raison des promesses « multi-cloud ».
Utilisateurs de Databricks et reconnaissance du marché
La reconnaissance de Databricks sur le marché présente une tendance claire : « forte du côté B et faible du côté C ». Sa valeur commerciale dépend principalement des décisions d’approvisionnement des équipes de données et d’IA au niveau de l’entreprise, plutôt que du bouche-à-oreille des développeurs individuels.
Échelle client entreprise : selon les informations officielles, Databricks sert plus de 10 000 entreprises clientes dans le monde entier, couvrant les services financiers, la santé, la vente au détail, la fabrication, les médias et le divertissement et d'autres secteurs. Les clients typiques incluent Shell Regeneron, Comcast H&M, etc. Le chiffre d'affaires dépasse 2 milliards de dollars au cours de l'exercice 2025, avec une croissance d'une année sur l'autre restant supérieure à 40 %. Sa structure de revenus est dominée par des contrats d'entreprise annuels (y compris des forfaits DBU réservés et une partie flexible de paiement à l'utilisation). La version communautaire et la version personnelle ne génèrent quasiment aucun revenu direct.
Influence écologique open source : les données de ses trois grands projets open source peuvent être vérifiées : Apache Spark a plus de 39 000 étoiles sur GitHub, Delta Lake a plus de 7 500 étoiles et MLflow a plus de 19 000 étoiles. L'activité communautaire et le taux d'adoption par les entreprises de ces trois projets se situent à l'échelon supérieur des projets similaires. Cependant, il convient de noter qu'il existe une couche fonctionnelle de « version communautaire open source par rapport à la version améliorée d'entreprise » entre ces projets open source et les produits commerciaux Databricks - certaines fonctionnalités avancées (telles que le partage Delta, la certification au niveau de l'entreprise du moteur de vectorisation Photon MLflow) ne sont disponibles que dans la version commerciale.
Paysage concurrentiel de l'industrie : Databricks et Snowflake sont en concurrence directe dans le domaine des entrepôts de données/lake Warehouse. Snowflake est connu pour sa « facilité d'utilisation et son expérience d'hébergement » et Databricks est connu pour son « ouverture et la profondeur de son intégration de l'IA ». Des institutions d'analyse telles que Gartner ont placé les deux côte à côte dans le quadrant des leaders dans le domaine de la gestion des données. Cependant, dans la sélection réelle, les deux ne sont pas complètement interchangeables : les équipes qui préfèrent l'analyse SQL standard et ne dépendent pas de l'écosystème Spark ont tendance à préférer Snowflake ; les entreprises qui disposent déjà de piles technologiques Spark/ML et qui ont besoin d’unifier les plates-formes de données et d’IA ont tendance à privilégier Databricks.
Évaluation et benchmark tiers : dans la catégorie des plates-formes unifiées données+IA, les performances de Databricks dans le test de référence TPCDS sont 2 à 4 fois supérieures à celles de produits concurrents similaires (grâce au moteur de vectorisation Photon), mais l'avantage n'est pas évident dans le scénario d'entrepôt de données traditionnel TPC-H. Dans la dimension de la plate-forme ML, le taux d'adoption par la communauté de MLflow est supérieur à celui de Kubeflow et de SageMaker Pipelines, mais il existe encore des outils tiers (tels que Weights & Biases, Arize AI) qui peuvent le remplacer dans certains scénarios en termes d'observabilité au niveau de la production et de profondeur de surveillance des modèles.
Avantages financiers des Databricks
La structure de coûts de Databricks présente les caractéristiques d'une « double facturation des services informatiques et de plateforme ». Le coût est composé des frais de ressources cloud sous-jacents et de la couche supérieure Databricks DBU (Databricks Unit). Comprendre cette architecture à deux niveaux est une condition préalable à la maîtrise des coûts.
Client C/utilisateurs individuels : la version communautaire offre un quota gratuit limité, adapté à l'apprentissage personnel et aux expériences à petite échelle. Cependant, l'édition communautaire présente de nombreuses limitations strictes : le nombre de simultanéités de cluster est limité, la gouvernance au niveau de l'entreprise Unity Catalog n'est pas prise en charge, il n'y a pas d'accès à la formation Mosaic AI et la capacité de stockage maximale est limitée. Pour les utilisateurs individuels qui souhaitent apprendre l'ingénierie des données et le ML sur Databricks, l'édition communautaire suffit pour commencer ; une fois que vous êtes impliqué dans le réglage fin du LLM ou le déploiement au niveau de la production, vous devez passer à un forfait prépayé ou à l'utilisation.
Appels développeur/API : lorsqu'ils sont appelés via l'API Serverless SQL Warehouse ou Notebook, la facturation est basée sur l'utilisation de DBU et il n'existe pas de package fixe unifié. Le prix unitaire du DBU varie selon le type de charge de travail (formation SQL, ETL, ML, inférence) et le fournisseur de cloud. En prenant SQL Warehouse sur AWS comme exemple, cela coûte environ 0,55 $ par DBU (prix de référence, soumis à la page de tarification officielle) et une seule requête moyenne consomme 1 à 5 DBU. Cela signifie que le coût de calcul direct d'une analyse simple peut se situer entre 0,5 et 3 dollars, ce qui la rend adaptée à une utilisation flexible par de petites équipes.
Déploiements d'entreprise/privés : il s'agit du véritable noyau de revenus de Databricks. Les entreprises achètent via des contrats d'entreprise, qui comprennent généralement trois éléments de coût majeurs :
| Éléments de coût | Descriptif | Estimation des proportions |
|---|---|---|
| Forfaits de préachat DBU | Payez d'avance sur un contrat annuel ou pluriannuel et bénéficiez de tarifs réduits (généralement environ 15 à 25 % pour un contrat d'un an, jusqu'à 30 à 40 % pour 3 ans) | Environ 50 à 60 % |
| Infrastructure cloud | Les ressources AWS/Azure/GCP sous-jacentes (EC2/VM, S3/Blob Storage, trafic réseau) sont facturées directement par le fournisseur de cloud et non au sein du DBU | Environ 30 à 40 % |
| Services à valeur ajoutée | Plans de support au niveau de l'entreprise, formations, services professionnels (PS) et autres modules complémentaires facultatifs | Environ 5-10% |
Ce qui mérite une attention particulière dans les contrats d'entreprise, c'est la rentabilité de la réservation et le risque de survente flexible : le pré-achat de packages DBU peut réduire considérablement le prix unitaire, mais si la DBU réservée n'est pas réellement utilisée, elle expirera souvent (utilisez-la ou perdez-la), provoquant un gaspillage caché ; à l’inverse, si les surventes déclenchent un paiement au fur et à mesure (excédents), le prix unitaire sera de 40 à 60 % plus élevé que le prix de pré-achat. Par conséquent, la stratégie d'achat recommandée consiste à acheter des packages réservés sur la base de 70 à 80 % de l'utilisation estimée, la partie restante étant flexible en fonction du volume, et à s'efforcer d'obtenir la clause « DBU réservé peut être étendu » dans le contrat.
Analyse comparative des coûts avec des produits concurrents : par rapport à Snowflake, Databricks évite les frais de transfert de données multiplateformes grâce à l'intégration native avec Spark dans les scénarios de formation ETL et ML (Snowflake encourt des frais de sortie supplémentaires lors de la sortie de données vers l'environnement de formation ML). Mais dans les scénarios d'analyse SQL pure, les stratégies de facturation à la seconde et de suspension automatique de Snowflake sont généralement plus économiques pendant les périodes de faible activité. Par rapport à AWS SageMaker, la gouvernance unifiée de Databricks (Unity Catalog) élimine les coûts cachés d'exploitation et de maintenance liés à la synchronisation des autorisations entre plusieurs outils.
Principales fonctionnalités de Databricks
Le système fonctionnel de Databricks s'articule autour du concept complet de « saisie de données dans le lac -> gestion -> analyse -> formation -> déploiement », plutôt que de rassembler des outils dispersés.
-
Delta Lake Data Lake Warehouse : la couche de stockage unifiée permet l'évolution du schéma de transaction ACID et le voyage dans le temps (backtracking des versions de données). Par rapport à l'utilisation directe de Spark pour traiter les fichiers originaux, Delta Lake améliore la fiabilité des données au niveau de la base de données, en évitant les incohérences des données causées par des « écritures sales » et des « mises à jour à mi-chemin ». Problèmes d'acceptation : dans le scénario de l'entrepôt Lake, le temps d'exécution et la consommation de ressources des opérations de maintenance OPTIMIZE/ZORDER de Delta Lake sur de très grandes tables (niveau PB) doivent être comparés avant la sélection.
-
Gouvernance unifiée d'Unity Catalog : un contrôle d'accès précis couvrant les données, les fonctionnalités, les modèles et les blocs-notes constitue la principale barrière des capacités de Databricks au niveau de l'entreprise. Unity Catalog fournit une vue unifiée des métadonnées dans tous les espaces de travail, résolvant les problèmes fondamentaux de « où se trouvent les données, qui peut y accéder et comment les auditer » lorsque plusieurs équipes partagent un cluster. Différences avec les produits concurrents : La gouvernance de Snowflake est indépendante de la couche informatique, tandis que Unity Catalog est profondément intégrée à la couche informatique de Databricks - ce qui signifie que si un moteur externe est utilisé pour accéder aux données gérées par Unity Catalog, la cohérence des politiques de gouvernance sera un défi.
-
Formation et réglage fin du modèle Mosaic AI : sur la base des capacités acquises grâce à l'acquisition de MosaicML, une formation, un réglage fin et une évaluation distribués LLM sont fournis. Prend en charge les stratégies parallèles telles que Megatron-LM et FSDP, ainsi que sa propre bibliothèque de formation Composer optimisée. La plateforme gère directement le suivi des expériences, le stockage Checkpoint et l'enregistrement des modèles, réduisant ainsi le coût de migration de l'expérimentation vers la production. Conseils de mise en œuvre : les opérations de formation Mosaic AI consommeront une grande quantité de DBU. Il est recommandé d'utiliser un petit modèle (tel que le niveau de paramètre 7B) pour vérifier le pipeline de formation et la qualité des données pendant la phase de développement, puis de l'étendre à l'échelle 70B+ après confirmation.
-
Gestion complète du cycle de vie de MLflow : MLflow natif intégré prend en charge le suivi des expériences, l'enregistrement des modèles, la gestion des versions et le déploiement. L'ouverture de MLflow réside dans le fait qu'il n'est pas lié à Databricks - le même ensemble d'enregistrements expérimentaux peut être lu par un contexte de raisonnement externe, mais le déploiement MLflow (Model Serving) fourni par Databricks est meilleur que la version communautaire en termes de latence de mise à l'échelle GPU et de prise en charge des tests A/B.
-
Delta Sharing Open Data Sharing : un protocole de partage de données sécurisé multiplateforme et interorganisations qui permet aux destinataires de lire les données partagées sans utiliser Databricks. Cela fournit une solution de collaboration à faible friction dans des scénarios de coopération de données à grande échelle (tels que le partage de données entre les chaînes d'approvisionnement en amont et en aval, la modélisation conjointe du contrôle des risques par les institutions financières).
-
Photon Vectorization Engine : un moteur C++ natif optimisé pour Delta Lake qui est 2 à 4 fois plus rapide que les moteurs Spark JVM traditionnels dans l'analyse SQL et les scénarios ETL (référence officielle). Photon est automatiquement activé et ne nécessite aucun ajustement de l'utilisateur - mais il convient de noter que son effet d'accélération est plus évident dans les analyses de colonnes et les requêtes d'agrégation, et l'amélioration est limitée dans les scénarios JOIN complexes avec des remaniements fréquents.
Evolution du modèle et de la version Databricks
En tant que plateforme d'hébergement plutôt que logiciel indépendant, l'évolution des versions de Databricks est basée sur le Runtime (Databricks Runtime, DBR), avec une version majeure LTS environ une fois par trimestre, complétée par des versions mineures mensuelles. Les étapes suivantes sont des étapes clés vérifiables de la version :
Sortie du LTS principal DBR
| Version | Date de sortie | Changements fondamentaux |
|---|---|---|
| DBR 10.4 LTS | 2022-04 | Spark 3.2.x, introduction de l'aperçu public de Photon |
| DBR 11.3 LTS | 2022-08 | Unity Catalog GA, intégration MLflow 2.0 |
| DBR 12.2 LTS | 2023-04 | Photon GA, Serverless SQL est officiellement disponible, Delta Lake 2.3 |
| DBR 13.3 LTS | 2023-08 | MLflow 2.4, début de l'intégration de Mosaic AI, Delta Sharing GA |
| DBR 14.3 LTS | 2024-04 | Spark 3.5.x, Photon étendu à ETL, Unity Catalog Lineage GA |
| DBR 15.4 LTS | 2025-12 | La dernière version LTS prend entièrement en charge la formation Mosaic AI et améliore Lakehouse Federation |
Remarque sur la politique de version : les versions LTS de Databricks fournissent un cycle de maintenance minimum de 2 ans, et les versions non LTS de seulement 6 mois. Pour les charges de travail de production, il est recommandé de toujours utiliser les versions LTS et d'attendre 2 à 3 mois après une version majeure avant de procéder à la mise à niveau. Attendre le cycle de commentaires de la communauté peut aider à contourner les problèmes de stabilité avec les versions antérieures.
Jalons du produit (niveau hors exécution)
- 2020-06 : Delta Lake est open source, jetant les bases de la feuille de route technique de Lakecang.
- 2021-06 : Databricks SQL GA, passant de l'ingénierie des données au marché de l'analyse SQL, évaluant directement Snowflake.
- 2022-07 : Unity Catalog est officiellement publié pour résoudre le problème de la fragmentation de la gouvernance des données multi-équipes.
- 2023-06 : acquisition de MosaicML (1,3 milliard de dollars) pour acquérir des capacités de formation LLM et des modèles de la série MPT.
- 2024-06 : Acquisition de Tabular (équipe principale de contributeurs d'Apache Iceberg) pour renforcer l'intégration d'Iceberg.
- 2025-05 : Lakehouse Federation GA, interrogation unifiée de sources de données externes (Snowflake, Redshift, PostgreSQL, etc.) sans migration.
Jugement principal : L'axe principal de l'évolution de la version de Databricks est la transformation de la « plateforme d'hébergement Spark en plateforme unifiée données + IA ». L'acquisition de MosaicML en 2023 a été un tournant : chaque version de LTS depuis lors a réduit l'écart d'expérience entre l'ingénierie des données et la formation à l'IA. La Lakehouse Federation lance en 2025 un signal : elle n'exige plus que les données résident dans Delta Lake, mais étend la portée de la gouvernance aux sources de données externes, ce qui abaisse le seuil pour les utilisateurs Snowflake/Redshift existants pour migrer vers Databricks.
Avantages techniques des Databricks
La barrière technique de Databricks ne réside pas dans le leadership absolu en termes de performances d'un seul composant, mais dans la résolution du « fossé miroir entre l'ingénierie des données et la formation en IA » : dans l'architecture traditionnelle, les données sont gérées dans l'entrepôt, mais le modèle de formation doit ETL les données dans un environnement indépendant, et les autorisations, les versions et le suivi de la qualité dans le processus sont souvent rompus.
Stockage et gouvernance unifiés : la combinaison de Delta Lake + Unity Catalog réalise l'architecture de « là où se trouvent les données, l'IA est là ». La formation du modèle ne nécessite plus d'ETL supplémentaire pour déplacer les données hors de l'entrepôt de données : le script de formation lit directement les données organisées dans Delta Lake et exploite Unity Catalog pour hériter des autorisations au niveau des lignes/colonnes de la table. L'effet direct de cette architecture est que l'équipe d'ingénierie des données et l'équipe ML utilisent les mêmes données, le même ensemble de configurations d'autorisations et le même ensemble de journaux d'audit, éliminant ainsi le « coût de traduction » de la coordination entre les équipes.
Exécution vectorisée du moteur Photon : Photon est un moteur d'exécution de requêtes réécrit par Databricks en C++, remplaçant l'exécution basée sur JVM de Spark par une exécution vectorisée native. Dans le benchmark TPCDS, Photon a réduit de 2 à 4 fois la latence des requêtes SQL courantes. Son noyau technique comprend : le traitement de vectorisation en colonnes (à l'aide du jeu d'instructions SIMD), l'optimisation adaptative du plan d'exécution (ajustement adaptatif du nombre de partitions aléatoires) et l'agrégation de hachage et les algorithmes JOIN spécialement optimisés. Photon est automatiquement activé sans que les utilisateurs n'aient besoin de modifier le code SQL ou Pipeline, ce qui signifie que les entreprises peuvent améliorer leurs performances sans modifier le code existant et que les coûts de migration sont proches de zéro.
Optimisation de la formation distribuée pour Mosaic AI : Avec l'acquisition de MosaicML, Databricks intègre profondément sa bibliothèque de formation Composer et l'intégration de Flash Attention dans la plateforme. Dans la série Llama 2/3 de benchmarks affinés, le débit de Mosaic AI est environ 1,3 à 1,8 fois supérieur à celui de l'implémentation standard de PyTorch FSDP (repère officiel, sous réserve des circonstances réelles). Les optimisations clés incluent : l'accumulation automatique de gradients, les points de contrôle d'activation, l'entraînement de précision mixte FP8 et la liaison avec le moteur Photon pour obtenir une lecture sans copie des données d'entraînement. Pièges réels : La stabilité de la formation distribuée est considérablement affectée par la topologie du réseau. Il est recommandé d'utiliser des tests de bande passante différée pour vérifier les performances de communication entre les nœuds avant de commencer officiellement la formation afin d'éviter les interruptions fréquentes de la formation causées par l'expiration du délai NCCL.
Requêtes à migration nulle pour Lakehouse Federation : fonctionnalités de GA 2025. Permet aux utilisateurs d'interroger directement des sources de données externes telles que Snowflake, Redshift, BigQuery, PostgreSQL, etc. via Unity Catalog sans déplacer de données. La couche Fédération utilise le refoulement des prédicats et l'élagage des informations statistiques pour extraire uniquement les lignes et les colonnes réellement nécessaires vers la couche de calcul au lieu de copier l'intégralité du tableau. Cela donne aux entreprises dans la « période de transition de migration » la possibilité pour les systèmes des deux côtés de coexister, réduisant ainsi la pression décisionnelle et le risque d'interruption d'activité liés à la « migration ALL-IN ».
Architecture de sécurité et de conformité : Unity Catalog fournit un filtrage au niveau des lignes, un masquage au niveau des colonnes (Masquage au niveau des colonnes) et un contrôle d'accès basé sur les attributs (ABAC). Les journaux d'audit peuvent être exportés vers les systèmes SIEM pour répondre aux exigences de conformité SOC 2 et RGPD. Les données sont cryptées par défaut pendant la transmission et le stockage, et les clients peuvent gérer les clés de cryptage via Bring Your Own Key (BYOK). Limite de conformité : la certification Databricks couvre SOC 2 Type II, ISO 27001 et HIPAA, mais vous devez faire attention aux restrictions de résidence des données lorsque vous opérez en Chine : le déploiement de conformité en Chine doit être effectué via la région Azure Chine ou des partenaires, et le déploiement mondial multi-cloud direct peut ne pas répondre entièrement aux exigences de classification.
Comment utiliser les Databricks
L'entrée d'utilisation de Databricks est divisée en trois chemins en fonction des rôles et des scénarios. Chaque chemin a des capacités et des autorisations différentes.
| Comment utiliser | Convient au rôle | Caractéristiques | Coût |
|---|---|---|---|
| Interface utilisateur de l'espace de travail | Ingénieurs de données, data scientists | Développement de notebook Requête SQL Création de tableaux de bord Suivi des expériences ML | Par DBU + ressources cloud |
| Entrepôt SQL sans serveur | Analyste SQL | Requête SQL pure, aucune gestion de cluster requise, expansion et contraction automatiques | Facturation par DBU |
| API/SDK | Ingénieur Plateforme Ingénieur ML | Gérez les tâches, les déploiements de modèles et les clusters par programmation via l'API REST ou le SDK Python | Facturé par DBU |
Flux de travail typique :
-
Créer un espace de travail : créez un espace de travail Databricks sur le cloud cible (AWS/Azure/GCP), finalisez l'initialisation des métadonnées Unity Catalog et l'intégration du fournisseur d'identité (IdP). Cette étape est généralement effectuée dans la console cloud ou la console du compte Databricks et prend environ 1 à 2 jours (y compris la configuration du réseau et la coordination des politiques de sécurité).
-
Données dans le lac : chargez les données brutes (CSV, JSON, Parquet) dans la table Delta Lake via Auto Loader (lecture incrémentielle des nouveaux fichiers dans le stockage cloud) ou la commande COPY INTO. Auto Loader prend en charge l'inférence et l'évolution automatiques du schéma, réduisant ainsi la charge de travail liée à la définition manuelle du schéma.
-
Transformation et analyse des données : utilisez Python/SQL/Scala pour ETL dans Notebook ou effectuez des requêtes ad hoc via Databricks SQL. Pour les tâches ETL de production, il est recommandé de définir de manière déclarative les pipelines de données à l'aide de Delta Live Tables (DLT), qui gère automatiquement les dépendances et les mises à jour incrémentielles.
-
Formation ML et déploiement de modèles : démarrez la tâche de formation dans l'interface Notebook ou Mosaic AI, les indicateurs expérimentaux sont automatiquement enregistrés dans MLflow et les produits modèles sont enregistrés dans le registre des modèles d'Unity Catalog. Déployez le modèle enregistré sur le point de terminaison Model Serving, configurez les règles de mise à l'échelle automatique du GPU et exposez l'API REST pour que les applications en aval puissent l'appeler.
Scénarios d'intégration courants : Databricks est intégré nativement à MLflow Tracking. L'appel de « mlflow.start_run() » dans le code de formation peut enregistrer automatiquement les paramètres, les indicateurs et les produits modèles sans configuration supplémentaire. Si vous utilisez un serveur MLflow externe, vous devez installer la bibliothèque « mlflow » sur le cluster et configurer l'URI de suivi.
Prix des produits
Le modèle de tarification est soumis à la page officielle en temps réel. Habituellement, un système freemium ou d'abonnement est adopté, les fonctions de base peuvent être utilisées gratuitement et les fonctions avancées ou l'utilisation à haute fréquence nécessitent un paiement.
Scénarios d'application
Les scénarios d'application de Databricks couvrent les deux dimensions de l'ingénierie des données traditionnelle et de la formation à l'IA. Les quatre scénarios suivants ont été largement vérifiés dans des déploiements d'entreprise réels :
-
Construction intégrée de lacs et d'entrepôts d'entreprise : unifiez le cluster Hadoop/Spark d'origine et plusieurs sources de données sur Delta Lake pour réaliser la gestion des données et la formation à l'IA sur la même plateforme. Parcours client typique : remplacez d'abord les anciennes tables Hive sur plusieurs champs de données clés (tels que le comportement des utilisateurs, les enregistrements de transactions), vérifiez l'amélioration des performances et de la qualité des données, puis étendez-les progressivement à toutes les sources de données. Conseils de mise en œuvre : Il n'est pas recommandé de poursuivre toutes les migrations de données dès la première étape de la construction d'un entrepôt lacustre. La priorité est donnée à la migration des requêtes à haute fréquence et des domaines de données qui doivent être gérés. Les données archivées avec une faible fréquence d'accès peuvent être maintenues en place via le partage Delta ou la table externe.
-
Pipelines ETL en direct et par lots : créez des pipelines de données déclaratifs à l'aide d'Auto Loader et de Delta Live Tables pour charger progressivement les données à partir du stockage cloud et gérer automatiquement l'évolution des schémas et les contraintes de qualité des données. Le mécanisme d'attentes de DLT vous permet de définir des règles de qualité des données (non vides, unicité, intégrité référentielle), et les données qui ne répondent pas aux règles entrent dans la file d'attente « échec » ou « avertissement » sans bloquer l'ensemble du pipeline. Différences avec la solution Airflow : DLT ne nécessite pas d'écriture manuelle des DAG et des plannings de configuration - la logique ETL est déclarée en SQL ou Python, et la plateforme gère automatiquement les plans d'exécution et la récupération des erreurs.
-
Réglage fin LLM et déploiement de modèles à l'échelle de l'entreprise : exploitez Mosaic AI pour affiner les grands modèles open source (Llama, Falcon, MPT, etc.) sur des ensembles de données propriétaires. La valeur fondamentale n'est pas le cadre de formation lui-même, mais l'intégration avec Unity Catalog : les données de formation sont lues directement à partir de la table Delta Lake gérée, les produits modèles sont enregistrés dans le catalogue et déployés par Model Serving, et le lignage des données et le contrôle des autorisations de l'ensemble du lien sont uniformément audités. Limite du scénario : si l'entreprise a uniquement besoin d'appeler des API externes (telles que l'utilisation d'OpenAI ou d'Anthropic), plutôt que de former des modèles sur ses propres données, les avantages de Databricks ne sont pas valables : les outils légers (tels que LangChain + base de données vectorielle) sont plus rentables.
-
Science des données et analyse exploratoire du ML : les data scientists utilisent Notebook pour explorer rapidement les données, former des modèles prototypes et enregistrer automatiquement les expériences dans MLflow. L'ajout de Feature Store (entrepôt de fonctionnalités en ligne) permet au modèle expérimental d'être connecté de manière transparente à l'inférence de production, évitant ainsi le point d'arrêt classique d'une « AUC hors ligne élevée et aucune fonctionnalité en ligne ». Problèmes de configuration : la latence des fonctionnalités en temps réel du Feature Store (généralement de quelques secondes à quelques minutes) doit correspondre aux exigences de latence de l'inférence en ligne. Les exigences en matière de fonctionnalités en temps réel au niveau de la milliseconde nécessitent un stockage en ligne externe tel que Redis.
Personnes concernées
Databricks a une stratégie d'adaptation claire et structurée par rôle, mais sa courbe d'apprentissage et son seuil de coût déterminent qu'elle ne convient pas à tous les praticiens des données.
-
Équipe d'ingénierie des données : le groupe d'utilisateurs principal. La gestion unifiée des données ETL et les outils de gouvernance réduisent les coûts de maintenance multi-systèmes. Delta Live Tables réduit la charge de travail de maintenance des pipelines, de l'orchestration de style DAG à la définition déclarative, afin que les équipes puissent se concentrer davantage sur la qualité des données plutôt que sur la planification du pipeline. Ne correspond pas aux limites : si la charge de travail principale de votre équipe est déjà constituée d'analyses SQL pures et n'a aucun besoin de ML ou de traitement de flux, Snowflake ou Redshift peuvent avoir une courbe d'apprentissage moins profonde et un coût total potentiellement inférieur.
-
Équipe ML et data scientists : Nous espérons travailler sur la même plateforme de l'expérimentation à la production pour réduire les problèmes d'incohérence causés par la migration limitée. La valeur de l'intégration de MLflow et de Feature Store est particulièrement évidente dans ce rôle : les paramètres expérimentaux, les artefacts de modèle et les pipelines de fonctionnalités se trouvent dans le même domaine de gouvernance. Limite inadaptée : pour les équipes qui nécessitent un contrôle extrêmement élevé sur le cadre de formation (comme le AI Lab engagé dans la recherche pré-formation LLM), la flexibilité de planification de la formation de Databricks est inférieure à celle de l'utilisation directe de Slurm + PyTorch natif, et le coût du GPU DBU dans une formation à très grande échelle peut être plus élevé que l'utilisation d'instances GPU d'origine.
-
Analystes SQL et équipe d'analyse commerciale : Databricks SQL vous permet d'interroger les données de Delta Lake à l'aide de SQL standard sans écrire Python ou Scala. Serverless SQL Warehouse supprime le fardeau de la gestion des clusters, mais l'un des principaux obstacles réside dans la différence entre les dialectes SQL : certaines fonctions analytiques complexes peuvent se comporter légèrement différemment dans le moteur Photon et dans Spark SQL standard. Prérequis : L'équipe doit avoir des concepts de base en matière d'entrepôt de données. Il n’est pas recommandé au personnel de l’entreprise n’ayant absolument aucune connaissance de SQL de se lancer directement.
-
Architectes d'entreprise et décideurs informatiques : nécessité d'unifier l'infrastructure de données et d'IA dans un environnement multi-cloud, en se concentrant sur les audits de sécurité, le contrôle des coûts et la standardisation des plateformes. Unity Catalog et Delta Sharing fournissent une base conforme pour les déploiements à l'échelle de l'entreprise. Ne convient pas aux frontières : si la gouvernance des données de l'entreprise n'a pas encore atteint un certain niveau de maturité (par exemple, la gestion de base des métadonnées n'a pas été établie), l'introduction directe de Databricks ne résoudra pas automatiquement le problème de gouvernance, mais peut augmenter la pression d'exploitation et de maintenance en raison de la complexité de la plateforme. Il est recommandé d’établir d’abord un cadre de gouvernance des données, puis de sélectionner la technologie de plateforme.
Résumé et Outlook
La valeur fondamentale de Databricks réside dans le concept de « même plateforme » d’ingénierie des données et de formation en IA. Grâce à la combinaison de Delta Lake, Unity Catalog et Mosaic AI, la gouvernance des données, la formation des modèles et le déploiement des inférences sont unifiés dans le même domaine de gouvernance, réduisant ainsi le coût du passage du contexte de l'expérimentation à la production et la perte cachée du transfert de données.
Principaux avantages actuels : Delta Lake + Unity Catalog + Mosaic AI forment l'une des combinaisons les plus complètes de la plateforme données + IA. Le moteur Photon atteint une accélération de 2 à 4 fois dans les scénarios d'analyse SQL sans aucune modification de code. L'écosystème open source (Spark, Delta Lake, MLflow) offre aux entreprises la portabilité de la pile technologique et évite d'être enfermée par un seul fournisseur de cloud. Lakehouse Federation réduit encore les frictions liées à la migration des sources de données externes.
Limitation actuelle majeure : la tarification DBU peut avoir un coût total plus élevé dans les scénarios de formation à grande échelle que l'utilisation directe d'instances GPU brutes. La complexité d'exploitation et de maintenance unifiée des déploiements multi-cloud est plus élevée que celle des solutions mono-cloud : les délais de réplication des données et le maintien de la cohérence entre les cloud nécessitent des investissements d'ingénierie supplémentaires. En concurrence directe avec Snowflake dans les scénarios d'analyse SQL purs, les coûts d'apprentissage et d'utilisation sont désavantagés au niveau superficiel (expérience d'entrée). La flexibilité de planification du cadre de formation de Mosaic AI est toujours inférieure à celle de l'utilisation directe de planificateurs professionnels tels que Slurm/PBS.
Points d'observation de suivi : L'impact de l'équipe Tabular acquise en 2025 sur l'écosystème Iceberg - comment se déroulera la compétition de format entre Delta Lake et Iceberg ; si la gamme de produits Serverless sera étendue à la formation ML (actuellement, Serverless ne couvre que SQL et ETL, et la formation nécessite toujours une gestion manuelle des clusters) ; Les progrès de conformité de Databricks sur le marché intérieur - actuellement, ils reposent principalement sur la région Azure Chine, et les alternatives de localisation directe full-stack ne sont pas encore matures.
Évaluation des risques d'approvisionnement et d'adoption : il est recommandé aux entreprises de sélectionner d'abord un domaine de données non critique (tel que des rapports d'analyse marketing ou une base de connaissances interne) comme pilote, d'effectuer la vérification fonctionnelle et le renforcement des capacités de l'équipe dans un délai de 3 à 6 mois, et de confirmer l'adaptabilité de la plateforme aux pipelines de données existants avant de l'étendre. Au niveau du contrat d'approvisionnement, concentrez-vous sur : la période de verrouillage du prix unitaire DBU et la limite de prix de survente, la façon de gérer le quota inutilisé de packages réservés (prolongé ou annulé), les conditions des frais de migration des données et la maturité de l'intégration entre Unity Catalog et l'IdP existant (LDAP/AD/Okta). Pour les secteurs qui ont des exigences strictes en matière de souveraineté des données (finances, affaires gouvernementales, soins médicaux), il est recommandé d'évaluer simultanément l'itinéraire auto-construit de la pile technologique open source (Trino + Iceberg + MLflow) comme solution de contrôle en plus du déploiement privatisé ou des solutions régionales exclusives Azure pour éviter le risque de verrouillage d'un seul fournisseur. Dans l'ensemble, Databricks est l'une des plateformes dotées des fonctionnalités les plus complètes dans son domaine, mais sa libération de valeur dépend fortement de la maturité de la gouvernance des données de l'entreprise et de la réserve technique de l'équipe d'ingénierie - lorsque ces deux prérequis ne sont pas remplis, le retour sur investissement de la plateforme sera considérablement réduit.
Outils associés : hugging-face, replicate
Comment utiliser les Databricks
- Client Web : Vous pouvez l'utiliser en visitant le site officiel et en créant un compte. La plupart des fonctions ne nécessitent pas d'installation.
- Accès API : fournit une API RESTful, les développeurs peuvent obtenir la clé API et l'intégrer dans leurs propres applications.
Informations de version
- Mise à jour de la plateforme Databricks de juin 2026 :La plateforme cloud est en constante itération et n'a pas encore de numéro de version fixe.
- Runtime Databricks 15.4 LTS :Il n’y a pas encore de date officielle précise.
Avis des utilisateurs