Évaluation profonde
Gratuit
DeepEval est un cadre d'évaluation LLM open source maintenu par l'équipe Confident AI. Il convient à l'intégration des tests de migration de RAG, d'agent, de chatbot et de modèle dans le processus qualité
DeepEval
Paramètres et statistiques de base
Le positionnement public de DeepEval est « Le cadre d'évaluation LLM ». Il ne s'agit pas d'un détecteur de contenu IA permettant aux utilisateurs finaux de juger de l'authenticité des articles, mais d'un cadre de test permettant aux équipes d'ingénierie d'évaluer la qualité des applications LLM : organiser des cas de test dans le style Pytest, utiliser des indicateurs pour mesurer les effets de RAG, Agent, chatbots, plusieurs cycles de dialogue et de migration de modèles, et connecter les résultats à la plateforme CI locale ou Confident AI.
| Projets | Informations publiques |
|---|---|
| Formulaire de produit | Package Python open source + Plateforme de qualité cloud Confident AI |
| Entrée officielle | IA confiante; La documentation et la page produit de DeepEval sont deepeval.com |
| Entrepôt open source | confident-ai/deepeval |
| Licence | Apache-2.0 |
| Version actuelle de PyPI | 4.0.7, mis en ligne le 2026-06-22 |
| Exigences Python | Python >=3,9, <4,0 |
| Taille de la communauté GitHub | Environ 16,4 000 étoiles, 1,5 000 fourchettes |
| Couverture des indicateurs de base | Agentic, RAG, dialogue multi-tours MCP, multi-modalité, hallucination, biais, correction JSON toxique, etc. |
| Entrée typique | pip install -U deepeval, exécution de test deepeval, plateforme Confident AI |
Jugement de classification : DeepEval travaille sur la qualité des applications LLM, les ensembles de tests, les indicateurs, la régression et l'amélioration du modèle/mot d'invite, ce qui est le plus proche de la « formation par modèle ai ». Bien qu'il contienne des indicateurs de détection tels que les hallucinations, les biais, la toxicité, etc., l'objectif est d'évaluer le système modèle plutôt que de fournir des services de reconnaissance de contenu générés par l'IA pour les plateformes de contenu.
Limite de spécification : DeepEval peut écrire une évaluation dans le code et CI/CD, mais les résultats de l'évaluation dépendent toujours de la qualité de l'ensemble de tests, du modèle de jugement de définition de seuil et de la sélection des indicateurs ; pour la gestion de la qualité de la production, l'annotation manuelle, le suivi des journaux, la référence de version et l'acceptation commerciale sont toujours nécessaires.
Reconnaissance des utilisateurs et du marché
La reconnaissance de DeepEval vient principalement de la communauté open source, du flux de travail des développeurs et du positionnement de la plateforme d'entreprise de Confident AI. La page officielle du produit montre que DeepEval a été utilisé pour « plus de 100 millions d'évaluations quotidiennes » et affiche les logos d'adoption de Google, OpenAI, Toyota, Adobe, Walmart, Mastercard, AWS, NVIDIA, Microsoft, etc. ; ces logos peuvent être utilisés comme signaux d'affichage officiels, mais la portée spécifique du contrat, l'échelle de déploiement et le niveau de paiement ne sont pas divulgués.
Communauté Open Source : le référentiel GitHub affiche publiquement environ 16,4 000 étoiles et 1,5 000 forks, ce qui indique que DeepEval a dépassé le stade initial du projet expérimental et a formé une entrée stable pour les développeurs autour des indicateurs, des intégrations, des ensembles de données et des commandes de test.
Écosystème de développement : README est intégré à des frameworks tels que OpenAI, OpenAI Agents, LangChain, LangGraph, Pydantic AI, CrewAI, Anthropic, AWS AgentCore, LlamaIndex, etc. Pour l'équipe, ce type d'intégration réduit la friction de « modifier d'abord l'application puis évaluer » et est plus approprié pour compléter la référence de qualité dans les projets RAG ou Agent existants.
Signal d'entreprise : Confident AI se positionne comme une plate-forme de qualité d'IA, couvrant les tests, les tests, la surveillance, la trace, la gestion des ensembles de données, etc. DeepEval fournit l'exécution d'évaluations au niveau de la couche de code locale, et Confident AI sert d'entrée commerciale pour la collaboration en équipe, le reporting, la persistance des données et la surveillance de la production.
Avantage de coût
- C-side/Individuel : Généralement, une version gratuite est fournie pour découvrir les fonctions de base, et l'utilisation à haute fréquence nécessite un abonnement payant.
- API/Développeur : Facturé au volume d'appels, adapté aux équipes de développement qui peuvent être intégrées de manière flexible dans leurs propres systèmes.
- Entreprise/Privatisation : contactez le propriétaire de l'entreprise pour obtenir un devis personnalisé et un plan de déploiement. Le prix spécifique est soumis à la page officielle de tarification en temps réel.
Fonctions principales
Les fonctions de DeepEval visent à « rendre la qualité LLM testable, explicable et régressable », et ses fonctionnalités principales couvrent les indicateurs, les cas de test, le suivi, les ensembles de données, l'intégration et la synchronisation de la plateforme.
- Indicateurs LLM-as-a-Judge : G-Eval, DAG et des indicateurs personnalisés sont utilisés pour convertir les normes commerciales en évaluations exécutables, adaptées aux scénarios où il n'y a pas de réponse déterministe mais où un jugement de qualité est requis.
- Évaluation RAG : des indicateurs tels que la pertinence des réponses, la fidélité, le rappel contextuel, la précision contextuelle et RAGAS sont utilisés pour diviser la qualité de récupération et la qualité de génération afin de faciliter la localisation s'il faut récupérer des questions contextuelles ou répondre à des questions de génération.
- Mesures agentiques : des mesures telles que l'achèvement des tâches, l'exactitude des outils, la précision des objectifs, l'efficacité des étapes, le respect du plan, la qualité du plan, l'utilisation des outils et l'exactitude des arguments conviennent pour évaluer si l'agent termine la tâche, appelle l'outil correctement et fait des détours.
- Évaluation multi-tours et MCP : rétention des connaissances, exhaustivité de la conversation, achèvement des tâches MCP, utilisation de MCP et d'autres indicateurs sont orientés vers des sessions multi-tours et des liens d'appel du serveur MCP, adaptés au service client, aux ventes, aux assistants opérationnels et aux agents basés sur des outils.
- Tests locaux et CI/CD : DeepEval adopte une méthode de test similaire à Pytest, qui peut être exécutée localement, dans des scripts ou des contextes CI, réduisant ainsi les angles morts de qualité liés au recours uniquement à des contrôles ponctuels manuels.
- Synchronisation confiante de la plateforme AI : Une fois connectés, les résultats des tests, les rapports, les ensembles de données et les traces peuvent être synchronisés avec la plateforme cloud pour faciliter la collaboration en équipe et l'observation de la qualité de la production.
En ce qui concerne la mise en œuvre, la sélection des fonctions ne doit pas être abordée d’un seul coup. Une approche plus prudente consiste à établir d'abord une base d'indicateur pour 1 à 2 liens de grande valeur, tels que "Les réponses RAG doivent être fidèles au contexte de récupération" ou "L'agent doit appeler le bon outil", puis à l'étendre progressivement à plusieurs cycles de MCP et de suivi de la production.
Evolution du modèle et de la version
Il existe deux indices publics sur l'évolution des versions de DeepEval : les versions du package PyPI pour l'installation et la gestion des dépendances, et les versions de GitHub pour afficher les principaux nœuds de fonctionnalités. Le PyPI actuel affiche la version 4.0.7 et la dernière version sur GitHub affiche la v4.0.5 ; lorsque les deux ne sont pas synchronisés, l'environnement de production doit être vérifié avec la version verrouillée du package et la description de la modification correspondante.
Version principale
- 4.0.7, 2026-06-22 : La version publique actuelle de PyPI, adaptée comme référence pour l'installation d'un nouveau projet ; prend en charge Python 3.9 à 3.14.
- v4.0.5, 2026-05-28 : nœud de version GitHub, ajoute la prise en charge des préréglages du modèle
claude-opus-4-8et inclut des mises à jour multimodales et structurées des métadonnées de sortie et de tarification. - v4.0.2, 13/05/2026 : nœud DeepEval 4.0, introduisant le harnais d'évaluation pour les agents de codage, l'inspection de trace de terminal et plus de 10 intégrations natives.
- v3.9.9, 01/12/2025 : enregistrement de diffusion publique axé sur les évaluations agentiques et les multiples séries de génération de données synthétiques.
Suggestions d'utilisation des versions
| Nœud de version | Modifications publiques | Utiliser les préoccupations |
|---|---|---|
| 4.0.7 | Version actuelle du package PyPI | Installation d'un nouveau projet, verrouillage des dépendances compatible avec la version Python |
| v4.0.5 | Préréglage Claude Opus 4.8 | Préréglages de modèle, métadonnées de prix, scénarios de sortie structurés |
| v4.0.2 | Ligne de fonctionnalités DeepEval 4.0 | boucle d'évaluation de l'agent de codage, trace TUI, intégration du framework |
| v3.9.9 | Indicateurs d'agent et données synthétiques multi-tours | Régression d'agent, génération d'ensembles de tests de sessions multi-tours |
Les frameworks d'itération à haute fréquence ne conviennent pas aux mises à niveau sans verrouillage dans les CI de production. L'équipe doit corriger la version « deepeval », enregistrer le modèle de juge, enregistrer les seuils d'indicateur et lire un ensemble de goldens stables avant la mise à niveau pour éviter que les changements dans la logique de l'indicateur ne soient mal jugés comme des changements dans la qualité du modèle.
Avantages techniques
L'avantage technique de DeepEval vient de la combinaison « cadre de test + système d'indicateurs + intégration de suivi » plutôt que des performances d'un seul modèle.
Mécanisme de style Pytest : regroupez la sortie LLM dans des cas de test, puis utilisez assert_test et les seuils d'indicateur pour déterminer si elle réussit. L'effet est que l'évaluation peut entrer dans les processus PR, CI et de publication ; Les scénarios applicables sont des projets d'ingénierie qui nécessitent une itération continue de modèles, un regroupement de mots RAG ou des chaînes d'outils d'agent.
Mécanisme interprétable par l'indicateur : de nombreux indicateurs non seulement des résultats, mais aussi des raisons. L'effet est que les résultats d'échec sont plus faciles à localiser pour répondre aux problèmes de pertinence, de fidélité aux faits, d'appel d'outil, d'efficacité des étapes ou de conformité des rôles ; le scénario applicable est un débogage collaboratif multi-équipes, plutôt qu'une simple conclusion de boîte noire « réussite/échec ».
Les évaluations de bout en bout et au niveau des composants coexistent : le document prend en charge l'ensemble de l'application LLM en tant qu'évaluation de boîte noire, et prend également en charge l'exécution d'indicateurs sur les appels au niveau de la trace, de l'étendue et des composants. L'effet est que l'équipe peut localiser les résultats de l'expérience utilisateur jusqu'aux nœuds de récupération, d'invocation d'outil ou de génération ; adapté à l’orchestration complexe RAG, Agent et multiservice.
Mécanisme d'intégration du framework : OpenAI, LangChain, LangGraph, CrewAI, LlamaIndex et d'autres intégrations réduisent les coûts d'accès. L’effet est que l’évaluation n’a pas besoin de réécrire le processus de candidature principal ; le scénario applicable consiste à compléter la gestion de la qualité des applications d’IA existantes, plutôt que de créer une plate-forme de test à partir de zéro.
Limites : le LLM en tant que juge lui-même est également affecté par les préférences du modèle, les mots d'invite, le contexte et les seuils. Les scénarios commerciaux clés nécessitent toujours une vérification conjointe des jeux d'annotations manuelles, des règles déterministes, de la surveillance en ligne et des échantillons de régression.
Comment utiliser
Le chemin le plus court vers DeepEval consiste à installer le package, à écrire des exemples de test, à sélectionner des indicateurs et à exécuter la CLI. Les commandes de base données dans la documentation sont :
pip install -U deepeval
test approfondi exécuté test_example.py
| Entrée | Convient à la foule | Utilisations typiques | Locaux clés |
|---|---|---|---|
| Paquet Python | Développeur, ingénieur algorithmique | Cahier d'évaluation locale, test unitaire | Python >=3,9 |
| Pytest/CLI | Équipe d'ingénierie | Régression CI, portes de qualité avant la publication | Cas de test et seuils définis |
| IA confiante | Équipe et entreprise | Rapports, trace de jeux de données, suivi de production | Clé API du compte, stratégie de gouvernance des données |
| Flux de travail MCP/IDE | Développeur d'agents | Extrayez des données, exécutez des évaluations et vérifiez les traces dans l'éditeur | Configuration du serveur AI MCP en toute confiance |
Le chemin d'utilisation typique peut être divisé en trois étapes : utiliser d'abord un petit nombre de Goldens pour couvrir les problèmes commerciaux fondamentaux ; puis sélectionnez les indicateurs correspondants pour RAG, Agent ou plusieurs séries de sessions ; enfin, connectez la commande test à CI et précipitez les échantillons ayant échoué dans des ensembles de régression. Pour la migration de modèles, comme le passage d'un modèle à un autre, la valeur de DeepEval réside dans le fait de rendre reproductible la différence de qualité avant et après la migration, plutôt que de s'appuyer uniquement sur des discussions d'essai manuelles.
Prix des produits
Le modèle de tarification est soumis à la page officielle en temps réel. Habituellement, un système freemium ou d'abonnement est utilisé et les fonctions de base peuvent être utilisées gratuitement. Les fonctions avancées ou l'utilisation à haute fréquence nécessitent des abonnements payants, et il est conseillé aux utilisateurs d'évaluer la solution optimale en fonction de l'utilisation réelle.
Scénarios d'application
DeepEval est plus adapté aux applications LLM qui « changent continuellement mais doivent être livrées de manière stable » plutôt qu'à une démonstration unique.
- RAG Knowledge Base Quality Regression : Évaluez si les réponses sont pertinentes, si elles sont fidèles au contexte de recherche et si les fragments récupérés couvrent les informations attendues. L’avantage est de quantifier l’impact du regroupement, de l’intégration, du reclassement et des changements de mots rapides.
- Acceptation de l'appel de l'outil de l'agent : vérifiez si l'agent termine la tâche, appelle le bon outil, si les paramètres sont corrects et si les étapes sont redondantes. L'avantage est de transformer quelque chose qui « semble pouvoir utiliser l'outil » en un test de régression.
- Migration de modèles et révision des mots d'invite : comparez les performances de différents modèles, de différentes invites ou de différentes architectures système sur le même ensemble de goldens. L’avantage est de réduire le risque de jugement subjectif lors du remplacement de modèles.
- Plusieurs cycles de service client et d'assistant commercial : Évaluez la rétention des connaissances, l'intégrité du dialogue, le respect des rôles et l'achèvement des tâches. La récompense est la détection précoce de plusieurs séries de dérives de contexte et de déviations de rôle.
- Surveillance de la qualité de la production : lorsqu'elles sont combinées à la plateforme Confident AI, des traces d'évaluation hors ligne et un suivi des réponses en ligne peuvent être connectés. L’avantage est de transformer les problèmes de qualité issus des retours d’expérience en indicateurs de tendance.
Le principe commun de ces scénarios est que l'équipe commerciale peut définir les critères d'une « bonne réponse » ou d'une « tâche réussie ». En l’absence de normes commerciales, le cadre d’évaluation ne peut que produire des scores et ne peut remplacer un consensus sur la qualité.
Personnes concernées
DeepEval est le plus précieux pour trois groupes de personnes.
- Développeurs d'applications IA : Nécessité d'écrire la qualité du RAG, du chatbot ou de l'agent dans le processus de test, particulièrement adapté aux équipes qui utilisent déjà Python, Pytest ou CI/CD.
- Équipe Machine Learning/LLM Platform : Il est nécessaire d'unifier les indicateurs d'évaluation, les ensembles de tests, les bases de migration des modèles et de libérer le contrôle d'accès des différents projets afin de réduire le besoin d'écrire un ensemble de scripts pour chaque secteur d'activité.
- Leader de l'assurance qualité et de la qualité des produits : des scores et des rapports interprétables doivent être utilisés pour déterminer si le système LLM répond aux normes commerciales, plutôt que de s'appuyer uniquement sur l'expérience humaine.
- Enterprise AI Governance Team : lorsque vous devez intégrer l'évaluation, la surveillance, l'audit et la gestion des ensembles de données dans une plate-forme unifiée, vous pouvez prêter attention aux capacités commerciales de Confident AI.
Les situations moins appropriées sont celles où l'équipe ne fait que des démonstrations ponctuelles, ne dispose pas d'échantillons de test stables, n'a pas de normes de qualité claires ou le produit n'est pas une ingénierie compatible Python/CI. À l'heure actuelle, il est plus important d'établir d'abord des critères d'acceptation par les entreprises que d'introduire directement un cadre d'évaluation complet.
Résumé et Outlook
La compétence principale de DeepEval réside dans la transformation de l'évaluation des applications LLM en un cadre de tests d'ingénierie : les développeurs peuvent utiliser des pipelines CLI et CI de fichiers de test familiers pour évaluer RAG, Agent, conversations à plusieurs tours et migration de modèles ; Confident AI étend ces résultats d’évaluation à la collaboration en équipe, au reporting et au suivi de la production. Il s'agit d'un choix d'entrée évident pour les équipes cherchant à passer du « chat d'essai manuel » aux « portes de qualité retournables ».
Les limitations actuelles doivent également être affrontées sans détour : les rythmes de publication de PyPI et de GitHub ne sont pas toujours totalement cohérents ; les prix publics ne divulguent pas tous les termes de l'entreprise ; Les indicateurs LLM-as-a-juge doivent être calibrés et ne peuvent pas remplacer directement l’annotation manuelle et l’acceptation commerciale ; l'identification client officiellement affichée ne peut pas être équivalente à l'échelle de déploiement spécifique. Lors de l'achat et de la mise en œuvre, vous devez d'abord sélectionner 1 à 2 liens à haut risque en tant que pilotes, enregistrer les scores de base, les taux d'intervention manuelle, les échantillons d'erreurs d'appréciation et les coûts d'appel modèles, puis décider si vous souhaitez étendre votre projet à des plateformes CI et d'entreprise complètes.
Outils associés : hugging-face, replicate
Informations de version
- DeepEval 4.0.7 :La version actuelle du package public de PyPI prend en charge Python 3.9 à 3.14 et continue les capacités d'évaluation, de suivi et de test CI de DeepEval 4.x.
- Opus 4.8 : Prise en charge du jour 0 :Le nœud de la version 4.x publié par GitHub Releases ajoute la prise en charge du modèle prédéfini claude-opus-4-8 et inclut des métadonnées de tarification liées à la sortie multimodale et structurée.
- DeepEval 4.0 :Le nœud DeepEval 4.0 divulgué par GitHub Releases introduit le harnais d'évaluation pour les agents de codage, l'inspection des traces de terminal et plus de 10 intégrations natives.
Avis des utilisateurs