tester le titrex

Le 10 février 2025, DeepSeek Artificial Intelligence Company a officiellement publié le **** grand modèle de langage. Il s'agit d'un modèle open source utilisant une architecture MoE (Mixed Expert) à paramètres 671B. Ses performances se comparent à celles d'OpenAI GPT-4o en matière de raisonnement mathématique, de génération de code et de tâches de raisonnement logique complexe, mais le prix d'appel de l'API ne représente que 3 à 5 % de la moyenne du secteur.

Percée technologique de base

DeepSeek-V3 adopte une conception d'architecture MoE innovante. Bien que le nombre total de paramètres atteigne « 671B », seuls les paramètres « 37B » sont activés pour chaque inférence, ce qui réduit considérablement le coût de calcul. Le modèle prend en charge les fenêtres contextuelles « 128 000 » et peut gérer des documents contenant jusqu'à des centaines de milliers de mots.

Schéma de conception de l'architecture DeepSeek-V3 MoE
DeepSeek-V3 adopte une architecture experte hybride MoE innovante pour réduire considérablement les coûts de calcul tout en maintenant des performances élevées

Indicateurs techniques clés

  • Paramètres du modèle : 671B (architecture MoE, activer 37B)
  • Fenêtre contextuelle : 128 000 jetons
  • Vitesse d'inférence : 60 jetons/seconde
  • Langues prises en charge : 83 langues
  • Coût de formation : environ 5,57 millions de dollars

Comparaison des performances

DeepSeek-V3 a démontré d'excellentes performances dans plusieurs tests de référence faisant autorité. Il a obtenu un score de « 88,5 % » à la tâche de raisonnement mathématique MATH et de « 85,2 % » au test de génération de code HumanEval, tous deux en tête du secteur.

Tableau de comparaison des performances de DeepSeek-V3 et GPT-4o
DeepSeek-V3 fonctionne à égalité avec GPT-4o dans plusieurs tests clés, offrant aux développeurs une option open source de haute qualité

"DeepSeek-V3 réduit le coût à 3 % par rapport à l'original tout en conservant des performances optimales, ce qui changera complètement le paysage de la commercialisation des grands modèles d'IA." — Liang Wenfeng, fondateur de DeepSeek

Stratégie open source

DeepSeek-V3 adopte la licence open source MIT, permettant une utilisation commerciale et un développement secondaire. Les développeurs peuvent l'utiliser des manières suivantes :

  • Interface API officielle : facturation à l'utilisation à faible coût, prend en charge les appels API flexibles
  • Déploiement local Ollama : exécutez ollama run deepseek-v3 pour une exécution locale
  • Téléchargements de modèles HuggingFace : plus de 50 millions de téléchargements, prend en charge les poids complets des modèles
  • Déploiement privatisé au niveau de l'entreprise : fournir des solutions de déploiement privatisées complètes et un support technique

Scénarios d'application

DeepSeek-V3 Convient à une variété de scénarios d'applications d'entreprise :

  • Service client intelligent et système de dialogue : répondez automatiquement aux questions des clients, prenez en charge plusieurs cycles de dialogue et de compréhension du contexte
  • Assistant de génération de code et de débogage : aidez les développeurs à écrire et à optimiser rapidement le code et à améliorer l'efficacité du développement.
  • Analyse de documents et extraction de connaissances : extrayez des informations clés et des points de connaissances à partir d'un grand nombre de documents
  • Analyse des données et Business Intelligence : aider les analystes de données à obtenir des informations sur les données et à générer des rapports
  • Services de création et de traduction de contenu : prend en charge la traduction multilingue et divers besoins de création de contenu

Impact sur l'industrie

La sortie de DeepSeek-V3 a eu un impact profond sur l'industrie de l'IA. Le modèle open source à faible coût et haute performance brise le monopole technologique des grands fabricants et offre plus de choix aux petites et moyennes entreprises et aux développeurs. Les experts du secteur prédisent que cela accélérera l’application de la technologie de l’IA dans diverses industries.

Perspectives d'avenir

Il est rapporté que l'équipe DeepSeek développe un modèle de raisonnement profond DeepSeek-R1 plus puissant, qui devrait atteindre de nouveaux sommets dans des tâches de raisonnement mathématique, scientifique et logique complexes. Dans le même temps, l’équipe explore également l’intégration de capacités multimodales, qui devraient soutenir la compréhension et la génération d’images, de vidéos et d’audio à l’avenir.

Copyright : Contenu source Site officiel de DeepSeek . Cette plateforme a compilé et organisé ce contenu à des fins d'information et d'échange éducatif. Pour tout problème de droit d'auteur, veuillez nous contacter.

Avis

  • Chargement des avis...