DeepSeek lance le grand modèle V3 : base MoE 671B, analyse comparative des performances GPT-4o et Claude 3.5

Le 26 décembre 2024, DeepSeek a publié le modèle de base MoE du paramètre 671B DeepSeek-V3, avec une activation de jeton unique d'environ 37B. Il a ajouté une prédiction multi-jetons et adopté un entraînement de précision mixte FP8. Ses performances ont comparé GPT-4o et Claude 3.5 Sonnet et ont attiré l'attention de l'industrie avec un coût de formation extrêmement faible.

Le 26 décembre 2024, DeepSeek a publié , un modèle de base MoE à paramètres 671B, qui a jeté les bases des capacités des séries suivantes.

Présentation de la version grand modèle open source DeepSeek-V3 671B MoE

Photo : interface de dialogue du site officiel de DeepSeek. La V3 est pré-entraînée sur un corpus multilingue de jetons de 14,8T, en utilisant la précision mixte FP8 et entraînée sur le cluster H800. La divulgation officielle du coût total de la formation est d'environ 5,576 millions de dollars américains (environ 2,788 millions d'heures GPU).

Aperçu des versions

Projet Contenu
Copyright : Contenu source Officiel DeepSeek . Cette plateforme a compilé et organisé ce contenu à des fins d'information et d'échange éducatif. Pour tout problème de droit d'auteur, veuillez nous contacter.

Avis

  • Chargement des avis...