DeepSeek lance le grand modèle V3 : base MoE 671B, analyse comparative des performances GPT-4o et Claude 3.5
Le 26 décembre 2024, DeepSeek a publié le modèle de base MoE du paramètre 671B DeepSeek-V3, avec une activation de jeton unique d'environ 37B. Il a ajouté une prédiction multi-jetons et adopté un entraînement de précision mixte FP8. Ses performances ont comparé GPT-4o et Claude 3.5 Sonnet et ont attiré l'attention de l'industrie avec un coût de formation extrêmement faible.
Le 26 décembre 2024, DeepSeek a publié
Photo : interface de dialogue du site officiel de DeepSeek. La V3 est pré-entraînée sur un corpus multilingue de jetons de 14,8T, en utilisant la précision mixte FP8 et entraînée sur le cluster H800. La divulgation officielle du coût total de la formation est d'environ 5,576 millions de dollars américains (environ 2,788 millions d'heures GPU).
Aperçu des versions
| Projet | Contenu |
|---|
Avis