DeepSeek lance le grand modèle open source V2 : la première architecture MLA, 236B MoE axée sur des performances à coût élevé
En mai 2024, DeepSeek a publié la série DeepSeek-V2 de grands modèles open source, qui a introduit pour la première fois l'attention latente multi-têtes (MLA) et l'architecture clairsemée MoE. Il dispose d'un total de 236 B de paramètres et d'une seule activation de jeton d'environ 21 B. Il compare les modèles traditionnels avec des coûts d'inférence extrêmement faibles et trace une voie efficace pour les versions V3 et R1 ultérieures.
En mai 2024, DeepSeek a publié la série
Photo : page d'accueil du site officiel de DeepSeek et entrée de dialogue. Le corpus de pré-formation V2 comprend environ 8,1 T de jetons, utilisant YaRN pour étendre le contexte de 4K à 128K et utilisant MLA pour compresser le cache KV. Selon le Financial Times, son prix par million de jetons de production est aussi bas que 2 yuans.
Aperçu des versions
| Projet | Contenu |
|---|
Avis