DeepSeek lance le grand modèle open source V2 : la première architecture MLA, 236B MoE axée sur des performances à coût élevé

En mai 2024, DeepSeek a publié la série DeepSeek-V2 de grands modèles open source, qui a introduit pour la première fois l'attention latente multi-têtes (MLA) et l'architecture clairsemée MoE. Il dispose d'un total de 236 B de paramètres et d'une seule activation de jeton d'environ 21 B. Il compare les modèles traditionnels avec des coûts d'inférence extrêmement faibles et trace une voie efficace pour les versions V3 et R1 ultérieures.

En mai 2024, DeepSeek a publié la série de grands modèles open source. En tant que modèle open source représentatif dans la piste AI Smart Assistant, la V2 combine pour la première fois l'attention latente multiple (MLA) avec le mélange d'experts (MoE), devenant ainsi une étape technique clé dans l'évolution de la série DeepSeek.

Présentation de l'architecture grand modèle MLA et MoE open source DeepSeek-V2

Photo : page d'accueil du site officiel de DeepSeek et entrée de dialogue. Le corpus de pré-formation V2 comprend environ 8,1 T de jetons, utilisant YaRN pour étendre le contexte de 4K à 128K et utilisant MLA pour compresser le cache KV. Selon le Financial Times, son prix par million de jetons de production est aussi bas que 2 yuans.

Aperçu des versions

Projet Contenu
Copyright : Contenu source Officiel DeepSeek . Cette plateforme a compilé et organisé ce contenu à des fins d'information et d'échange éducatif. Pour tout problème de droit d'auteur, veuillez nous contacter.

Avis

  • Chargement des avis...