DeepSeek veröffentlicht großes V3-Modell: 671B MoE-Basis, Leistungsbenchmarking GPT-4o und Claude 3.5
Am 26. Dezember 2024 veröffentlichte DeepSeek das 671B-Parameter-MoE-Basismodell DeepSeek-V3 mit einer einzelnen Token-Aktivierung von etwa 37B. Es wurde eine Multi-Token-Vorhersage hinzugefügt und das FP8-Training mit gemischter Präzision übernommen. Seine Leistung war mit GPT-4o und Claude 3.5 Sonnet vergleichbar und erregte durch extrem niedrige Schulungskosten Aufmerksamkeit in der Branche.
Am 26. Dezember 2024 veröffentlichte DeepSeek
Bild: Dialogoberfläche der offiziellen DeepSeek-Website. V3 ist auf dem mehrsprachigen 14,8T-Token-Korpus vorab trainiert, verwendet FP8-Mischpräzision und wurde auf dem H800-Cluster trainiert. Die offiziellen Angaben zu den gesamten Schulungskosten belaufen sich auf etwa 5,576 Millionen US-Dollar (ungefähr 2,788 Millionen GPU-Stunden).
Versionsübersicht
| Projekt | Inhalt |
|---|
Bewertungen