DeepSeek veröffentlicht großes V3-Modell: 671B MoE-Basis, Leistungsbenchmarking GPT-4o und Claude 3.5

Am 26. Dezember 2024 veröffentlichte DeepSeek das 671B-Parameter-MoE-Basismodell DeepSeek-V3 mit einer einzelnen Token-Aktivierung von etwa 37B. Es wurde eine Multi-Token-Vorhersage hinzugefügt und das FP8-Training mit gemischter Präzision übernommen. Seine Leistung war mit GPT-4o und Claude 3.5 Sonnet vergleichbar und erregte durch extrem niedrige Schulungskosten Aufmerksamkeit in der Branche.

Am 26. Dezember 2024 veröffentlichte DeepSeek , ein MoE-Basismodell mit 671B Parametern, das den Grundstein für die Fähigkeiten der nachfolgenden Serie legte.

DeepSeek-V3 671B MoE Open-Source-Release-Übersicht für große Modelle

Bild: Dialogoberfläche der offiziellen DeepSeek-Website. V3 ist auf dem mehrsprachigen 14,8T-Token-Korpus vorab trainiert, verwendet FP8-Mischpräzision und wurde auf dem H800-Cluster trainiert. Die offiziellen Angaben zu den gesamten Schulungskosten belaufen sich auf etwa 5,576 Millionen US-Dollar (ungefähr 2,788 Millionen GPU-Stunden).

Versionsübersicht

Projekt Inhalt
Urheberrecht: Inhaltquelle DeepSeek-Beamter . Diese Plattform hat den Inhalt für Informationszwecke und Lernaustausch zusammengestellt. Bei Urheberrechtsbedenken kontaktieren Sie uns bitte.

Bewertungen

  • Bewertungen werden geladen...