DeepSeek、V2オープンソース大規模モデルをリリース:初のMLAアーキテクチャ、高コストパフォーマンスを重視した236B MoE

2024 年 5 月、DeepSeek は、マルチヘッド潜在注意 (MLA) と MoE スパース アーキテクチャを初めて導入したオープンソース大規模モデルの DeepSeek-V2 シリーズをリリースしました。合計 236B のパラメータと、約 21B の単一トークンのアクティベーションがあります。極めて低い推論コストで主流のモデルのベンチマークを行い、後続の V3 および R1 に効率的なルートを構築します。

2024 年 5 月、DeepSeek は、オープンソースの大規模モデルの シリーズをリリースしました。 AI Smart Assistant トラックの代表的なオープン ソース モデルとして、V2 はマルチ潜在注意 (MLA) と専門家混合 (MoE) を初めて組み合わせ、DeepSeek シリーズの進化における重要な技術的マイルストーンとなります。

DeepSeek-V2 オープンソース大規模モデル MLA および MoE アーキテクチャの概要

※写真:DeepSeek公式サイトのホームページとダイアログ入り口。 V2 事前トレーニング コーパスは約 8.1T トークンで、YaRN を使用してコンテキストを 4K から 128K に拡張し、MLA を使用して KV キャッシュを圧縮します。フィナンシャル・タイムズ紙によると、100万枚の生産トークンあたりの価格はわずか2元だという。 *

バージョンの概要

プロジェクト コンテンツ
著作権:コンテンツソース ディープシーク公式 。このプラットフォームは、情報提供と学習交流の目的でコンテンツを編集・整理しています。著作権に関する問題がございましたら、お問い合わせください。

レビュー

  • レビューを読み込み中...