DeepSeek、V2オープンソース大規模モデルをリリース:初のMLAアーキテクチャ、高コストパフォーマンスを重視した236B MoE
2024 年 5 月、DeepSeek は、マルチヘッド潜在注意 (MLA) と MoE スパース アーキテクチャを初めて導入したオープンソース大規模モデルの DeepSeek-V2 シリーズをリリースしました。合計 236B のパラメータと、約 21B の単一トークンのアクティベーションがあります。極めて低い推論コストで主流のモデルのベンチマークを行い、後続の V3 および R1 に効率的なルートを構築します。
2024 年 5 月、DeepSeek は、オープンソースの大規模モデルの
※写真:DeepSeek公式サイトのホームページとダイアログ入り口。 V2 事前トレーニング コーパスは約 8.1T トークンで、YaRN を使用してコンテキストを 4K から 128K に拡張し、MLA を使用して KV キャッシュを圧縮します。フィナンシャル・タイムズ紙によると、100万枚の生産トークンあたりの価格はわずか2元だという。 *
バージョンの概要
| プロジェクト | コンテンツ |
|---|
著作権:コンテンツソース
ディープシーク公式
。このプラットフォームは、情報提供と学習交流の目的でコンテンツを編集・整理しています。著作権に関する問題がございましたら、お問い合わせください。
レビュー