DeepSeek, V2 오픈 소스 대형 모델 출시: 최초의 MLA 아키텍처, 높은 비용 성능에 초점을 맞춘 236B MoE

2024년 5월 DeepSeek는 멀티 헤드 MLA(잠재 주의) 및 MoE 희소 아키텍처를 최초로 도입한 오픈 소스 대형 모델 DeepSeek-V2 시리즈를 출시했습니다. 총 236B 매개변수와 약 21B의 단일 토큰 활성화가 있습니다. 추론 비용이 매우 낮은 주류 모델을 벤치마킹하고 후속 V3 및 R1을 위한 효율적인 경로를 마련합니다.

2024년 5월, DeepSeek는 시리즈 오픈소스 대형 모델을 출시했습니다. AI Smart Assistant 트랙의 대표적인 오픈 소스 모델인 V2는 MLA(Multi-Latent Attention)와 MoE(Mixture of Experts)를 처음으로 결합하여 DeepSeek 시리즈 진화의 핵심 기술 이정표가 되었습니다.

DeepSeek-V2 오픈 소스 대형 모델 MLA 및 MoE 아키텍처 개요

사진설명: DeepSeek 공식 홈페이지 및 다이얼로그 입구. V2 사전 훈련 자료는 약 8.1T 토큰으로, YaRN을 사용하여 컨텍스트를 4K에서 128K로 확장하고 MLA를 사용하여 KV 캐시를 압축합니다. 파이낸셜 타임즈(Financial Times)에 따르면, 백만 개의 출력 토큰당 가격은 2위안 정도로 낮습니다.

버전 개요

프로젝트 내용
저작권: 콘텐츠 출처 DeepSeek 공식 . 이 플랫폼은 정보 제공 및 학습 교류를 목적으로 콘텐츠를 편집 및 정리했습니다. 저작권 문제가 있으시면 연락해 주세요.

후기

  • 후기를 불러오는 중...