DeepSeek, V3 대형 모델 출시: 671B MoE 기반, 성능 벤치마킹 GPT-4o 및 Claude 3.5
2024년 12월 26일 DeepSeek은 약 37B의 단일 토큰 활성화로 671B 매개변수 MoE 기본 모델 DeepSeek-V3를 출시했습니다. 다중 토큰 예측을 추가하고 FP8 혼합 정밀 교육을 채택했습니다. GPT-4o와 Claude 3.5 Sonnet의 성능을 벤치마킹했으며, 매우 저렴한 교육 비용으로 업계의 주목을 받았습니다.
2024년 12월 26일, DeepSeek는 후속 시리즈 기능의 기반을 마련한 671B 매개변수 MoE 기본 모델인
사진: DeepSeek 공식 웹사이트 대화 인터페이스. V3는 FP8 혼합 정밀도를 사용하여 14.8T 토큰 다국어 코퍼스에서 사전 훈련되었으며 H800 클러스터에서 훈련되었습니다. 총 훈련 비용의 공식 공개는 약 557만 6천 달러(약 278만 8천 GPU 시간)입니다.
버전 개요
| 프로젝트 | 내용 |
|---|
저작권: 콘텐츠 출처
DeepSeek 공식
. 이 플랫폼은 정보 제공 및 학습 교류를 목적으로 콘텐츠를 편집 및 정리했습니다. 저작권 문제가 있으시면 연락해 주세요.
후기