빅코드
무료
BigCode는 Hugging Face와 ServiceNow Research가 공동으로 시작한 개방형 과학 협업 프로젝트로, Code LLM(Code Large Language Model)의 개방적이고 책임감 있는 개발에 전념하고 있습니다. 주요 출력에는 StarCoder 시리즈 모델(StarCoder 15B, StarCoder2 3B/7B/15B), Stack 데이터 세트 BigCodeBench 벤치마크 및 BigCodeArena 코드 평가 플랫폼이 포함됩니다.
빅코드
핵심 매개변수 및 통계
BigCode는 Hugging Face와 ServiceNow Research가 공동으로 시작한 오픈 사이언스 협업 프로젝트로, 오픈 소스 연구와 Code LLM(Code Large Language Model)의 책임감 있는 개발에 중점을 두고 있습니다. 프로젝트의 공식 웹사이트는 "대형 코드 모델의 개방적이고 책임감 있는 개발에 전념하는 개방형 과학 협력"으로 자리잡고 있습니다. 이는 단일 제품이 아니라 모델, 데이터, 평가 및 배포 도구를 포괄하는 완전한 오픈 소스 생태계 세트입니다.
| 프로젝트 | 공공정보 |
|---|---|
| 공식 포지셔닝 | 대규모 코드 언어 모델의 개방적이고 책임감 있는 개발을 위해 노력하는 개방형 과학 협력 |
| 후원자 | 포옹하는 얼굴 + ServiceNow 연구 |
| 조직형태 | 비영리 오픈 사이언스 협업 |
| 핵심 모델 | 스타코더(15.5B), 스타코더2(3B/7B/15B) |
| 핵심 데이터세트 | 스택(v1/v2, 최대 라이센스 코드 사전 학습 데이터 세트) |
| 평가 프레임워크 | BigCodeBench, BigCodeArena, BigCode 평가 하네스 |
| 오픈 소스 라이센스 | Apache-2.0(핵심 저장소), BigCode OpenRAIL-M v1(모델) |
| 커뮤니티 규모 | GitHub 1.8k 팔로우 HF 2.1k 팔로우 359명의 팀원 |
| 최신 모델 버전 | 스타코더2-15B (2024-02-29) |
| 지원되는 플랫폼 | 웹(HF Spaces), API(TGI), 자체 호스팅 |
커뮤니티 규모: GitHub에서 구성한 공공 창고가 29개 있습니다. StarCoder 창고는 7.5k 별, 2.1k 별 및 BigCode 평가 하네스 1.1k 별을 통해 StarCoder2 창고를 선도합니다. Hugging Face 조직에는 69개의 모델, 93개의 데이터 세트 및 29개의 공간이 있습니다. 가장 많이 다운로드된 모델인 StarCoder2-3B는 누적 다운로드 181,000건을 기록했습니다.
출력 범위: BigCode는 모델 교육, 데이터 거버넌스, 평가 벤치마크 및 추론 배포의 네 가지 섹션을 동시에 다룹니다. 이는 오픈 소스 코드 모델 프로젝트에서는 상대적으로 드뭅니다. 대부분의 프로젝트는 단일 섹션에만 중점을 둡니다(예: 모델 출시만 또는 벤치마크 제공만 제공).
사용자 및 시장 인지도
BigCode의 인지도는 전통적인 의미의 사용자 등록이나 수익 수치보다는 오픈 소스 커뮤니티의 채택과 학술 인용에 반영됩니다.
오픈 소스 커뮤니티 인기: StarCoder 시리즈 리포지토리에는 총 10,000개 이상의 GitHub 스타가 있습니다. BigCode 평가 하네스(별 1,100개)는 코드 모델 평가를 위한 표준 프레임워크 중 하나가 되었으며 여러 타사 모델 프로젝트에서 평가 도구로 인용되었습니다.
엔터프라이즈 수준 채택: ServiceNow는 공동 후원자로서 코드 인텔리전스 시나리오를 위해 내부적으로 StarCoder 모델을 사용했습니다. Hugging Face는 TGI(Text Generation Inference)를 통해 StarCoder2 추론 서비스를 제공합니다. 오픈 소스 생태계에는 이미 StarCoder 미세 조정을 기반으로 하는 여러 수직 모델이 있습니다(13개의 어댑터 모델과 21개의 미세 조정 모델이 Hugging Face 모델 트리에 나열되어 있습니다).
학술적 영향: StarCoder2 논문(arXiv 2402.19173)은 2024년 2월에 출판되었고, BigCodeBench 논문은 ICLR 2025에 승인되었으며, SelfCodeAlign 논문은 NeurIPS 2024에 승인되었습니다. 코드 생성 분야에서 프로젝트에 의해 생성된 학술 인용 횟수는 계속 증가하고 있습니다.
구현을 위한 전제조건: StarCoder 시리즈는 명령 모델이 아닌 기본 모델입니다. 특정 작업(예: 코드 완성, 버그 수정, 테스트 생성)에 적응하려면 미세 조정이나 신속한 엔지니어링이 필요합니다. 대화식으로 직접 사용하면 잘 작동하지 않습니다.
비용 이점
BigCode 프로젝트의 비용 이점은 API 가격 경쟁이 아니라 Apache-2.0 라이선스에 따라 모든 모델 가중치를 개방하여 팀이 라이선스 비용 없이 코드 생성 기능을 얻을 수 있다는 점입니다.
C면/개별: StarCoder2 모델은 완전 무료이며 Hugging Face Spaces를 통해 온라인으로 경험하거나 로컬 GPU에서 실행할 수 있습니다. 3B 모델은 8비트 양자화 기능을 갖춘 소비자급 GPU(예: RTX 3090)에서 실행될 수 있으며 약 9GB의 비디오 메모리를 차지합니다. 15B 모델에는 8비트 양자화를 갖춘 약 17GB의 비디오 메모리가 필요합니다.
개발자/자체 호스팅: 모델 가중치는 무료로 다운로드할 수 있으며 TGI 또는 vLLM을 통해 자체 추론 서비스를 구축할 수 있습니다. 하드웨어 비용은 모델 크기 및 처리량 요구 사항에 따라 다릅니다. 3B 모델은 단일 카드 T4로 배포할 수 있으며, 15B 모델은 최소 24GB의 비디오 메모리 및 양자화 기능을 갖춘 GPU 사용을 권장합니다. 전체적으로 자체 호스팅 코드 모델의 총 비용 = GPU 인스턴스 비용 + 운영 및 유지 관리 인력은 토큰으로 청구되는 동일한 기능을 갖춘 상용 API보다 훨씬 저렴합니다.
기업/개인: 기업은 BigCode 프로젝트에 라이센스 비용을 지불하지 않고도 직접 StarCoder2 가중치를 기반으로 비공개적으로 배포하고 미세 조정할 수 있습니다. 그러나 BigCode OpenRAIL-M v1 라이센스 계약의 제약 조건(사용 제한 포함)에 주의해야 합니다. 상업적으로 사용하기 전에 법무 부서에서 라이센스 검토를 완료하는 것이 좋습니다.
숨겨진 비용: 기본 모델은 종종 과소평가되는 사용 가능한 수준에 도달하기 위해 미세 조정이나 신속한 엔지니어링이 필요합니다. 또한, 모델 생성 코드의 저작권 소유권 및 라이선스 준수에도 추가적인 거버넌스가 필요합니다. BigCode는 교육 데이터 소스를 추적하기 위한 검색 색인 도구를 제공하지만 기업은 여전히 자체 코드 추적 프로세스를 구축해야 합니다.
주요 기능
BigCode 프로젝트의 핵심 기능은 코드 LLM의 전체 링크 오픈 소스를 중심으로 설계되었으며 공개 출력은 5가지 수준으로 요약될 수 있습니다.
- 코드 생성 모델(StarCoder 시리즈): FIM(Fill-in-the-Middle) 코드 완성, 다중 언어 코드 생성(StarCoder2는 600개 이상의 프로그래밍 언어 포함) 및 긴 컨텍스트 코드 이해(16K 토큰)를 지원하는 다중 규모(1.1B ~ 15B) 기본 모델을 제공합니다.
- 사전 훈련 데이터 세트(The Stack): Stack v2는 현재 최대 규모의 라이선스가 부여된 코드 사전 훈련 데이터 세트(54억 5천만 개 토큰)로, 600개 이상의 프로그래밍 언어를 포함하며 개발자가 훈련 데이터에서 자신의 웨어하우스를 제거하도록 선택할 수 있는 옵트아웃 메커니즘을 지원합니다.
- 평가 벤치마크(BigCodeBench/BigCodeArena): BigCodeBench(ICLR 2025)는 여러 함수 호출 및 복잡한 명령의 코드 생성 평가에 중점을 둡니다. BigCodeArena(2025)는 코드 실행 결과를 통해 모델 선호도를 평가하여 보다 안정적인 자동 평가 방법을 제공합니다.
- 평가 하네스: 표준화된 코드 모델 평가 프레임워크를 제공하여 HumanEval, HumanEval+, GSM8K(PAL), DS-1000, CruxEval-I 등과 같은 여러 벤치마크의 원클릭 평가를 지원합니다.
- 미세 조정 및 배포 도구: LoRA 미세 조정 스크립트 PEFT 통합 비트 및 바이트 정량화 지원 TGI 추론 컨테이너 및 starcoder.cpp(ggml 기반 C++ 추론 구현)를 제공합니다.
시너지: 이러한 기능은 독립적으로 존재하지 않습니다. Stack 데이터 세트는 StarCoder 모델을 훈련하는 데 사용되며 StarCoder 모델은 평가 하네스를 통해 평가되며 BigCodeBench는 표준화된 평가 방법론을 제공합니다. 세 가지가 "데이터-모델-평가" 구조를 형성합니다. 이는 BigCode를 사용하는 팀이 동일한 도구 체인을 재사용하여 여러 프로젝트에 걸쳐 구성 요소를 결합할 필요 없이 교육부터 평가까지 전체 프로세스를 완료할 수 있음을 의미합니다.
모델 및 버전의 진화
지속적인 반복 업데이트인 최신 버전에는 성능 최적화와 새로운 기능이 도입되었습니다. 과거 버전 정보는 공식 출시 페이지를 통해 확인할 수 있습니다. 현재 완전한 공개 버전 발전 일정은 없습니다.
기술적인 장점
BigCode의 기술적 장점은 모델 설계, 교육 규모 및 오픈 소스 거버넌스의 세 가지 차원에 반영됩니다. 핵심 논리는 "오픈 사이언스를 통해 코드 모델을 더욱 투명하고 재현 가능하게 만드는 것"입니다.
모델 아키텍처: StarCoder2는 추론 중 KV 캐시 사용량을 줄이고 Multi-Head Attention에 비해 자체 배포 메모리 요구 사항을 줄이는 GQA(Grouped Query Attention)를 사용합니다. 슬라이딩 윈도우 어텐션(4K 토큰)은 16K 유효 컨텍스트를 유지하면서 긴 시퀀스 시나리오의 계산 비용을 제어합니다. FIM 교육 목표는 모델을 코드 완성 시나리오에 자연스럽게 적합하게 만듭니다. 즉, 왼쪽에서 오른쪽으로 텍스트를 생성하는 것이 아니라 코드 중간을 채우는 의미를 이해합니다.
훈련 규모: 1024× H100 GPU에서 훈련된 150억 개의 모델, 총 4조 개 이상의 토큰. 이 규모는 오픈 소스 코드 모델의 첫 번째 단계에 속합니다. 훈련은 NVIDIA NeMo 프레임워크와 Eos 슈퍼컴퓨터를 사용하는데, 이는 동일한 크기의 상용 모델의 훈련 구성과 비슷합니다.
데이터 거버넌스: Stack v2의 처리 파이프라인(중복 제거, 권한 필터링 PII 제거 옵트아웃 지원)은 오픈 소스 코드 데이터 세트 중에서 가장 성숙합니다. 각 훈련 샘플은 소스 추적성을 유지하며, 검색 색인 도구를 통해 사용자는 생성된 코드가 특정 오픈 소스 웨어하우스에서 나온 것인지 확인할 수 있습니다. 이는 기업 규정 준수 추적성에 중요합니다.
평가 재현성: BigCode 평가 하네스는 표준화된 평가 스크립트와 Docker 환경을 제공합니다. 동일한 벤치마크에서 여러 팀의 결과를 직접 비교할 수 있으므로 평가 방법의 차이로 인해 발생하는 비비교 문제가 줄어듭니다.
기술적 한계: StarCoder 시리즈는 명령 미세 조정 모델이 아닌 기본 모델이며 직접적인 대화 효과가 좋지 않습니다. 모델의 추론, 수학 및 기타 기능은 동일한 규모의 다중 모드 기본 모델(예: DeepSeek, LLaMA 3)보다 약합니다. 강력한 컨텍스트 이해가 필요한 긴 파일 재구성 시나리오의 경우 16K 컨텍스트 창이 충분하지 않을 수 있습니다.
사용방법
- 웹 클라이언트 : 공식 홈페이지에 접속하여 계정을 등록하시면 사용하실 수 있습니다. 대부분의 기능은 설치가 필요하지 않습니다.
- API 액세스: RESTful API를 제공하므로 개발자는 API 키를 획득하여 자신의 애플리케이션에 통합할 수 있습니다.
제품 가격
BigCode 프로젝트 자체에는 수수료가 없습니다. 모든 모델 가중치, 데이터 세트 및 코드는 오픈 소스 라이선스에 따라 릴리스됩니다.
- C면/개인: 완전 무료입니다. Hugging Face Spaces를 통해 온라인으로 경험하거나 로컬 GPU에서 모델을 실행해 보세요.
- 개발자/API 사용자: 공식 호스팅 API가 없습니다. TGI 또는 vLLM을 통해 자체 추론 서비스를 구축할 수 있으며 비용에는 GPU 인스턴스 비용만 포함됩니다.
- 기업/개인: 모델 가중치는 라이센스 비용 없이 무료로 제공됩니다. BigCode OpenRAIL-M v1 라이센스 계약 조건(사용 제한 포함)이 적용됩니다. 상업적으로 사용하기 전에 법적 라이선스 검토를 완료하는 것이 좋습니다.
애플리케이션 시나리오
BigCode의 모델은 코드 생성 및 이해 분야에서 적용 가능한 광범위한 시나리오를 가지고 있으며, 그 핵심은 "오픈 소스 코드에서 일반적인 프로그래밍 패턴을 학습"하는 능력에 있습니다.
- 코드 완성 및 생성: IDE 플러그인 또는 CLI 도구에 StarCoder 모델을 통합하여 실시간 코드 완성, 함수 본문 생성 및 상용구 코드 채우기를 제공합니다. 반복적인 코딩 작업이 줄어들고 프로토타입 개발이 가속화된다는 이점이 있습니다. 기본 모델에는 자연어 지시보다는 적절한 프롬프트 설계가 필요하다는 점에 유의해야 합니다.
- 코드 번역 및 마이그레이션: 다국어 코드를 이해하는 모델의 기능을 사용하여 코드를 한 언어에서 다른 언어로 번역(예: Python→Java)하거나 프레임워크 업그레이드를 위한 코드 마이그레이션을 완료하는 데 도움을 줍니다. 그 효과는 훈련 데이터의 소스 언어와 타겟 언어의 적용 범위에 따라 달라집니다.
- 테스트 케이스 생성: 함수 서명 및 문서 문자열을 기반으로 단위 테스트 뼈대를 생성합니다. BigCodeBench 평가 데이터에 따르면 StarCoder2는 복잡한 다기능 호출 시나리오에서 잘 작동하지만 테스트를 생성하려면 여전히 적용 범위와 정확성을 수동으로 검토해야 합니다.
해당자
BigCode의 오픈 소스 포지셔닝으로 인해 서비스 그룹은 주로 개발자와 연구원이 됩니다.
- AI/ML 연구원: 연구 코드 LLM 아키텍처, 교육 방법 또는 평가 방법론. BigCode는 모델 가중치, 데이터 처리 파이프라인, 평가 프레임워크 및 벤치마크를 포함하여 완벽하게 재현 가능한 기준선을 제공합니다.
- 소프트웨어 엔지니어 및 설계자: 자체 코드 인텔리전스 기능을 구축해야 하는 팀. 소스 코드를 타사 API로 전송하지 않도록 StarCoder2 모델을 기반으로 비공개 코드 완성 서비스를 구축할 수 있습니다.
- 엔터프라이즈 AI 플랫폼팀: 오픈 소스 코드 모델을 평가하고 내부 툴체인에 통합합니다. BigCode의 라이선스 투명성과 데이터 세트 추적성은 비즈니스 모델에 비해 핵심적인 이점입니다.
경계에 맞지 않음:
- 대화형 코드 도우미가 필요한 시나리오(GitHub Copilot Chat 등) - StarCoder 시리즈는 명령어 모델이 아니며, 상호작용 방식은 대화보다는 완성을 기반으로 합니다.
- 생성된 코드의 저작권에 대한 무관용 규정 준수 시나리오 - 모델은 교육 데이터에서 오픈 소스 라이선스 코드와 유사한 스니펫을 생성할 수 있으므로 추가 추적성 검토가 필요합니다.
- 리소스가 극도로 제한된 엣지 장치 - 3B 모델에도 특정 GPU 또는 메모리 리소스가 필요하므로 모바일 단말기나 MCU에서 직접 실행하는 것은 비현실적입니다.
요약 및 전망
BigCode의 핵심 가치는 훈련 데이터(The Stack), 모델(StarCoder 시리즈), 평가 벤치마크(BigCodeBench)부터 배포 도구(TGI, starcoder.cpp)에 이르기까지 개방형 과학 방식으로 완전한 코드 LLM 인프라 세트를 제공하는 것입니다. 이는 훈련에서 구현까지 코드 모델의 전체 링크를 포괄합니다. 가장 빠른 코드 도우미도 아니고 가장 가벼운 모델도 아니지만, 코드 생성 기능을 완전히 제어하고 데이터 추적성과 라이선스 투명성에 주의를 기울여야 하는 팀을 위해 BigCode는 오픈 소스 생태계에서 가장 완벽한 도구 체인을 제공합니다.
현재 제한 사항: StarCoder2 시리즈에는 공식 지침 미세 조정 버전이 없으며(커뮤니티의 instruct-v0.1은 아직 실험적임) 팀이 자체적으로 미세 조정 및 적응을 완료해야 합니다. 대규모 코드 베이스를 처리할 때는 모델 컨텍스트 창(16K)이 충분하지 않을 수 있습니다. 프로젝트는 관리형 API를 제공하지 않으며 자체 배포에는 특정 MLOps 기능이 필요합니다.
조달 및 채택 위험 평가: BigCode의 모델 가중치는 Apache-2.0 및 OpenRAIL-M v1 라이선스에 따라 출시됩니다. 라이선싱 위험은 상대적으로 통제 가능하지만 OpenRAIL-M의 추가 사용 제한은 대상 시나리오에 적용 가능한지 여부에 대한 법적 확인이 필요합니다. 채택하기 전에 기업은 다음 사항을 평가하는 데 집중해야 합니다. ① 대상 프로그래밍 언어 및 코딩 스타일에서 StarCoder2의 완성 정확도가 사용 가능한 임계값에 도달하는지 여부; ② 허용 가능한 성능 수준으로 미세 조정하는 데 필요한 데이터 주석 및 GPU 비용 ③ Hugging Face 및 ServiceNow가 주도하는 프로젝트 거버넌스 모델의 장기적인 지속 가능성. 먼저 7B 모델을 비프로덕션 환경에서 소규모 샘플로 실행해 효과를 확인한 후 평가 범위를 확대하는 것이 좋습니다.
관련 도구: github-copilot, cursor
BigCode의 버전 진화
BigCode의 버전 컨텍스트는 모델 릴리스를 기반으로 하며 StarCoder2 시리즈의 초기 소규모 탐색에서 대규모 교육으로 점차 발전합니다.
초기 탐사(~2023-01)
- SantaCoder-1.1B: 다중 언어 코드 생성의 기본 기능을 검증하는 데 사용되는 최초의 공개 모델 출력인 1.1B 매개변수입니다.
메인라인 출시
- StarCoder-15.5B(~2023-05): 최초의 플래그십 모델, 15.5B 매개변수, 80개 이상의 프로그래밍 언어, 1조 토큰 훈련, 8K 컨텍스트. Pass@1은 HumanEval에서 33.6%에 도달했으며, 출시 후 여러 가지 미세 조정된 변형이 커뮤니티에 빠르게 나타났습니다.
- StarCoder2-3B/7B/15B (2024-02-29): 2세대 모델 시리즈가 완전히 업그레이드되었습니다. 3B/7B는 3조 개 이상의 토큰으로 훈련되고, 15B는 4조 개 이상의 토큰으로 훈련됩니다. 그룹화된 쿼리 주의, 16K 컨텍스트 창(4K 슬라이딩 창) 및 FIM 대상이 도입되었습니다. 훈련 하드웨어는 1024× H100 GPU로 업그레이드되었습니다.
평가 및 생태보충(2024-2025)
- BigCodeBench(ICLR 2025): 단일 기능 생성만 테스트하는 기존 벤치마크의 격차를 메우는 다기능 호출 벤치마크를 출시합니다.
- SelfCodeAlign(NeurIPS 2024): 수동 주석 없이 모델 지침 준수 기능을 향상시키는 코드 자체 정렬 방법을 제안합니다.
- BigCodeArena(2025-10): 기존 수동 평가의 반복성 문제를 해결하기 위해 실행 결과를 기반으로 한 코드 선호도 평가를 도입합니다.
- OctoPack(~2024): 코드 모델에 대한 표준화된 정렬 데이터를 제공하기 위해 데이터 세트 및 교육 제품을 미세 조정하라는 지침을 발행합니다.
2026년 7월 현재 프로젝트는 GitHub 및 Hugging Face를 통해 새로운 모델과 데이터 세트를 계속 생산하고 있지만 고정된 버전 출시 주기를 설정하지는 않았습니다. 프로덕션 사용자는 StarCoder2-15B 또는 StarCoder2-7B를 평가 기준으로 사용하고 작업의 복잡성에 따라 적절한 사양을 선택하는 것이 좋습니다.
빅코드 사용법
BigCode의 모델은 다양한 기술 배경을 가진 팀에 적합한 다양한 방법으로 획득하고 사용할 수 있습니다.
| 사용 방법 | 군중에게 적합 | 특징 | 비용 |
|---|---|---|---|
| 포옹 얼굴 공간 온라인 체험 | 제품평가/간편검증 | 설치가 필요하지 않으며 브라우저에서 직접 실행 | 무료 |
| Transformers 라이브러리 로드 | 개발 통합 | PyTorch, 비트와 바이트 정량화 지원 | 무료(고유 GPU 필요) |
| 텍스트 생성 추론(TGI) | 프로덕션 추론 배포 | REST API, 연속 일괄 처리 지원 | 무료 오픈 소스(GPU 필요) |
| starcoder.cpp(ggml) | 엣지/CPU 배포 | C++ 구현, Python 종속성 없음 | 무료 |
| 로컬 미세 조정(PEFT + LoRA) | 모델 맞춤화 | 4비트 양자화 미세 조정, 소비자급 GPU 사용 가능 | 무료(GPU 필요) |
일반적인 사용 단계(예를 들어 StarCoder2-15B를 로드하는 Transformer 사용):
``파이썬
종속성 설치
pip 설치 git+https://github.com/huggingface/transformers.git
변환기에서 AutoModelForCausalLM, AutoTokenizer 가져오기
체크포인트 = "bigcode/starcoder2-15b" 장치 = "쿠다"
토크나이저 = AutoTokenizer.from_pretrained(체크포인트) 모델 = AutoModelForCausalLM.from_pretrained( 검문소, device_map="자동", torch_dtype=torch.bfloat16 ).to(기기)
입력 = tokenizer.encode("def fibonacci(n):", return_tensors="pt").to(device) 출력 = model.generate(입력, max_new_tokens=128) 인쇄(tokenizer.decode(출력[0]))
**정량적 배포**: 비트와 바이트를 사용하면 8비트(약 16.9GB 비디오 메모리) 또는 4비트(약 9.2GB 비디오 메모리) 추론을 달성하여 GPU 요구 사항을 크게 줄일 수 있습니다.
**미세 조정 적응**: 이 프로젝트는 4비트 양자화 하에서 단일 카드 소비자급 GPU로 도메인 적응을 완료할 수 있는 PEFT + LoRA를 기반으로 하는 미세 조정 스크립트를 제공합니다.
실제 구현은 '평가 기준선 선택 → 소규모 샘플 검증 → 미세 조정 및 적응 → 정량적 배포'의 4단계로 추진하는 것이 좋습니다. 첫 번째 주에는 대상 프로그래밍 언어 및 작업 유형에서 모델의 완성 정확도를 검증하는 데 중점을 두고 미세 조정에 들어갈지 여부를 결정합니다.
버전 정보
- 스타코더2-15B :16K 컨텍스트 창을 갖춘 Grouped Query Attention을 사용하여 600개 이상의 프로그래밍 언어와 4조 개 이상의 토큰에 대해 훈련된 StarCoder2 시리즈(15B 매개변수)의 가장 큰 모델입니다.
- 스타코더2-7B :StarCoder2 시리즈 중간 규모 모델(7B 매개변수), 3조 개 이상의 토큰 교육, 단일 GPU 배포 시나리오에 적합합니다.
- 스타코더2-3B :리소스가 제한된 시나리오에서 코드 완성 및 생성을 지향하는 StarCoder2 시리즈(3B 매개변수)의 가장 작은 모델입니다.
- StarCoder-15.5B :최초의 StarCoder 시리즈 플래그십 모델, 80개 이상의 프로그래밍 언어 1조 토큰 트레이닝, 8K 컨텍스트 창. 아직 공식적인 정확한 날짜는 없습니다.
- 산타코더-1.1B :다국어 코드 생성을 탐색하기 위한 BigCode의 소규모 코드 모델(1.1B 매개변수)의 초기 출력입니다. 아직 공식적인 정확한 날짜는 없습니다.
사용자 후기