아체 무료

-

Gemma는 Google DeepMind가 Gemini 연구 결과를 바탕으로 출시한 경량 오픈소스 시리즈입니다. Gemma 2는 2B/9B/27B의 세 가지 규모를 제공하고 Apache 2.0 라이선스를 따르며 상업적 용도로 무료로 제공됩니다. 이는 엔드사이드 및 리소스가 제한된 시나리오에 특별히 최적화되었습니다. 동일한 매개변수 규모에서 최고의 성능을 제공하며 HuggingFace, Kaggle 및 Google Cloud를 지원합니다. 다중 채널 액세스.

아체 제품 인터페이스

Gemma — Google의 오픈소스 경량 대형 언어 모델 시리즈

핵심 매개변수 및 통계

매개변수 세부정보
최신 버전 젬마 2(2B/9B/27B)
출시일 2024-06-27
라이센스 Apache 2.0(상업적 사용을 위해 완전 개방형, 월간 활동 제한 없음)
컨텍스트 창 8192 토큰(Gemma 2)
기술원천 Gemini 연구 결과를 바탕으로 지식 증류 기술을 활용
출시 채널 HuggingFace, Kaggle, Google Cloud Vertex AI
변형 모델 CodeGemma(코드), PaliGemma(시각적 언어), RecurrentGemma
양자화 지원 GGUF, GPTQ, AWQ 및 기타 주류 양자화 형식
추론 프레임워크 HuggingFace 트랜스포머, llama.cpp, Ollama, vLLM
Google Colab 지원 무료 Colab 노트북, 브라우저에서 직접 Gemma 실행

Gemma와 Llama의 주요 차이점은 라이선스입니다. Gemma는 Apache 2.0(사용자 크기 제한 없음, 완전한 오픈 소스)을 사용하는 반면 Llama 3의 Meta Llama 라이선스는 월간 활성 사용자가 7억 명을 초과하면 특별 라이선스가 필요합니다. 성장하는 상업용 애플리케이션을 위해 Gemma의 Apache 2.0 라이센스는 더욱 걱정 없는 법적 보호를 제공합니다.

사용자 및 시장 인지도

Gemma는 2024년 2월 출시 이후 HuggingFace에서 다운로드가 계속 증가하여 Llama 시리즈 다음으로 두 번째로 인기 있는 오픈 소스 LLM 제품군이 되었습니다. Google의 강력한 개발자 생태계(Kaggle, Colab, Google Cloud)는 Gemma에게 고유한 배포 채널을 제공합니다. 수많은 데이터 과학자와 Kaggle 대회 참가자가 친숙한 플랫폼을 통해 Gemma에 액세스하여 빠르게 성장하는 사용자 기반을 형성하고 있습니다.

Gemma 2 27B는 LMSys Chatbot Arena의 블라인드 테스트 순위에서 GPT-4 Turbo에 가까운 수준에 도달했습니다. 이 벤치마크 결과는 오픈 소스 커뮤니티에서 광범위한 관심을 끌었으며 매개변수 효율적인 소형 모델이 지식 증류를 통해 예상 매개변수 수를 훨씬 초과하는 성능 수준을 달성할 수 있음을 입증했습니다. CodeGemma 및 PaliGemma와 같은 전문 변형의 출시로 Gemma 생태계의 애플리케이션 시나리오 적용 범위가 더욱 확장되었습니다.

비용 이점

방법 가격 주요 적용 시나리오 특징
로컬 배포 하드웨어 비용(일회성) 개인 정보 보호 응용 프로그램, 개발 실험 Apache 2.0, 상업적 제한 없음
Google Cloud Vertex AI 토큰별 청구(Gemini 가격 책정 시스템) 엔터프라이즈 API 통합 Google Cloud와의 긴밀한 통합
포옹얼굴 추론 무료(제한적) 또는 PRO 플랜 경량 앱 테스트 가장 빠른 시작, 로컬 GPU 필요 없음
캐글 노트북 무료(GPU 포함) 데이터 과학 실험 Kaggle 사용자를 위한 무료 액세스

젬마2 2B의 양자화 버전은 CPU에서 거의 구동이 안되고 맥북(M칩)이나 RTX 3060에서도 원활하게 구동된다. '노트북에서 구동 가능한 AI 모델' 중 가장 강력한 옵션 중 하나다. Gemma 2B/9B의 하드웨어 요구 사항으로 인해 A100이 필요한 대규모 모델에 비해 개발 비용이 크게 절감됩니다.

주요 기능

  • Gemma 2 다중 규모 사전 학습 모델(Base): 특정 작업이나 분야에서 연구자가 2차 미세 조정을 수행하는 데 적합한 지침 미세 조정 없이 기본적인 사전 학습 모델을 제공합니다. 2B/9B/27B의 세 가지 규모는 터미널측 배포부터 고성능 서버까지 다양한 컴퓨팅 성능 시나리오를 다룹니다.
  • Gemma 2 지침 미세 조정 버전(Instruct): 지침 준수 및 안전한 정렬을 통해 훈련된 대화형 버전입니다. 즉시 사용 가능한 채팅 도우미 및 Q&A 애플리케이션에서 사용할 수 있습니다. 별도의 미세 조정 없이도 고품질의 자연어 상호작용 능력을 얻을 수 있습니다.
  • 지식 증류 최적화의 매우 높은 매개변수 효율성: Gemma 2는 대규모 Gemini 모델(Gemini에서 증류된 27B, 27B에서 증류된 9B/2B)에서 매개변수 효율성을 획득하여 동일한 매개변수 규모에서 상당히 앞서는 벤치마크 테스트 결과를 달성합니다. 이 "증류 체인" 전략은 Gemma 시리즈의 핵심 기술 혁신입니다.
  • CodeGemma(코드별 변형): 코드 완성, 코드 생성 및 수학적 추론을 위해 특별히 최적화된 Gemma 변형입니다. 2B(코드 채우기)와 7B(명령어 버전)의 두 가지 사양을 제공합니다. 코드 작업의 성능은 동일한 규모의 일반 Gemma 모델보다 우수합니다.
  • PaliGemma(시각 언어 다중 모드 버전): 이미지 이해를 지원하는 다중 모드 Gemma 변형입니다. 이미지와 텍스트의 혼합 입력을 처리하고, 이미지 설명, 시각적 질문 답변, 문서 이해 작업을 수행할 수 있습니다. 이는 Google의 경량 다중 모드 오픈 소스 모델을 대표합니다.
  • Apache 2.0 무제한 상업용 라이센스: 모든 Gemma 모델은 Apache 2.0 라이센스를 따르며 사용자 수나 수입에 제한 없이 모든 규모의 상업용 제품에서 자유롭게 사용, 수정 및 배포될 수 있습니다. 가장 자유로운 오픈 소스 LLM 상업용 라이센스 중 하나입니다.
  • Google Colab 제로 구성 환경: Google은 Gemma를 위한 공식 Colab 노트북을 제공합니다. 사용자는 로컬 GPU 없이 브라우저에서 직접 Gemma를 실행할 수 있습니다. AI 학습자와 데이터 과학자가 Gemma를 경험할 수 있는 가장 낮은 진입점입니다.
  • Kaggle 생태학적 심층 통합: Gemma는 Kaggle 플랫폼에 깊이 통합되어 있으며 Kaggle 대회 참가를 지원합니다.

노트북에서의 직접 호출과 데이터 과학 커뮤니티를 위한 고유한 배포 채널은 Gemma를 다른 오픈 소스 LLM과 차별화하는 고유한 틈새 시장을 형성합니다.

모델 및 버전의 진화

버전 출시일 설명
젬마 1.0(2B/7B) 2024-02-21 Google의 첫 번째 Gemma 릴리스, 기본 버전 + 명령 버전, Apache 2.0 라이선스
코드젬마(2B/7B) 2024-04-09 코드별 변형, 코드 채우기 및 생성 최적화
Gemma 1.1(2B/7B 업데이트 버전) 2024-04-05 명령은 품질 개선을 따르고 버전 1.0의 대화 문제 수정
RecurrentGemma(2B/9B) 2024-04 선형 재귀 아키텍처를 기반으로 하는 효율적인 추론 변형으로 에지 장치에 적합
PaliGemma(3B 멀티모달) 2024-05 이미지 이해 작업을 지원하는 시각적 언어 모델
젬마 2(2B/9B/27B) 2024-06-27 2세대, 지식 증류 최적화, 크게 향상된 성능, 27B는 GPT-4 Turbo에 가깝습니다
Gemma 2 JetBrains/Ollama 2024-08 주류 IDE 및 로컬 추론 도구는 Gemma 2를 지원하며 생태계는 계속 확장됩니다

기술적인 장점

지식 증류 체인이 가져오는 매우 높은 매개변수 효율성: Gemma 2의 기술 핵심은 다단계 지식 증류입니다. 27B는 더 큰 Gemini에서 증류되고 9B와 2B는 27B에서 증류됩니다. 이 증류 체인을 통해 Gemma 2 모델의 각 크기는 매개변수 크기를 훨씬 뛰어넘는 성능 수준을 달성할 수 있습니다. HuggingFace Open LLM 리더보드에서 Gemma 2 9B가 Llama 3 70B를 능가하는 기술적 이유이며, 모델 압축 및 지식 전달 분야에서 Google DeepMind의 선도적인 연구 결과를 반영합니다.

Apache 2.0의 가장 느슨한 상용 라이센스: Llama의 Meta Llama 라이센스(7억 MAU 이상에는 특별 승인이 필요함)와 비교할 때 Gemma의 Apache 2.0 라이센스는 상업적 사용에 제한이 없습니다. 개발자와 기업은 비즈니스 성장에 따른 라이선스 제한에 대한 걱정 없이 Gemma를 모든 규모의 상용 제품에 통합할 수 있으므로 오픈 소스 LLM을 사용하는 기업의 법적 준수 위험을 줄일 수 있습니다.

Google 인프라와의 긴밀한 통합: Gemma는 Google Cloud, Vertex AI, Colab 및 Kaggle을 위한 기본 지원 모델로, 이러한 플랫폼에서 최적의 액세스 및 도구 지원을 제공합니다. 클라우드 인프라를 위해 Google Cloud를 채택한 기업의 경우 Gemma를 사용하면 Vertex AI의 미세 조정된 관리형 모델 레지스트리 및 보안 모니터링 기능을 포함하여 Google 생태계와 가장 긴밀하게 통합됩니다.

소규모 고성능 최종 배포 가치: Gemma 2 2B는 현재 가장 성능이 좋은 2B 매개변수 규모 오픈 소스 모델 중 하나입니다. 중형 구성 Android 휴대폰(Google AI Edge 프레임워크 포함)에서 로컬로 실행할 수 있으며 최종 AI 애플리케이션(오프라인 음성 지원, 개인 정보 보호 장치 측 처리 등)을 위한 실용적인 로컬 LLM 기능을 제공합니다. 이는 Llama(최소 8B)와 비교하여 Gemma의 중요한 차별화 이점입니다.

사용방법

입구 설명
포옹얼굴 https://huggingface.co/google/gemma-2-9b를 방문하여 액세스를 요청하고 모델을 다운로드하세요
캐글 GPU 가속을 포함하여 Kaggle Notebook에서 무료로 Gemma 사용
구글 코랩 Google의 공식 Colab 노트북을 사용하여 로컬 GPU 없이 실행
올라마(현지) ollama run gemma2:9b 원클릭 로컬 배포
버텍스 AI Google Cloud Vertex AI를 통해 Gemma API 서비스에 액세스

일반적인 사용 단계(Gemma 2에 연결된 HuggingFace):

  1. https://huggingface.co/google/gemma-2-9b를 방문하여 HuggingFace 계정에 로그인하고 사용 계약에 동의합니다(Apache 2.0, 추가 제한 없음).
  2. 종속성을 설치합니다: pip install Transformers Acceleration.
  3. HuggingFace Transformers를 사용하여 'from Transformers import AutoTokenizer, AutoModelForCausalLM' 모델을 로드합니다.
  4. 토크나이저 및 모델을 로드하거나(9B 모델을 실행하려면 최소 20GB의 비디오 메모리 필요, 2B는 약 6GB 필요) 양자화 버전을 사용하여 비디오 메모리 요구 사항을 줄입니다.
  5. 추론 코드를 작성하고 model.generate()를 사용하여 텍스트를 생성합니다. Gemma 명령 버전은 <start_of_turn>user ... <end_of_turn> 대화 형식을 따릅니다.
  6. 미세 조정이 필요한 경우 효율적인 파라미터 미세 조정을 위해 HuggingFace TRL + LoRA를 사용하는 것이 좋습니다.

제품 가격

Gemma 모델 가중치는 완전히 무료이며 각 플랫폼 사용 비용은 다릅니다.

  • 모델 웨이트 다운로드: 완전 무료, Apache 2.0 라이센스, 상업적 제한 없음, HuggingFace 또는 Kaggle에서 직접 다운로드할 수 있으며 특별한 애플리케이션이 필요하지 않습니다.
  • 로컬 배포: 하드웨어 비용만 있고 Gemma 2 2B는 RTX 3060(12GB)에서 원활하게 실행되며 9B에는 RTX 3090(24GB) 또는 다중 카드 배포가 필요합니다.
  • Kaggle 노트북: Kaggle 무료 계정은 제한된 GPU 할당량(주당 약 30시간 T4 GPU)을 제공하므로 Gemma 실험을 실행하고 무료로 시작할 수 있습니다.
  • Google Colab: 무료 버전은 제한된 GPU 사용량을 제공하며 Colab Pro(약 $10/월)는 더 많은 GPU 리소스를 제공하므로 중간 규모 실험에 적합합니다.
  • Google Cloud Vertex AI: 상용 API 서비스는 토큰을 기준으로 비용이 청구됩니다. 구체적인 가격은 Google Cloud 공식 가격 페이지를 참조하세요. 엔터프라이즈 수준 애플리케이션을 위한 관리형 추론 서비스를 제공합니다.

애플리케이션 시나리오

  1. 모바일 및 엣지 디바이스 AI 기능: Gemma 2 2B의 컴팩트한 디자인은 엔드사이드 배포에 최적화되어 있습니다. Google AI Edge 프레임워크를 통해 중급 및 고급형 Android 기기에서 로컬로 실행할 수 있습니다. 오프라인 지능형 비서, 실시간 텍스트 처리 및 개인 정보 보호 장치 측 NLP 기능을 지원합니다. 오프라인 AI 기능이 필요한 모바일 애플리케이션에 선호되는 오픈 소스 솔루션입니다.

  2. 제한된 리소스를 사용한 AI 배포: 임베디드 시스템, 에지 서버 및 낮은 컴퓨팅 클라우드 인스턴스의 AI 애플리케이션은 Gemma 2B/9B 양자화 모델을 사용하여 제한된 GPU 메모리(8~16GB) 내에서 실용적인 텍스트 생성 및 질문 답변 기능을 제공합니다. 하드웨어 조건이 제한적일 때 AI 기능을 극대화하기 위한 이상적인 선택입니다.

  3. 학생 및 연구원을 위한 AI 학습 실험: 데이터 과학 학생은 Kaggle 노트북(무료 GPU)을 통해 Gemma에 액세스하여 무료로 전체 LLM 미세 조정, 평가 및 배포 프로세스를 경험할 수 있습니다. Apache 2.0 라이선스는 학술 연구 결과를 자유롭게 출판하고 상용화할 수 있도록 보장하여 AI 교육을 위한 가장 장벽 없는 오픈 소스 LLM 중 하나입니다.

  4. Google Cloud 기업을 위한 AI 통합: Google Cloud를 채택한 기업은 Vertex AI에서 Gemma를 사용하여 Google 인프라와의 가장 긴밀한 통합, 관리형 미세 조정 서비스 모델 레지스트리 버전 관리 및 엔터프라이즈급 보안 규정 준수 기능을 활용하고 오픈 소스 모델의 비용 이점과 Google Cloud의 엔지니어링 안정성을 결합합니다.

  5. 코드 지원 도구 개발: CodeGemma 7B를 사용하여 비공개 코드 완성 및 코드 검토 도구를 구축하고 로컬 또는 인트라넷에 배포하며 GitHub Copilot과 같은 클라우드 서비스를 통한 코드 전송을 방지합니다. Apache 2.0 라이선스는 코드 도구를 자유롭게 상용화할 수 있도록 보장하며, 이는 지적 재산권 보호가 필요한 소프트웨어 회사에 적합합니다.

해당자

  • 데이터 과학자 및 Kaggle 대회 참가자: Kaggle 플랫폼의 긴밀한 통합과 무료 GPU 액세스 덕분에 Gemma는 이 그룹에게 자연스러운 선택이 되어 기존 워크플로에 원활하게 들어맞습니다.
  • 모바일 및 클라이언트 측 AI 개발자: 기기에서 LLM을 실행해야 하는 Android 개발자의 경우 Gemma 2B와 Google AI Edge의 조합은 현재 가장 성숙한 클라이언트 측 LLM 개발 솔루션입니다.
  • Apache 2.0 라이선스가 필요한 기업: Llama의 Meta Llama 라이선스에 대한 법적 문제가 있고 보다 완화된 오픈 소스 라이선스가 필요한 기업을 위해 Gemma for Apache 2.0은 걱정 없는 상업적 사용을 보장합니다.
  • Google Cloud 사용자: Google Cloud 인프라를 배포한 팀은 Vertex AI에서 Gemma를 사용하여 최고의 통합 경험과 엔터프라이즈급 지원을 얻을 수 있습니다.
  • 부적합한 시나리오: 매우 긴 컨텍스트 처리(>8K 토큰)가 필요한 애플리케이션(Gemma 2 컨텍스트 창이 상대적으로 작으며 Llama 3.1의 128K가 더 적합함) 최고 성능을 요구하는 생산 수준 애플리케이션(Gemma 27B는 동일한 규모의 경쟁 제품보다 강력하지만 Llama 3.1 405B 또는 GPT-4와 비교하면 여전히 격차가 있음) 이미 안정적인 Llama 기술 스택을 보유하고 있고 마이그레이션할 동기가 없는 팀.

요약 및 전망

Gemma 시리즈는 오픈소스 AI 분야에서 Google의 전략적 레이아웃을 나타냅니다. Gemini의 최고 연구 결과를 오픈 라이선스 형태로 개발자 커뮤니티에 공개함으로써 AI의 인기를 홍보할 뿐만 아니라 수많은 개발자를 Google 생태계(Cloud, Colab, Kaggle)로 끌어들입니다. 지식 증류 체인이 가져오는 매우 높은 매개변수 효율성은 Gemma의 가장 중요한 기술적 차별화 포인트로, 소규모 모델이 매개변수 규모의 예상 성능을 초과하는 성능을 가질 수 있도록 해줍니다.

Apache 2.0 라이선스의 선택은 오픈소스 커뮤니티에 대한 Google의 진심 어린 헌신을 반영합니다. Meta의 Llama 라이선스보다 더 개방적이어서 법규 준수에 민감한 기업 시장에서 독보적인 이점을 제공합니다.

후속 초점: Gemma 3 시리즈의 매개변수 규모 확장 및 다중 모드 기능 향상(시각적, 오디오), PaliGemma 시각적 언어 모델의 기능적 진화, Google AI Edge의 기기측 배포 생태계의 완벽함, Gemini Nano(기기측 Gemini)를 통한 차별화된 포지셔닝이 오픈 소스 LLM 경쟁 환경에서 Gemma의 장기적인 위치를 결정할 것입니다.

관련 도구: hugging-face, replicate

버전 정보

  • 젬마 2(2B/9B/27B) :Gemma 2는 2B, 9B, 27B의 세 가지 매개변수 크기로 공식 출시되었습니다. 지식 증류 기술을 사용하여 대규모 모델 기능을 작은 모델로 압축합니다. LMSys Chatbot Arena와 같은 주류 벤치마크 테스트에서 Gemma 2 27B는 GPT-4 Turbo 수준에 가깝고 9B 버전은 동일한 규모의 모든 오픈 소스 모델을 능가합니다. 모든 버전은 Apache 2.0 라이센스를 따르며 상업적 용도로 무료입니다. 동시에 HuggingFace, Kaggle 및 Google Cloud에서는 세 가지 주요 채널이 동시에 출시되어 액세스 임계값이 크게 감소합니다.
  • Gemma 1.1(2B/7B 업데이트 버전) :Gemma 1.1의 업데이트 버전이 출시되었습니다. Gemma 1.0에서는 사용자들이 보고한 품질 문제에 따른 지침을 해결하기 위해 특별한 개선이 이루어졌으며, 지침 버전(Instruct)의 대화 기능이 크게 향상되었습니다. 동시에 CodeGemma(2B/7B 코드별 버전) 및 RecurrentGemma(고효율 추론 변형)가 공식 출시되어 Gemma 모델 제품군을 코드 생성과 같은 전문적인 시나리오로 확장했습니다.
  • :구글은 젬마(Gemma) 오픈소스 모델 시리즈를 최초로 출시해 사전 훈련 버전(Base)과 명령어 미세 조정 버전(Instruct)을 2B와 7B 두 가지 크기로 출시했다. Gemini 모델 연구 결과를 정제하여 동일한 매개변수 규모의 오픈소스 모델 벤치마크 테스트에서 선도적인 결과를 달성했습니다. HuggingFace, Kaggle, Google Colab의 세 가지 액세스 채널을 제공하고 책임감 있는 AI 사용 툴킷을 출시합니다.

사용자 후기

  • 후기를 불러오는 중...