CMMLU 무료

-

CMMLU는 인문학, 사회과학, 과학 및 공학, 중국어 관련 지식 등 다양한 분야의 객관식 문제를 다루는 포괄적인 중국 대형 모델 평가 벤치마크입니다. 이는 중국어 맥락에서 대규모 언어 모델의 지식 보유 및 추론 능력을 측정하는 데 사용됩니다. 데이터 세트와 평가 코드는 GitHub의 오픈 소스입니다.

CMMLU 제품 인터페이스

CMMLU

CMMLU의 핵심 매개변수 및 통계

CMMLU(중국어 대규모 다중 작업 언어 이해)는 학술 연구팀이 2023년에 발표할 중국어 대형 언어 모델에 대한 다중 영역 지식 평가 벤치마크 세트입니다. 최종 사용자를 위한 채팅이나 생성 기능을 제공하지 않지만, 연구원과 모델 개발 팀에 67개 분야를 포괄하는 표준화된 중국어 지식 문제 은행을 제공하여 중국 맥락에서 모델의 사실적 지식 보유량과 추론 정확도를 측정합니다.

매개변수 항목 가치
벤치마크 전체 이름 CMMLU(중국어 대규모 멀티태스킹 언어 이해)
총 질문 수 ~11,500개의 객관식 문제
주제 범위 인문학, 사회과학, 이공계, 중국 고유의 지식 등 4개 분야로 분류된 67개 학문
옵션 구조 4가지 중 하나 선택(A/B/C/D)
질문 유형 지식기반 객관식 문제(사실기억+추론과 판단)
출력 표시기 과목별 정확도(Accuracy) 및 전체 평균 정확도
라이센스 계약 오픈 소스(GitHub 공개 저장소)
첫 번째 논문 arXiv 2023
평가방법 로컬 추론 + 스크립트 스코어링, 퓨샷 및 제로샷 설정 지원
종속성 PyTorch / Transformers + 평가 스크립트

매개변수 의미 해석: 67개 과목의 분할 세분성은 MMLU(57개 과목) 및 C-Eval(52개 과목)보다 훨씬 세밀합니다. 이는 CMMLU가 과목 차원에서 보다 세분화된 능력 진단 기능을 제공한다는 것을 의미합니다. 총 11,500개의 문항 수는 수만 개의 문항에 비해 많지 않지만, 과목당 평균 약 170개의 문항의 밀도는 통계적으로 유의미한 과목 수준의 정확도 비교를 뒷받침하기에 충분합니다. 4지 선택 형식은 무작위 추측 기준선(25%)을 줄여 30%-40% 정확도 구간이 여전히 식별 가치를 가지며 이는 어려운 주제에서 모델의 단점을 찾는 데 적합합니다.

유사한 벤치마크와의 규모 비교:

벤치마크 과목수 질문 수 언어 중국 관련 지식
MMLU 57 ~14,000 영어 없음
C-평가 52 ~13,900 중국어 부분
CMMLU 67 ~11,500 중국어 주요 내용
AGI평가 20세 이상 ~8,000 중국어/영어 부분

유형 결정: CMMLU는 "기본 대형 모델/API 인프라" 범주의 모델 평가 인프라에 속합니다. 핵심 결과물은 표준화된 데이터 세트 + 평가 프로토콜 + 기준 점수 세트입니다. API 서비스를 지속적으로 실행하는 것은 아니지만 모델 개발 체인에서 필수적인 품질 게이트 제어입니다.

CMMLU의 사용자 및 시장 인지도

  • 학술적 인용 및 영향: CMMLU 논문이 arXiv에 공개된 후 Qwen, Yi, Baichuan, InternLM 및 모두 CMMLU 점수를 보고한 기타 모델 시리즈의 출시를 포함하여 기술 보고서 및 논문에서 여러 중국 대형 모델 팀에서 기능의 증거로 인용되었습니다. 2026년 중반 현재 GitHub 저장소는 수천 개의 별을 받았으며 커뮤니티 포크와 문제 토론이 활발합니다.

  • 산업 채택 모델: 국내 대형 모델 제조업체에서는 일반적으로 CMMLU와 C-Eval을 중국 지식 능력에 대한 표준 평가 조합으로 사용합니다. 모델 능력 비교표에서 CMMLU의 전반적인 정확도와 각 과목의 정확도는 가장 많이 인용되는 중국 벤치마크 지표 중 하나입니다. 일부 팀은 CMMLU를 일일 회귀 테스트 파이프라인에 통합하여 훈련 중 성능 저하를 감지합니다.

  • C-Eval과의 위치 차이: C-Eval은 일반 과목의 중국 대학 입시/대학원 입시 어려운 문제에 중점을 두고 있는 반면, CMMLU는 중국 고유의 지식(중국 역사, 지리, 법률, 문학 등)을 다루는 데 더 중점을 두고 있습니다. 전체 과목 분포에서는 둘 사이에 약 60%의 중복이 있지만, 중국 관련 지식 범주에서는 CMMLU의 깊이가 훨씬 더 높습니다. 많은 팀이 중국어 능력에 대한 보다 완전한 그림을 얻기 위해 두 벤치마크에 대한 점수를 동시에 보고합니다.

  • 경계 참고: 객관식 질문 벤치마크에는 데이터 오염의 위험이 내재되어 있습니다. 모델이 사전 학습 단계에서 질문의 원본 텍스트를 확인하여 잘못 높은 점수를 얻었을 수도 있습니다. 현재 CMMLU 팀은 독립적인 홀드아웃 개인 정보 보호 세트나 동적 질문 생성 메커니즘을 확립하지 않았으므로 점수를 인용할 때 동일한 모델 배치에 대한 MMLU/C-Eval 추세 교차 검증과 결합해야 합니다. 또한 높은 점수는 사실적 지식의 양만 반영할 뿐 모델의 추론 깊이, 대화 품질 또는 지시 따르기 능력을 나타내지는 않습니다.

CMMLU의 비용 이점

C측/개인연구원:

  • 직접 비용 제로: 데이터 세트 및 평가 스크립트는 완전히 오픈 소스이며 GitHub 저장소는 라이센스 비용이나 구독 비용을 지불하지 않고 직접 복제하여 사용할 수 있습니다.
  • 운영 비용: 평가를 위해서는 모델을 로드하고 자체 하드웨어 또는 클라우드 인스턴스에서 추론을 수행해야 합니다. 7B 매개변수 규모 모델을 예로 들면, 단일 A100에서 67개 주제 모두에 대한 추론을 완료하는 데 약 30~60분 정도 소요되며, 해당 클라우드 컴퓨팅 비용은 약 1~3달러(주문형 가격 기준 추정)입니다. 700억 개 이상의 규모 모델에 필요한 컴퓨팅 성능은 선형적으로 증가하며 단일 전체 규모 평가의 예상 비용은 10~30달러 범위입니다.

API 개발자/모델 서비스 제공업체:

  • 자체 구축된 대체 비용 비교: 67개 과목과 각 과목의 약 170개 질문을 다루는 중국어 평가 세트를 처음부터 구축하는 경우 문제를 개발, 검토, 테스트 및 보정하기 위해 주제 전문가를 고용해야 합니다. 예상 인건비는 수십만 위안이다. CMMLU는 검증된 문제 은행과 기준선을 라이선스 비용 없이 직접 제공함으로써 이 비용을 0으로 줄입니다.
  • 통합 비용: 평가 스크립트는 Hugging Face 변환기 및 데이터 세트 라이브러리를 기반으로 하며 추가 조정 없이도 주류 모델 프레임워크와 자연스럽게 호환됩니다. CMMLU 평가를 모델 훈련 파이프라인에 통합하는 데 드는 엔지니어링 비용은 일반적으로 1~2일(man-day) 이내입니다.

기업/기관:

  • 비공개 배포: 데이터 세트는 완전히 오프라인으로 사용할 수 있으며 데이터 보안 및 규정 준수 요구 사항을 충족하기 위해 외부 API에 의존하지 않습니다. 평가 결과는 지역을 벗어나지 않으며 데이터 수출에 엄격한 제한이 있는 금융, 의료, 공무 등 산업에 적합합니다.
  • 숨겨진 비용 - 평가 프로토콜 일관성: 프롬프트 템플릿 소수 샘플 선택 및 답변 추출 논리에서 여러 팀 간의 작은 차이로 인해 3~5% 포인트의 점수 편차가 발생할 수 있습니다. 수평적으로 비교 가능한 결과를 얻으려면 공식적으로 권장되는 평가 매개변수(제로샷 또는 5샷, 통합 프롬프트 형식)를 엄격하게 구현해야 합니다. 프로토콜이 조화되지 않으면 보고된 점수를 비교할 수 없을 수도 있습니다.

CMMLU의 주요 기능

  • 다학제간 표준화된 문제은행: 67개 과목으로 인문학(중국문학, 역사, 철학 등), 사회과학(법학, 경제, 교육학 등), 이공계(수학, 물리학, 컴퓨터 등), 중국특화지식(중국정치, 중국지리, 중국민속학 등)의 4개 분야로 구성되어 있습니다. 각 과목에는 약 170개의 질문이 있으며, 4지 선택 형식, 25%의 무작위 기준이 있습니다. 사용 가치: 중국어 지식 능력에 대한 표준화된 측정 척도를 제공하여 다양한 모델을 동일한 척도에서 비교할 수 있도록 합니다.

  • 유연한 평가 프레임워크: 제로샷과 퓨샷(기본 5샷)의 두 가지 평가 설정을 지원합니다. 프롬프트 템플릿, 예제 수 및 순서는 다양한 모델의 최적 성능 범위에 맞게 조정될 수 있습니다. 사용 가치: 팀은 단일 스타일로 인한 편차를 방지하기 위해 모델 유형(기본 및 명령 미세 조정)을 기반으로 가장 적절한 평가 설정을 선택할 수 있습니다.

  • 오픈 소스 기준 결과: 창고는 GPT-4, Claude, Qwen, Baichuan, InternLM, Yi 및 기타 시리즈를 포함한 다양한 분야의 여러 주류 모델의 정확도 기준을 공개했습니다. 사용가치: 신모델팀은 처음부터 기준체계를 구축하지 않고도 기준 대비 역량 수준을 직접 판단할 수 있습니다.

  • 과목별 능력 진단: 평가 스크립트는 각 과목의 독립적인 정확도를 출력하고 수평 비교를 위한 레이더 차트 또는 히스토그램을 자동으로 생성할 수 있습니다. 사용 가치: 모델이 강한 과목(예: 중국 역사, 문학)과 약한 과목(예: 고급 수학, 물리학)을 정확하게 찾아 데이터 매칭 및 훈련 전략 조정을 위한 정량적 기반을 제공합니다.

  • 커뮤니티 확장성: 데이터 세트와 코드는 대중에게 완전히 공개됩니다. 연구팀은 주제를 추가 또는 삭제하고, 질문을 수정하고, 새로운 모델 기준선을 추가하거나, 평가 스크립트에서 인터페이스를 추출하여 사용자 정의 테스트 파이프라인에 삽입할 수 있습니다. 사용 가치: 특정 산업(예: 법률, 의학)을 대상으로 하는 팀은 CMMLU를 기반으로 수직 현장 평가 세트를 구축하고 기성 평가 도구 체인을 재사용할 수 있습니다.

전문가 의견: CMMLU의 "과목 수준 진단"과 "기준선 비교"는 서로 관련되어 있습니다. 기준선은 참조 프레임을 제공하고 과목 점수는 단점을 찾습니다. 이 둘의 조합을 통해 모델 팀은 더 이상 모델의 품질을 측정하기 위해 전체 점수에만 의존하지 않고 "어느 대상이 X%만큼 더 나쁜지"를 정확하게 판단할 수 있습니다. 이 링크는 훈련 데이터 비율의 최적화, 코스 학습 전략의 설계, 도메인 강화 및 미세 조정을 위한 데이터 선택에 대한 직접적인 지침이 됩니다.

CMMLU의 모델 및 버전 진화

메인라인 출시

  • 논문 첫 번째 버전(2023-06): arXiv 논문 공개 데이터 세트 v1.0 및 평가 합의와 함께 67개 주제 부문 및 5샷 평가 사양이 설정되었습니다. 이 백서는 또한 GPT-4, ChatGPT 및 여러 초기 중국 모델의 기본 결과를 보고합니다. 이는 CMMLU의 초기 이정표이며 모든 후속 업데이트는 이 릴리스를 기반으로 합니다.

  • 데이터 세트 업데이트(~2024): 커뮤니티 피드백을 바탕으로 일부 과목의 문제 오류 및 답변 표시 문제가 수정되었으며 소수의 새로운 과목 문제가 추가되었습니다. 공식 버전 번호는 별도로 기재되지 않으며, 업데이트 기록은 GitHub 커밋 로그를 따릅니다. 변경사항: 수십개 정도의 오류가 수정되었으며, 총 과목수는 67개로 변동이 없습니다.

  • 지속적인 유지 관리 기간(2024년~현재): 창고는 이슈를 사용하여 커뮤니티에서 피드백된 문제 보고서 및 제안을 관리하고 정기적으로 PR을 병합 및 수정합니다. 기준 점수 테이블은 새로운 모델이 출시됨에 따라 지속적으로 업데이트되지만 데이터 세트 온톨로지의 구조적 변화는 안정적인 경향이 있습니다. 변경 포인트: 기본 모델의 수는 계속 증가하고 있으며 데이터 세트의 핵심 구조는 크게 변경되지 않았습니다.

버전 컨텍스트의 핵심 사항

CMMLU의 버전 진화 기능은 "일회성 데이터 세트 공개 + 기준선의 지속적인 업데이트"라는 학술 벤치마크 모델로, 상용 제품의 의미론적 버전 관리와는 다릅니다. 데이터 세트 자체는 출시 이후 정오표 수준에서만 수정되었으며 구조적 확장이나 버전 번호 점프는 발생하지 않았습니다. 인용할 때는 논문 출판 날짜와 GitHub 커밋 해시가 우선합니다.

버전 마일스톤 날짜 핵심 변경 사항
첫 번째 논문 발표 ~2023-06 공개 67개 주제 데이터 세트 v1.0, 평가 스크립트, 기준 점수
정오표 업데이트 ~2024 일부 문제 오류 수정, 제목 보충, 버전넘버 점프 없음
지속적인 유지관리 2024년~현재 기본 모델은 계속 확장되고 데이터 세트 구조는 안정적으로 유지됩니다

CMMLU의 기술적 장점

메커니즘: CMMLU는 "정적 데이터 세트 + 로컬 평가 스크립트"의 오프라인 평가 아키텍처를 채택합니다. 데이터 세트는 질문 어간, 4가지 옵션, 각 질문의 정답 인덱스를 JSON 형식으로 저장합니다. 평가 스크립트는 순차적으로 질문을 읽고, 프롬프트를 구성하고, 모델 추론을 호출하고, 답변을 비교하고, 주제별로 정확도를 계산합니다.

효과:

  • 오프라인에서 완전히 재현 가능: 모든 평가 논리는 로컬로 실행되며 외부 서비스에 의존하지 않습니다. 동일한 버전의 데이터 세트와 스크립트를 사용하는 모든 팀은 일관된 결과를 얻을 수 있습니다. 이는 API 버전 차이, 서비스 업데이트, 온라인 리뷰의 무작위 샘플링 등 통제할 수 없는 요인으로 인해 발생하는 점수 간섭을 제거합니다.

  • 세밀한 대상 진단: 67개 대상의 세분화는 중국 평가 벤치마크의 최전선에 있습니다. MMLU의 57개 과목을 C-Eval의 52개 과목과 비교하여 CMMLU는 "중국 고유의 지식" 범주에 많은 하위 항목(예: 중국 정치 체제, 중국 민속, 고대 중국 역사 등)을 추가하여 모델의 중국 현지 지식 숙달도를 개별적으로 측정할 수 있습니다.

  • MMLU를 통한 보완적 디자인: CMMLU와 MMLU의 주제 설정은 단순히 한-영 번역에만 관련된 것이 아닙니다. MMLU가 다루는 학문 분야는 서구 지식 시스템을 기반으로 하는 반면, CMMLU는 중국 고유의 수많은 지식과 평가 차원을 추가합니다. 동일한 모델에서 MMLU와 CMMLU를 동시에 실행함으로써 "일반 지식 능력"과 "중국어 문맥 지식 능력"이라는 두 가지 차원의 차이를 분리할 수 있습니다. 예를 들어, MMLU에서 잘 수행되는 모델은 CMMLU의 중국 관련 지식 범주에서 낮은 점수를 받을 수 있으며, 이는 모델이 중국 사전 학습 데이터에서 중국 문화에 대한 적용 범위가 충분하지 않음을 나타냅니다.

적용 가능한 시나리오: CMMLU는 출시 전 최종 홍보 지표보다는 모델 개발 단계의 기능 진단 도구로 더 적합합니다. 훈련 과정 중에 정기적으로 CMMLU 평가를 실행하면 특정 주제에서 모델 성능 저하(과잉 정렬로 인한 사실 지식 망각 등)를 즉시 감지할 수 있습니다. 보고서를 게시하려면 단일 벤치마크 점수에 대한 과도한 해석을 피하기 위해 CMMLU를 C-Eval, MMLU, AGIEval 등과 결합하여 평가 제품군을 구성하는 것이 좋습니다.

CMMLU 사용법

입국 통제:

입구 목적 비용
GitHub 저장소(haonan-li/CMMLU) 데이터 세트 다운로드, 평가 스크립트, 기준 결과, 문서화 무료
arXiv 논문 방법 설명, 대상 정의, 초기 기준선 무료
포옹하는 얼굴 데이터세트 데이터 세트 라이브러리를 통해 CMMLU 직접 로드 무료

일반적인 단계:

  1. 데이터세트 가져오기: git clone https://github.com/haonan-li/CMMLU.git 또는 datasets.load_dataset("haonan-li/cmmlu")를 통해 직접 로드합니다.
  2. 모델 준비: 평가할 모델이 Hugging Face 변환기의 AutoModelForCausalLM을 통해 로드될 수 있는지 확인하거나 호환 가능한 추론 인터페이스를 구현할 수 있습니다.
  3. 평가 실행: 평가 스크립트를 실행하고, 모델 경로, 평가 설정(제로샷 또는 5샷), 출력 디렉터리 및 기타 매개변수를 지정합니다. 예제 명령: python eval.py --model Qwen/Qwen2-7B --shot 5 --output ./results.
  4. 결과 보기: 스크립트는 각 과목의 정확도와 전체 평균 정확도를 출력하고, 과목 간의 시각적 비교 차트도 생성합니다.

적응 팁:

  • 프롬프트 형식은 통일되어야 합니다: 다양한 프롬프트 템플릿(예: 역할 설명 추가 여부, 중국어 명령 접두사 사용 여부)으로 인해 점수가 2~5% 포인트 변동될 수 있습니다. 점수를 보고할 때 사용된 프롬프트 버전을 기록해야 합니다. 그렇지 않으면 결과를 비교할 수 없습니다.
  • Few-shot 샘플의 무작위성: 5-shot 평가에서는 샘플이 선택되는 순서가 모델 성능에 영향을 미칩니다. 단일 샘플링의 분산을 줄이기 위해 무작위 시드를 수정하고 여러 실행에 걸쳐 평균을 내는 것이 좋습니다.
  • 디코딩 매개변수 제어: 샘플링 전략에 의해 도입된 무작위성이 정확도 통계를 방해하지 않도록 평가에서는 그리디 디코딩(온도=0)을 사용해야 합니다.
  • 모델 토크나이저 호환성: 일부 모델의 토크나이저는 한자를 다양한 방식으로 분할합니다. 이는 프롬프트의 실제 토큰 길이와 주제에 대한 모델의 이해에 영향을 미칠 수 있습니다. 공식적인 평가 전에 작은 샘플에서 프롬프트가 올바르게 인코딩될 수 있는지 확인하는 것이 좋습니다.

CMMLU 제품 가격

  • 청구 모델: 완전 무료이며 오픈 소스입니다. 라이센스 비용, 구독료, 종량제 결제가 없습니다.
  • 포함 비용: 평가에 필요한 컴퓨팅 성능은 사용자가 부담합니다. 모델 규모에 따라 단일 전체 평가에 대한 컴퓨팅 전력 비용은 1~30달러입니다(주요 클라우드 GPU 주문형 가격 기준).
  • 기업 민영화: 데이터 세트는 아웃바운드 데이터 전송이나 추가 SaaS 비용 없이 완전히 오프라인으로 실행될 수 있습니다.
  • 숨겨진 용어 없음: GitHub 오픈소스 라이선스는 상업적 사용을 제한하지 않지만, CMMLU 점수를 인용할 때 결과 재현성을 유지하기 위해 데이터 버전 및 평가 설정을 표시해야 합니다.

CMMLU의 응용 시나리오

  • 모델 개발 단계의 역량 진단: 사전 학습 또는 미세 조정 과정에서 정기적으로 CMMLU 평가를 실행하여 다양한 주제에서 모델 역량의 변화 추세를 모니터링합니다. 실제 이점: 특정 대상의 기능 저하를 조기에 감지할 수 있으며(예: 모델이 과잉 정렬 후 중국 역사적 지식을 잊어버림) 학습 데이터 비율이나 학습 전략을 적시에 조정할 수 있습니다. 수락 초점: 체크포인트가 다음 단계에 진입할 수 있는지 여부에 대한 액세스 조건으로 주체 수준 정확도 임계값(예: 각 주체가 기준 수준의 90%보다 낮아서는 안 됨)을 설정합니다.

  • 모델 릴리스의 역량 선언문: 기술 보고서 ​​또는 릴리스 발표에서 CMMLU 점수를 중국어 지식 숙련도의 정량적 증거로 보고합니다. 실제 이점: 업계 내에서 비슷한 수준의 역량을 제공하고 사용자가 선택할 때 정보 비대칭성을 줄입니다. 수용성 문제: 점수 보고 시 평가 설정(제로샷/5샷, 프롬프트 버전, 디코딩 매개변수)도 참고해야 하며, 교차 검증을 위해 동일한 조건의 C-Eval 및 MMLU 점수를 보완해야 합니다.

  • 학술적 연구 및 벤치마크 비교: NLP 연구자들은 CMMLU를 중국어 이해를 위한 평가 도구로 사용하고, 이 벤치마크에 대한 모델의 성능을 논문으로 보고하거나 CMMLU를 기반으로 한 평가 방법 연구(예: 신속한 민감도 분석, 데이터 오염 탐지 등)를 수행합니다. 실제 이점: 중국 NLP 연구를 위한 표준화된 평가 플랫폼을 제공하고 새로운 모델과 새로운 방법의 평가 비용을 절감합니다.

  • 수직분야 모델 선정 평가: 중국 산업(법률, 의료, 금융 등)의 대형 모델 선정 시, CMMLU의 해당 학문분야(법학, 의학, 경제학 등) 점수를 선정 기준 차원 중 하나로 활용합니다. 실질적인 이점: 지식 범위의 관점에서 대상 분야에서 확실한 장점이 있는 모델을 빠르게 선택할 수 있고 테스트 범위를 줄일 수 있습니다. 인정 고려사항: 해당 과목 점수만 참고해야 하며, 전체 평균 점수가 분야별 평가를 대신할 수는 없습니다.

CMMLU 적용 그룹

  • 대형 모델 알고리즘 엔지니어 및 연구원: 모델 훈련 효과를 검증하고, 능력 저하를 감지하고, 다양한 훈련 전략의 영향을 비교하려면 표준화된 중국어 지식 평가가 필요합니다. CMMLU에서 제공하는 과목별 진단을 통해 데이터 할당 조정 및 강좌 학습 설계를 직접적으로 안내할 수 있습니다. 전제조건: 모델 추론 및 기본적인 Python 스크립트 실행 능력을 보유하고 있어야 합니다.

  • NLP 학술 연구원: 중국어 이해, 평가 방법론, 데이터 오염 감지 등에 대한 연구에 참여하고 있으므로 실험 플랫폼으로 공개적으로 재현 가능한 벤치마크 세트가 필요합니다. CMMLU의 오픈 소스 특성과 세분화된 주제 구분은 실험 설계에 유연성을 제공합니다. 전제 조건: Hugging Face 생태계 및 표준 평가 프로세스에 익숙합니다.

  • 모델 선택 및 조달 의사결정권자: 기업이 대형 모델을 구매하거나 오픈 소스 모델 기반을 선택할 때 CMMLU 점수를 중국 지식 역량에 대한 정량적 참조 지표 중 하나로 사용합니다. 전제조건: 객관식 질문 벤치마크의 한계를 이해하고 이를 의사결정의 유일한 기초로 사용하지 않아야 합니다.

  • ❌ 사람에게 적합하지 않음:

    • 대화, 글쓰기, 번역 등 사용 가능한 기능에 직접 액세스하려는 최종 사용자. - CMMLU는 검토 도구이지 응용 제품이 아닙니다.
    • 모델 추론의 깊이, 창의성, 여러 라운드의 대화 품질을 평가해야 하는 시나리오(객관식 질문 형식으로는 측정할 수 없는 차원)
    • 모형선정 시 하나의 전체점수만을 참고하는 의사결정자 - 객관식 문제 벤치마크는 데이터 오염의 영향을 받으며, 전체점수가 주요 과목의 심각한 결점을 커버할 수 있음. 다른 평가 및 실제 측정과 함께 종합적인 판단이 이루어져야 합니다.

요약 및 전망

핵심 역량: CMMLU는 67개 분야의 세분화된 구분, 중국 관련 지식의 주요 적용 범위, 완전히 오프라인에서 재현 가능한 오픈 소스 아키텍처를 통해 중국 대형 모델 평가 환경에서 없어서는 안될 부분이 되었습니다. 이는 C-Eval을 보완합니다. 전자는 일반 과목의 난이도 구배에 초점을 맞추고, 후자는 중국 현지 지식의 깊이에 초점을 맞춥니다. 이 둘의 조합은 모델의 중국어 지식 능력 구조를 보다 완벽하게 특징짓을 수 있습니다.

현재 제한사항:

  • 데이터 오염 위험: 정적 공개 데이터 세트는 사전 훈련 단계에서 모델에 의해 쉽게 "미리 확인"되어 잘못된 높은 점수를 얻습니다. 현재 CMMLU에는 동적 질문 생성이나 정기적인 새로 고침 메커니즘이 없으며 고정 버전에 장기적으로 의존하면 점점 더 많은 오염 문제에 직면하게 됩니다.
  • 단일 질문 유형: 객관식 질문이 4개만 있으며 모델의 생성 추론, 다단계 추론, 개방형 질문 및 답변 기능을 평가할 수 없습니다. 높은 점수는 암기된 사실적 지식의 양만을 반영할 뿐 실제 응용에서의 성과를 보장하지는 않습니다.
  • 주제 적용 범위에 여전히 격차 있음: 이미 67개 교과목의 밀도가 높지만, 신흥 학제간 주제(AI 윤리, 컴퓨터 사회 과학 등)와 일부 수직 산업(제약, 금융 공학 등)에서는 적용 범위가 부족합니다.
  • 평가 프로토콜의 불충분한 표준화: 팀 간 프롬프트 템플릿의 몇 번의 샷 설정 및 답변 추출의 차이로 인해 여전히 직접적으로 비교할 수 없는 점수가 발생합니다. 커뮤니티에는 보다 엄격한 표준 평가 프로토콜이 필요합니다.

추가 관찰 포인트:

  • CMMLU가 데이터 오염에 대처하기 위해 "프라이버시 세트"의 동적 평가 버전을 출시할지 여부.
  • 사용자가 응용 시나리오에서 객관식 시험 점수의 실제 의미를 이해할 수 있도록 실제 작업 평가(예: Baichuan-TextEval, SuperCLUE)와 연관시키고 변환할 수 있습니까?
  • 커뮤니티가 CMMLU 프레임워크를 기반으로 수직 산업 확장 세트(예: CMMLU-Med, CMMLU-Law)를 구축할지 여부.
  • 주류 모델의 점수가 CMMLU에 수렴된 후 벤치마크가 차별성을 유지하기 위해 난이도를 높이거나 적대적인 샘플을 도입해야 하는지 여부.

조달 및 채택 위험 평가: CMMLU를 평가 시스템에 통합하려는 팀의 경우 다음 단계를 수행하는 것이 좋습니다. 단기(1~2주) 이를 기존 평가 파이프라인에 통합하고 MMLU 및 C-Eval과 동시에 실행하고 기준 비교를 설정합니다. 사전 훈련 데이터 비율 조정을 안내하기 위해 CMMLU의 주제 수준 진단 결과에 중기(1-3개월) 초점을 맞춥니다. 장기간(6개월 이상) CMMLU를 면밀히 추적합니다. 관찰된 커뮤니티 보고 점수 인플레이션이 합리적인 범위를 초과하는 등 데이터 오염 경향을 다른 이질적인 평가 지표를 보완하기 위해 고려해야 합니다. 상용 모델의 성능 설명에는 CMMLU 외에 항상 동일한 조건에서 MMLU 및 C-Eval 점수를 공개하고, 평가 불일치로 인해 모델 선택이 오도되는 일이 없도록 평가 설정(샷 번호, 프롬프트 버전, 디코딩 매개변수)을 명확하게 표시하는 것이 좋습니다.

관련 도구: hugging-face, replicate

버전 정보

  • CMMLU 평가 벤치마크(GitHub 오픈 소스) :오픈소스 종합 중국어 지식 평가 벤치마크는 인문학, 사회과학, 과학 및 공학, 중국어 관련 지식의 객관식 문제를 다룹니다. 데이터 세트, 평가 스크립트 및 기준 점수를 제공합니다. 공식 버전은 창고와 종이를 기반으로 합니다. 연속된 부 버전 번호는 별도로 나열되지 않습니다. 날짜는 대략적인 것입니다.
  • CMMLU 논문 및 데이터 세트 최초 출시 :데이터 세트와 평가 프로토콜은 논문과 함께 공개하고, 주제 구분과 기준 평가 방법을 확립한다. 후속 조치는 주로 창고 업데이트 및 결과 보완에 중점을 둘 것입니다. 관계자는 정확한 날짜를 공개하지 않았으며 대략적인 날짜입니다.

사용자 후기

  • 후기를 불러오는 중...