투기장
무료
Arena(이전 LMArena / LMSYS Chatbot Arena)는 UC Berkeley 연구진이 출시한 커뮤니티 중심의 AI 리뷰 플랫폼입니다. 전투 모드와 커뮤니티 투표 메커니즘을 통해 사용자는 실제 시나리오에서 다양한 모델의 출력 품질을 비교할 수 있으며, 8,200만 개 이상의 실제 선호도를 기반으로 공개 순위를 형성할 수 있습니다. 텍스트, 코드, 이미지 및 비디오 에이전트와 같은 다중 모드 평가 차원을 포괄하며 기업 및 모델 실험실을 위한 상용 평가 서비스도 제공합니다.
아레나
아레나의 핵심 매개변수 및 통계
Arena(구 LMArena / LMSYS Chatbot Arena)는 UC Berkeley 연구팀이 설립한 커뮤니티 중심의 AI 평가 플랫폼입니다. 공식적으로는 "현실 세계에서 AI 성능을 이해하기 위한 커뮤니티 기반 플랫폼"으로 자리매김했습니다. AI 대화 도우미도 모델 훈련 프레임워크도 아닌 '모델 생산자'와 '모델 소비자'를 연결하는 평가 인프라입니다. 8,200만 개 이상의 실제 인간 투표를 통해 텍스트, 코드, 이미지, 비디오 에이전트 등 다양한 차원을 포괄하는 공개 순위를 형성합니다.
| 프로젝트 | 공공정보 |
|---|---|
| 공식 포지셔닝 | 커뮤니티 기반 AI 평가 플랫폼 |
| 전임자 | LMSYS 챗봇 아레나 → LM아레나(2025) → 아레나(2026) |
| 평가차원 | 텍스트, 코드(WebDev/Image-to-WebDev), 이미지 생성/편집, 영상 생성/편집 비전, 문서, 검색, Agent |
| 커뮤니티 규모 | 1,000만 명 + 월간 활성 방문자 7억 명 + 대화 8,200만 명 + 표 |
| 비즈니스 모델 | 무료 커뮤니티 티어 + 엔터프라이즈 평가 서비스(AI 평가) |
| 자금조달상황 | $100M 시드(2025.05) → $150M 시리즈 A(2026.01) |
| 연간 수익 | $100M ARR (2026.06 기준, 기업 서비스는 8개월 동안 온라인 상태였습니다) |
| 소속 장소 | 미국(캘리포니아주 버클리) |
| 지원 플랫폼 | 웹 |
간략한 설명: 아레나는 본질적으로 "AI 모델 평가 필드"입니다. 사용자가 모델을 선택하고 채팅을 할 수는 없지만 배틀 모드와 커뮤니티 투표를 통해 "어떤 모델이 더 좋은가"라는 주관적인 인상을 정량화 가능한 커뮤니티 합의로 변경합니다.
핵심 메커니즘: 사용자가 프롬프트 단어를 입력하면 시스템은 두 모델의 출력을 익명으로 표시하고 사용자는 자신의 판단에 따라 더 나은 답변에 투표합니다. 투표 결과는 공개 순위를 결정하며 오픈 소스 데이터 세트는 학술 및 산업 연구에 사용할 수 있습니다. 이 메커니즘은 평가 결과를 정적 벤치마크의 과적합 지표가 아닌 실제 인간 선호도에 더 가깝게 만듭니다.
수익 구조: Arena는 기업 평가 서비스가 출시된 지 8개월 만인 2026년 6월에 연간 1억 달러의 수익을 달성할 예정입니다. 성장은 주로 Model Lab의 맞춤형 평가 서비스와 기업 고객을 위한 선택 지원에서 비롯됩니다. 1억 5천만 달러 규모의 시리즈 A는 Felicis와 UC Investments가 공동 주도하고 a16z, Kleiner Perkins, Lightspeed 등이 참여했습니다.
아레나의 사용자와 시장 인지도
Arena의 시장 인지도는 커뮤니티 측의 데이터 규모 효과와 기업 측의 상업적 검증이라는 두 가지 명확한 경로에서 비롯됩니다.
커뮤니티 측면의 데이터 밀도: 공식 공개에 따르면 플랫폼에는 총 7억 + 8,200만 대화 + 1,000만 + 월간 활성 방문자가 있습니다. 이러한 수치의 중요성은 트래픽 자체에 있는 것이 아니라 "인간 선호도 데이터"가 부족하다는 데 있습니다. 대부분의 모델 검토는 정적 벤치마크나 판사로서의 LLM에 의존하는 반면 Arena는 공개 작업에 대한 실제 사용자의 판단을 유지합니다. Arena는 HuggingFace(lmarena-ai)에 대한 최대 규모의 인간 선호도 데이터 세트를 오픈 소스화했으며, 이는 여러 모델링 실험실 및 학술 기관에서 인용됩니다.
기업 측면의 성장 곡선: 기업 평가 서비스는 출시 후 8개월 만에 ARR 1억 달러에 도달했습니다. 이는 모델 연구소와 대기업이 "실제 인간 피드백을 기반으로 한 독립적이고 투명한 평가"에 대한 엄격한 요구를 갖고 있음을 나타냅니다. 오픈 소스 모델과 비공개 소스 모델을 모두 포함하는 400개 이상의 새로운 모델이 Arena를 통해 공개적으로 평가되었습니다. 에이전트 모드는 출시 후 한 달 만에 월 500만 회 이상의 상호 작용 라운드를 달성했으며 주당 10% 증가했습니다. 이는 다단계 에이전트 평가가 현재 시장에서 가장 시급한 격차 중 하나임을 입증합니다.
학술적 영향: Arena 팀은 ICML 2024(Chatbot Arena 논문), NeurIPS 2023(LLM-as-a-judge), ICLR 2025(RouteLLM), ICML 2025(Prompt-to-Leaderboard, Arena-Hard) 등 최고의 컨퍼런스에서 평가 방법론 논문을 발표했으며 순위 방식은 커뮤니티의 사실상 표준 중 하나가 되었습니다.
전제 조건: 평가 플랫폼의 신뢰성은 투표 샘플의 다양성, 프롬프트 단어의 중립성, 순위 방법의 통계적 엄격성을 기반으로 합니다. 플랫폼 사용자는 주로 기술적인 사람들(X/Discord 커뮤니티가 활성화되어 있음)이며 샘플 편견은 특정 사용 시나리오에 편향될 수 있습니다. 이는 순위를 해석할 때 고려해야 할 요소이다.
아레나의 비용 우위
- C사이드/개인 : 핵심 기능 체험을 위해 주로 무료 버전을 제공하며, 빈도가 높은 경우에는 유료 패키지 가입이 필요합니다.
- API/개발자: 호출량에 따라 비용이 청구되며 자체 시스템에 유연하게 통합할 수 있는 개발팀에 적합합니다.
- 기업/민영화: 맞춤형 견적 및 배포 계획은 사업주에게 문의하세요. 구체적인 가격은 공식 실시간 가격 페이지에 따릅니다.
아레나의 주요 기능
Arena의 기능은 "채팅 상자와 순위 목록"이 아니라 "평가-라우팅-순위-데이터 피드백"을 중심으로 구축된 포괄적인 시스템입니다.
-
배틀 모드(익명 모델 비교): 사용자가 프롬프트 단어를 입력하면 두 명의 익명 모델이 이를 동시에 출력하고 사용자가 투표하여 더 나은 답변을 선택합니다. 이것이 Arena의 핵심 데이터 수집 메커니즘입니다. 핵심 디자인은 브랜드 편견을 제거하기 위한 익명성, 순위 노이즈를 줄이기 위한 무작위 페어링, 그리고 ELO 채점 시스템은 시간이 지나도 안정적인 순위를 제공하는 것입니다. 숨겨진 연결: 각 투표는 순위 업데이트, Max 라우팅 모델 학습, 오픈 소스 데이터 세트 확장 등 세 가지 값을 동시에 생성합니다. 데이터 수집, 라우팅 최적화, 커뮤니티 기여라는 세 가지 작업을 한 번의 작업으로 완료합니다.
-
다차원 순위 시스템: 단순한 "전체 순위"가 아니라 기능과 모드에 따라 13개 이상의 세분화된 순위로 나뉩니다: 전체, 에이전트, 텍스트, WebDev, 이미지-웹Dev, 텍스트-이미지, 이미지 편집, 텍스트-비디오, 이미지-비디오, 비디오 편집, 비전, 문서, 검색 등 전문가 견해: 세분화 목록의 값은 혼란을 없애기 위한 것입니다. 전체에서 높은 순위를 매긴 모델이 수행할 수 있습니다. WebDev 시나리오에서는 평범합니다. 분할 목록은 "가장 적합한 모델 선택"에서 "이 작업에 가장 적합한 모델 선택"으로 선택을 변경합니다.
-
Max Model Router: 사용자 팁을 가장 적합한 모델에 자동으로 배포하는 커뮤니티의 500만 개 이상의 투표 데이터를 학습한 지능형 라우팅 엔진입니다. 공학적 의미: Max는 본질적으로 인간 선호도 훈련을 기반으로 한 "모델 추천 시스템"입니다. 그 존재는 Arena가 평가 플랫폼일 뿐만 아니라 점차 모델 스케줄링의 의사 결정 계층이 되고 있음을 의미합니다.
-
에이전트 모드(다단계 작업 평가): 2026년 6월에 출시된 새로운 평가 모드로 에이전트 시나리오의 객관적인 작업 완료율과 환각율을 측정합니다. 기존의 정적 벤치마크와 달리 에이전트 모드는 개방형 컨텍스트에서 다단계 추론 및 도구 호출을 수행하는 모델의 능력을 평가합니다. 출시 후 한 달 만에 월간 상호작용 500만 건 이상을 달성했는데, 이는 에이전트 평가에 대한 시장 수요가 기대치를 훨씬 뛰어넘는다는 것을 의미합니다.
-
기업 평가 서비스(AI 평가): 출시 전 모델 검증, 경쟁 제품 비교, 세분화된 역량 분석을 포함하여 모델 실험실 및 기업을 위한 맞춤형 평가를 제공합니다. 핵심 가치: 내부 평가팀은 표본 크기가 부족하고 평가 차원이 고정되어 있는 문제에 직면하는 경우가 많습니다. Arena의 엔터프라이즈 서비스는 실제 인간 투표 풀에 액세스하여 이 두 가지 병목 현상을 해결합니다.
아레나의 모델과 버전의 진화
Arena는 AI 모델 자체가 아니므로 버전 진화는 플랫폼 기능 계층의 지속적인 확장에 반영됩니다.
- 2025.09 기업 평가 서비스 런칭 : 순수 커뮤니티 프로젝트에서 정식 상용화 단계에 돌입, AI 평가 맞춤형 평가 서비스 출시.
- 2025.11 아레나 전문가: 전문가 수준의 평가 모드가 도입되고, 평가 방법론 및 순위 알고리즘이 체계적으로 업그레이드되며, 순위 목록이 모델 간의 작은 차이에도 더욱 민감해집니다.
- 2026.01 브랜드 업그레이드 + 시리즈 A: LMArena는 Arena로 이름이 변경되어 '챗봇 경기장'에서 더 광범위한 AI 평가 플랫폼으로 재배치됩니다. 같은 기간 1억5000만 달러 규모의 시리즈A 파이낸싱을 완료했다.
- 2026.02 Max Model Router: 500만 개 이상의 커뮤니티 투표를 기반으로 학습된 지능형 라우팅 엔진 출시로 Arena의 기능이 "수동 평가"에서 "능동 스케줄링"으로 전환됩니다.
- 2026.05 Multimodal Extension: Fullstack Code Arena 하위 분류 순위(WebDev, Image-to-WebDev 등)를 추가하고 다중 모드 모델 라우팅을 지원하는 Multimodal Max를 출시했습니다.
- 2026.06 에이전트 모드: 온라인 에이전트 평가 기능으로 개방형 다단계 작업 평가를 지원하며 에이전트 신뢰성 평가에 대한 업계의 긴급한 요구에 직접적으로 대응합니다.
- 2026.07 사실 정확도 순위: AI 모델의 "환각 평가의 어려움"이라는 오랜 문제점에 대응하여 인간 선호도 외에 객관적인 사실 정확성의 차원을 도입하는 사실성 리더보드를 추가했습니다.
진화 본선: '텍스트 대화 평가'를 시작으로 코드, 이미지, 영상 에이전트, 실용성 등의 차원을 순차적으로 다루면서 '순수 평가'에서 '평가 + 라우팅 + 엔터프라이즈 서비스'의 비즈니스 관계로 확장됩니다. 각 버전 업데이트는 AI 평가와 관련해 업계가 우려하는 지점에 해당한다.
아레나의 기술적 장점
Arena의 기술적 가치는 단일 모델의 성능이 아니라 평가 엔지니어링 시스템의 설계 깊이와 데이터 플라이휠의 규모 효과에 있습니다.
ELO 순위 시스템의 통계적 엄격함: Arena는 향상된 ELO 점수 시스템을 사용하여 익명 페어링, 무작위 순서 및 충분한 샘플링을 통해 순위 편향을 줄입니다. 순위 방법론 문서는 ICML의 동료 검토를 거쳤으며 단순한 승률이나 평균 평점보다 통계적으로 더 신뢰할 수 있습니다. 인과 사슬: 엄격한 순위 방법론 → 더 신뢰할 수 있는 순위 → 커뮤니티의 투표 참여 의향이 더 높음 → 더 많은 데이터 → 더 정확한 순위.
대규모 인간 선호도 데이터의 부족: 7억 개 이상의 대화와 8,200만 개 이상의 투표가 세계에서 가장 큰 공개 인간 선호도 데이터 세트 중 하나를 구성합니다. 이러한 데이터의 가치는 "공개 작업 + 실제 사용자 + 다차원 선호도"에 있으며, 이는 정적 벤치마크(예: MMLU, GSM8K)의 과적합 위험과 다릅니다. HuggingFace의 오픈 소스 데이터 세트는 여러 모델 실험실의 평가 지원 리소스가 되었습니다.
Max 라우팅 엔진의 엔지니어링 재사용: Max의 추천 모델은 본질적으로 커뮤니티 투표 데이터의 부산물입니다. 동일한 데이터 스트림이 순위 업데이트와 라우팅 모델 교육을 모두 제공합니다. 이는 "더 많은 투표 → 더 정확한 라우팅 → 더 나은 사용자 경험 → 더 많은 사용자 투표"라는 긍정적인 피드백 루프를 형성합니다. 비용 관점에서 볼 때 라우팅 기능의 한계 교육 비용은 매 순간 무료 사용자가 교육 데이터를 생성하기 때문에 매우 낮습니다.
다중 모드 평가를 위한 통합 아키텍처: 텍스트, 코드, 이미지, 비디오와 같은 다양한 모드 에이전트는 "익명 비교 + 인간 투표 + ELO 순위 지정"이라는 동일한 기본 프레임워크를 공유하므로 새로운 평가 차원을 추가하는 데 드는 엔지니어링 비용이 절감됩니다. 에이전트 모드의 특징은 객관적인 완료율 측정 도입으로, 주관적인 선호도에 수치화 가능한 작업 성공률을 추가한 것입니다. 이 설계 아이디어는 후속 평가 표준화에 대한 참조를 제공합니다.
기술적 제약: 평가 시스템의 핵심 병목 현상은 기술적 구현이 아니라 적대적 조작의 거버넌스입니다. 즉, 특정 프롬프트 단어의 타겟 최적화를 통해 모델 실험실이 순위를 조작하는 것을 방지하는 방법, 투표 브러싱을 감지하는 방법, 프롬프트 어휘의 중립성과 신선도를 유지하는 방법입니다. 이러한 문제는 커뮤니티 규모가 지속적으로 성장함에 따라 더욱 두드러질 것입니다.
아레나 이용방법
Arena는 주로 웹을 통해 액세스되며 다양한 역할의 요구 사항에 맞는 여러 입구를 제공합니다.
| 사용 방법 | 군중에게 적합 | 작업 경로 | 일반적인 단계 |
|---|---|---|---|
| 전투 모드 | 모든 사용자 | arena.ai 홈페이지 → 작업 유형 선택 → 프롬프트 단어 입력 → 익명 출력 비교 → 투표 | 1분 안에 모델 비교 완료 |
| 직접적인 대화 | 특정 모델이 필요한 사용자 | arena.ai → 다이렉트 모드 → 모델 선택 → 대화 입력 | 다중 모델 채팅 클라이언트와 동일 |
| 순위 보기 | 기술 의사결정자 | arena.ai/leaderboard → 차원 선택(전체/에이전트/코드 등) | 등록하지 않고 보기 |
| 최대 라우팅 | 최적의 답변을 자동으로 받고 싶은 사용자 | arena.ai → Max Mode → 프롬프트 단어 입력 | 시스템이 자동으로 가장 적합한 모델을 선택합니다 |
| 에이전트 모드 | 다단계 작업 평가 | arena.ai/agent → 작업 목표 정의 → 모델 실행 과정 관찰 | 개방형 장기 작업 평가 지원 |
임원을 위한 빠른 시작: 기술 의사 결정권자가 Arena를 평가 도구로 사용할 수 있는지 평가할 때 필요한 세 단계는 다음과 같습니다. - ① arena.ai/leaderboard를 방문하여 세분화된 순위의 구조가 관심 있는 기능 차원을 포괄하는지 확인합니다. ② 일반 프롬프트가 아닌 나만의 비즈니스 프롬프트를 사용하여 배틀모드에서 10~20회 비교하여 결과의 차이가 실제 경험과 일치하는지 느껴보세요. ③ 기업 평가의 맞춤화 범위 및 데이터 격리 체계에 대해 알아보려면 [email protected]에 문의하세요.
데이터 소비 경로: 연구원과 경쟁 제품 분석 팀은 HuggingFace에서 오픈 소스 데이터세트(lmarena-ai)를 직접 다운로드할 수 있습니다. 여기에는 2차 분석 및 사용자 지정 순위 계산을 위한 완전한 익명 투표 기록과 모델 출력이 포함되어 있습니다.
아레나 제품 가격
가격 모델은 공식 실시간 페이지를 따릅니다. 일반적으로 부분 유료화 또는 구독 시스템이 채택됩니다. 기본 기능은 무료로 사용할 수 있으며, 고급 기능이나 자주 사용하려면 유료 구독이 필요합니다. 사용자는 실제 사용량을 기반으로 최적의 솔루션을 평가하는 것이 좋습니다.
아레나 적용 시나리오
Arena의 평가 인프라 기능은 다양한 의사 결정 링크에 포함될 수 있습니다.
-
모델 선택 및 조달 결정: 기업은 AI 모델을 구매하거나 액세스하기 전에 아레나 순위 및 맞춤형 비교를 통해 후보를 신속하게 좁힐 수 있습니다. 구현 팁: 분할된 순위의 값은 전체 순위보다 높습니다. 예를 들어 기본 시나리오가 프런트 엔드 코드 생성인 경우 전체 순위 대신 WebDev 및 Image-to-WebDev 순위에 집중해야 합니다. Arena를 통해 사전 심사를 먼저 진행하신 후, 후보 모델을 활용하여 자체 비즈니스 데이터를 대상으로 소규모 A/B 테스트를 진행하여 최종 결정을 내리는 것을 권장드립니다.
-
Model Lab의 반복 검증: 모델 개발팀은 출시 전 Arena의 기업 평가 서비스를 통해 독립적인 제3자 인간 선호도 평가를 획득하여 버전 개선 효과를 검증합니다. 비용 절감 및 효율성 향상: 기존 모델은 출시에 앞서 자체 평가팀과 주석 플랫폼을 구축해야 하며, 구축부터 출력까지 보통 3~6개월이 소요됩니다. Arena 기업 검토를 사용하면 이 주기를 2~4주로 단축할 수 있으며 검토 비용도 수십만 달러에서 계약에 합의된 연간 수수료 수준으로 절감됩니다.
-
에이전트 및 다단계 작업 신뢰성 평가: 에이전트 제품이 폭발적으로 증가함에 따라 기존의 단일 평가에서는 더 이상 다단계 추론 및 도구 호출 시나리오를 다룰 수 없습니다. Arena의 에이전트 모드는 고객 서비스 에이전트의 주문 완료율 및 코드 에이전트의 구성 성공률과 같은 객관적인 지표를 평가하는 데 사용할 수 있는 개방형 작업 컨텍스트를 제공합니다. 시나리오 문제점: 에이전트 평가의 가장 큰 어려움은 "최적 표준"을 정의하기 어렵다는 것입니다. 동일한 작업에 대해 서로 다른 실행 경로가 정확할 수 있습니다. 아레나 에이전트 모드는 인간의 판단과 목표 완료율의 혼합 평가를 도입하여 이 문제를 완화합니다.
-
교육 및 기술 전도: 교육 시나리오에서 Arena의 전투 모드는 다양한 모델이 동일한 프롬프트 단어를 처리하는 방식의 차이를 시각적으로 표시하여 학생들이 모델 기능의 경계를 이해하는 데 도움을 줍니다. 월간 활성 방문자 수가 1,010만 명이 넘는 커뮤니티 규모 자체도 교육 현장에서의 침투를 반영합니다.
아레나 적용 대상
Arena의 다층적 기능 설계는 네 가지 역할 유형을 제공하며, 각 계층마다 사용 깊이와 이점이 다릅니다.
-
AI 제품 관리자 및 기술 의사 결정자: 모델 선택이 필요한 사람들입니다. Arena의 핵심 가치는 모델 제조사와 독립적인 제3자 평가 데이터를 제공하는 것입니다. 권장 경로: 먼저 순위 목록을 사용하여 후보 범위를 좁힌 다음(1일), 배틀 모드를 사용하여 자신의 장면 데이터로 소규모 검증을 수행(3~5일)하고, 마지막으로 기업 평가에 문의하여 심층 평가를 수행합니다(1~2주). 부적합한 경계: 장면이 매우 수직적인 경우(의료 영상 진단, 법률 문서 검토 등) Arena의 일반 평가 데이터가 충분히 세분화되지 않을 수 있으므로 자체 데이터 세트에 대한 맞춤형 평가를 수행해야 합니다.
-
모델 개발자 및 AI 연구자: 모델 버전의 반복 효과를 검증해야 하는 사람. Arena의 기업 검토는 내부 검토 팀이 다루기 어려운 실제 인간 선호도 차원을 보완합니다. 오픈 소스 데이터 세트는 순위 방법론, 선호도 조정 및 모델 평가 기술에 대한 연구를 위한 귀중한 리소스이기도 합니다.
-
기업 조달 및 규정 준수 팀: 조직의 AI 벤더를 선택해야 하는 사람들의 그룹입니다. Arena의 세분화된 순위 및 공개 방법론은 재사용 가능한 선택 데모 자료를 제공합니다. 경계에 적합하지 않음: 평가 플랫폼의 데이터는 모델 보안에 대한 완전한 평가를 구성하지 않습니다. 시나리오에 민감한 데이터 또는 엄격한 규정 준수 요구 사항(예: HIPAA, GDPR)이 포함된 경우 독립적인 보안 감사 및 규정 준수 검토가 여전히 필요합니다.
-
AI 매니아 및 얼리 어답터: 여러 모델에 무료로 액세스할 수 있는 전투 모드를 통해 최첨단 모델 기능의 차이점을 알아보세요. 이러한 사용자는 플랫폼 투표 데이터의 주요 기여자이기도 합니다.
아레나 개요 및 전망
Arena의 핵심 경쟁력은 "커뮤니티 중심의 데이터 플라이휠 + 상업용 평가 서비스"의 2륜 모델에 있습니다. 8,200만 개 이상의 실제 인간 투표가 매우 높은 데이터 장벽을 구성하고 기업 평가 서비스의 급속한 성장(8개월 내에 1억 달러 ARR)이 상업적 측면에서 이 자산의 수익화 능력을 검증합니다. 텍스트에서 에이전트, 사실까지의 능력 확장 경로는 아레나가 '모델 채팅 장'에서 'AI 역량을 위한 종합 평가 인프라'로 진화하고 있음을 보여줍니다.
현재의 한계 및 불확실성: ① 순위의 표본 편향 - 활성 사용자는 주로 기술 및 얼리 어답터이며 일반 사용자의 선호도를 나타내지 않을 수 있습니다. ② 적대적 조작의 위험 - 순위의 상업적 영향력이 커짐에 따라 모델 실험실은 순위의 즉각적인 단어를 최적화할 인센티브를 가지며 순위 방법은 이러한 Goodhart 효과에 지속적으로 대처해야 합니다. ③ 민영화된 배포 기능은 공개되지 않습니다. 데이터 주권에 대한 요구 사항이 높은 기업은 Arena가 완전히 격리된 평가 컨텍스트를 지원하는지 확인해야 합니다. ④ 다국어 지원 - 현재 평가 데이터는 주로 영어로 되어 있으며, 중국어 등 비영어권 시나리오에서는 순위의 신뢰성에 대한 검증이 필요합니다.
조달/채택 위험 평가: 모델 비교를 위한 참조 도구인 Arena는 매우 비용 효율적입니다. 무료 등급에는 이미 핵심 비교 기능이 포함되어 있습니다. 그러나 기업 차원의 조달의 경우 3단계로 진행하는 것이 좋습니다. ① 먼저 프리 티어를 사용하여 2~3가지 핵심 시나리오(1개월)에서 순위 데이터와 실제 경험의 일관성을 확인합니다. ② 보다 세밀한 평가 역량이 필요한 경우 기업 평가팀에 연락하여 맞춤형 솔루션 요청 및 고객 사례 참조 ③ 계약을 체결하기 전에 데이터 격리, 결과 귀속 및 독점 조건을 확인하는 데 중점을 두고 평가 응답 시간 및 데이터 가용성 보장을 포함하는 SLA를 요구합니다. 최종 선정 결정은 아레나의 평가 데이터에 의존할 뿐만 아니라 자체 비즈니스 시나리오 및 독립적인 보안 평가의 실제 측정 결과와 결합되어야 합니다.
관련 도구: deepseek, chatgpt
아레나 이용방법
- 웹 클라이언트 : 공식 홈페이지에 접속하여 계정을 등록하시면 사용하실 수 있습니다. 대부분의 기능은 설치가 필요하지 않습니다.
- API 액세스: RESTful API를 제공하므로 개발자는 API 키를 획득하여 자신의 애플리케이션에 통합할 수 있습니다.
버전 정보
- Arena 플랫폼(에이전트 모드 + 사실 순위표) :새로운 사실 순위표를 추가하고 에이전트 모드 평가 기능을 월 500만 회 이상의 상호 작용 라운드로 확장했으며 다중 모드 평가 범위를 지속적으로 개선했습니다.
- 에이전트 모드 + 풀스택 코드 아레나 :다단계 복잡한 작업의 목표 완료율 및 환각율 평가를 지원하는 에이전트 모드 출시 Fullstack Code Arena 랭킹을 출시했습니다.
- 새로운 카테고리 + 멀티모달 맥스 :Code Arena 세분화 순위가 추가되었습니다(WebDev/Image-to-WebDev 등). Multimodal Max 다중 모드 모델 라우팅 기능이 출시되었습니다.
- 최대 모델 라우터 :500만 개 이상의 커뮤니티 투표를 기반으로 사용자 프롬프트를 가장 적절한 모델로 자동 라우팅하는 Max 모델 라우팅 엔진을 출시했습니다.
- LM아레나 리브랜드 → 아레나 :LM아레나(LMArena)는 공식적으로 명칭을 아레나(Arena)로 변경하며 브랜드 업그레이드와 제품 확장을 완료했다. 같은 기간 1억5000만달러 규모의 시리즈A 자금 조달을 완료했다.
- 투기장 전문가 :Arena Expert 전문가 수준의 평가 모드를 출시하고 더욱 세분화된 도메인 능력 평가 차원 및 순위 방법론 업데이트를 도입했습니다.
- 기업 평가 출시 :기업 및 모형연구소를 대상으로 맞춤형 모형 평가를 제공하는 상용 평가 서비스(AI 평가)를 공식 출시했습니다.
사용자 후기