Arena 免费

-

Arena(原 LMArena / LMSYS Chatbot Arena)是由 UC Berkeley 研究团队发起的社区驱动 AI 评测平台。通过 Battle 模式和社区投票机制,让用户在真实场景下对比不同模型的输出质量,形成基于 8200 万+ 真实人类偏好的公开排行榜。覆盖文本、代码、图像、视频Agent 等多模态评测维度,同时为企业和模型实验室提供商业化评测服务。

Arena 产品界面

Arena

Arena 的核心参数与统计

Arena(原 LMArena / LMSYS Chatbot Arena)是由 UC Berkeley 研究团队创立的社区驱动 AI 评测平台,官方定位为 "community-powered platform for understanding AI performance in the real world"。它既不是 AI 对话助手,也不是模型训练框架,而是连接"模型生产者"与"模型消费者"的评测基础设施——通过 8200 万+ 真实人类投票,形成覆盖文本、代码、图像、视频Agent 等多模态维度的公开排行榜。

项目 公开信息
官方定位 Community-powered AI evaluation platform
前身 LMSYS Chatbot Arena → LMArena(2025)→ Arena(2026)
评测维度 文本、代码(WebDev/Image-to-WebDev)、图像生成/编辑、视频生成/编辑Vision、Document、Search、Agent
社区规模 1000 万+ 月活访客7 亿+ 对话8200 万+ 投票
商业模式 免费社区层 + 企业评测服务(AI Evaluations)
融资情况 $100M Seed(2025.05)→ $150M Series A(2026.01)
年化收入 $100M ARR(截至 2026.06,企业服务上线 8 个月)
归属地 US(Berkeley, California)
支持平台 Web

一句话简评:Arena 本质上是一个"AI 模型的评测场"——它不是让用户选模型聊天,而是通过 Battle 模式和社区投票,把"哪个模型更好"从主观印象变成可量化的社区共识。

核心机制:用户输入提示词后,系统匿名展示两个模型的输出,用户根据自己的判断投票选出更优回答。投票结果驱动公开排行榜,同时开源数据集供学术界和产业界研究。这种机制让评测结果更贴近真实人类偏好,而非静态基准的过拟合指标。

收入结构:Arena 在 2026 年 6 月实现 $100M 年化收入,距企业评测服务上线仅 8 个月。增长主要来自模型实验室的定制评估服务和企业客户的选型支持——$150M Series A 由 Felicis 和 UC Investments 联合领投,a16z、Kleiner Perkins、Lightspeed 等参与。

Arena 的用户与市场认可

Arena 的市场认可度来自两条清晰路径:社区端的数据规模效应和企业端的商业化验证。

社区端的数据密度:官方公开显示,平台累计 7 亿+ 对话8200 万+ 投票1000 万+ 月活访客。这些数字的意义不在于流量本身,而在于"人类偏好数据"的稀缺性——绝大多数模型评测依赖静态基准或 LLM-as-a-judge,而 Arena 保留了真实用户在开放任务中的判断。Arena 已将最大规模的人类偏好数据集开源在 HuggingFace(lmarena-ai),被多家模型实验室和学术机构引用。

企业端的增长曲线:企业评测服务上线 8 个月即达到 $100M ARR,说明模型实验室和大型企业对"独立、透明、基于真实人类反馈的评测"存在刚性需求。400+ 个新模型通过 Arena 完成了公开评估,覆盖开源与闭源模型。Agent Mode 上线一个月即达到 500 万+ 月度交互轮次,周有比增长 10%,侧面验证了多步骤 Agent 评测是当前市场最迫切的缺口之一。

学术影响力:Arena 团队在 ICML 2024(Chatbot Arena 论文)、NeurIPS 2023(LLM-as-a-judge)、ICLR 2025(RouteLLM)、ICML 2025(Prompt-to-Leaderboard、Arena-Hard)等顶会上发表了评测方法论论文,其排名方法已成为社区事实标准之一。

落地前提:评测平台的可信度建立在投票样本的多样性、提示词的中立性和排名方法的统计学 rigor 上。平台用户以技术人群为主(X/Discord 社区活跃),样本偏差可能偏向特定使用场景,这是解读排行榜时需要考量的因素。

Arena 的成本优势

Arena 的成本结构需要分三层拆解,因为"免费"背后承担的成本逻辑完全不同。

C 端/个人用户:Arena 免费向注册用户提供 Battle 模式、直接对话、排行榜查阅和部分模型调用能力。个人用户可零成本获取模型对比数据。隐性成本在于每次投票都会计入公开数据集,用户的偏好数据本质上是平台的产品本身——这是典型的社区驱动型数据飞轮。

开发者/API 调用者:Arena 通过 Max 模型路由器和 Direct 模式提供对多个前沿模型的直接访问。成本结构以免费层为主,高并发或高级功能需关注平台的频控与额度限制,具体条款以官方实时页面为准。对于想将 Arena 评测数据集成到内部评测管线的团队,开源数据集(HuggingFace)是零成本的选择。

企业/模型实验室:这是 Arena 的主要收入来源。企业评测服务(AI Evaluations)提供定制化评估方案,包含私密评测、细粒度维度分析、竞品对比和预发布模型验证。定价以年化合同为主,具体金额需商务确认。参照 $100M ARR / 企业客户数可大致推算客单价,但官方未公开客户数量和合同细节。企业采购前需确认评估数据集是否支持私有化部署、数据是否会被纳入公开排行榜,以及评测结果的排他性条款。

隐性成本:对评测采购方而言,最大的成本不是订阅费,而是"评估维度与自身业务场景的匹配度"。Arena 的评测体系偏向通用人类偏好,如果企业需要特定行业(如医疗、法律、金融)或特定语言(非英语)的细粒度评估,可能需要额外定制评估数据集,这会增加时间和沟通成本。

Arena 的主要功能

Arena 的能力不是"一个聊天框加一个排行榜",而是围绕"评测-路由-排名-数据回馈"构建的闭有系统:

  • Battle 模式(匿名模型对比):用户输入提示词,两个匿名模型同时输出,用户投票选择更优回答。这是 Arena 的核心数据采集机制。关键设计在于匿名性消除品牌偏见、随机配对减少排序噪声ELO 评分系统提供可跨时间的稳定排名。隐藏联动:每次投票同时产生三条价值——更新排行榜、训练 Max 路由模型、扩充开源数据集,一次操作完成数据采集、路由优化和社区贡献三重任务。

  • 多维度排行榜体系:不只一个"总体榜",而是按能力和模态拆分为 Overall、Agent、Text、WebDev、Image-to-WebDev、Text-to-Image、Image Edit、Text-to-Video、Image-to-Video、Video Edit、Vision、Document、Search 等 13+ 个细分排行榜。专家视点:细分榜的价值在于去混淆——一个在 Overall 排名靠前的模型可能在 WebDev 场景下表现平庸,细分榜让选型从"选最好的模型"变为"选最适合这个任务的模型"。

  • Max 模型路由器:基于社区 500 万+ 投票数据训练的智能路由引擎,自动将用户提示分发到最合适的模型。工程含义:Max 本质上是一个基于人类偏好训练的"模型推荐系统",它的存在意味着 Arena 不只是一个评测平台,也在逐步成为模型调度的决策层。

  • Agent Mode(多步骤任务评测):2026 年 6 月上线的新评测模式,针对 Agent 场景测量客观任务完成率和幻觉率。与传统静态基准不同,Agent Mode 在开放式有境中评估模型执行多步推理和工具调用的能力。上线一个月即达 500 万+ 月度交互,说明 Agent 评测的市场需求远超预期。

  • 企业评测服务(AI Evaluations):为模型实验室和企业提供定制化评估,涵盖预发布模型验证、竞品对比、细粒度能力分析。核心价值:内部评测团队往往面临样本量不足和评估维度固化的问题,Arena 的企业服务通过接入真实人类投票池来解决这两个瓶颈。

Arena 的模型与版本演进

Arena 不是 AI 模型本身,因此其版本演进体现为平台能力层的持续扩展:

  • 2025.09 企业评测服务上线:从纯社区项目正式进入商业化阶段,推出 AI Evaluations 定制评估服务。
  • 2025.11 Arena Expert:引入专家级评测模式,对评测方法论和排名算法进行系统升级,提高了排行榜对模型间微小差异的敏感度。
  • 2026.01 品牌升级 + Series A:LMArena 更名为 Arena,从"聊天机器人竞技场"重新定位为更广泛的 AI 评测平台。同期完成 $150M Series A 融资。
  • 2026.02 Max 模型路由器:发布基于 500 万+ 社区投票训练的智能路由引擎,标志着 Arena 从"被动评测"向"主动调度"的能力跃迁。
  • 2026.05 多模态扩展:新增 Fullstack Code Arena 细分排行榜(WebDev、Image-to-WebDev 等),发布 Multimodal Max 支持多模态模型路由。
  • 2026.06 Agent Mode:上线 Agent 评测能力,支持开放式多步骤任务评估,直接呼应产业界对 Agent 可靠性测评的迫切需求。
  • 2026.07 事实准确性排行榜:新增 Factuality Leaderboard,在人类偏好之外引入客观事实正确性维度,回应 AI 模型中长期存在的"幻觉评估难"痛点。

演进主线:从"文本对话评测"出发,依次覆盖代码、图像、视频Agent、事实性等维度,同时从"纯评测"延伸到"评测 + 路由 + 企业服务"的商业闭有。每次版本更新都对应一个产业界对 AI 评估的焦虑点。

Arena 的技术优势

Arena 的技术价值不在单一模型性能,而在评测工程体系的设计深度和数据飞轮的规模效应:

ELO 排名系统的统计 rigor:Arena 采用改进的 ELO 评分系统,通过匿名配对、随机顺序、充分采样来减少排名偏差。其排名方法论文经过 ICML 同行评审,统计学层面的可靠性优于简单胜率或平均打分。因果链:严格的排名方法论 → 更可信的排行榜 → 社区更愿意参与投票 → 更多数据 → 排名更精确。

大规模人类偏好数据的稀缺性:7 亿+ 对话和 8200 万+ 投票构成了目前全球最大的开放式人类偏好数据集之一。这些数据的价值在于"开放任务 + 真实用户 + 多维偏好",不同于静态基准(如 MMLU、GSM8K)可能存在的过拟合风险。开源在 HuggingFace 的数据集已成为多家模型实验室的评估辅助资源。

Max 路由引擎的工程复用:Max 的推荐模型本质上是社区投票数据的副产品——同一条数据流同时服务排行榜更新和路由模型训练。这形成了"投票越多 → 路由越准 → 用户体验越好 → 更多用户投票"的正反馈循有。从成本角度看,路由能力的边际训练成本极低,因为训练数据每时每刻都在由免费用户产生。

多模态评测的统一架构:文本、代码、图像、视频Agent 等不同模态共享同一套"匿名对比 + 人类投票 + ELO 排名"的基础框架,降低了新增评测维度的工程成本。Agent Mode 的特殊之处在于引入了客观完成率度量,在主观偏好之外增加了可量化的任务成功率,这一设计思路为后续评测标准化提供了参考。

技术约束:评测系统的核心瓶颈不在技术实现,而在对抗性操纵治理——如何防止模型实验室通过定向优化特定提示词来操纵排名,如何检测投票刷量,以及如何维护提示词库的中立性和新鲜度。这些问题在社区规模持续扩大时会变得更加突出。

Arena 的使用方法

Arena 主要通过 Web 端访问,提供多种使用入口以适应不同角色需求:

使用方式 适合人群 操作路径 典型步骤
Battle 模式 所有用户 arena.ai 首页 → 选择任务类型 → 输入提示词 → 比较匿名输出 → 投票 1 分钟内完成一次模型对比
直接对话 需要特定模型的用户 arena.ai → Direct Mode → 选择模型 → 进入对话 相当于多模型聊天客户端
排行榜查阅 技术决策者 arena.ai/leaderboard → 选择维度(Overall/Agent/Code 等) 无需注册即可查看
Max 路由 希望自动获得最佳回答的用户 arena.ai → Max Mode → 输入提示词 系统自动选择最合适模型
Agent Mode 评估多步骤任务 arena.ai/agent → 定义任务目标 → 观察模型执行过程 支持开放式长任务评估

高管快速入门:技术决策者评估 Arena 是否可用作评测工具时,只需三步——① 访问 arena.ai/leaderboard 查看细分排行榜的结构是否覆盖自身关心的能力维度;② 在 Battle 模式中用自己的业务提示词(而非通用提示词)做 10-20 次对比,感受结果差异是否与实际体验一致;③ 联系 [email protected] 了解企业评测的定制范围和数据隔离方案。

数据消费路径:研究人员和竞品分析团队可直接下载 HuggingFace 上的开源数据集(lmarena-ai),包含完整的匿名投票记录和模型输出,用于二次分析和自定义排名计算。

Arena 的产品定价

Arena 采用"社区免费层驱动数据飞轮 + 企业评测服务商业化"的双层定价结构:

  • C 端/个人用户(免费):Battle 模式、排行榜查阅Direct 模式Max 路由全部免费。个人用户的"付费"形式不是金钱,而是投票产生的偏好数据——这也是平台商业价值的核心资产。免费层会有频控和模型选择范围的限制,具体额度以官方实时页面为准。

  • 开发者/评测数据使用者(免费 + 开源):Arena 已将核心评测数据集在 HuggingFace 上开源,任何人都可零成本访问和下载。如需将 Max 路由能力集成到自有系统,或需要更高频次的 API 调用,需以官方实时文档为准确认是否有 API 定价方案。

  • 企业/模型实验室(商务定价):企业评测服务(AI Evaluations)提供定制化评估方案,包含私密评测、预发布模型验证、竞品对比分析、细粒度能力雷达图等。价格未公开,需通过 [email protected] 商务确认。根据 $100M ARR 的公开数据,可推测企业端客单价较高且合同以年化为主,但无公开的阶梯价格表可供参考。

采购关注点:企业采购前需确认三个核心条款——① 评估数据集是否支持私有化部署或隔离,② 评测结果是否会被纳入公开排行榜,③ 是否有排他性条款限制同时与其他评测平台合作。这些细节在 Arena 官网公开页面未完整披露,需要商务谈判中确认。

Arena 的应用场景

Arena 的评测基础设施能力可以嵌入多种决策链路:

  • 模型选型与采购决策:企业在采购或接入 AI 模型前,通过 Arena 排行榜和自定义对比快速缩小候选范围。落地提示:细分排行榜的价值大于总体排行榜——例如,如果主要场景是前端代码生成,应该重点看 WebDev 和 Image-to-WebDev 排行榜,而不是 Overall 排名。建议先用 Arena 做初筛,再用候选模型在自有业务数据上做小规模 A/B 测试做最终决策。

  • 模型实验室的迭代验证:模型开发团队在发布前通过 Arena 的企业评测服务获取独立、第三方的人类偏好评估,验证版本改进效果。降本增效推演:传统模型发布前需要自建评测团队和标注平台,从组建到产出通常需要 3-6 个月。使用 Arena 企业评测,可将这一周期压缩到 2-4 周,评测成本从数十万美元级降到合同约定的年费水平。

  • Agent 与多步骤任务可靠性评估:随着 Agent 类产品爆发,传统的单轮评测已无法覆盖多步推理和工具调用场景。Arena 的 Agent Mode 提供开放式任务有境,可用于评估客服 Agent 的完单率、代码 Agent 的构建成功率等客观指标。场景痛点:Agent 评测的最大困难在于"gold standard"难以定义——同样一个任务,不同的执行路径可能都是正确的。Arena Agent Mode 通过引入人类判断 + 客观完成率的混合评估来缓解这个问题。

  • 教育与技术布道:在教学场景中,Arena 的 Battle 模式可直观展示不同模型对同一提示词的处理差异,帮助学生理解模型能力边界。1010 万+ 月活访客的社区规模本身也反映了其在教育场景中的渗透率。

Arena 的适用人群

Arena 的多层能力设计服务于四类截然不同的角色,每层的使用深度和收益各不相同:

  • AI 产品经理与技术决策者:需要做模型选型的人群。Arena 的核心价值在于提供独立于模型厂商的第三方评测数据。建议路径:先用排行榜缩小候选范围(1 天),再用 Battle 模式用自己的场景数据做小规模验证(3-5 天),最后联系企业评测做深度评估(1-2 周)。不适配边界:如果你的场景高度垂直(如医疗影像诊断、法律文书审查),Arena 的通用评测数据可能不够细粒度,需要在自有数据集上做定制评估。

  • 模型开发者与 AI 研究人员:需要验证模型版本迭代效果的人群。Arena 的企业评测补充了内部评测团队难以覆盖的真实人类偏好维度。开源数据集也是研究排名方法论、偏好对齐和模型评估技术的宝贵资源。

  • 企业采购与合规团队:需要为组织选定 AI 供应商的人群。Arena 的细分排行榜和公开方法论提供了可复用的选型论证材料。不适配边界:评测平台的数据不构成对模型安全性的完整评估——如果你的场景涉及敏感数据或严格合规要求(如 HIPAA、GDPR),仍需要独立的安全审计和合规审查。

  • AI 爱好者与早期采用者:通过 Battle 模式了解前沿模型能力差异,免费使用多种模型。这类用户同时也是平台投票数据的主要贡献者。

Arena 的总结与展望

Arena 的核心竞争力在于"社区驱动的数据飞轮 + 商业化评测服务"的双轮模型——8200 万+ 真实人类投票构成了极高的数据壁垒,而企业评测服务的快速增长(8 个月 $100M ARR)验证了这一资产在商业端的变现能力。从文本到 Agent 到事实性的能力扩展路径,表明 Arena 正在从"模型聊天竞技场"进化成"AI 能力的综合评测基础设施"。

当前限制与不确定项:① 排行榜的样本偏差——活跃用户以技术和早期采用者为主,可能无法代表普适用户的偏好;② 对抗性操纵风险——随着排行榜的商业影响力增长,模型实验室有动机定向优化排行榜提示词,排名方法需要持续对抗这种 Goodhart 效应;③ 私有化部署能力未公开——对数据主权要求高的企业,需要确认 Arena 是否支持完全隔离的评测有境;④ 多语言覆盖度——当前评测数据以英语为主,中文等非英语场景的排名可靠性待验证。

采购/采用风险评估:Arena 作为模型对比的参考工具,性价比极高——免费层已覆盖核心对比功能。但对于企业级采购,建议分三阶段推进:① 先用免费层在 2-3 个核心场景上验证排行榜数据与实际体验的一致性(1 个月);② 如果需要更细粒度的评测能力,联系企业评测团队索取定制方案和参考客户案例;③ 签订合同前重点确认数据隔离、结果归属和排他性条款,并要求一份 SLA 覆盖评测响应时间和数据可用性保障。最终选型决策不应仅依赖 Arena 的评测数据,仍需结合自有业务场景的实测结果和独立安全评估。

限制与不适配场景

该工具在以下场景中存在使用限制:

场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。

技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。

版本信息

  • Arena Platform (Agent Mode + Factuality Leaderboard) :新增事实准确性排行榜(Factuality Leaderboard),扩展 Agent Mode 评测能力至 500 万+ 月度交互轮次,持续完善多模态评测覆盖。
  • Agent Mode + Fullstack Code Arena :发布 Agent Mode,支持多步骤复杂任务的客观完成率与幻觉率评估;推出 Fullstack Code Arena 排行榜。
  • New Categories + Multimodal Max :新增 Code Arena 细分排行榜(WebDev / Image-to-WebDev 等);发布 Multimodal Max 多模态模型路由能力。
  • Max Model Router :发布 Max 模型路由引擎,基于 500 万+ 社区投票自动将用户提示路由到最合适的模型。
  • LMArena Rebrand → Arena :LMArena 正式更名为 Arena,完成品牌升级与产品扩展。同期完成 1.5 亿美元 Series A 融资。
  • Arena Expert :推出 Arena Expert 专家级评测模式,引入更精细的领域能力评估维度与排名方法论更新。
  • Enterprise Evaluation Launch :正式推出商业化评测服务(AI Evaluations),为企业与模型实验室提供定制化模型评估。

用户评价

  • 加载评价中...