LMArena(即 Chatbot Arena)是由 LMSYS Org 组织发起的一个开源项目,旨在通过人类投票的协作方式来评估大语言模型(LLM)。在人工智能爆发的今天,单一的基准测试已经很难全面衡量一个模型的好坏。LMArena 采用了创新的“众包盲测”机制,将两个不同的模型置于同一黑盒环境下,由用户提出问题,并根据它们的表现进行主观打分。
这种方法有效地解决了“数据污染”问题,因为模型无法预知用户会问什么。通过 Elo 等级分系统,LMArena 建立了一套极具权威性的排行榜,涵盖了 GPT-4, Claude 3, Gemini 以及各种优秀的开源模型。它是开发者选择模型、研究人员观察行业趋势的重要参考标杆。
作为一个开放平台,LMArena 致力于降低 AI 技术的门槛。无论你是技术专家还是 AI 爱好者,都可以在这个平台上体验到最前沿的技术博弈。我们希望通过本站的整理,能让更多中文用户了解并熟练使用这一利器,共同推动 AI 社区的健康发展。
在不知道模型名称的情况下进行评分,彻底消除品牌偏见,确保结果真实可靠。
借鉴竞技体育的排名算法,动态更新全球顶级 AI 模型的战力水平。
数据集完全公开,支持学术研究,是目前全球最活跃的 AI 评测社区之一。
兼容性:LMArena 是一套基于 Web 的交互系统,完美适配所有主流操作系统。同时提供 API 接入方式,方便开发者进行二次开发。
是否免费:LMArena 基础版完全免费向公众开放。用户可以免费参与对模型进行评分,并查看完整的实时排行榜。
注:部分特定的 API 调用可能涉及 LMSYS 的积分系统或合作方成本。