大模型评测榜单

整理国内外常见 AI 大模型评测体系,帮助理解不同榜单的评测方法、适用场景与更新状态。

共找到 32 条结果

Artificial Analysis

提供模型性能、速度、价格等多维度对比,适合模型选型。数据更新及时,涵盖主流模型排名。

综合
主办方

Artificial Analysis

方式

综合指数 / 多基准聚合

更新中

更新时间 2025年6月18日模型性价比分析、速度与性能权衡

LM Arena / Chatbot Arena

基于用户偏好投票的大模型竞技场,通过Elo评分系统对模型进行对比。

综合
主办方

LMSYS Org

方式

人类盲测

更新中

更新时间 2025年6月15日评估模型对话能力、整体实力对比

GAIA

评估通用AI助手在搜索、工具调用和多步任务中的能力,包含真实世界任务。

Agent
主办方

GAIA Consortium

方式

真实任务/工具使用

更新中

更新时间 2025年6月15日Agent能力评测、工具使用评估

LiveBench

持续更新题目,降低数据污染影响,包含数学、推理、编程等多领域评测。

综合推理
主办方

LiveBench Team

方式

动态题库

更新中

更新时间 2025年6月12日模型持续跟踪、近期能力评估

Aider LLM Leaderboard

评估模型在真实代码编辑和补丁生成中的能力,使用编辑弱化的代码库。

代码软件工程
主办方

Aider

方式

代码编辑任务

更新中

更新时间 2025年6月12日代码编辑能力评测、代码修改任务

OpenCompass 司南

开源大模型评测平台,支持多维度评测,提供中英文双语评测集,覆盖语言、知识、推理等能力。

综合中文
主办方

上海人工智能实验室

方式

静态题库

更新中

更新时间 2025年6月10日全面评测模型能力、中文模型评测

SWE-bench Live

使用更新的软件工程任务,降低数据泄露风险,保持评测的公平性。

代码软件工程
主办方

SWE-bench Team

方式

动态真实任务

更新中

更新时间 2025年6月10日代码任务能力评测、数据泄露规避

HELM

Stanford提供的大模型整体评测框架,涵盖准确性、鲁棒性、公平性等多维度指标。

评测框架综合
主办方

Stanford HAI

方式

多指标系统评估

更新中

更新时间 2025年6月8日全面系统评估、标准化评测

LiveCodeBench

使用较新的编程题评估代码生成能力,题目持续更新避免数据污染。

代码
主办方

LiveCodeBench Team

方式

动态编程题

更新中

更新时间 2025年6月8日代码生成能力评测、编程任务评估

Open VLM Leaderboard

HuggingFace主导的多模态大模型评测榜单,涵盖视觉问答、图像理解等任务。

多模态
主办方

HuggingFace

方式

视觉语言模型评测

更新中

更新时间 2025年6月8日多模态模型评测、视觉语言任务

AlpacaEval

使用GPT-4作为评判的自动化评测,支持长文本生成评估。

综合
主办方

Stanford

方式

LLM-as-judge

更新中

更新时间 2025年6月5日自动化评测、快速迭代测试

SWE-bench Verified

SWE-bench中更高质量的验证任务集,经过人工验证确保任务的有效性。

代码软件工程
主办方

SWE-bench Team

方式

人工验证任务子集

更新中

更新时间 2025年6月5日代码任务能力评测、软件工程能力

MathArena

评估模型数学解题和推理能力,覆盖初高中到竞赛级别的数学问题。

数学
主办方

MathArena Team

方式

数学问题评测

更新中

更新时间 2025年6月5日数学解题能力、推理能力

HLE / Humanity's Last Exam

面向前沿模型的高难度综合能力测试,设计为AI难以通过刷题方式解决的问题。

综合推理
主办方

HLE Consortium

方式

高难度综合考试

更新中

更新时间 2025年6月2日前沿能力评测、泛化能力测试

SWE-bench

评估模型解决真实GitHub Issue的能力,需要模型生成代码补丁修复实际问题。

代码软件工程
主办方

Princeton & Together.ai

方式

真实 GitHub issue 修复

更新中

更新时间 2025年6月1日代码任务能力评测、开发者工具选型

MMMU-Pro

更高难度的多模态学科推理评测,题目更具挑战性,需要更强的视觉理解能力。

多模态推理
主办方

HHI & HKUST

方式

增强多模态推理

更新中

更新时间 2025年6月1日高级多模态推理评测

EvalPlus

HumanEval+、MBPP+等的更严格代码评测,增加更多测试用例提升评测可靠性。

代码
主办方

NTU & SJTU

方式

增强单元测试

更新中

更新时间 2025年5月30日代码质量评测、单元测试覆盖

SuperCLUE

面向中文大模型的综合评测平台,包含语义理解、生成质量、推理能力等多个维度。

中文
主办方

CLUE团队

方式

综合中文评测

更新中

更新时间 2025年5月28日中文NLP能力评测、中文模型选型

MT-Bench

用于评估模型多轮对话和指令跟随能力,包含8个多轮对话场景。

综合对话
主办方

Stanford

方式

多轮对话评测

更新中

更新时间 2025年5月25日对话能力评测、指令跟随评估

MMMU

评估模型在大学级多模态题目上的理解和推理能力,包含30个学科的11500道题。

多模态推理
主办方

UT Austin & UIUC & NYU

方式

多学科图文题

更新中

更新时间 2025年5月25日多模态推理评测、大学知识评估

MMLU-Pro

MMLU的增强版本,更强调推理和抗猜测能力,增加题目难度和选项数量。

推理综合
主办方

MMLU-Pro Team

方式

高难度多选题

更新中

更新时间 2025年5月20日推理能力评测、高难度知识测试

WebArena

评估Agent在真实网页环境中的任务执行能力,包含5个真实网站的自动化任务。

Agent
主办方

WebArena Team

方式

网页任务

更新中

更新时间 2025年5月20日网页Agent评测、UI自动化能力

AgentBench

评估大模型作为智能体在不同任务环境中的表现,包括操作系统、数据库、游戏等。

Agent
主办方

THUDM

方式

多环境Agent任务

更新中

更新时间 2025年5月20日Agent能力评测、自动化任务场景

C-Eval

中文学科知识和推理能力评测,覆盖13948道多选题,涵盖52个学科领域。

中文
主办方

清华大学、上海交通大学等

方式

学科考试题库

更新中

更新时间 2025年5月15日中文知识评测、中文推理能力

SEED-Bench

覆盖图像、视频、空间和时间理解能力,包含19000道多选题。

多模态
主办方

Shanghai AI Lab

方式

图像/视频理解

更新中

更新时间 2025年5月15日视觉理解评测、视频分析能力

BIG-Bench Hard / BBH

评估模型在复杂推理任务上的表现,包含23个需要多步推理的任务。

推理
主办方

Google Research

方式

高难度任务集合

更新中

更新时间 2025年5月10日复杂推理评测、任务分解能力

GPQA

用于评估高难度科学推理能力,包含生物学、化学、物理学等领域的高级问题。

推理科学
主办方

MetaAI & Others

方式

专家级科学问答

更新中

更新时间 2025年4月25日科学推理评测、专家级问题

CMMLU

覆盖中文语境下的知识、文化和推理能力,包含67个主题的11528道选择题。

中文
主办方

MBZUAI、Together.ai

方式

中文多任务理解

更新中

更新时间 2025年4月20日中文知识理解、中华文化评测

MMLU

经典通用知识能力评测,包含57个学科领域的知识测试。

综合
主办方

MIT

方式

多任务知识测试

更新中

更新时间 2025年4月15日知识储备评测、学术能力评估

MATH Benchmark

评估模型处理复杂数学题的能力,包含12500道来自数学竞赛的题目。

数学
主办方

UC Berkeley

方式

竞赛级数学题

更新中

更新时间 2025年4月10日数学能力评测、竞赛题解答

HumanEval

经典代码生成评测基准,包含164个Python编程问题,需要生成通过测试的代码。

代码
主办方

OpenAI

方式

函数生成

更新中

更新时间 2025年3月20日代码生成评测、Python能力评估

GSM8K

经典数学推理基准,包含8500道小学数学应用题,主要考察算术和逻辑推理能力。

数学
主办方

OpenAI

方式

小学数学应用题

更新中

更新时间 2025年3月15日数学基础评测、算术能力评估