大模型评测榜单
整理国内外常见 AI 大模型评测体系,帮助理解不同榜单的评测方法、适用场景与更新状态。
共找到 32 条结果
综合
主办方
Artificial Analysis
方式
综合指数 / 多基准聚合
更新中
是
更新时间 2025年6月18日模型性价比分析、速度与性能权衡
综合
主办方
LMSYS Org
方式
人类盲测
更新中
是
更新时间 2025年6月15日评估模型对话能力、整体实力对比
Agent
主办方
GAIA Consortium
方式
真实任务/工具使用
更新中
是
更新时间 2025年6月15日Agent能力评测、工具使用评估
综合推理
主办方
LiveBench Team
方式
动态题库
更新中
是
更新时间 2025年6月12日模型持续跟踪、近期能力评估
代码软件工程
主办方
Aider
方式
代码编辑任务
更新中
是
更新时间 2025年6月12日代码编辑能力评测、代码修改任务
综合中文
主办方
上海人工智能实验室
方式
静态题库
更新中
是
更新时间 2025年6月10日全面评测模型能力、中文模型评测
代码软件工程
主办方
SWE-bench Team
方式
动态真实任务
更新中
是
更新时间 2025年6月10日代码任务能力评测、数据泄露规避
评测框架综合
主办方
Stanford HAI
方式
多指标系统评估
更新中
是
更新时间 2025年6月8日全面系统评估、标准化评测
代码
主办方
LiveCodeBench Team
方式
动态编程题
更新中
是
更新时间 2025年6月8日代码生成能力评测、编程任务评估
多模态
主办方
HuggingFace
方式
视觉语言模型评测
更新中
是
更新时间 2025年6月8日多模态模型评测、视觉语言任务
代码软件工程
主办方
SWE-bench Team
方式
人工验证任务子集
更新中
是
更新时间 2025年6月5日代码任务能力评测、软件工程能力
综合推理
主办方
HLE Consortium
方式
高难度综合考试
更新中
是
更新时间 2025年6月2日前沿能力评测、泛化能力测试
代码软件工程
主办方
Princeton & Together.ai
方式
真实 GitHub issue 修复
更新中
是
更新时间 2025年6月1日代码任务能力评测、开发者工具选型
代码
主办方
NTU & SJTU
方式
增强单元测试
更新中
是
更新时间 2025年5月30日代码质量评测、单元测试覆盖
中文
主办方
CLUE团队
方式
综合中文评测
更新中
是
更新时间 2025年5月28日中文NLP能力评测、中文模型选型
多模态推理
主办方
UT Austin & UIUC & NYU
方式
多学科图文题
更新中
是
更新时间 2025年5月25日多模态推理评测、大学知识评估
推理综合
主办方
MMLU-Pro Team
方式
高难度多选题
更新中
是
更新时间 2025年5月20日推理能力评测、高难度知识测试
Agent
主办方
WebArena Team
方式
网页任务
更新中
是
更新时间 2025年5月20日网页Agent评测、UI自动化能力
Agent
主办方
THUDM
方式
多环境Agent任务
更新中
是
更新时间 2025年5月20日Agent能力评测、自动化任务场景
中文
主办方
清华大学、上海交通大学等
方式
学科考试题库
更新中
是
更新时间 2025年5月15日中文知识评测、中文推理能力
多模态
主办方
Shanghai AI Lab
方式
图像/视频理解
更新中
是
更新时间 2025年5月15日视觉理解评测、视频分析能力
推理
主办方
Google Research
方式
高难度任务集合
更新中
是
更新时间 2025年5月10日复杂推理评测、任务分解能力
推理科学
主办方
MetaAI & Others
方式
专家级科学问答
更新中
是
更新时间 2025年4月25日科学推理评测、专家级问题
中文
主办方
MBZUAI、Together.ai
方式
中文多任务理解
更新中
是
更新时间 2025年4月20日中文知识理解、中华文化评测
数学
主办方
UC Berkeley
方式
竞赛级数学题
更新中
是
更新时间 2025年4月10日数学能力评测、竞赛题解答
代码
主办方
OpenAI
方式
函数生成
更新中
是
更新时间 2025年3月20日代码生成评测、Python能力评估