如何读分数。「最高分」是结果账本中的最佳一行,不是模型排名:各行的评测条件(工具、推理强度、scaffold、pass@k)不同,均逐条记录在 JSON 中。优先相信 官方榜单 与 独立复现,其次才是 厂商自报 或 聚合站。污染风险 high 表示测试集公开且静态。
模型基准
对模型本身做静态的「提示—回答」打分:知识、推理、数学、代码、事实性、长上下文。按发布时间倒序。
| Benchmark | 发布 | 领域 | 状态 | 污染风险 | 最高分 | 分数历史 |
|---|---|---|---|---|---|---|
| BenchCAD 17,900 个经执行验证的 CadQuery 程序,覆盖 106 个工业零件族(齿轮、弹簧、钻头、管件等),约半数锚定真实 ISO/DIN/EN/ASME/IEC 规范表。主任务 Vision2Code 给出四视图渲染,要求生成 CadQuery 程序并重新执行,以 IoU-score(体素 IoU 乘执行率)评分;配套的 Vision QA、Code QA 和 Code Edit 任务分别隔离感知、参数抽象和程序合成能力。智能体变体提供 Python 沙箱用于渲染、测量和迭代。是各厂商引用的 AI for hardware 标尺。 | 2026-05 | multimodal code reasoning | active | medium | 0.843 Claude Fable 5.1 (max, Python tools) 厂商自报 | 5 条 |
| AA-Omniscience 6,000 道由权威学术与行业来源生成的短答事实题,覆盖商业、人文社科、健康、法律、软件工程、科学工程数学六大领域 42 个主题。LLM 评分器将答案标为正确、部分正确、错误或未作答;Omniscience Index(-100 至 100)对正确加分、错误扣分、弃答不计,衡量知识校准而非单纯记忆。准确率与幻觉率另行报告并计入 Artificial Analysis Intelligence Index。 | 2025-11 | knowledge factuality | active | low | 44 GPT-6 Astra (high) 独立复现 | 4 条 |
| GDPval 取自美国 GDP 贡献最大的 9 个行业、44 个职业的真实工作交付物(法律文书、电子表格、幻灯片、CAD、排班、视频剪辑),由平均 14 年经验的专业人士编写与审核。模型一次性根据任务描述和参考文件生成交付物,由同职业专家盲评与人类专家作品比较,得分为被评为优于或不逊于专家的比例。是衡量有经济价值的知识工作的主要公开标尺。 | 2025-09 | general-assistant knowledge instruction-following | active | medium | 74.1% GPT-5.2 Pro 厂商自报 | 6 条 |
| HealthBench 5,000 段模型与普通用户或临床人员之间的真实多轮、多语言健康对话,涵盖急诊转诊、追问上下文、全球健康等七类主题。每段对话附医生撰写的评分细则(来自 60 国 262 名医生的 48,562 条标准);GPT-4.1 评分器判断末轮回复满足哪些标准,得分为所得分值占满分的比例。Hard(1,000)与 Consensus(3,671)子集分别隔离未饱和与医生共识标准。医疗有用性与安全性的参考评估。 | 2025-05 | knowledge safety instruction-following | active | medium | 59.9% o3 论文 | 4 条 |
| ARC-AGI-2 ↑ ARC-AGI-1 ↓ ARC-AGI-3 第二代 ARC 网格谜题,旨在击败暴力搜索,并测试符号解释、组合推理和依赖上下文的规则应用。包含 1,000 个公开训练任务,以及经校准的各 120 个任务的公开、半私有和私有评估集;每个任务都至少被两名人类在两次尝试内解出。得分为两次尝试内完全正确的测试输出百分比,始终与每任务成本一并报告。作为 ARC-AGI-1 的继任者随 ARC Prize 2025 发布。 | 2025-03 | reasoning | medium | 95% · 人类 100% GPT-6 Astra (Max) 官方榜单 | 5 条 | |
| ScreenSpot-Pro 1,581 条 GUI 定位指令,每条对应一张来自 23 个专业应用(CAD、IDE、创意套件、科学工具、办公)与三种操作系统的真实高分辨率截图。模型需输出指令所指元素的点击点或框;目标平均仅占屏幕 0.07%,准确率为预测落入真值框的比例(文本与图标目标微平均)。是计算机使用智能体所依赖的视觉定位能力的标准压力测试。 | 2025-01 | computer-use multimodal | high | 92.7% GPT-6 Astra 厂商自报 | 5 条 | |
| Humanity's Last Exam 2,500 道专家编写的封闭式问题(多项选择与精确匹配的简答,约 14% 含图像),覆盖数学、自然科学、人文等领域,经筛选确保前沿模型在收集时无法作答。由 LLM 评判(o3-mini)对照参考答案计算准确率;同时报告校准误差。设计为最后一个广泛的学术基准,如今是前沿知识推理的主要测试。 | 2025-01 | knowledge reasoning science math multimodal | active | medium | 65% Claude Fable 5.1 (with tools) 厂商自报 | 6 条 |
| Aider Polyglot 从 C++、Go、Java、JavaScript、Python、Rust 的 Exercism 练习中选出 7 个参考模型至多 3 个能解的最难 225 题。模型在 aider CLI 中以指定编辑格式修改文件,失败后可凭测试输出重试一次;得分为两次尝试内通过单元测试的题目比例。被广泛引用的指令跟随式代码编辑指标,同时暴露编辑格式合规性与运行成本。 | 2024-12 | code instruction-following | medium | 88% gpt-5 (high) 官方榜单 | 5 条 | |
| SimpleQA 4,326 个简短的事实型问题,每题有唯一无可争议的答案,针对 GPT-4o 对抗式收集并经两名独立标注者验证,涵盖科学、历史、艺术、地理等。评分模型将每个回答标记为正确、错误或未尝试;主指标为正确率,同时报告 F 分数和校准。它衡量模型是否知道自己知道什么:易产生幻觉的模型即便其他能力出色,得分也会很低。 | 2024-11 | factuality knowledge | active | high | 62.5% gpt-4.5-preview-2025-02-27 厂商自报 | 4 条 |
| FrontierMath 数百道由专家数学家编写并审核的原创、未发表的研究级数学问题,难度从高难本科(Tier 1)经高阶研究生(Tier 3)到研究水平的 Tier 4,每题答案均可自动验证。模型可在 token 预算内推理并运行 Python,提交答案函数;得分为解出问题的比例。为避免污染而保持私有,是前沿数学推理的主要衡量标准,所有评估均由 Epoch 自行运行。 | 2024-11 | math reasoning research | low | 93.7% gpt-6-astra (max) 独立复现 | 5 条 | |
| MMMU-Pro ↑ MMMU 1,730 道 MMMU 题目,已过滤掉纯文本模型即可作答的题目,每题选项扩展为十个候选,并增加纯视觉设置:问题渲染在图像内部,模型必须同时阅读和观看。以准确率评分;主指标为标准(10 选项)设置与视觉设置的平均值。因消除了曾使 MMMU 虚高的纯文本捷径,它是当前专家级多模态推理的标准。 | 2024-09 | multimodal knowledge reasoning | active | medium | 86.9% · 人类 85.4% Chance Vision 1.5 厂商自报 | 5 条 |
| MMLU-Pro ↑ MMLU 约 12,000 道题,覆盖 14 个学科,基于 MMLU、STEM 网站、TheoremQA 和 SciBench 构建,选项从四个扩展到十个,并移除了琐碎或有噪声的题目。以思维链下的准确率评分(官方设置为 5-shot)。减少了猜测空间和提示敏感性,成为比较知识与推理时 MMLU 的标准替代品。 | 2024-06 | knowledge reasoning | high | 91% Gemini 3.1 Pro (High) 独立复现 | 4 条 | |
| RULER 合成长上下文套件,包含四类共 13 个任务(多种大海捞针检索变体、多跳变量追踪、高频词聚合以及长输入问答),可按 4K 到 128K 或更长的 token 长度配置生成。以各长度下跨任务平均准确率评分;模型的"有效上下文"为其超过固定阈值(Llama-2-7B 在 4K 下的 85.6%)的最长长度。它揭示了宣称的与可用的上下文窗口之间的差距。 | 2024-04 | long-context | low | 95.1% Jamba-1.5-large 官方榜单 | 5 条 | |
| LiveCodeBench 从 LeetCode、AtCoder 和 Codeforces 竞赛中持续收集的竞赛编程题,每题标注发布日期,以便仅在模型训练截止之后发布的题目上评分。代码生成以针对隐藏测试的 pass@1(多次采样取平均)评分;自我修复、代码执行和测试输出预测为独立场景。滚动的发布日期过滤使其成为标准的防污染编程基准,但所选时间窗口会改变分数。 | 2024-03 | code reasoning | active | low | 93.5% DeepSeek-V4-Pro (Think Max) 厂商自报 | 5 条 |
| BFCL 评估模型根据自然语言请求生成函数(工具)调用的准确度。V1 引入对 Python、Java、JavaScript 和 REST 中单个、多个及并行调用的抽象语法树匹配;V2 增加用户贡献的实时函数;V3 增加多轮、多步和状态跟踪场景;V4 增加网页搜索与记忆类智能体任务及格式敏感性检查。总分为各子类别准确率的无权重平均,并同时报告成本与延迟。是工具调用能力的事实标准。 | 2024-02 | tool-use | active | medium | 77.47% Claude-Opus-4-5-20251101 (FC) 官方榜单 | 5 条 |
| MMMU ↓ MMMU-Pro 11,500 道大学水平的题目,将文本与图像(图表、示意图、地图、表格、化学结构、乐谱)配对,覆盖六个学科和 30 个科目,收集自考试、测验和教科书。以 900 题验证集上的准确率评分(10,500 题的测试集通过 EvalAI 评分)。首个广泛的专家级多模态基准;如今已接近专家人类准确率,并已被 MMMU-Pro 取代。 | 2023-11 | multimodal knowledge reasoning | high | 85.4% · 人类 88.6% GPT-5.1 厂商自报 | 5 条 | |
| IFEval 541 个提示,每个包含 25 类可验证指令中的一种或多种,例如"至少写 400 字"、"以 JSON 回复"、"包含关键词 X 三次"或"不使用逗号"。合规性通过程序检查,给出严格与宽松匹配下的提示级和指令级准确率。低成本、可复现且不依赖 LLM 评判,是检验聊天模型是否真正遵守格式约束的标准。 | 2023-11 | instruction-following | high | 95% Qwen3.5-27B 厂商自报 | 4 条 | |
| GPQA Diamond 198 道生物、物理和化学领域的四选一多项选择题,由领域博士编写并经验证:专家意见一致,而可无限制访问网络的熟练非专家却会答错。Diamond 子集仅保留两位专家均答对且多数非专家答错的题目。是前沿科学推理的标准基准;在 n=198 时噪声下限约为正负 3 分。 | 2023-11 | science reasoning knowledge | medium | 96% · 人类 69.7% GPT-6 Astra 聚合站 | 7 条 | |
| LMArena Text 实时众包的人类偏好排行榜。访问者输入任意提示,并排收到两个匿名模型的回答后投票;数百万成对投票以 Bradley-Terry 模型(最初为在线 Elo)拟合得到 Arena 分数及自举置信区间,另有风格控制与分类视图。提示新鲜且由真实用户评判,难以污染并反映感知有用性,但会奖励有说服力的排版并受模型采样策略影响。 | 2023-05 | human-preference general-assistant | active | low | 1466 gemini-2.5-pro 官方榜单 | 5 条 |
| 已饱和或退役 —— 不再用于比较前沿系统。所示分数为最后一次报告值,不是榜首。 | ||||||
| AIME 2025 | 2025-02 | math, reasoning | saturated | high | 最后报告 100% 独立复现 | |
| BIG-Bench Hard | 2022-10 | reasoning | saturated | high | 最后报告 87.5% 厂商自报 | |
| GSM8K | 2021-10 | math, reasoning | saturated | high | 最后报告 92.6% 厂商自报 | |
| TruthfulQA | 2021-09 | factuality, safety | saturated | high | 最后报告 58% 论文 | |
| MBPP | 2021-08 | code | saturated | high | 最后报告 88.6% 厂商自报 | |
| HumanEval | 2021-07 | code | saturated | high | 最后报告 76.8% 厂商自报 | |
| MATH | 2021-03 | math, reasoning | saturated | high | 最后报告 98.1% 厂商自报 | |
| MMLU → MMLU-Pro | 2020-09 | knowledge, reasoning | saturated | high | 最后报告 90.1% 厂商自报 | |
| ARC-AGI-1 → ARC-AGI-2 | 2019-11 | reasoning | saturated | medium | 最后报告 98.5% 官方榜单 | |
| WinoGrande | 2019-07 | commonsense, reasoning | saturated | high | 最后报告 81.5% 厂商自报 | |
| HellaSwag | 2019-05 | commonsense | saturated | high | 最后报告 88% 厂商自报 | |
| DROP | 2019-03 | reasoning, knowledge | saturated | high | 最后报告 88.7% 厂商自报 | |
Agent 基准
交互式环境:系统执行动作、调用工具,按任务完成度打分。分数受 scaffold 与预算的影响不亚于模型本身。按发布时间倒序。
| Benchmark | 发布 | 领域 | 状态 | 污染风险 | 最高分 | 分数历史 |
|---|---|---|---|---|---|---|
| OSWorld 2.0 ↑ OSWorld 108 个长程计算机使用工作流(人类完成中位时间约 1.6 小时,智能体约 300 次工具调用),覆盖科研、创意、工程、财务、行政和医疗场景,涉及桌面应用与 31 个自托管网站。每个任务平均设 27 个基于执行的检查点,给出二元完成率(主指标,500 步预算)和部分得分。任务包含任务中途的动态事件、隐藏状态和模拟用户澄清,用于区分 OSWorld 1.0 已无法分辨的失败模式。 | 2026-06 | computer-use multimodal tool-use | active | medium | 41.7% Claude Fable 5.1 厂商自报 | 5 条 |
| AutomationBench 覆盖销售、市场、运营、客服、财务和 HR 的业务流程任务:智能体接收单条触发消息后,需在 47 个模拟 SaaS 应用的约 500 个 REST 端点中(BM25 检索)自行发现接口,遵循隐藏在环境中的政策文档,避开干扰记录,并修改模拟公司的状态。评分为确定性的最终状态断言(含负向断言);官方得分为所有断言全部通过的任务比例,在私有保留集(600+ 任务)上运行,另有 600 个公开任务供研究。 | 2026-04 | tool-use general-assistant instruction-following | active | low | 50.3% Claude Opus 5 (max) 官方榜单 | 6 条 |
| ARC-AGI-3 ↑ ARC-AGI-2 仅基于核心知识先验构建的交互式回合制类游戏环境,不提供任何说明:智能体必须探索、推断目标、构建世界模型并进行规划。包含 25 个公开演示环境、55 个半私有(API 测试)环境和 55 个完全私有(竞赛)环境,每个环境均经未受训人类验证可完全解决。评分基于相对人类行动基线的效率,100% 意味着以人类同等效率通关所有关卡。是 ARC-AGI 系列首个交互式版本。 | 2026-03 | reasoning tool-use | low | 99.9% · 人类 100% GPT-6 Astra (high) 官方榜单 | 5 条 | |
| Terminal-Bench 由人工编写的高难任务,智能体需在真实终端环境中完成(软件工程、科学计算、ML、安全、数据处理)。每个任务自带容器、人类解答和测试;得分为测试通过的任务比例,对多次试验取平均并附 95% 置信区间。是 CLI 编程智能体的事实基准,通过 Harbor 框架运行。 | 2026-01 | software-engineering code tool-use ml-engineering | active | medium | 64.6% GPT-6 Astra 厂商自报 | 11 条 |
| DeepSearchQA 900 个人工构造、时间锚定的网页研究问题,覆盖 17 个领域,答案为完整集合而非单一事实(65% 为集合型答案)。每题是一条依赖链式检索,智能体需规划多步搜索、汇总多来源碎片、消歧去重并判断何时停止。由固定的 Gemini 2.5 Flash 自动评审判定语义集合匹配;主指标为逐题平均 F1(精确率对召回率),并报告完全正确、完全错误和多答比例作为诊断。针对 BrowseComp 等单答案基准忽视的全面性缺口。 | 2025-12 | web research factuality tool-use | active | medium | 95% Claude Opus 5 聚合站 | 5 条 |
| Tool Decathlon (Toolathlon) 108 个人工采集或构造的任务,要求智能体通过 604 个工具(主要为 MCP server)操作 32 个真实软件应用,如 Google Calendar、Notion、Canvas、WooCommerce、Kubernetes 和 BigQuery,从真实的初始环境状态出发,平均约 20 轮交互。每个任务由专用的基于执行的评测脚本对最终状态评分;榜单报告三次运行的 Pass@1 以及 Pass@3 和 Pass^3。是目前覆盖最广的通用 MCP 风格跨应用工具使用公开测试。 | 2025-10 | tool-use general-assistant software-engineering | active | medium | 78.4% GLM 5.3 Flash (max) 官方榜单 | 6 条 |
| SWE-Bench Pro ↑ SWE-bench Verified 1,865 个经人工核验的长程软件工程任务,来自 41 个代码库(公开集:来自 copyleft 许可开源库的 731 个任务;商业集:来自专有初创公司代码库的 276 个任务;保留集:858 个任务)。每个任务给出增强的问题陈述、需求和可选接口;补丁以 fail-to-pass 和 pass-to-pass 测试评分。参考解答平均改动约 107 行、跨 4 个文件,因此它衡量的是 SWE-bench Verified 已无法区分的多文件、企业级工作。 | 2025-09 | software-engineering code tool-use | active | medium | 61.5% Muse Spark 1.1 官方榜单 | 6 条 |
| tau2-bench ↑ tau-bench tau-bench 的继任者,新增电信故障排查领域(114 个任务),其中智能体和模拟用户都拥有工具,因此智能体必须协调并引导用户而非独自行动;保留了经核验的零售(115)和航空(50)领域。任务由原子子任务组合生成,并按最终数据库状态评分;pass^k 衡量重复试验间的可靠性。现以 tau^3-bench 形式维护,增加了银行知识领域和语音模态。 | 2025-06 | tool-use instruction-following general-assistant | active | medium | 87.9% Qwen3.5-397B-A17B 官方榜单 | 5 条 |
| FieldWorkArena 886 个任务,基于真实工厂、仓库和零售店现场采集的图像、视频和文档(711 个感知任务、121 个决策任务、54 个组合任务),依据对现场工人和管理者的访谈编写。智能体需提取信息、检测安全或流程违规并生成报告;答案对照真值,以精确匹配与近似匹配的加权组合按 0-1 评分(此处以百分比报告)。它测试多模态智能体在物理世界现场作业而非数字环境中的表现。 | 2025-05 | multimodal general-assistant safety reasoning | active | low | 52% · 人类 74% GPT-5.2 (2025-12-11) 论文 | 3 条 |
| PaperBench 智能体需从零复现 20 篇 ICML 2024 Spotlight 和 Oral 论文:理解论文、编写代码库并在可访问 GPU 的容器中运行实验。评分使用与作者共同制定的层级式评分表(8,316 个可评分叶节点),由 LLM 评判应用,给出 0 到 100 的复现分数。Code-Dev 变体仅对代码评分。它衡量长程研究工程能力,并有实测的人类(ML 博士)基线可供比较。 | 2025-04 | research ml-engineering code tool-use | active | medium | 43.4% IterativeAgent o1-high 官方榜单 | 4 条 |
| BrowseComp 1,266 个人工编写的问题,其简短可验证的答案只能通过持续浏览大量网页并组合相互交织的约束才能找到;人类训练者验证了他人无法在十分钟内作答,且当时的模型均告失败。通过评分器对照参考答案计算准确率。它隔离考察深度网络研究的持久性而非潜在知识,因此能显著区分各浏览智能体。 | 2025-04 | web tool-use factuality reasoning | medium | 92.2% GPT-5.6 Sol 聚合站 | 6 条 | |
| SWE-bench Multilingual 300 个精选的问题修复任务,来自 C、C++、Go、Java、JavaScript/TypeScript、PHP、Ruby 和 Rust 的 42 个代码库,使用 SWE-bench 收集流水线构建,并以 fail-to-pass 和 pass-to-pass 测试评分。它检验智能体编程能力能否迁移到 Python 之外,因为脚手架和模型都针对 SWE-bench Verified 做了大量调优。 | 2025-03 | software-engineering code tool-use | active | high | 72.7% Gemini 3 Flash 官方榜单 | 6 条 |
| MLE-bench 75 个 Kaggle 竞赛(22 低、38 中、15 高复杂度),智能体需在沙盒内于算力预算之内阅读任务、准备数据、训练模型并提交预测。得分为提交结果在真实 Kaggle 排行榜上至少能获得铜牌的竞赛比例。是端到端 ML 工程(而非孤立编码)的标准测试。 | 2024-10 | ml-engineering code tool-use | active | medium | 64.44% Famou-Agent 2.0 + Gemini-3-Pro-Preview 官方榜单 | 5 条 |
| SWE-bench Verified ↑ SWE-bench ↓ SWE-Bench Pro 500 个来自 12 个 Python 代码库的真实 GitHub issue,经人工标注者筛选以移除描述不足或无法测试的任务。智能体获得 issue 文本和代码库,需生成补丁,并以隐藏的 FAIL_TO_PASS 和 PASS_TO_PASS 测试评分。是智能体编程的事实标准;分数高度依赖脚手架及步数/成本限制。 | 2024-08 | software-engineering code tool-use | high | 96% Claude Opus 5 聚合站 | 4 条 | |
| OSWorld ↓ OSWorld 2.0 369 个在实时 Ubuntu 虚拟机中的真实计算机使用任务,涵盖 Chrome、LibreOffice、GIMP、VLC、VS Code、Thunderbird、操作系统文件操作和多应用工作流。智能体查看截图(可选无障碍树),输出鼠标/键盘动作,由基于执行的检查器对最终机器状态评分。是 GUI 计算机使用智能体的标准基准;OSWorld-Verified(2025 年 7 月)修复了 300 多个任务问题,是当前官方排行榜的基础。 | 2024-04 | computer-use multimodal tool-use | active | medium | 90.19% · 人类 72.36% Intelligence-Indeed Agent 官方榜单 | 6 条 |
| VisualWebArena 910 个在 Classifieds、Shopping 和 Reddit 站点上的网页任务,需要读取图像(商品照片、列表、发布的图片)才能完成,以视觉落地的检查扩展了 WebArena 的功能性评估。智能体接收截图(可选 Set-of-Marks 标注)和无障碍树,并需在浏览器中行动。它隔离考察纯文本网页智能体无法弥合的多模态感知差距。 | 2024-01 | web multimodal computer-use | active | high | 54% · 人类 88.7% Gemini 2.5 Flash (SGV) 官方榜单 | 5 条 |
| GAIA 466 个真实世界问题(166 个公开验证、300 个私有测试),需要网页浏览、文件处理、多模态阅读和工具使用才能得出简短、无歧义的答案;归一化后按准精确匹配评分。分三个难度等级,Level 3 需要长工具使用链。问题对人类来说很容易,因此与人类准确率的差距是通用助手的主要信号。 | 2023-11 | general-assistant tool-use web reasoning multimodal | medium | 93.36% · 人类 92% CustomGPT.ai Research Lab v44 官方榜单 | 5 条 | |
| WebArena 812 个长程自然语言任务,运行于自托管、功能完整的网站(电商、论坛、GitLab、CMS)以及地图、计算器和 wiki。智能体通过浏览器行动,以对最终站点状态或答案的程序化功能检查评分,而非匹配动作序列。是首个可复现的端到端网页智能体基准,至今仍是文本/DOM 网页智能体的参考。 | 2023-07 | web tool-use computer-use | active | high | 74.3% · 人类 78.24% WebTactix + Deepseek v3.2 官方榜单 | 5 条 |
| 已饱和或退役 —— 不再用于比较前沿系统。所示分数为最后一次报告值,不是榜首。 | ||||||
| Cybench | 2024-08 | safety, code, tool-use | saturated | high | 最后报告 96% 厂商自报 | |
| tau-bench → tau2-bench | 2024-06 | tool-use, instruction-following, general-assistant | retired | high | 最后报告 69.2% 官方榜单 | |
| AndroidWorld | 2024-05 | computer-use, multimodal, tool-use | saturated | medium | 最后报告 85.3% 聚合站 | |
| SWE-bench → SWE-bench Verified | 2023-10 | software-engineering, code, tool-use | saturated | high | 最后报告 52.62% 官方榜单 | |
| AgentBench | 2023-08 | tool-use, reasoning, web, code | retired | high | 最后报告 3.11 论文 | |
评测方
你自己运行的框架、基准维护者运营的榜单、独立复现模型的机构,以及转载已报告数字的聚合站。
| 评测方 | 类型 | 维护者 | 方法 | 状态 |
|---|---|---|---|---|
| DeepEval 开源、pytest 风格的 LLM 评估框架,面向应用测试:G-Eval、答案相关性、忠实度和工具正确性等指标通过 LLM 评判或本地 NLP 模型计算。它还内置了多个公开基准(MMLU、HellaSwag、BBH、DROP、TruthfulQA、HumanEval、GSM8K)的实现,遵循原论文的提示方式。分数由用户自行运行得出;该公司围绕它销售托管平台(Confident AI)。 | framework | Confident AI | self-run | active |
| EvalScope ModelScope 面向 LLM、VLM、嵌入和 AIGC 模型的一键评估框架。内置 100 多个基准并支持 pass@k 式聚合,提供在多轮循环中配合 Docker 沙盒运行基准的智能体模式、OpenCompass 和 VLMEvalKit 后端,以及推理压力测试和结果看板。分数由用户自行运行得出;它是 Qwen 及其他 ModelScope 模型发布的默认评估工具。 | framework | ModelScope (Alibaba) | self-run | active |
| HELM Holistic Evaluation of Language Models,斯坦福 CRFM 的开源框架,用于可复现的多指标评估。场景以标准提示封装数据集,run-spec 固定 shot 数和解码方式,指标涵盖准确率以及效率、偏见、毒性和校准;CRFM 自行运行该框架发布 HELM Capabilities(MMLU-Pro、GPQA、IFEval、WildBench、Omni-MATH)等排行榜。可作为独立的跨实验室基线,但已于 2026 年 6 月进入维护模式。 | framework | Stanford CRFM | self-run | archived |
| Inspect AI 英国 AI 安全研究所的开源评估框架。评估以 Python 任务形式编写,由数据集、求解器(提示、工具使用、多轮智能体、沙盒)和评分器(精确匹配、模型评分、自定义)组成,并提供可检视每个样本的日志查看器。配套的 inspect_evals 包提供 200 多个即用评估。结果由执行任务者自行运行得出;Inspect 也是 Epoch AI 和 lighteval 评估背后的引擎,因此许多已发布的第三方数据都可追溯至它。 | framework | UK AI Security Institute | self-run | active |
| Lighteval Hugging Face 的评估工具包,由运营 Open LLM Leaderboard 的团队构建。支持 1000 多个任务,覆盖 transformers、vLLM、SGLang、Nanotron 和 API 端点,保存样本级输出以便调试,并自 2025 年起以 Inspect AI 作为首选执行后端。分数由用户自行运行得出,任务配置(提示、指标、few-shot)在仓库中版本化,以便复现数据。 | framework | Hugging Face | self-run | active |
| LM Evaluation Harness 针对语言模型运行学术基准最广泛使用的开源框架。任务以 YAML 声明,后端包括 Hugging Face transformers、vLLM、SGLang 和托管 API,结果可缓存且可复现。曾为 Hugging Face Open LLM Leaderboard 提供支撑;需自行运行,因此分数取决于你的提示和 shot 设置。 | framework | EleutherAI | self-run | active |
| OpenAI Evals OpenAI 用于评估 LLM 和 LLM 系统的开源框架与注册表。评估以 YAML 声明,由精确匹配、模糊匹配和模型评分比较等模板打分;注册表混合了标准数据集与数百个社区贡献的任务。需自行针对 OpenAI API 运行,因此结果为自行运行所得。历史上影响深远,但该仓库自 2024 年以来没有新版本,OpenAI 现引导用户使用其控制台中的托管 Evals。 | framework | OpenAI | self-run | archived |
| OpenCompass 上海人工智能实验室的开源评估平台,覆盖 100 多个数据集,支持可配置提示、LLM 评判和 math-verify 评估器,推理后端包括 LMDeploy、vLLM 和 API 模型。分数需自行运行框架得出;同一团队自行运行它以发布 CompassRank 排行榜。广泛用于中英文开放权重模型报告,因此标注为"OpenCompass"的数据通常可由其配置复现。 | framework | Shanghai AI Laboratory (OpenCompass team) | self-run | active |
| Holistic Agent Leaderboard (HAL) 普林斯顿的第三方、成本感知 AI 智能体排行榜。HAL 框架以相同的编排在多个基准(GAIA、SWE-bench Verified Mini、tau-bench、CORE-Bench、USACO、AssistantBench、Online Mind2Web、ScienceAgentBench、SciCode)上运行智能体,记录每次模型调用和每一美元开销,并将结果绘制在准确率-成本帕累托前沿上。轨迹以加密形式发布。它显示了脚手架选择和成本的重要性,而实验室的单一数字报告掩盖了这一点;2026 年暂停新模型更新,转向可靠性工作。 | leaderboard | Princeton University (SAgE team) | self-run | active |
| LiveBench 限制污染的 LLM 基准与排行榜。题目每月刷新,取自近期 arXiv 论文、新闻、数据集和 IMDb 剧情简介,覆盖数学、编程、推理、语言、数据分析和指令遵循;每题都有客观的真值答案,因此评分自动完成且无需 LLM 评判。维护者自行运行所有上榜模型,且最新题集暂不公开发布,使其成为核对实验室自报分数的有用手段。 | leaderboard | LiveBench team (Abacus.AI, NYU and collaborators) | self-run | active |
| LMArena 众包人类偏好排行榜,前身为 Chatbot Arena。访问者与两个匿名模型并排对话并投票;评分基于数百万次成对投票用 Bradley-Terry 模型(最初为 Elo)拟合,并提供折减长度和格式影响的风格控制变体。由于它衡量的是真实用户的偏好而非答案正确性,它与准确率基准互补且难以被污染,但会奖励说服力,并对投票来源和模型采样策略敏感。 | leaderboard | Arena (LMArena, spun out of LMSYS / UC Berkeley) | crowdsourced | active |
| Open LLM Leaderboard Hugging Face 面向开放权重模型的排行榜。任何人都可提交 Hub 检查点,系统会用固定版本的 lm-evaluation-harness 在相同提示下自动评估(v1:ARC、HellaSwag、MMLU、TruthfulQA、WinoGrande、GSM8K;2024 年 6 月起的 v2:IFEval、BBH、MATH level 5、GPQA、MuSR、MMLU-Pro)。它使数千个开放模型的可复现、同等条件比较成为可能,随后趋于饱和并于 2025 年 3 月退役。 | leaderboard | Hugging Face | submission | archived |
| SWE-rebench Nebius 持续刷新的智能体软件工程排行榜。每月从新的 GitHub issue 中挖掘出可执行任务,所有模型使用同一固定脚手架运行,成功率为隐藏测试通过的任务比例(附 pass@5、每题成本和 token 数)。任务带有日期,可标记相对各模型发布时间的污染情况。由于在单一框架下对新问题自行运行,它比实验室自报的 SWE-bench Verified 数据更干净。 | leaderboard | Nebius | self-run | active |
| Artificial Analysis 独立基准测试公司,在完全相同的零样本提示、温度和重复设置下,对每个主要模型和 API 端点自行运行一套固定评估,并发布 Intelligence Index 以及速度、延迟和价格。答案通过正则提取、代码执行或 LLM 等价检查器评分;智能体评估在其开源 Stirrup 框架中运行。实验室不为排名付费,且"神秘顾客"政策会对公开端点进行复测,使其成为对照各家自报数据的有用跨实验室参考。 | independent-evaluator | Artificial Analysis | self-run | active |
| Epoch AI Benchmarking Hub Epoch AI 的前沿模型基准结果数据库。部分基准(GPQA Diamond、FrontierMath、SWE-bench Verified、SimpleQA Verified、MirrorCode)由其内部使用 Inspect AI 在有文档记录的一致设置下评估并附误差线;其他基准(ARC-AGI、Terminal-Bench、HLE、MMLU)从官方排行榜或一手来源收集并如实标注。数据采用 CC-BY 许可且可下载,使其成为独立于实验室宣传的能力趋势分析的标准来源。 | independent-evaluator | Epoch AI | self-run | active |
| Scale SEAL Leaderboards Scale AI 的专家驱动排行榜。多数提示集为私有并由经审核的领域专家编写,模型由 Scale 运行,答案由专家或评分表引导的 LLM 评判打分并附误差线;模型通常仅在其开发者首次接触提示时上榜。它还托管 Scale 共同创作的公开基准(如 Humanity's Last Exam 和 SWE-Bench Pro)的官方排行榜。独立于其所排名的实验室,尽管 Scale 本身是其中许多实验室的数据供应商。 | independent-evaluator | Scale AI (SEAL Research Lab) | self-run | active |
| Vals AI 独立评估机构,在法律、金融、税务、医疗、编程和数学领域基准上运行前沿模型和智能体。多数测试集为私有且由专家构建(Finance Agent、Legal Research Bench、TaxEval、Vibe Code Bench、Excel Modeling),因此不会泄漏到训练数据中;它也重新运行部分公开学术基准。分数报告准确率及标准误,附成本和延迟,所有评估均在内部运行而非从供应商收集,这也是其数据常与实验室自报数据不同的原因。 | independent-evaluator | Vals AI | self-run | active |
| BenchLM 聚合器,从模型卡、发布博文、基准排行榜和 OpenBench 收集已发布的基准分数,汇成一张涵盖 400 多个模型的表格,归一化为类别与总体排名,并标注"Supported"与"Estimated"证据标签。它不自行运行任何评估,因此数值继承原始来源所用的脚手架和设置;其价值在于覆盖广度、每个分数附来源链接,以及对基准的新鲜度/饱和度标记。 | aggregator | BenchLM.ai (independent, maintained by @glevd) | collected | active |
时间线
所有被追踪的基准与评测方的发布年份。
- - - 人类基线 ⇢ 被取代 ● 发布条高 = 有来源的最高分。悬停看详情,点击进入。
未绘制(非百分制指标): AA-Omniscience, AgentBench, BenchCAD, LMArena Text
模型基准Agent 基准评测方
- 20265
- 202518
- 202423
- Artificial Analysis01
- VisualWebArena01
- BFCL02
- Lighteval02
- LiveCodeBench03
- EvalScope04
- Inspect AI04
- OSWorld04
- RULER04
- Vals AI04
- AndroidWorld05
- Scale SEAL Leaderboards05
- LiveBench06
- MMLU-Pro06
- tau-bench06
- Cybench08
- SWE-bench Verified08
- MMMU-Pro09
- MLE-bench10
- Epoch AI Benchmarking Hub11
- FrontierMath11
- SimpleQA11
- Aider Polyglot12
- 202313
- 20222
- 20216
- 20201
- MMLU09
- 20194
- DROP03
- HellaSwag05
- WinoGrande07
- ARC-AGI-111