跳转至

LLM 评测基准

概述

LLM 基准测试从推理、知识、编程、数学、指令遵循、安全性等多个维度衡量大型语言模型的能力。本页涵盖社区驱动的排行榜与标准化学术基准测试两类资源。

社区驱动排行榜

LMSYS Chatbot Arena

资源LMSYS Chatbot Arena

目前引用最广泛的社区驱动 LLM 对比评测平台。该平台采用 Elo 评分体系,基于盲测匿名对比下收集的人类偏好投票,已汇聚来自数百个模型的逾百万次人工投票。

核心特性: - 基于人类偏好排名,而非自动化指标 - 盲测评估——用户不知道对比的是哪个模型 - 覆盖通用对话、编程、数学及创意任务 - 随新模型提交持续更新 - 被视为真实用户偏好的黄金标准

Vellum LLM Comparison Board

资源Vellum LLM Leaderboard

综合性排行榜,从质量、速度、成本等多个维度对 LLM 性能进行横向对比,提供并排比较视图,帮助团队为具体使用场景选择合适的模型。

Berkeley Function/Tool Calling Leaderboard

资源Berkeley Function Calling Leaderboard

使用真实 API 数据评测 LLM 的工具调用准确性。对于需要模型正确选择并调用工具、传入合法参数的智能体应用而言,这是至关重要的基准测试。

核心特性: - 涵盖 1,600+ 个 API 的真实世界数据 - 测试简单调用、并行调用、多重调用及嵌套函数调用 - 同时评测函数选择准确率与参数正确性 - 随新模型和新 API 类别持续更新 - 智能体场景下模型评测的必备基准

Galileo Agent Leaderboard

资源Galileo Agent Leaderboard

专注于智能体场景的 LLM 性能排行榜,评测模型在多步推理、工具调用及特定智能体上下文中的任务完成能力。第二版提供了更完善的评测指标。

学术与标准化基准测试

推理与知识

Humanity's Last Exam(HLE) 由 Scale AI 与 Center for AI Safety 联合构建的大规模专家级基准测试,收录了来自 100 多个学术领域、由领域专家贡献的数千道题目。题目取材于人类知识的前沿——研究生级别乃至更高——覆盖数学、物理、化学、生物、法律、历史、哲学等领域。该基准专门设计为难以被前沿模型"刷满分",旨在随着 MMLU、GPQA 等通用基准逐渐触及天花板,持续发挥有效区分作用。

核心特征: - 约 3,000 道题目,横跨 100+ 学科,每题均经过领域专家提交与审核 - 包含选择题和开放式问答两种形式 - 题目难度刻意超出常规学术课程,许多题目需要跨子领域的综合推理 - 作为留存测试集维护,最大程度降低数据污染风险 - 可作为推理能力的长期上界参考基准

MMLU(Massive Multitask Language Understanding) 涵盖 57 个科目的知识测试,包括 STEM、人文、社会科学等方向。是衡量广博知识与推理能力的标准基准。

HellaSwag 测试常识推理与自然语言推理能力,要求模型以语境恰当的方式完成句子。

ARC(AI2 Reasoning Challenge) 测试小学科学题,要求超越简单事实检索的推理能力,包含简单(Easy)和挑战(Challenge)两个子集。

TruthfulQA 评测模型在人类因认知误区常答错的问题上能否生成真实准确的回答,衡量模型产生幻觉的倾向。

编程基准测试

HumanEval OpenAI 发布的基准测试,包含 164 道 Python 编程题,模型生成的代码需通过单元测试。是衡量代码生成能力的标准基准。

MBPP(Mostly Basic Python Problems) 500 道众包 Python 编程题,与 HumanEval 互补,覆盖更广泛的难度层级。

LiveCodeBench 无污染的编程基准测试,持续从竞技编程平台(LeetCode、Codeforces、AtCoder)引入新题目。

数学

MATH 包含 12,500 道数学竞赛题,分 7 个难度级别,从代数到微积分,测试高级数学推理能力。

GSM8K 8,500 道小学数学应用题,要求多步算术推理,是数学问题解决能力的标准基准。

AIME 美国数学邀请赛(American Invitational Mathematics Examination)真题,测试前沿数学推理能力。

长上下文

RULER 在 4K 到 128K token 的不同上下文长度下,评测检索、多跳推理、信息聚合等任务中的长上下文理解能力。

HELMET 全面评测长上下文语言模型(Holistic Evaluation of Long-context Language Models),覆盖需要真正长上下文理解的多样化任务。

推理性能基准测试

LLM-Inference-Bench

资源Inference Benchmarking of LLMs on AI Accelerators

综合性基准测试套件,评测 LLM 在各类 AI 加速器上的推理性能,衡量指标包括首 Token 生成时间(TTFT)、每秒生成 Token 数以及不同硬件配置下的吞吐量。

vLLM Benchmark

资源vLLM Benchmark

使用 vLLM 托管推理 LLM 的基准测试,衡量生产服务场景下的吞吐量与延迟。

基准选择指南

评测目标 推荐基准
通用能力对比 LMSYS Chatbot Arena
工具 / 函数调用 Berkeley Function Calling Leaderboard
智能体性能 Galileo Agent Leaderboard
编程能力 HumanEval、LiveCodeBench
数学推理 MATH、GSM8K
广博知识 MMLU
专家级 / 前沿推理 Humanity's Last Exam(HLE)
真实性 TruthfulQA
长上下文 RULER、HELMET
推理性能 LLM-Inference-Bench

局限与注意事项

基准饱和

许多主流基准测试(MMLU、HumanEval)正逐渐饱和,前沿模型的得分已接近 90% 以上。需要更具挑战性的新基准,才能有效区分顶尖模型之间的差距。

训练数据污染

模型在训练阶段可能已经见过基准题目,导致分数虚高。应优先选择留存测试集或动态生成题目的基准测试。

任务覆盖缺口

没有任何单一基准能覆盖所有真实使用场景。建议同时使用多个基准,并针对具体业务领域补充专项评测。

参见