10.7 参考文档
LLM 评测排行榜
- LMSYS Chatbot Arena:由社区驱动的最佳 LLM 与 AI 聊天机器人评测平台
- Vellum LLM 对比排行榜
- Berkeley 函数/工具调用排行榜:评测 LLM 准确调用函数(即工具)的能力,采用真实世界数据,定期更新。
- Galileo 智能体排行榜:评测 LLM 在智能体场景下的表现。第二版已同步上线。
评测基准测试
- VisualWebArena:面向多模态智能体的基准测试
- GAIA:HF 通用 AI 智能体基准测试
- OSWorld 多模态智能体基准测试:在真实计算机环境中对开放式任务的多模态智能体进行基准评测
- SWE-Bench:用于测试系统自动解决 GitHub Issue 能力的数据集
LLM 推理基准测试研究
- Inference Benchmarking of Large Language Models on AI Accelerators(大语言模型在 AI 加速器上的推理基准测试):LLM-Inference-Bench,一套综合性基准测试套件,评测各类 llama 风格 LLM 在当前主流 AI 加速器上的推理性能
