2026 LLM大模型权威排行榜评测网站指南(持续更新)
面对不同的大模型排行榜真正困难的不是找到一个名次而是判断这个名次反映的是用户偏好、标准化测试、软件工程能力还是价格与速度.如果只想快速了解当前大模型的综合表现优先查看Arena和Artificial Analysis前者更接近真实用户的使用偏好后者适合同时比较能力、价格和推理速度。专项能力则应结合 LiveBench、SWE-bench 等对应基准判断。网站编号表示推荐阅读顺序不代表对平台权威性的绝对排名动态榜单的结果和维护状态仍可能继续变化。网站汇总评测网站开发/维护团队主要方向更新状态ArenaArena Team起源于 UC Berkeley SkyLab / LMSYS真实用户偏好、文本、多模态、代码、Agent持续更新Artificial AnalysisArtificial Analysis综合能力、价格、速度、Agent、API持续更新LiveBenchAbacus.AI、NYU、NVIDIA、UMD、USC 等研究人员动态题库、抗污染、客观评分代码仓库持续更新官网显示“Showing LiveBench-2026-06-25 — the latest release”SWE-benchSWE-bench Team起源于 Princeton、PLI、UChicago软件工程、Coding Agent持续更新LM Market CapAnalyxa LLC多来源综合排名、价格、速度、上下文与趋势持续更新官方称模型元数据每小时刷新Hugging Face Open LLM LeaderboardHugging Face 与开源社区开放权重模型标准基准官方已停止并归档OpenCompass司南上海人工智能实验室相关团队及开源社区中文、通用能力、多模态、专项评测本文归档为历史参考主榜单最近更新时间为 2026-05-13首选推荐快速了解当前大模型表现1. ⭐ Arena看真实用户偏好与实际对战表现网站简介Arena 是基于真实用户匿名对战与偏好投票进行模型比较的平台。平台最初以 Chatbot Arena 形式出现后更名为 LMArena并于 2026 年 1 月正式更名为 Arena。其公开榜单覆盖文本、视觉、代码、图像、视频、搜索和 Agent 等多种模型与任务。开发团队简介Arena 最初由加州大学伯克利分校UC BerkeleySkyLab 的研究人员创建项目早期属于 UC Berkeley / LMSYS 研究体系。此后项目公司化运营由 Arena Team 持续开发和维护。主要评测方式匿名模型对战真实用户投票基于成对比较数据计算模型排名文本、视觉、Web 开发、图像、视频、搜索、Agent 等分类榜单官方链接及更新时间官网https://arena.ai/更新时间动态更新截至 2026-08-19Arena 官方最近公开的榜单产品更新日期为2026-08-14。排行榜https://arena.ai/leaderboard更新时间动态更新截至 2026-08-19Arena 官方最近公开的榜单产品更新日期为2026-08-14。2. ⭐ Artificial Analysis综合比较模型能力、价格与速度网站简介Artificial Analysis 是独立 AI 基准测试与分析平台公开比较大语言模型和 AI API 服务商的能力、价格、输出速度、延迟、上下文窗口以及其他性能指标。其模型榜单包含 Artificial Analysis Intelligence Index并提供代码、Agent、长上下文、多模态、指令遵循等专项评测。开发团队简介Artificial Analysis 由同名独立 AI 基准测试公司开发和维护。平台业务覆盖语言模型评测、推理性能、AI 硬件、语音、图像与视频生成、Agent 等方向。主要评测方式Artificial Analysis Intelligence Index独立运行的模型能力基准测试Coding、Agentic、Long Context、Multimodal 等专项评测API 输出速度、首 Token 延迟、端到端响应时间测试模型与 API 价格比较官方链接及更新时间官网https://artificialanalysis.ai/更新时间持续更新截至 2026-08-19首页 Changelog 最近一条公开更新为2026-08-18。大模型排行榜https://artificialanalysis.ai/leaderboards/models更新时间动态更新截至 2026-08-19平台最近一批公开语言模型评测更新日期为2026-08-18。其他评测与基准测试网站3. LiveBench强调抗污染的动态评测网站简介LiveBench 是面向大语言模型的基准测试和排行榜目标之一是降低测试集污染对评测结果的影响。其题目来源包括数学竞赛、论文、新闻和数据集等并使用具有客观标准答案的任务进行自动评分。开发团队简介LiveBench 由来自 Abacus.AI、纽约大学NYU、NVIDIA、马里兰大学UMD和南加州大学USC等机构的研究人员共同开发项目由 Abacus.AI 赞助。其论文入选 ICLR 2025 Spotlight。主要评测方式使用较新的信息来源构造题目以限制测试集污染使用可验证的客观标准答案进行自动评分Reasoning、Coding、Mathematics、Data Analysis、Language、Instruction Following 等分类评测官方仓库持续维护模型配置与评测代码官方链接及更新时间官网与排行榜https://livebench.ai/更新时间动态页面展示 Showing LiveBench-2026-06-25 — the latest release.GitHubhttps://github.com/LiveBench/LiveBench更新时间最近提交2026-08-18。4. SWE-bench软件工程与 Coding Agent 评测网站简介SWE-bench 是面向大语言模型和软件工程 Agent 的代码能力评测基准。其任务来自真实 GitHub Issue 和对应代码仓库要求模型理解现有代码库、修改代码并通过项目测试。SWE-bench 官方榜单包括 SWE-bench、SWE-bench Verified、SWE-bench Multilingual、SWE-bench Multimodal、SWE-bench Lite 等版本并在 2026 年继续维护相关榜单和软件工程评测项目。开发团队简介SWE-bench 最初由来自 Princeton University、Princeton Language and IntelligencePLI和 University of Chicago 的研究人员提出。原始论文作者包括 Carlos E. Jimenez、John Yang、Alexander Wettig、Shunyu Yao、Kexin Pei、Ofir Press 和 Karthik Narasimhan。项目由 SWE-bench Team 持续维护。主要评测方式真实 GitHub Issue真实开源代码仓库自动运行测试验证补丁正确性以成功解决任务的比例作为核心指标之一Verified、Multilingual、Multimodal 等不同任务集合官方链接及更新时间官网与排行榜https://www.swebench.com/更新时间动态更新官网 News 最近一项标为2026 年 5 月ProgramBench官方代码仓库截至核对日仍在更新。GitHubhttps://github.com/SWE-bench/SWE-bench更新时间最近提交2026-08-18。5. LM Market Cap综合查看模型排名、价格与使用成本网站简介LM Market Cap 是一个 AI 模型排名与比较平台。它汇总多个公开评测来源为模型计算统一的 LMC Score并集中展示价格、输出速度、上下文窗口、能力特性和排名变化等信息。除了大语言模型网站还收录图像与视频生成模型。LM Market Cap 更适合用来快速筛选和横向比较模型而不是作为某项原始基准测试的官方结果来源。需要核验具体能力时仍应回到 Arena、LiveBench、SWE-bench 等原始评测平台。开发团队简介LM Market Cap 官网将其标注为 Analyxa LLC 旗下产品。官网公开资料主要介绍平台功能和排名方法未提供更详细的开发团队成员信息。主要评测方式汇总 Arena Elo、LiveBench、SWE-bench Verified、模型官方报告等多个来源的数据对不同基准分数进行基线扣除和归一化统一换算到 0100 分LMC Score 由基准测试分数90%、能力特性5%和上下文窗口5%组成在基准测试部分将 Arena Elo 作为 30% 的权重其余任务基准合计占 70%单独展示模型价格、速度、上下文窗口、可用方式和历史排名变化支持按照质量、成本和使用需求调整权重生成自定义排名官方链接及更新时间官网与排行榜https://lmmarketcap.com/更新时间动态更新截至 2026-08-19官网显示榜单处于 Live 状态官方说明模型元数据每小时刷新。排名方法https://lmmarketcap.com/docs/methodology更新时间方法页持续维护截至 2026-08-19页面模型评估方法变更记录的最新版本为v32026 年 4 月。历史参考6. Hugging Face Open LLM Leaderboard已停止维护网站简介Open LLM Leaderboard 是 Hugging Face 曾长期维护的开放大语言模型排行榜主要用于比较公开权重模型在多个标准基准上的表现。该榜单曾广泛用于 Llama、Mistral、Qwen 等开放模型的横向比较。Hugging Face 在2025-03-13正式宣布 Open LLM Leaderboard 退役。官方归档材料继续保留旧版榜单、评测方法和历史结果。开发团队简介该榜单由 Hugging Face 团队及开源社区建设和维护依托 Hugging Face Hub、Datasets 和评测工具运行开放模型基准测试。主要评测方式历史版本使用过 IFEval、BBH、MATH、GPQA、MMLU-Pro 等标准基准评测开放模型。官方链接及更新时间归档文档https://huggingface.co/docs/leaderboards/en/open_llm_leaderboard/archive更新时间归档页面本身未公开单一最后更新时间其中 Open LLM Leaderboard v1 官方记录为2024 年 6 月归档。官方退役公告https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard/discussions/1135更新时间2025-03-13官方宣布 leaderboard officially retiring。7. OpenCompass司南本文作为历史参考网站简介OpenCompass 是面向大语言模型和多模态大模型的开源评测平台提供模型评测框架、数据集、评测配置和公开榜单。其评测体系支持客观评测和主观评测并覆盖知识、语言、理解、推理、代码、安全及垂直领域等能力。本文将 OpenCompass 的综合大模型排行榜列入“归档/历史参考”。截至 2026-08-19主榜单页面显示的最近一次更新时间为2026-05-13CompassArena 页面显示的榜单更新日期为2026-06-11。OpenCompass 代码仓库仍在维护但官网主页显示的模型已经较为陈旧因此显示归档。开发团队简介OpenCompass 由上海人工智能实验室相关团队开发并维护同时接受开源社区贡献。其开源代码、文档和多个专项评测平台仍可访问。主要评测方式标准数据集客观评测LLM-as-a-Judge 评测主观模型比较CompassAcademic 学术榜单CompassArena 匿名模型对战与用户投票多模态、医疗、金融等专项评测官方链接及更新时间OpenCompass 官网https://opencompass.org.cn/更新时间官网首页未公开单一最后更新时间本文参考的综合主榜单最近一次页面更新时间为2026-05-13。大语言模型主榜单https://rank.opencompass.org.cn/leaderboard-llm-v2更新时间2026-05-13主榜单页面显示的最近更新时间。

相关新闻

病媒防控新利器:蚊子种类检测数据集(含YOLOv11n实战)

病媒防控新利器:蚊子种类检测数据集(含YOLOv11n实战)

病媒防控新利器:蚊子种类检测数据集(含YOLOv11n实战) 蚊虫是疟疾、登革热、寨卡病毒等多种传染病的重要传播媒介。传统蚊虫种类鉴定依赖人工形态学观察,效率低且对专业人员要求高。今天介绍的蚊子种类检测数据集,结合深…

2026/8/22 17:14:53 阅读更多 →
Vite 项目怎么跑进 qiankun 微前端:vite-plugin-qiankun 快速上手指南

Vite 项目怎么跑进 qiankun 微前端:vite-plugin-qiankun 快速上手指南

Vite 项目怎么跑进 qiankun 微前端:vite-plugin-qiankun 快速上手指南 【免费下载链接】vite-plugin-qiankun 保留vite es特性,快速接入乾坤微前端子应用 项目地址: https://gitcode.com/gh_mirrors/vi/vite-plugin-qiankun 乾坤是主流的微前端框…

2026/8/22 17:14:53 阅读更多 →
xiaozhi-esp32 如何把一块 ESP32 开发板变成 AI 语音助手:完整上手指南

xiaozhi-esp32 如何把一块 ESP32 开发板变成 AI 语音助手:完整上手指南

xiaozhi-esp32 如何把一块 ESP32 开发板变成 AI 语音助手:完整上手指南 【免费下载链接】xiaozhi-esp32 An MCP-based chatbot | 一个基于MCP的聊天机器人 项目地址: https://gitcode.com/GitHub_Trending/xia/xiaozhi-esp32 xiaozhi-esp32 是一个开源的固件…

2026/8/22 17:14:53 阅读更多 →

最新新闻

从数学建模到临床决策:出血性脑卒中预后预测与治疗分析实战

从数学建模到临床决策:出血性脑卒中预后预测与治疗分析实战

1. 项目概述:从赛题到临床问题的映射每年九月的中国研究生数学建模竞赛,对于相关领域的研究生来说,都是一场硬仗。2023年的E题“出血性脑卒中临床智能诊疗建模”,直接把战场拉到了医疗健康这个硬核又充满挑战的领域。看到这个题目…

2026/8/22 19:25:44 阅读更多 →
神经网络自学指南:从核心概念到实战避坑

神经网络自学指南:从核心概念到实战避坑

1. 从零到一:一个非科班生的神经网络自学心路几年前,当我第一次听说“神经网络”这个词时,感觉它像是科幻电影里的东西,离我这个普通程序员的世界很远。身边的朋友、网上的文章都在谈论它,仿佛不懂点深度学习&#xff…

2026/8/22 19:25:44 阅读更多 →
马尔科夫预测模型:从核心原理到实战应用,解决有限数据下的状态预测问题

马尔科夫预测模型:从核心原理到实战应用,解决有限数据下的状态预测问题

1. 从“薛定谔的猫”到“明天的天气”:为什么我们需要马尔科夫预测如果你问一个刚接触数学建模的同学,预测未来最需要什么,他可能会说“海量的历史数据”或者“复杂的神经网络”。但现实中,很多预测问题,我们手头的数据…

2026/8/22 19:25:44 阅读更多 →
Node.js项目脚手架搭建:从零构建可维护的后端服务工程化实践

Node.js项目脚手架搭建:从零构建可维护的后端服务工程化实践

1. 从零到一:为什么你的第一个Node.js项目总感觉不对劲? 很多刚接触Node.js的朋友,在跟着教程敲完 npm init -y 和 npm install express 之后,看着跑起来的“Hello World”服务器,心里总会犯嘀咕:这就…

2026/8/22 19:25:44 阅读更多 →
无人机物流系统架构解析:从云端调度到边缘计算的工程实践

无人机物流系统架构解析:从云端调度到边缘计算的工程实践

无人机送货,这个听起来像科幻电影里的场景,正在以超乎想象的速度变成现实。如果你还认为这只是硅谷实验室里的概念验证,或者仅限于几个富裕社区的“科技秀”,那么亚马逊的最新动作可能会改变你的看法。亚马逊近日宣布,…

2026/8/22 19:25:44 阅读更多 →
旅游业销售岗面试技巧与应答策略

旅游业销售岗面试技巧与应答策略

1. 旅游业销售岗面试的底层逻辑旅游业销售岗位的核心价值在于"连接供需"。与普通销售不同,旅游产品销售的是"体验预期",客户购买的不仅是机票酒店,更是对美好旅程的想象。这决定了面试考察的三大维度:产品理解…

2026/8/22 19:24:43 阅读更多 →

日新闻

沉金PCB工艺实战指南:从设计到SMT焊接的可靠性保障

沉金PCB工艺实战指南:从设计到SMT焊接的可靠性保障

在电子硬件开发领域,PCB(印制电路板)的沉金工艺是提升产品可靠性和焊接质量的关键环节。对于需要高密度互连、长期稳定运行或高频信号传输的板卡,如“黍姐仿通行证”这类可能涉及身份识别、数据交互的硬件项目,选择正确…

2026/8/22 0:00:11 阅读更多 →
电气考研电路八月强化四步法:从知识体系到真题实战的闭环攻略

电气考研电路八月强化四步法:从知识体系到真题实战的闭环攻略

这次我们来看一个针对电气考研电路科目的学习规划项目。它不是软件工具,而是一套聚焦于8月份关键节点的备考策略。对于电气工程考研的同学来说,电路分析是专业课的重中之重,也是拉开分差的关键。进入8月,复习进入强化阶段&#xf…

2026/8/22 0:00:11 阅读更多 →
消除AI代码的“AI味”:Claude Code设计优化技能配置与实战指南

消除AI代码的“AI味”:Claude Code设计优化技能配置与实战指南

大家好,我是专注于前端开发与AI工具实践的技术博主。在日常使用 Claude Code 等AI编程助手时,你是否也遇到过这样的困扰:生成的代码功能上没问题,但代码风格、组件设计、交互逻辑总透着一股“AI味”——布局单调、样式简陋、交互生…

2026/8/22 0:00:11 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/21 3:21:33 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/22 8:09:09 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/21 6:07:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/22 18:08:39 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/22 7:31:03 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/22 3:22:48 阅读更多 →