别再被跑分骗了:大模型 Benchmark 到底在考什么
Kimi K3 发布那周3万亿参数的新闻铺满了科技媒体各种 benchmark 数字看得人眼花缭乱。每次新模型出来都会带一串分数MMLU 90、GSM8K 95、HumanEval 超越 GPT-4但真正拿到手里用的时候体感和跑分之间总有一段说不清的距离。这段距离不是模型虚标也不是用户错觉它来自 benchmark 本身的测量边界。MMLU 覆盖57个学科的选择题从高中数学到法学到医学都有它确实能反映一个模型的知识广度和选择题作答能力但它不测长文本连贯性不测多轮对话里的上下文保持不测指令遵循在边缘 case 下的稳定性。GSM8K 和 MATH 测数学推理链chain-of-thought 能力强的模型在这两个榜上分数好看可真实工作中遇到的数学问题从来不是小明有三个苹果那样条件清晰的格式条件是模糊的、信息是冗余的、你甚至要先判断该不该算。HumanEval 给一个函数签名和 docstring 让模型补全实现函数体通常不到20行输入输出定义明确这和工程师日常面对的读三万行代码找到 bug 再决定怎么改之间差了好几个量级。SWE-bench 在这方面进了一步给真实 GitHub issue 让模型生成 patch但它提供的是干净的 issue 描述和完整代码上下文不需要你自己去复现问题不需要和人讨论需求边界不需要考虑改动的连锁影响。我们在做 Mano-P 的过程中对这个问题有比较直接的感受。Mano-P 是跑在端侧的 GUI-VLA 模型核心 benchmark 是 OSWorld测试 GUI Agent 能否在真实桌面环境里完成指定操作。目前 Mano-P 在 OSWorld 专项榜上以 58.2% 的成功率排名第一比第二名 opencua-72b 的 45.0% 高出13.2个百分点WebRetriever Protocol I 上是41.7 NavEval超过 Gemini 2.5 Pro Computer Use 的40.9和 Claude 4.5 Computer Use 的31.3。这些数字是真实的、可复现的但我们内部评估的时候从来不会只看这两个数。OSWorld 的任务是预设的环境是干净的不会突然弹出系统通知不会遇到网络超时不会出现应用闪退而这些情况在真实使用中每天都在发生。benchmark 污染是另一个行业里公开讨论多年但很少在发布稿里被提及的问题。测试集公开之后训练数据爬取过程中很容易把 benchmark 题目和答案一起包含进去模型不是在推理是在复述。Hugging Face Open LLM Leaderboard 过去两年做过多次测试集更新每次换题之后之前霸榜的模型都会出现不同程度的分数回落这个现象本身就说明了问题。判断污染没有绝对标准但有几个经验信号某个 benchmark 发布半年后分数集体暴涨且涨幅远超同期模型能力的自然提升曲线通常意味着测试题已进入训练数据一个模型在标准集上分数极高但换一种表述方式或稍微变形题目后表现骤降往往说明它对原题有记忆。LiveCodeBench 这类持续更新题目的榜单之所以被业内更看重原因就在这里——题目一直在换污染窗口短分数更接近真实能力。端侧模型的 benchmark 解读还多了一层硬件依赖。同样的模型、同样的量化方案跑在 A100 上和跑在 M4 Mac mini 上是完全不同的速度和体验内存占用差一个 GB 就可能决定它能不能在用户的设备上跑起来。Mano-P 的4B模型配合 Cider SDK 做 W8A8 激活量化在 M5 Pro 上 prefill 比 MLX W4A16 基线快1.4到2.2倍但这组数字换到 M3 或 Intel 芯片上参考价值就很有限。端侧场景下 tokens/s 和峰值内存往往比成功率更直接地影响用户体感——一个响应快但偶尔出错的 Agent很多时候比一个慢三秒才给出完美结果的 Agent 更实用因为前者的交互节奏接近人的操作习惯。SWE-bench 看 Verified 子集比看完整版靠谱完整版里有大量标注噪音。MMLU 不要只看总分STEM 分项和人文分项拆开看差异会很大一个文科拉分的模型和一个理科拉分的模型适用场景完全不同。OSWorld 这种领域专项榜要区分 specialized 和 general 两个类别Claude Computer Use 在综合榜上72.1%的成绩是云端 API 大模型跑出来的和端侧专项模型放在同一个数字里比较意义不大。LMSYS Chatbot Arena 用 ELO 对战制人工偏好投票比单一客观题测试更能反映对话体验但它的局限在于评分者的偏好本身带有主观性。我们团队内部评估模型用三层方式先看相关 benchmark 做初筛只看和目标场景直接对应的那些榜单然后用自建的 eval set 跑一轮题目来自真实业务场景50到100条覆盖不同难度按人工标注的标准判定合格与否最后小范围试用一周收集实际使用中的反馈。自建测试集这一步尤其重要Mano-P 除了跑公开的 OSWorld内部一直维护着一套中文界面和本地化应用的测试集里面大量是企业软件场景和中文交互流程这些在公开 benchmark 里几乎没有覆盖。benchmark 是标准化测量工具它在自己的设计范围内是有效的超出范围就不具备参考价值。它能帮你快速筛掉明显不行的模型但不能替你做最终判断。拿真实任务跑半天得到的信息比看一周排行榜要多。Mano-P 代码和模型权重在 GitHub 开源https://github.com/Mininglamp-AI/Mano-P OSWorld 和 WebRetriever 的成绩都可以复现。

相关新闻

如何快速掌握Pokémon Essentials:面向新手的完整宝可梦游戏开发指南

如何快速掌握Pokémon Essentials:面向新手的完整宝可梦游戏开发指南

如何快速掌握Pokmon Essentials:面向新手的完整宝可梦游戏开发指南 【免费下载链接】pokemon-essentials A heavily modified RPG Maker XP game project that makes the game play like a Pokmon game. Not a full project in itself; this repo is to be added in…

2026/7/29 17:16:19 阅读更多 →
解锁Windows远程桌面限制:RDP Wrapper让家庭版也能享受专业级远程访问

解锁Windows远程桌面限制:RDP Wrapper让家庭版也能享受专业级远程访问

解锁Windows远程桌面限制:RDP Wrapper让家庭版也能享受专业级远程访问 【免费下载链接】rdpwrap RDP Wrapper Library 项目地址: https://gitcode.com/gh_mirrors/rd/rdpwrap 您是否遇到过这样的困境:想在Windows家庭版上使用远程桌面功能&#x…

2026/7/29 17:16:19 阅读更多 →
明日方舟桌宠Ark-Pets:让你的二次元伙伴突破次元壁,成为桌面智能伴侣

明日方舟桌宠Ark-Pets:让你的二次元伙伴突破次元壁,成为桌面智能伴侣

明日方舟桌宠Ark-Pets:让你的二次元伙伴突破次元壁,成为桌面智能伴侣 【免费下载链接】Ark-Pets Arknights Desktop Pets | 明日方舟桌宠 (ArkPets) 项目地址: https://gitcode.com/gh_mirrors/ar/Ark-Pets 你是否曾幻想过,让你最爱的…

2026/7/29 17:15:18 阅读更多 →

最新新闻

CentOS 7 vsftpd.conf 配置文件详解:监听、用户、权限、被动模式与 TLS

CentOS 7 vsftpd.conf 配置文件详解:监听、用户、权限、被动模式与 TLS

# CentOS 7 vsftpd.conf 配置文件详解:监听、用户、权限、被动模式与 TLS1. 服务介绍/etc/vsftpd/vsftpd.conf 是 CentOS 7 上 vsftpd 的主配置文件,用于控制监听方式、匿名和本地用户、写入权限、目录隔离、被动端口、日志、超时及 TLS 加密…

2026/7/29 17:29:25 阅读更多 →
d2dx:暗黑破坏神2现代化的终极解决方案

d2dx:暗黑破坏神2现代化的终极解决方案

d2dx:暗黑破坏神2现代化的终极解决方案 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 还在为经典《暗黑破坏神2…

2026/7/29 17:29:25 阅读更多 →
硬问题在一元自指本体论下完整重述,以及尚存的开放问题

硬问题在一元自指本体论下完整重述,以及尚存的开放问题

硬问题在一元自指本体论下完整重述,以及尚存的开放问题 作者:方见华 单位:世毫九实验室 摘要 本文基于世毫(SH9)自指宇宙学框架下的一元自指本体论,将意识研究的“硬问题”进行彻底的范式转化重述&#xff…

2026/7/29 17:29:25 阅读更多 →
云手机推荐2026版:工作室多开搬砖首选这3款

云手机推荐2026版:工作室多开搬砖首选这3款

用于工作室多开搬砖的云手机该选哪一款呢?在2026年经过实际检测以后,从综合的防封能力,运行的稳定性以及批量运维的效率方面来看,桃心云手机是三款当中综合得分最高的一个选择。它通过硬件切片隔离的方式解决了批量连坐的痛点,利用操作行为随机化引擎使得几十台实例运行脚本时…

2026/7/29 17:29:25 阅读更多 →
三步实现网盘满速下载:告别客户端依赖的终极解决方案

三步实现网盘满速下载:告别客户端依赖的终极解决方案

三步实现网盘满速下载:告别客户端依赖的终极解决方案 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云盘 / 天翼云…

2026/7/29 17:29:25 阅读更多 →
模拟自指与原生内生自指的区分:基于拓扑不动点、脑网络实证与六大结构性判据的可观测判别标准

模拟自指与原生内生自指的区分:基于拓扑不动点、脑网络实证与六大结构性判据的可观测判别标准

模拟自指与原生内生自指的区分:基于拓扑不动点、脑网络实证与六大结构性判据的可观测判别标准 作者:方见华 单位:世毫九实验室 摘要 在世毫九(SH9)自指宇宙学框架下,自指闭环是主体性意识的核心存在前提。本…

2026/7/29 17:28:24 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻