EvalScope 安装与使用说明
EvalScope 安装与使用说明一、项目简介EvalScope 是由魔搭社区ModelScope打造的一站式大模型评测框架支持全面的评测基准内置 MMLU、C-Eval、GSM8K 等 200 评测基准多模态支持LLM、VLM、Embedding、Reranker、AIGC 等推理性能测试TTFT、TPOT、吞吐量等指标交互式报告WebUI 可视化界面支持多维度模型对比二、安装步骤2.1 环境要求Python 3.10Windows / Linux / macOSGPU 环境推荐用于本地模型评测2.2 创建虚拟环境# 创建虚拟环境python-mvenv venv# 激活虚拟环境Windows PowerShell.\venv\Scripts\Activate.ps1# 激活虚拟环境Linux/macOSsourcevenv/bin/activate2.3 安装依赖# 切换到 evalscope 源码目录cdevalscope# 安装核心依赖使用清华镜像加速pipinstall-rrequirements/framework.txt-ihttps://pypi.tuna.tsinghua.edu.cn/simple --prefer-binary# 安装额外依赖可选pipinstalltorch accelerate-ihttps://pypi.tuna.tsinghua.edu.cn/simple --prefer-binary2.4 配置项目路径重要由于 editable install 模式在 Windows 下存在 namespace package 问题需要通过.pth文件配置# 创建 .pth 文件指向项目源码目录echoE:\project\evalscope\evalscopeE:\project\evalscope\venv\Lib\site-packages\evalscope.pth2.5 验证安装# 验证模块路径应输出 __init__.py 的路径而非 Nonepython-cimport evalscope; print(evalscope.__file__)# 验证注册表所有数值应大于 0python-cimport evalscope; from evalscope.api.registry import BENCHMARK_REGISTRY, MODEL_APIS, METRIC_REGISTRY, AGGREGATION_REGISTRY; print(Benchmarks:, len(BENCHMARK_REGISTRY), Model APIs:, len(MODEL_APIS), Metrics:, len(METRIC_REGISTRY), Aggregators:, len(AGGREGATION_REGISTRY))三、快速开始3.1 方式一命令行评测# 评测本地模型自动从 ModelScope 下载evalscopeeval\--modelQwen/Qwen2.5-0.5B-Instruct\--datasetsgsm8k arc\--limit5# 评测 OpenAI API 兼容的在线模型evalscopeeval\--modelyour-model-name\--api-url$OPENAI_API_BASE_URL\--api-key$OPENAI_API_KEY\--eval-type openai_api\--datasetsgsm8k\--limit53.2 方式二Python 代码创建demo1.pyfromevalscope.runimportrun_task task_cfg{model:Qwen/Qwen2.5-0.5B-Instruct,datasets:[gsm8k,arc],limit:5}run_task(task_cfgtask_cfg)运行python demo1.py E:\project\evalscope\venv\Scripts\python.exe E:\project\evalscope\demo1.py3.3 方式三配置文件创建config.yamlmodel:Qwen/Qwen2.5-0.5B-Instructmodel_args:revision:masterprecision:torch.float16datasets:-gsm8k-arcgeneration_config:max_tokens:2048temperature:0.7limit:5运行python-cfrom evalscope.run import run_task; run_task(task_cfgconfig.yaml)四、配置说明4.1 核心参数参数说明默认值model模型名称ModelScope 或 HuggingFace 地址无datasets评测数据集列表如[gsm8k, arc, mmlu]无limit每个数据集评测样本数用于快速测试无eval_type评测类型llm_ckpt本地模型、openai_apiAPI 模型llm_ckptwork_dir输出目录./outputs/{timestamp}4.2 模型参数task_cfg{model:Qwen/Qwen2.5-0.5B-Instruct,model_args:{revision:master,precision:torch.float16,device_map:auto},generation_config:{max_tokens:2048,temperature:0.7,top_p:0.95,do_sample:False}}4.3 数据集参数task_cfg{dataset_args:{gsm8k:{few_shot_num:4,few_shot_random:False,subset_list:[main]}}}五、支持的数据集5.1 LLM 基准部分数据集类型描述gsm8k数学推理Grade School Math 8Karc科学问答AI2 Reasoning Challengemmlu多任务Massive Multitask Language Understandingceval中文评测Chinese Evaltruthful_qa真实性Truthful QAhumaneval代码生成HumanEval Code5.2 VLM 基准部分数据集类型描述mmmu多模态MMMU Benchmarkai2d图表理解AI2D Diagram Understandingmathvista数学视觉MathVistavqav2视觉问答VQA v2.05.3 查看全部支持的数据集python-cimport evalscope; from evalscope.api.registry import BENCHMARK_REGISTRY; print(sorted(BENCHMARK_REGISTRY.keys()))六、评测结果6.1 输出目录结构outputs/20260728_100401/ ├── configs/ │ └── task_config.yaml # 任务配置 ├── reports/ │ ├── Qwen2.5-0.5B-Instruct/ │ │ ├── gsm8k.json # 数据集报告 │ │ └── arc.json │ └── report.html # 可视化 HTML 报告 └── predictions/ └── Qwen2.5-0.5B-Instruct/ └── gsm8k_main_preds.json # 预测结果6.2 示例输出gsm8k report table: ┌───────────────────────┬───────────┬──────────┬──────────┬───────┬─────────┬─────────┐ │ Model │ Dataset │ Metric │ Subset │ Num │ Score │ Cat.0 │ ├───────────────────────┼───────────┼──────────┼──────────┼───────┼─────────┼─────────┤ │ Qwen2.5-0.5B-Instruct │ gsm8k │ mean_acc │ main │ 5 │ 0.4 │ default │ └───────────────────────┴───────────┴──────────┴──────────┴───────┴─────────┴─────────┘6.3 启动可视化服务# 安装服务依赖pipinstallevalscope[service]# 启动服务evalscopeservice访问http://127.0.0.1:9000查看可视化报告。七、常见问题Q1: Benchmark ‘gsm8k’ not found原因evalscope/__init__.py未被执行导致注册表为空。解决方案使用.pth文件配置方式详见 2.4 节。Q2: litellm 安装失败缺少 Rust解决方案使用预编译版本pipinstalllitellm1.55.0 --prefer-binary-ihttps://pypi.tuna.tsinghua.edu.cn/simpleQ3: editdistance 编译错误解决方案安装预编译替代包pipinstalleditdistance-sQ4: 模型下载速度慢解决方案配置 ModelScope 镜像pipinstallmodelscope-ihttps://pypi.tuna.tsinghua.edu.cn/simple设置环境变量exportMODEL_SCOPE_ENDPOINThttps://www.modelscope.cnQ5: CUDA 内存不足解决方案task_cfg{model_args:{device_map:auto,load_in_4bit:True# 或 load_in_8bit}}八、进阶功能8.1 性能压测# 单模型性能测试evalscope perf--modelQwen/Qwen2.5-0.5B-Instruct--concurrency124# 多模型对比evalscope perf--modelQwen/Qwen2.5-0.5B-Instruct Qwen/Qwen2.5-7B-Instruct8.2 竞技场模式模型对战evalscope arena\--model-list Qwen/Qwen2.5-0.5B-Instruct Qwen/Qwen2.5-7B-Instruct\--datasetsgsm8k\--limit108.3 Agent 评测evalscopeeval\--modelQwen/Qwen2.5-0.5B-Instruct\--datasetsgsm8k\--agent-config{strategy: function_calling}\--limit5九、参考文档官方文档支持的数据集列表参数说明自定义数据集指南十、项目结构evalscope/ ├── evalscope/ # 核心代码 │ ├── benchmarks/ # 评测基准适配器 │ ├── models/ # 模型 API 接口 │ ├── metrics/ # 评测指标 │ ├── evaluator/ # 评测执行器 │ ├── report/ # 报告生成 │ ├── run.py # 主入口 │ └── config.py # 配置管理 ├── requirements/ # 依赖文件 ├── docs/ # 文档 ├── tests/ # 测试 └── pyproject.toml # 项目配置

相关新闻

为什么你的AI模型在PDB数据上准确率92%,却在真实先导化合物优化中全军覆没?(药化专家闭门复盘实录)

为什么你的AI模型在PDB数据上准确率92%,却在真实先导化合物优化中全军覆没?(药化专家闭门复盘实录)

更多请点击: https://kaifayun.com 第一章:为什么你的AI模型在PDB数据上准确率92%,却在真实先导化合物优化中全军覆没?(药化专家闭门复盘实录) 幻觉精度的根源:PDB ≠ 药物化学现实 PDB结构数…

2026/7/29 19:12:07 阅读更多 →
[特殊字符] OpenClaw(Clawd)完整安装教程:从零搭建你的专属 AI 助手

[特殊字符] OpenClaw(Clawd)完整安装教程:从零搭建你的专属 AI 助手

前言 最近有个开源 AI 助手彻底火出圈了——OpenClaw(曾用名 ClawdBot / Moltbot)。截至 2026 年 1 月,它的 GitHub 星数飙到 4.2 万,fork 数超 5800,全球有 1200 多名开发者主动参与贡献,单日最高新增 2.…

2026/7/29 19:12:07 阅读更多 →
如何用Outfit字体打造专业品牌设计:9种字重的完全指南

如何用Outfit字体打造专业品牌设计:9种字重的完全指南

如何用Outfit字体打造专业品牌设计:9种字重的完全指南 【免费下载链接】Outfit-Fonts The most on-brand typeface 项目地址: https://gitcode.com/gh_mirrors/ou/Outfit-Fonts 还在为设计项目寻找既现代又免费的字体吗?Outfit字体就是你的完美选…

2026/7/29 19:11:07 阅读更多 →

最新新闻

AntiDupl.NET:告别重复图片烦恼,智能清理您的数字相册

AntiDupl.NET:告别重复图片烦恼,智能清理您的数字相册

AntiDupl.NET:告别重复图片烦恼,智能清理您的数字相册 【免费下载链接】AntiDupl A program to search similar and defect pictures on the disk 项目地址: https://gitcode.com/gh_mirrors/an/AntiDupl 您是否曾经面对电脑里堆积如山的照片感到…

2026/7/29 19:28:23 阅读更多 →
Pixelle-Video:一句话生成专业短视频的终极指南

Pixelle-Video:一句话生成专业短视频的终极指南

Pixelle-Video:一句话生成专业短视频的终极指南 【免费下载链接】Pixelle-Video 🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine 项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video 你是否曾经想过制作一个精彩…

2026/7/29 19:28:23 阅读更多 →
研究背景相关内容梳理与核心要素解析

研究背景相关内容梳理与核心要素解析

搞科研的大家!找英文文献依然是科研路上最头疼的一道坎儿吧? 尤其是现在AI工具层出不穷,老工具也在不断升级,选对平台能省下大把时间。今天我给大家盘点8个好用的英文文献检索网站,涵盖传统权威平台 新一代AI智能工具…

2026/7/29 19:28:23 阅读更多 →
draw.io桌面版完整指南:免费跨平台图表工具终极教程

draw.io桌面版完整指南:免费跨平台图表工具终极教程

draw.io桌面版完整指南:免费跨平台图表工具终极教程 【免费下载链接】drawio-desktop Official electron build of draw.io 项目地址: https://gitcode.com/GitHub_Trending/dr/drawio-desktop 还在寻找功能强大且完全免费的Visio替代品吗?draw.i…

2026/7/29 19:28:23 阅读更多 →
潍坊正规鸢都充电程序售卖租用

潍坊正规鸢都充电程序售卖租用

随着新能源汽车的日益普及,充电桩及相关充电管理系统的需求也愈发迫切。在潍坊,潍坊骏驰天下能源发展有限公司自主研发的鸢都充电程序,正为各类充电场站运营带来智能化、无人化管理新方案,目前该程序支持售卖和租用,下…

2026/7/29 19:28:22 阅读更多 →
如何在AMD显卡上解锁ComfyUI-Zluda的完整AI创作潜力

如何在AMD显卡上解锁ComfyUI-Zluda的完整AI创作潜力

如何在AMD显卡上解锁ComfyUI-Zluda的完整AI创作潜力 【免费下载链接】ComfyUI-Zluda The most powerful and modular stable diffusion GUI, api and backend with a graph/nodes interface. Now ZLUDA enhanced for better AMD GPU performance. 项目地址: https://gitcode.…

2026/7/29 19:27:22 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻