DeepEval 快速指南:三步跑通 LLM 评估的完整路径
DeepEval 快速指南三步跑通 LLM 评估的完整路径【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval改完 prompt、换了模型之后你往往要先回答一个问题RAG 返回的答案还可信吗逐条人工看既不现实凭感觉也不可靠。DeepEval 是一个开源的 LLM 评估框架把这种判断变成可执行的测试用一个更强的模型当评委LLM-as-a-judge用 40 个指标给输出打分用 pytest 的方式验证模型质量。下面从最小可运行的用例讲起走到接入生产。DeepEval 是什么用更强的模型当评委给输出打分DeepEval 是一个开源 LLM 评估框架思路和 pytest 一致写测试用例、跑测试、按分数判定通过与否。它兼容 LangChain、OpenAI、Anthropic 等框架构建的 LLM 应用既能评估单轮问答也能评估 agent 的完整执行轨迹。核心机制是LLM-as-a-judge把任意 LLM 配置为评委让它按预设标准对输出打分产出 0–1 的分数分数低于阈值测试用例即失败。部分指标ExactMatch、Toxicity 等由本地 NLP 模型驱动完全不消耗 API token。除内置指标外你还可以注册自定义指标复用整套数据流仓库里也附带了 10 行以内跑 MMLU、HumanEval 等基准的脚本。全部指标的源码在 deepeval/metrics/ 目录。三步跑通第一次 LLM 评估安装。要求 Python 3.9pip install -U deepeval写最小用例。新建test_chatbot.py内容是一个LLMTestCase加一个指标下一节第一个示例可直接复制。用例文件就是普通 Python 文件无需任何额外配置DeepEval 会自动收集结果并输出控制台报告。配置 Key 并运行。设置评委模型 Key然后跑测试export OPENAI_API_KEYyour-key deepeval test run test_chatbot.py评委模型和被评估的模型可以完全不同用更强的模型给更弱的模型打分是 LLM-as-a-judge 的标准用法。能力深潜跑评估、多指标组合与 G-EvalLLM 输出质量怎么评估这个问题可以拆成三层先能跑再能覆盖最后能自定义。如何跑一次评估assert_test 与阈值判定解决单条输出好不好靠人眼看的问题把判定变成一条断言。from deepeval import assert_test from deepeval.metrics import AnswerRelevancyMetric from deepeval.test_case import LLMTestCase test_case LLMTestCase( input如果鞋子不合适怎么办, actual_output你可以在 30 天内申请全额退款。, expected_output购买后 30 天内可全额退款。, ) assert_test(test_case, [AnswerRelevancyMetric(threshold0.7)])每个指标输出 0–1 分任一项低于阈值assert_test抛出AssertionError用例失败控制台会实时打印各指标得分与通过情况可直接挂进 pytest 或 CI。多指标组合RAG 评估指标怎么一起跑解决单一指标覆盖不了全部失败模式的问题——检索错了、答案编造了、答非所问可以分别量化。from deepeval.test_case import LLMTestCase from deepeval.metrics import AnswerRelevancyMetric, FaithfulnessMetric test_case LLMTestCase( input退货政策是什么, actual_output购买后 30 天内可全额退款。, retrieval_context[客户可在购买后 30 天内申请全额退款。], ) assert_test(test_case, [AnswerRelevancyMetric(threshold0.7), FaithfulnessMetric(threshold0.8)])FaithfulnessMetric会把答案拆成若干声明逐条与retrieval_context对账真实 RAG 项目里这两个指标常成对出现同时锁住检索质量与生成质量。G-Eval 自定义评估标准怎么配现成指标描述不了你关心的质量语气、合规、格式时G-Eval 用一句自然语言标准直接产出分数。from deepeval.metrics import GEval from deepeval.test_case import SingleTurnParams tone_metric GEval( name语气, criteria评估回答是否专业、克制是否使用了礼貌的表达。, evaluation_params[SingleTurnParams.ACTUAL_OUTPUT, SingleTurnParams.INPUT], threshold0.6, ) assert_test(test_case, [tone_metric])G-Eval 内部把标准分解成思维链让评委模型逐步打分标准用自然语言维护换标准时不用改代码。把评估接入 CI/CD 与生产监控assert_test基于 pytest接 CI 只需在流水线里加一步deepeval test run任一指标低于阈值构建即失败prompt 与模型的每次变更都被锁定为LLM 回归测试。上线后用 DeepEval 的 tracing 能力采集线上每轮对话的输入、输出与检索链路沉淀成数据集反哺评估评估平台还提供线上 trace 与评估结果的回归对比视图让你在用户投诉之前看到分数下滑。该视图把同一测试用例的两轮运行并排对比各指标得分与通过状态一目了然。选型与避坑怎么选、怎么校准如果你对评估成本敏感那么先用本地 NLP 指标ExactMatch、PatternMatch、Toxicity 等做初筛只把需要语义判断的样本交给评委模型token 开销可以压到最低。如果你有数据隐私要求医疗、金融场景那么把评委模型换成本地部署如 Ollama或只用纯本地指标组合prompt 与用户数据不出本机。如果你不确定评估本身可不可信那么抽一批人工标注数据与评委模型打分做一致性对齐再定阈值也可用强弱两个模型各评一遍同一批数据做交叉校验。如果你想抓住 prompt 变更引发的回归那么把输入与期望输出固化成数据集用evaluate()批量跑每次改动前后对比分数而不是靠抽样抽查。如果你在评估 agent 而非单轮问答那么在端到端输出之外补上TaskCompletionMetric、ToolCorrectnessMetric这类指标把工具调用与步骤轨迹也纳入评分范围。值得深入的项目路径官方文档与教程docs/可运行的完整示例含 RAG 与 agent 评估examples/40 指标的完整源码deepeval/metrics/tracing 与框架埋点代码deepeval/tracing/基线一旦建立后续的每次变更都有了可以对照的数字。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

NodeInject_Hook_example:Node.js 动态注入与 Hook 快速上手指南

NodeInject_Hook_example:Node.js 动态注入与 Hook 快速上手指南

NodeInject_Hook_example:Node.js 动态注入与 Hook 快速上手指南 【免费下载链接】NodeInject_Hook_example A hooking example for NodeInject 项目地址: https://gitcode.com/gh_mirrors/no/NodeInject_Hook_example NodeInject_Hook_example 是一个 Hook …

2026/8/25 8:37:53 阅读更多 →
基于AI Agent与Streamlit的智能报价工作台搭建指南

基于AI Agent与Streamlit的智能报价工作台搭建指南

你是不是也经历过这样的场景?客户发来一份产品清单,你需要在十几个Excel表格里来回切换,手动查找物料编码、匹配价格表、计算折扣、加上税费和运费,最后生成一份报价单。整个过程耗时费力不说,还容易因为看错行、公式引…

2026/8/25 16:02:00 阅读更多 →
华为MetaERP # Oracle EBS Receivables vs Oracle Fusion Receivables(应收模块 AR)深度对比分析全文覆盖:**设计哲学 → 核心原理 →

华为MetaERP # Oracle EBS Receivables vs Oracle Fusion Receivables(应收模块 AR)深度对比分析全文覆盖:**设计哲学 → 核心原理 →

Oracle EBS Receivables vs Oracle Fusion Receivables(应收模块 AR)深度对比分析 全文覆盖:设计哲学 → 核心原理 → 业务实现逻辑 → 业务对象 / 逻辑实体 / 物理实体 → 核心后台表 → 标准程序示例 前置说明: EBS R12 AR&…

2026/8/25 16:02:48 阅读更多 →

最新新闻

NixOS in Production完整指南:为什么NixOS是SaaS生产部署的最佳选择?DevOps工程师必读书籍深度解读

NixOS in Production完整指南:为什么NixOS是SaaS生产部署的最佳选择?DevOps工程师必读书籍深度解读

NixOS in Production完整指南:为什么NixOS是SaaS生产部署的最佳选择?DevOps工程师必读书籍深度解读 【免费下载链接】nixos-in-production Source files for the book "NixOS in Production" 项目地址: https://gitcode.com/gh_mirrors/ni/n…

2026/8/25 18:06:13 阅读更多 →
SQL注入漏洞报告:从HTTP请求到可复现证据链

SQL注入漏洞报告:从HTTP请求到可复现证据链

1. 这不是“提交报告”,而是一份漏洞生命周期的现场切片很多人第一次看到“SQL注入漏洞提交报告(示例)”这个标题,下意识会以为这是份模板文档——填空式地写上URL、payload、影响说明,点个提交就完事。我见过太多刚入…

2026/8/25 18:06:13 阅读更多 →
Vue3高亮文本(Highlight)

Vue3高亮文本(Highlight)

效果如下图: 在线预览 APIs Highlight 参数说明类型默认值text文本stringundefinedpatterns需要高亮的文本内容string[][]autoEscape自动转义。默认情况下,patterns 中的元素会被转化为正则表达式进行匹配,这个过程中需要进行自动转义&…

2026/8/25 18:06:13 阅读更多 →
MyBatis #{}与${}核心原理与实战避坑指南

MyBatis #{}与${}核心原理与实战避坑指南

1. 项目概述:从一次线上事故说起那天下午,监控系统突然报警,数据库CPU瞬间飙到100%。紧急排查后发现,是一条看似普通的MyBatis查询语句引发的全表扫描。问题的根源,就出在一个小小的$符号上。开发同学为了图方便&#…

2026/8/25 18:05:13 阅读更多 →
obd-java-api快速上手:Maven接入ELM327蓝牙OBD-II并读取发动机RPM完整教程

obd-java-api快速上手:Maven接入ELM327蓝牙OBD-II并读取发动机RPM完整教程

obd-java-api快速上手:Maven接入ELM327蓝牙OBD-II并读取发动机RPM完整教程 【免费下载链接】obd-java-api OBD-II Java API 项目地址: https://gitcode.com/gh_mirrors/ob/obd-java-api obd-java-api 是一个开源的 OBD-II Java API 库,专门用于对…

2026/8/25 18:05:13 阅读更多 →
C 语言笔记

C 语言笔记

笔记会不定期补充更新 数据类型 基本类型数据: 整型 整型 -- int 4字节 短整型 -- short int 2字节 长整型 -- long int 8字节 浮点数【实数】 单精度浮点数 -- float …

2026/8/25 18:05:13 阅读更多 →

日新闻

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

【题目来源】 https://www.luogu.com.cn/problem/P7912 【题目描述】 小熊的水果店里摆放着一排 n 个水果。每个水果只可能是苹果或桔子,从左到右依次用正整数 1,2,…,n 编号。连续排在一起的同一种水果称为一个“块”。小熊要把这一排水果挑到若干个果篮里&#x…

2026/8/25 0:00:34 阅读更多 →
Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG 【免费下载链接】transformers.js State-of-the-art Machine Learning for the web. Run 🤗 Transformers directly in your browser, with no need for a server! 项目地址: https:/…

2026/8/25 0:00:34 阅读更多 →
数学建模竞赛论文写作指南:从模型构建到学术表达的核心技能

数学建模竞赛论文写作指南:从模型构建到学术表达的核心技能

1. 项目概述:从“会做”到“会写”的竞赛核心跃迁“全国大学生数学建模竞赛”,这个名字对理工科学生来说,分量极重。每年,无数团队在三天三夜的时间里,为一个开放性问题绞尽脑汁,从建立模型、求解算法到编程…

2026/8/25 0:00:34 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 3:38:12 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 3:38:18 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 3:38:23 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/24 20:22:44 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/25 10:31:12 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/24 11:20:22 阅读更多 →