全网最全面的 DeepEval从入门到精通教程 - DeepEval 5分钟快速入门
文章目录DeepEval 5分钟快速入门安装创建您的首次测试运行DeepEval 5分钟快速入门本快速入门指南将引导您在几分钟内完成从安装 DeepEval 到首次成功评估的整个过程。您将创建一个小型测试用例选择一个指标然后运行它deepeval test run。完成本快速入门指南后您应该能够使用测试用例、指标和deepeval test run.当您想要评估人工智能代理或其内部组件时请添加跟踪功能。了解数据集、合成数据、集成和 Confident AI 平台的下一步发展方向。安装在新建的虚拟环境中运行pip install -U deepevaldeepevalDeepEval会在本地环境中运行评估。要将测试报告集中存储在云端请使用 Confident AI 这是一个 AI 质量平台具备可观测性、评估和监控功能DeepEval 可与其原生集成deepeval login您的浏览器仅负责身份验证。登录或创建帐户后请返回终端输入您的姓名和组织确认预填的初始项目名称或选择您现有的项目之一。DeepEval 会自动创建并保存一个专用的项目 API 密钥。对于 CI 或其他非交互式环境请传递一个现有的密钥deepeval login --api-key ...。配置环境变量DeepEval 会自动加载环境文件在导入时优先级现有进程环境 -.env.local-.env选择退出设置DEEPEVAL_DISABLE_DOTENV1更多env设置信息请点击 此处查看。# quickstart cp .env.example .env.local # then edit .env.local (ignored by git)创建您的首次测试运行创建一个测试文件来运行你的第一个端到端评估。fromdeepevalimportassert_testfromdeepeval.modelsimportOllamaModelfromdeepeval.test_caseimportLLMTestCase,SingleTurnParamsfromdeepeval.metricsimportAnswerRelevancyMetric,GEval# 使用本地 Ollama 模型进行评估llm_modelOllamaModel(modelqwen3:0.6b)deftest_correctness():test_caseLLMTestCase(inputWhat is your return policy?,actual_outputYoure eligible for a free full refund within 30 days of purchase.,expected_outputYoure eligible for a free full refund within 30 days of purchase.,)answer_relevancy_metricAnswerRelevancyMetric(threshold0.5,modelllm_model,)correctness_metricGEval(nameCorrectness,criteriaDetermine if the actual output is correct based on the expected output.,evaluation_params[SingleTurnParams.ACTUAL_OUTPUT,SingleTurnParams.EXPECTED_OUTPUT,],modelllm_model,)assert_test(test_case,[answer_relevancy_metric,correctness_metric])执行结果(2 durations 0.005s hidden.Use-vv to show these durations.)1 passed,3 warnings in 12.37s Test Results ┏━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━┳━━━━━━━━━━━━━━━━━━━━━┳━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━┳━━━━━━━━┳━━━━━━━━━━━━━━━━━━━━━━┓ ┃ Test case ┃ Metric ┃ Score ┃ Status ┃ Overall Success Rate ┃ ┡━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━╇━━━━━━━━━━━━━━━━━━━━━╇━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━╇━━━━━━━━╇━━━━━━━━━━━━━━━━━━━━━━┩ │ test_correctness │ │ │ │ 100.0% │ │ │ Answer Relevancy │ 0.67(threshold0.5,evaluation modelqwen3:0.6b(Ollama),reasonThe score is 0.67 │ PASSED │ │ │ │ │ because there is one irrelevant statement in the actual output that does not address │ │ │ │ │ │ the input question aboutreturnpolicy.,errorNone)│ │ │ │ │ Correctness[GEval]│ 1.0(threshold0.5,evaluation modelqwen3:0.6b(Ollama),reasonThe output matches │ PASSED │ │ │ │ │ the expected output exactly in content and structure.No errors or inconsistencies │ │ │ │ │ │ were found,and there are no additional details present.The score is 10 as it │ │ │ │ │ │ reflects strong alignment with the evaluation steps.,errorNone)│ │ │ │ Note: Use Confident AI with DeepEval to analyze failed test casesformore details │ │ │ │ │ └────────────────────────────────────────────────────────────────────────────────────┴─────────────────────┴──────────────────────────────────────────────────────────────────────────────────────┴────────┴──────────────────────┘ ⚠ WARNING: No hyperparameters logged.» Log hyperparameters to attribute prompts and models to your test runs. ✓ Evaluation completed !(time taken: 12.58s|token cost: None)» Test Results(1 total tests): » Pass Rate: 100.0%|Passed: 1|Failed: 0 » Want to share evals with your team,or a placeforyour test cases to live? ❤️ » Rundeepeval viewto analyze and save testing results on Confident AI.恭喜您的测试用例应该已经通过✅ 让我们来分析一下发生了什么。input 模拟用户输入actual_output 是应用程序根据此输入应输出内容的占位符。expected_output 代表给定的理想答案inputGEval是由提供的研究支持的指标deepeval用于以类似人类的准确度评估 LLM 输出的任何自定义指标。在这个例子中指标是基于所提供的criteria数据的正确性但并非所有指标都需要数据。actual_outputexpected_outputexpected_output所有指标分数范围为 0 - 1阈threshold0.5值最终决定你的测试是否通过。

相关新闻

2026-07-26:将数组转换为交替质数数组的最少操作次数。用go语言,给定一个整数数组 `nums`,你需要通过最少的操作次数,把它变成满足特定规律的数组。 规律是: - 数组中所有索引为偶数的位

2026-07-26:将数组转换为交替质数数组的最少操作次数。用go语言,给定一个整数数组 `nums`,你需要通过最少的操作次数,把它变成满足特定规律的数组。 规律是: - 数组中所有索引为偶数的位

2026-07-26:将数组转换为交替质数数组的最少操作次数。用go语言,给定一个整数数组 nums,你需要通过最少的操作次数,把它变成满足特定规律的数组。 规律是:数组中所有索引为偶数的位置,最终的值必须是质数。…

2026/7/27 3:30:48 阅读更多 →
TI MibSPI DMA配置详解:从寄存器解析到实战调试

TI MibSPI DMA配置详解:从寄存器解析到实战调试

1. 项目概述与核心价值在嵌入式开发,尤其是基于TI Hercules或C2000系列MCU的项目中,处理高速、连续的SPI数据流是个绕不开的挑战。想象一下,你的系统需要从多个传感器通过SPI轮询数据,或者向一个高分辨率显示屏持续刷新帧缓存&…

2026/7/26 2:29:53 阅读更多 →
人已经用 WorkBuddy 找工作拿了面试,你还在一份份手工改简历

人已经用 WorkBuddy 找工作拿了面试,你还在一份份手工改简历

文章目录别人已经用 WorkBuddy 找工作拿了面试,你还在一份份手工改简历1\. 先别急着投,看看自己到底适合什么2\. 岗位太多,不要再一页页刷3\. 简历不是写得漂亮,是让对方看见你能干什么4\. 投得一多,先做张表救命5\. 面…

2026/7/26 2:29:53 阅读更多 →

最新新闻

C++控制台绘制爱心曲线:从数学公式到字符图形的实现与优化

C++控制台绘制爱心曲线:从数学公式到字符图形的实现与优化

1. 项目概述:当C遇上数学浪漫最近在整理一些经典的图形学小项目时,又翻出了“爱心曲线”这个老朋友。用代码画一个爱心,听起来像是编程初学者的小浪漫,但如果你只用cout打印几个字符拼凑,那未免太没技术含量了。我们今…

2026/7/27 3:30:43 阅读更多 →
Kmeans算法在轨迹聚类中的应用与实践

Kmeans算法在轨迹聚类中的应用与实践

1. 轨迹聚类与Kmeans算法概述轨迹数据作为时空信息的重要载体,在交通规划、用户行为分析、动物迁徙研究等领域具有广泛应用价值。面对海量轨迹数据,如何从中提取有意义的模式成为关键挑战。Kmeans聚类作为一种经典的无监督学习方法,因其简单高…

2026/7/27 3:30:43 阅读更多 →
Win11升级后应用兼容性问题解决方案

Win11升级后应用兼容性问题解决方案

1. 问题现象与背景分析最近在帮客户处理一批Windows 10升级到Windows 11的设备时,发现一个棘手问题:部分原本在Win10运行正常的应用程序,在升级到Win11后突然无法启动或频繁崩溃。这种情况在财务软件、行业专用工具和老旧应用程序上尤为常见。…

2026/7/27 3:30:43 阅读更多 →
智能PPT生成器:自动化答辩演示文稿制作

智能PPT生成器:自动化答辩演示文稿制作

1. 项目概述:智能PPT生成器的价值定位作为一名经历过数十场学术答辩的老兵,我深知制作答辩PPT的痛苦:连续72小时不眠不休调整版式、反复修改内容结构、临场前还在担心动画效果是否流畅。直到去年团队开发了"百考通智能答辩PPT生成器&quo…

2026/7/27 3:30:43 阅读更多 →
C++20 std::bind_front与std::bind_back:现代参数绑定的简洁与安全之道

C++20 std::bind_front与std::bind_back:现代参数绑定的简洁与安全之道

1. 项目概述:告别std::bind的烦恼,拥抱现代 C 的参数绑定如果你写过几年 C,尤其是接触过标准库算法和回调函数,那你对std::bind这个“老朋友”一定不陌生。它功能强大,能把函数、成员函数、参数一股脑儿打包成一个可调…

2026/7/27 3:30:43 阅读更多 →
Python静态类型检查:Mypy实战与最佳实践

Python静态类型检查:Mypy实战与最佳实践

1. 为什么Mypy类型警告值得认真对待第一次看到Mypy抛出类型警告时,我像大多数Python开发者一样不以为然——毕竟Python是动态类型语言,类型提示只是可选项。直到线上服务因为一个隐蔽的类型错误崩溃后,我才真正重视起这些警告。Mypy实际上是在…

2026/7/27 3:29:43 阅读更多 →

日新闻

【JAVA毕设源码分享】基于SpringBoot的社区智能垃圾管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于SpringBoot的社区智能垃圾管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/27 0:00:54 阅读更多 →
SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

1. 项目概述:从寄存器手册到实战指南 如果你手头有一份类似德州仪器(TI)TMS320x240xA系列DSP的SPI模块技术手册,看着里面密密麻麻的寄存器位定义、时序图和公式,是不是感觉头大?这份资料虽然权威&#xff0…

2026/7/27 0:00:54 阅读更多 →
【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/27 0:00:54 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

月新闻