大模型测试第一步DeepEval环境配置与安装
文章目录1. 环境配置与安装1.1. 安装 deepeval1.1.1. pip 安装1.1.2. 验证安装1.2. 配置 LLM 提供商1.2.1. OpenAI需要 API Key1.2.2. DeepSeek国内推荐1.2.3. 本地模型Ollama1.3. 配置环境变量1.3.1. .env 文件方式1.3.2. 必需的环境变量1.3.3. 可选的环境变量1.4. 环境验证脚本1.5. 小结1. 环境配置与安装文档基于 DeepEval v4.1.0 编写来源https://deepeval.com/docs/getting-started1.1. 安装 deepeval1.1.1. pip 安装DeepEval 要求 Python 3.9。建议在虚拟环境中安装# 创建虚拟环境可选但推荐python-mvenv deepeval_envsourcedeepeval_env/bin/activate# Linux/Mac# deepeval_env\\Scripts\\activate # Windows# 安装 DeepEvalpipinstall-Udeepeval1.1.2. 验证安装# 来源: https://deepeval.com/docs/getting-started# 验证安装是否成功importdeepeval# 打印版本号print(fDeepEval 版本:{deepeval.__version__})# 运行上面代码后输出类似 DeepEval 版本: 4.1.01.2. 配置 LLM 提供商DeepEval 的指标大多使用 LLM-as-a-Judge 模式需要指定一个 LLM 来执行评估。默认使用 OpenAI 的 GPT 模型。1.2.1. OpenAI需要 API Key# 设置 OpenAI API KeyexportOPENAI_API_KEYsk-your-openai-api-key# Windows 用户# set OPENAI_API_KEYsk-your-openai-api-key# 来源: https://deepeval.com/docs/metrics-introduction# 在 Jupyter/Colab 中设置环境变量%env OPENAI_API_KEYsk-your-openai-api-key注意如果使用 OpenAI 需要科学上网国内用户建议使用 DeepSeek 或 Ollama 本地模型见下方配置。1.2.2. DeepSeek国内推荐DeepSeek 提供兼容 OpenAI 接口的 API国内可直接访问价格低廉。# 获取 API Key: https://platform.deepseek.com/api_keysexportDEEPEVAL_TELEMETRY_OPT_OUTYESexportOPENAI_API_KEYsk-your-deepseek-api-keyexportOPENAI_API_BASEhttps://api.deepseek.compythonpython# 来源: https://deepeval.com/guides/guides-using-custom-llms# 方式一通过自定义 LLM 类使用 DeepSeekfrom openaiimportOpenAI from deepeval.models.base_modelimportDeepEvalBaseLLM class DeepSeekModel(DeepEvalBaseLLM): def __init__(self, model_name: strdeepseek-chat): self.model_namemodel_name# 初始化 DeepSeek 客户端self.clientOpenAI(api_keysk-your-deepseek-api-key,base_urlhttps://api.deepseek.com)def load_model(self):returnself.model_name def generate(self, prompt: str)-str:# 调用 DeepSeek API 生成响应responseself.client.chat.completions.create(modelself.model_name,messages[{role:user,content:prompt}],temperature0)returnresponse.choices[0].message.content async def a_generate(self, prompt: str)-str:returnself.generate(prompt)def get_model_name(self)-str:returnself.model_name# 创建 DeepSeek 模型实例deepseek_llmDeepSeekModel()# 验证模型是否可用test_responsedeepseek_llm.generate(请用一句话介绍你自己)print(f测试响应: {test_response})# 运行上面代码后输出类似 测试响应: 我是 DeepSeek由深度求索公司创造的 AI 助手。1.2.3. 本地模型OllamaOllama 允许在本地运行开源模型完全离线无需 API Key。# 安装 OllamamacOS/Linux# curl -fsSL https://ollama.com/install.sh | sh# 拉取模型ollama pull deepseek-r1:1.5b# 启动 Ollama 服务后配置 DeepEvaldeepeval set-ollama--modeldeepseek-r1:1.5b# 来源: https://deepeval.com/docs/metrics-introduction#configure-llm-judges# 验证 Ollama 配置fromdeepeval.metricsimportAnswerRelevancyMetricfromdeepeval.test_caseimportLLMTestCase# 创建测试用例test_caseLLMTestCase(input什么是机器学习,actual_output机器学习是人工智能的一个子领域它使计算机能够从数据中学习。)# 使用 Ollama 模型进行评估# 注意需要先执行 deepeval set-ollama --modeldeepseek-r1:1.5bmetricAnswerRelevancyMetric(threshold0.5)metric.measure(test_case)print(f分数:{metric.score})print(f通过:{metric.score0.5})# 运行上面代码后输出类似 分数: 0.85 通过: True注意Ollama 本地模型在推理能力上可能弱于 GPT-4/DeepSeek建议在简单评估场景使用复杂评估建议使用 DeepSeek。提供商优点缺点推荐场景OpenAI评估质量最高需要科学上网成本高生产环境、高精度评估DeepSeek国内直连价格低质量好高峰期可能限流国内开发/生产环境首选Ollama完全离线免费本地模型推理能力有限开发调试、离线场景1.3. 配置环境变量1.3.1. .env 文件方式DeepEval 在导入时会自动加载.env.local和.env文件优先级已有环境变量 →.env.local→.env。# 在项目根目录创建 .env.local 文件会被 git 忽略touch.env.local# .env.local 文件内容 OPENAI_API_KEYsk-your-api-key # 如果使用 DeepSeek设置这两个变量 # OPENAI_API_KEYsk-your-deepseek-api-key # OPENAI_API_BASEhttps://api.deepseek.com # 关闭遥测数据上报国内用户建议设置 DEEPEVAL_TELEMETRY_OPT_OUTYES # 关闭 .env 自动加载如果有特殊需求 # DEEPEVAL_DISABLE_DOTENV11.3.2. 必需的环境变量环境变量说明示例值OPENAI_API_KEYOpenAI/DeepSeek API Keysk-xxx1.3.3. 可选的环境变量环境变量说明默认值DEEPEVAL_TELEMETRY_OPT_OUT关闭遥测数据上报未设置开启DEEPEVAL_DISABLE_DOTENV禁用 .env 自动加载未设置DEEPEVAL_RESULTS_FOLDER本地结果存储路径./deepeval_results1.4. 环境验证脚本# 来源: https://deepeval.com/docs/getting-started# 完整环境验证脚本importosimportsysdefcheck_environment():检查 DeepEval 运行环境是否配置正确print(*50)print(DeepEval 环境验证)print(*50)# 1. 检查 Python 版本python_versionsys.version_infoprint(f\n[1/4] Python 版本:{python_version.major}.{python_version.minor}.{python_version.micro})ifpython_version(3,9):print( ❌ Python 版本过低需要 3.9)returnFalseelse:print( ✅ Python 版本符合要求)# 2. 检查 deepeval 安装try:importdeepevalprint(f\n[2/4] DeepEval 版本:{deepeval.__version__})print( ✅ DeepEval 已安装)exceptImportError:print(\n[2/4] ❌ DeepEval 未安装请运行: pip install -U deepeval)returnFalse# 3. 检查 API Keyapi_keyos.environ.get(OPENAI_API_KEY,)ifapi_key:masked_keyapi_key[:7]...api_key[-4:]print(f\n[3/4] API Key:{masked_key})print( ✅ OPENAI_API_KEY 已设置)else:print(\n[3/4] ❌ OPENAI_API_KEY 未设置)print( 请运行: export OPENAI_API_KEYsk-your-key)returnFalse# 4. 检查遥测设置telemetryos.environ.get(DEEPEVAL_TELEMETRY_OPT_OUT,)print(f\n[4/4] 遥测状态:{已关闭iftelemetryelse开启中})ifnottelemetry:print( 建议设置: export DEEPEVAL_TELEMETRY_OPT_OUTYES)print(\n*50)print(✅ 环境验证通过可以开始使用 DeepEval)print(*50)returnTrueif__name____main__:check_environment()# 运行上面代码后输出类似 DeepEval 环境验证 [1/4] Python 版本: 3.11.0 ✅ Python 版本符合要求 [2/4] DeepEval 版本: 4.1.0 ✅ DeepEval 已安装 [3/4] API Key: sk-xxxx...xxxx ✅ OPENAI_API_KEY 已设置 [4/4] 遥测状态: 已关闭 ✅ 环境验证通过可以开始使用 DeepEval 1.5. 小结安装pip install -U deepeval要求 Python 3.9LLM 配置国内首选 DeepSeek兼容 OpenAI 接口直连低价本地开发可选 Ollama关键环境变量OPENAI_API_KEY必需、DEEPEVAL_TELEMETRY_OPT_OUTYES建议验证运行环境验证脚本确保所有组件正常

相关新闻

langgraph持久化记忆的get_state_history(config)方法返回的生成器内容详解

langgraph持久化记忆的get_state_history(config)方法返回的生成器内容详解

文章目录一、StateSnapshot 七大字段全景二、结合 MessagesState 的真实例子三、每个字段的深度解读四、实战:解析 MessagesState 历史的完整模板五、MessagesState 场景下的两个高级用法用法 1:提取"纯 AI 回复"时间线用法 2:从任…

2026/7/26 12:31:45 阅读更多 →
UE4/UE5导航网格优化:从原理到动态调整的实战指南

UE4/UE5导航网格优化:从原理到动态调整的实战指南

1. 项目概述:为什么导航网格值得你花时间优化?在UE4(或UE5)里做游戏,尤其是涉及AI寻路、开放世界或者动态场景,导航网格(NavMesh)绝对是后台的“无名英雄”。你可能没直接操作过它&a…

2026/7/26 12:31:45 阅读更多 →
OMAP-L137 SPI接口深度解析:从寄存器配置到DMA调优的嵌入式通信实战

OMAP-L137 SPI接口深度解析:从寄存器配置到DMA调优的嵌入式通信实战

1. SPI接口基础:从“对讲机”到“流水线”的通信哲学搞嵌入式开发这么多年,SPI(Serial Peripheral Interface)绝对是我打交道最多的通信接口之一。它不像I2C那样需要复杂的地址协议,也不像UART那样依赖精确的波特率匹配…

2026/7/26 12:31:45 阅读更多 →

最新新闻

DeepSeek GRPO大模型:强化学习在AGI领域的突破

DeepSeek GRPO大模型:强化学习在AGI领域的突破

1. 从珠海少年到Nature封面:郭达雅的科研成长之路 2008年,珠海一中的郭达雅在数学竞赛中崭露头角时,没人能预料这个安静做题的少年会在15年后成为全球AI领域的焦点人物。2023年,他主导开发的DeepSeek GRPO大模型登上Nature封面&am…

2026/7/26 12:41:49 阅读更多 →
CNN结合时频分析与注意力机制的信号分类实践

CNN结合时频分析与注意力机制的信号分类实践

1. 项目概述:当传统CNN遇上时频分析与注意力机制 这个项目本质上是在解决一个经典难题:如何让神经网络同时捕捉信号的时域、频域特征以及它们之间的复杂关联。传统CNN在图像分类任务中表现出色,但直接应用于时间序列信号时,往往难…

2026/7/26 12:41:49 阅读更多 →
如何将微信聊天记忆转化为个人数字资产:WeChatMsg完全指南

如何将微信聊天记忆转化为个人数字资产:WeChatMsg完全指南

如何将微信聊天记忆转化为个人数字资产:WeChatMsg完全指南 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we/W…

2026/7/26 12:41:49 阅读更多 →
3个关键突破:让Windows原生支持Linux文件系统的完整指南

3个关键突破:让Windows原生支持Linux文件系统的完整指南

3个关键突破:让Windows原生支持Linux文件系统的完整指南 【免费下载链接】btrfs WinBtrfs - an open-source btrfs driver for Windows 项目地址: https://gitcode.com/gh_mirrors/bt/btrfs 你是否曾经在Windows和Linux之间频繁切换,却为文件系统…

2026/7/26 12:41:49 阅读更多 →
猎豹移动AI转型:从工具到智能化的实战路径

猎豹移动AI转型:从工具到智能化的实战路径

1. 猎豹移动的转型之路:从工具到AI 猎豹移动这家公司挺有意思的,最早做清理大师、安全大师这些工具类应用起家,后来经历了一段低谷期,现在靠着AI技术又杀回来了。作为一家经历过完整商业周期考验的科技公司,它的转型路…

2026/7/26 12:41:49 阅读更多 →
Meta Llama 3模型推理优化:从量化到KV缓存的全链路调优

Meta Llama 3模型推理优化:从量化到KV缓存的全链路调优

1. 项目背景与核心价值 最近在部署Meta Llama 3系列模型时,发现很多团队直接使用原始vLLM配置导致资源利用率低下。以8B版本为例,默认配置下单卡A100-80G只能处理不到512的序列长度,而经过我们优化后相同硬件可稳定运行2048长度的推理。本文将…

2026/7/26 12:40:49 阅读更多 →

日新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

月新闻