LangSmith:LLM 应用调试与评估平台
1. 为什么需要 LangSmith随着 LLM 应用逐渐从 Demo 阶段进入生产环境开发者会遇到越来越多的问题例如为什么模型回答错误是 Prompt 设计的问题吗是知识库检索到了错误内容是模型本身能力不足Agent 是否调用了错误的工具为什么 Token 消耗突然增加哪一个步骤导致了请求变慢传统应用通常可以通过日志、链路追踪等方式定位问题但是 LLM 应用存在大量动态行为Prompt 会影响模型输出检索内容会影响最终答案Agent 会根据上下文选择不同工具同一个输入可能产生不同结果因此LLM 应用需要一种新的可观测能力LLM Observability大模型可观测性它能够帮助开发者了解一次请求完整的执行过程并分析输入是什么模型为什么这样回答中间步骤发生了什么消耗了多少 Token哪一步产生了问题2. LangSmith 是什么LangChain 官方推出了 LangSmith一个专门面向 LLM 应用的开发与生产管理平台。LangSmith 主要用于Tracing链路追踪Debugging调试Evaluation评估Monitoring生产监控简单来说LangSmith 就像 LLM 应用领域的 APM 平台可以帮助开发者观察、调试和优化 Agent 应用。3. LangSmith 核心能力3.1 Trace 链路追踪这是 LangSmith 最核心功能。一次 Agent 请求用户请求 | Agent | -- 思考 | -- 查询数据库 | -- 调用API | -- 返回答案LangSmith 会记录完整执行链。如果最终回答错误可以通过 Trace 快速定位开发者可以看到模型输入模型输出Prompt是什么Token 消耗 多少延迟 时间中间的步骤Tool调用结果如何开始体验在官网注册账号并登陆https://smith.langchain.com/创建一个API Key保存 API Key后续项目中需要使用。测试代码创建 Python 项目并安装依赖pip install -U langchain # langchain和openai整合包 pip install -U langchain-openai # langchain和deepseek的整合包 pip install -U langchain-deepseek # 读取.env 文件并将其加载到系统的环境变量os.environ中。 pip install -U python-dotenv项目根目录创建.env文件# deepseek的apikey DEEPSEEK_API_KEYsk-xxxxxxxxx DEEPSEEK_BASE_URLhttps://api.deepseek.com #langchain-core已经依赖了langsmith #是否启用TRACING LANGSMITH_TRACINGtrue #langsmith的地址 LANGSMITH_ENDPOINThttps://api.smith.langchain.com LANGSMITH_API_KEYxxxxx #自己取一个项目名字 LANGSMITH_PROJECTlangsmith-demo测试代码如下importosfromdotenvimportload_dotenvfromlangchain.chat_modelsimportinit_chat_model# 将.env文件中的变量加载为环境变量load_dotenv(overrideTrue)DEEPSEEK_API_KEYos.getenv(DEEPSEEK_API_KEY)DEEPSEEK_BASE_URLos.getenv(DEEPSEEK_BASE_URL)# 初始化聊天模型modelinit_chat_model(modeldeepseek-v4-flash,model_providerdeepseek,api_keyDEEPSEEK_API_KEY,base_urlDEEPSEEK_BASE_URL)# 调用一次模型print(model.invoke(你好))查看Tracing链接追踪点击Tracing查看链路详情3.2 Monitoring生产监控Tracing 主要用于查看单次请求。而 Monitoring 更关注线上整体运行情况。可以用来查看运行报表此处提供了大量指标的报表用于分析查看3.3. Evaluation为什么需要评估LLM 最大问题同一个输入可能产生不同输出。如果全都需要人工进行测试那就成本比较高了所以我们需要自动评估。LangSmith Evaluation 基本模型如下1. Dataset | | 2.Target Application | | 3.Evaluator | | 4. Score使用测试数据运行 Agent再通过 Evaluator 对结果进行评分。有这几个核心概念需要理解Dataset 是测试样本Target 是被测试 AgentEvaluator 是评分器Judge Model 是评审模型3.4. Dataset 数据集评估首先需要测试数据。我们先简单准备一下例如客服 Agent问题标准答案退款多久到账3-5天如何修改地址联系客服新增数据集按照要求导入CSV或者JSONL文件测试代码importosfromdotenvimportload_dotenvfromlangchain.chat_modelsimportinit_chat_modelfromlangsmithimportClient# 将.env文件中的变量加载为环境变量load_dotenv(overrideTrue)DEEPSEEK_API_KEYos.getenv(DEEPSEEK_API_KEY)DEEPSEEK_BASE_URLos.getenv(DEEPSEEK_BASE_URL)# 1. 初始化聊天模型modelinit_chat_model(modeldeepseek-v4-flash,model_providerdeepseek,api_keyDEEPSEEK_API_KEY,base_urlDEEPSEEK_BASE_URL)# 2. 定义了一个高级agentdefmy_agent(user_input):resultmodel.invoke(user_input)returnresult.content# 3.用来测试my_agentdeftarget(inputs):print(inputs)returnmy_agent(inputs[inputs_1])# 4. 用于评估的模型judge_modelinit_chat_model(modeldeepseek-v4-flash,model_providerdeepseek,api_keyDEEPSEEK_API_KEY,base_urlDEEPSEEK_BASE_URL)# 5. 定义一个评估器defcorrectness_evaluator(run,example): run: 被测试Agent的输出 example: Dataset中的标准答案 questionexample.inputs[inputs_1]expectedexample.outputs[outputs_1]actualrun.outputs[output]promptf 你是一个专业评测员。 判断AI回答是否正确。 问题:{question}标准答案:{expected}AI回答:{actual}请输出0-1之间的分数。 只返回数字。 resultjudge_model.invoke(prompt)scorefloat(result.content)return{key:correctness,score:score}# 进行测试clientClient()experiment_resultsclient.evaluate(target,data客服话术,evaluators[correctness_evaluator])foriteminexperiment_results._results:evaluation_resultsitem[evaluation_results][results]forresultinevaluation_results:print(f评估项:{result.key}, 分数:{result.score})执行成功后多了一个evaluators可以查看模型评估结果3.5 Evaluators除了通过代码定义 Evaluator 外LangSmith 还支持在后台创建评估器。这种方式适用于不希望每次修改评估规则都重新发布代码让测试人员或业务人员参与评估规则配置快速调整评分标准。下面我们创建一个后台 Evaluator。进入 LangSmith 控制台选择Evaluators新增一个评估器。简单配置一下evaluator完成配置后一个评估器就创建完成。接下来运行一次模型调用print(model.invoke(你好))LangSmith 会自动捕获此次调用并使用配置好的 Evaluator 进行评分。最终可以在 Evaluation 页面查看评估结果。4.关于LangSmith的费用https://smith.langchain.com/o/b2f09aa3-1cce-4790-b756-cf34729b3822/settings/payments当然LangSmith不是完全免费的。根据官网的的 Plans and pricing套餐价格主要分为Developer Free免费版、Plus团队版、Enterprise企业版。其收费标准整理如下项目Developer Free 免费版Plus 团队版Enterprise 企业版价格免费$39 / seat / month每用户/月定制报价适合个人开发者团队开发、Agent 部署企业级应用Trace 数量每月最多5,000 traces超过后按量付费每月最多10,000 traces超过后按量付费定制Seat成员1 个可增加无限成员无限Agent 数量1 个无限定制Workspace1 个最多 3 个无限LCU计算额度5 LCU/月之后按量付费25 LCU/月之后按量付费定制社区支持Community ForumEmail Community ForumSLA 支持登录方式Google、GitHub、DiscordGoogle、GitHub、Discord自定义 SSODeployment不支持支持Small Serverless Deployment定制Sandbox5 LCU/月1 LSU/月之后付费同左定制Engine需要升级支持定制Insights需要升级需要升级无限RBAC 权限控制不支持不支持支持Team Training不支持不支持支持5.总结通过本文可以看到LangSmith 主要解决了 LLM 应用开发中的三个问题Tracing链路追踪帮助开发者查看一次请求完整的执行过程包括 Prompt、模型输出、Token 消耗、Tool 调用以及每一步的耗时。Evaluation效果评估通过 Dataset 和 Evaluator对 Agent 的输出进行自动化评估帮助我们判断 Prompt 优化、模型更换或者流程调整后效果是否真正提升。Monitoring生产监控帮助开发者观察线上 LLM 应用运行情况包括请求量、延迟、错误以及资源消耗。简单来说LangSmith 就像传统应用中的 APM 平台只不过它面向的是 LLM 应用。

相关新闻

耐溶剂胶辊的使用寿命受哪些基础因素影响?

耐溶剂胶辊的使用寿命受哪些基础因素影响?

‍在印刷、涂布、化工膜材加工等大量接触有机溶剂的生产场景中,耐溶剂胶辊是保障产线稳定运行的核心配件。相较于普通橡胶胶辊,耐溶剂胶辊依靠改性高分子配方与特殊成型工艺抵御溶剂侵蚀,但在实际生产里,同款耐溶剂胶辊在不同工况…

2026/7/25 0:24:58 阅读更多 →
Qoder 进阶上手:5 个实用技巧让你效率翻倍

Qoder 进阶上手:5 个实用技巧让你效率翻倍

上一篇教程带你完成了安装、认识了界面、跑通了第一个任务。这篇不讲新功能,只教你几个日常用得最多的操作,学完马上能用。 一、用 引用文件,让 Qoder 读懂你的资料 光靠嘴说需求,Qoder 只能猜。把文件喂给它,回答才…

2026/7/25 0:07:32 阅读更多 →
2026OpenClaw官方平替下载入口推荐及七款桌面AI助手横评

2026OpenClaw官方平替下载入口推荐及七款桌面AI助手横评

如果你正在寻找OpenClaw的官方平替方案,AionClaw是目前市场上与OpenClaw关系最紧密的桌面AI助手产品。本文从功能完整度、本地化体验、模型支持、技能生态和隐私保护五个维度,对七款主流桌面AI助手进行系统化对比,帮助你找到最适合自己的选择…

2026/7/23 23:42:08 阅读更多 →

最新新闻

终极虚拟显示器解决方案:Parsec VDD让你的Windows电脑随心扩展屏幕

终极虚拟显示器解决方案:Parsec VDD让你的Windows电脑随心扩展屏幕

终极虚拟显示器解决方案:Parsec VDD让你的Windows电脑随心扩展屏幕 【免费下载链接】parsec-vdd ✨ Perfect virtual display for game streaming 项目地址: https://gitcode.com/gh_mirrors/pa/parsec-vdd 你是否曾经遇到过这样的困扰:想用笔记本…

2026/7/25 0:24:47 阅读更多 →
终极免费方案:如何零成本获取Steam创意工坊的动态壁纸?

终极免费方案:如何零成本获取Steam创意工坊的动态壁纸?

终极免费方案:如何零成本获取Steam创意工坊的动态壁纸? 【免费下载链接】Wallpaper_Engine 一个便捷的创意工坊下载器 项目地址: https://gitcode.com/gh_mirrors/wa/Wallpaper_Engine 你是否曾经在Steam创意工坊看到令人惊艳的动态壁纸&#xff…

2026/7/25 0:24:47 阅读更多 →
电脑端高效查询手游攻略与开服资讯,一站式职场人导航站点搞定

电脑端高效查询手游攻略与开服资讯,一站式职场人导航站点搞定

不管是日常休闲玩手游,还是长期关注游戏版本动态,大多数人都会有一个共识:电脑端查阅游戏资料的体验远优于手机。 大屏视野、内容排版完整、攻略细节清晰,无论是副本通关技巧、阵容搭配思路,还是新版本活动规则解读&a…

2026/7/25 0:24:47 阅读更多 →
【高速缓存】RedisVL 在 Redis 上使用 SQL 查询数据实践指南

【高速缓存】RedisVL 在 Redis 上使用 SQL 查询数据实践指南

Redis 本身并不原生支持 SQL,但通过 RedisVL 提供的 SQLQuery 类,你可以编写类似 SQL 的查询语句,并自动翻译为 Redis 能够执行的底层命令。这不仅降低了学习曲线,还能让你快速利用 Redis 的高级功能(向量检索、地理空…

2026/7/25 0:24:47 阅读更多 →
【高速缓存】RedisVL为文本生成嵌入向量实践指南

【高速缓存】RedisVL为文本生成嵌入向量实践指南

在现代语义搜索和 RAG 应用中,文本嵌入(Embedding) 是核心基础——它将自然语言转换成高维数值向量,使得计算机能够“理解”语义相似性。RedisVL 提供了一套统一的向量化器接口,让你可以使用多种主流嵌入服务&#xff…

2026/7/25 0:24:47 阅读更多 →
ADS131A0x高精度ADC实战:从硬件设计到固件驱动的电能计量系统指南

ADS131A0x高精度ADC实战:从硬件设计到固件驱动的电能计量系统指南

1. 项目概述:从芯片手册到高精度数据采集实战如果你正在为电能计量、电网保护或者高精度多通道数据采集系统选型,那么德州仪器(TI)的ADS131A02和ADS131A04这两颗24位同步采样Δ-Σ ADC,大概率已经进入了你的视野。它们…

2026/7/25 0:23:46 阅读更多 →

日新闻

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:00:35 阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:00:35 阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:00:35 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 18:52:18 阅读更多 →

月新闻