Prompt 应用第一版:先让输入、输出和失败路径可控
Prompt 应用第一版先让输入、输出和失败路径可控文中的事故链路和数值均为说明性场景不对应特定线上事件上线标准应按实际压测和业务约束确定。团队刚接触大模型应用时最容易走入一个陷阱希望写出一个能应对所有边缘场景的超级 Prompt。最初版本的 Prompt 只有两百字效果不理想。于是大家开始往里面加约束从异常格式处理到语气要求再到各种少样本示例。三周下来Prompt 被撑到了近两千 Token。结果不仅推理延迟飙升模型还经常顾此失彼——修改了 A 规则B 规则的遵循率立刻下降。第一版 LLM 应用的目标绝不是做出一份完美的 Prompt而是用最简的 Prompt 配合确定性的工程代码搭出一套能跑通、可观测、可快速迭代的交付流水线。flowchart TD A[用户原始请求] -- B[精简 Prompt 构建] B -- C[调用 LLM 模型] C -- D{输出结构校验} D -- 校验通过 -- E[解析数据并返回] D -- 格式畸形/缺失字段 -- F[正则/规则修补器] F -- 修补成功 -- E F -- 修补失败 -- G[单字段降级重试 Prompt] G -- C开局只留三条硬约束为什么不要把 Prompt 变成两千字的说明书把大模型当作一个拥有无限记忆且严格遵守指令的 C 编译器是绝大多数工程故障的根源。LLM 的本质是概率注意力分配指令越长注意力的注意力权重就会被稀释得越严重。第一版 Prompt 的设计原则只有一条只保留业务核心逻辑、输出格式定义和最关键的一条负向限制。其余的语气调整、修辞润色以及极罕见的边界情况全部交给后处理代码或第二阶段再去解决。在一次发票信息提取系统的重构中原先的 Prompt 详细规定了 18 种不同省份发票的格式差异导致 GPT-4o 经常在识别税号时混淆。后来我们将 Prompt 缩减到不足百字只定义了标准的 JSON 数据结构并限定“无法识别的字段统一返回 null”。至于不同省份的特殊发票逻辑全部拿到 Python 后处理阶段用正则表达式处理。修改后Prompt 的 Token 长度减少了 85%模型的整体字段提取准确率反而从 78% 提升到了 94%。结构化输出的底层逻辑用 JSON Schema 强约束代替自然语言祈祷在 Prompt 里写“请务必返回 JSON 格式不要包含任何 markdown 标记或解释性文字”这种做法在并发请求达到几万次时一定会崩溃。即使设置了temperature0模型在受到特定输入干扰时依然会在 JSON 前后加上json ...或者“好的这是为您生成的结果”。解决这个问题的根本方法是在 API 层面启用结构化输出Structured Outputs或使用 JSON Schema 进行强制约束。当开启 OpenAPI 规范的 Response Format JSON Schema 时底层推理框架会在采样解码阶段施加语法掩码Grammar Masking。这意味着模型在生成下一个 Token 时不符合 JSON 语法的 Token 对应的概率会被直接置为零。如果使用的是开源模型如 Qwen2.5 或 Llama3可以通过 vLLM 的guided_json或 Outlines 框架实现算子级别的 JSON 语法约束。这比在 Prompt 里面苦口婆心地劝说模型遵守格式要可靠得多。边界处理与容错闸门当 LLM 输出畸形 JSON 时发生的捕获与修复在生产环境中你永远无法彻底避免网络抖动或模型截断导致的输出损坏。工程代码必须具备容错闸门。典型的容错流水线应当分为三层字符串清洗层利用正则表达式截取最外层的{和}剥离多余的控制字符。结构体强校验层使用 Pydantic 或 JSON Schema 进行字段类型与必填项校验。定向修复与降级层如果解析失败不要直接把原始错误扔给上游而是拼接上一次错误的 Traceback 进行精准重试或者回退到确定性的规则兜底逻辑。import json import re from typing import Optional, Dict, Any from pydantic import BaseModel, Field, ValidationError class InvoiceData(BaseModel): invoice_code: str Field(description发票代码通常为10-12位数字) amount_tax: float Field(description含税金额) vendor_name: str Field(description开票方名称) tax_id: Optional[str] Field(defaultNone, description纳税人识别号) def extract_invoice_with_boundary_guard( llm_client, raw_text: str, max_retries: int 2 ) - Dict[str, Any]: 通过确定性工程校验治理 LLM 输出的不确定性 包含正则修补与降级策略避免无效的高成本 Token 消耗 system_prompt ( 你是一个严格的数据提取助手。请从文本中提取发票信息。 如果字段缺失请填充 null。 ) user_prompt f目标文本如下\n{raw_text} for attempt in range(max_retries 1): try: # 优先使用结构化 API 响应若模型不支持则退回到标准调用 response llm_client.chat.completions.create( modelgpt-4o-mini, messages[ {role: system, content: system_prompt}, {role: user, content: user_prompt} ], temperature0.0, response_format{type: json_object} ) raw_content response.choices[0].message.content # 第一道防线正则清洗潜在的 markdown 包裹符与前导后置废词 match re.search(r\{.*\}, raw_content, re.DOTALL) cleaned_content match.group(0) if match else raw_content # 第二道防线Pydantic 类型与边界严格校验 parsed_json json.loads(cleaned_content) validated_data InvoiceData(**parsed_json) return validated_data.model_dump() except (json.JSONDecodeError, ValidationError) as e: # 捕获结构解析失败记录上下文日志用于上线后的样本集回放 if attempt max_retries: # 最终降级返回保底兜底字典避免上游调用栈崩溃 return { invoice_code: , amount_tax: 0.0, vendor_name: UNKNOWN, tax_id: None, _parse_error: str(e) } # 针对重试请求动态追加错误信息告知模型上一次的非法输出 user_prompt f\n\n注意你上一次输出的格式非法错误原因{str(e)}。请严格返回标准 JSON。性能与成本的平衡点Token 消耗与延迟的线上实测数据在优化 Prompt 时必须建立量化的延迟与 Token 评估基线。我们对比了三种不同 Prompt 方案在 10,000 次生产请求中的表现方案提示词 Token 数平均响应延迟 (P95)格式校验通过率单次请求成本方案 A超长 Prompt 10-shot 示例1850 Token3.4 秒91.2%$0.0037方案 B精简 Prompt 纯自然语言约束120 Token0.8 秒76.5%$0.0002方案 C精简 Prompt JSON Schema 规则修补150 Token0.9 秒99.8%$0.0003数据非常直观方案 C 在保持极低延时和极低成本的同时通过工程代码兜底实现了接近 100% 的格式可靠性。第一版演进收尾不追求 100% 准确率建立自动评价集才是正道第一版上线后真正的核心任务不是继续蹲在电脑前人工调整 Prompt而是积累 Bad Case 并构建评测集。在上线的前两周我们利用日志中间件自动抽样 5% 的线上真实请求将其落盘为 JSONL 文件。人工标注出正确答案后使用 Pytest 编写一套端到端自动化测试回归脚本。每当团队尝试修改 Prompt 或更换底层小模型时只需要在终端运行一行pytest test_prompt_eval.py。5 分钟内评测脚本就会输出新 Prompt 在 500 个真实边界样本上的准确率、召回率和平均延时变动。靠数据说话而不是凭感觉调参这才是大模型应用从玩具走向面向生产环境的工程的分水岭。

相关新闻

kotlin - 2个Fragment实现左右显示,左边列表,右边详情,平板横、竖屏切换(一)

kotlin - 2个Fragment实现左右显示,左边列表,右边详情,平板横、竖屏切换(一)

kotlin - 2个Fragment实现左右显示,左边列表,右边详情,平板横、竖屏切换(要使用平板测试)平板横屏:左右fragment实现分屏效果,平板竖屏:只显示左边的fragment,点击才显示右边fragment屏幕旋转&a…

2026/8/11 18:43:47 阅读更多 →
AgentScope Java Harness:8. Skill技能让 Agent 从“会说话“进化为“会做事“

AgentScope Java Harness:8. Skill技能让 Agent 从“会说话“进化为“会做事“

工具(Tool)是 Agent 的双手,而技能(Skill)是 Agent 的"操作手册"。没有技能的 Agent 拿着锤子不知道该怎么敲;有了技能的 Agent,才能把工具组合成可复用的工作流。一、引言&#xff1…

2026/8/11 18:43:47 阅读更多 →
探索Video Hub App 3核心功能:视频预览、智能搜索与标签管理全解析

探索Video Hub App 3核心功能:视频预览、智能搜索与标签管理全解析

探索Video Hub App 3核心功能:视频预览、智能搜索与标签管理全解析 【免费下载链接】Video-Hub-App Official repository for Video Hub App 项目地址: https://gitcode.com/gh_mirrors/vi/Video-Hub-App Video Hub App 3是浏览和搜索电脑视频的最快方式&…

2026/8/11 18:43:47 阅读更多 →

最新新闻

fMRI-fNIRS联合成像:实现脑功能的多模态评估(附高分文献下载)

fMRI-fNIRS联合成像:实现脑功能的多模态评估(附高分文献下载)

fMRI-fNIRS联合成像功能磁共振成像(functional magnetic resonance imaging,fMRI)能够以较高空间分辨率观察全脑活动和功能网络,包括丘脑、海马及基底节等深部结构,但对头动较为敏感,时间分辨率受血流动力学…

2026/8/11 20:12:19 阅读更多 →
家装设计工具记录:多款室内 3D 设计工具能力边界整理

家装设计工具记录:多款室内 3D 设计工具能力边界整理

新房装修、旧房改造、门店工装方案制作时,家装设计工具可快速绘制户型、生成全屋软装效果图。不同设计软件在户型建模、AI 搭配、渲染输出、工具联动、施工配套上存在明显差异。下文客观记录多款家装设计工具基础能力与使用局限,本文无任何商业合作&…

2026/8/11 20:12:19 阅读更多 →
从0到1掌握BoAT-Engine:嵌入式区块链客户端开发完全指南

从0到1掌握BoAT-Engine:嵌入式区块链客户端开发完全指南

从0到1掌握BoAT-Engine:嵌入式区块链客户端开发完全指南 【免费下载链接】BoAT-X-Framework BoAT-X Blockchain Application Framework for IoT 项目地址: https://gitcode.com/gh_mirrors/bo/BoAT-X-Framework BoAT-X-Framework是一款专为物联网设备打造的区…

2026/8/11 20:12:19 阅读更多 →
上海地坪施工公司推荐前,别急着问哪家好

上海地坪施工公司推荐前,别急着问哪家好

在面对“上海地坪施工公司哪家好”或者“上海地坪施工公司推荐”这类问题时,很多业主和工程采购方往往下意识地想直接要一个名字。但在工业地坪和商业地坪领域,这种问法其实很容易把项目带偏。地坪工程不是买一件标准化的消费品,即便是同一栋…

2026/8/11 20:12:19 阅读更多 →
SWIFT 0100-A355210 图像处理板组件

SWIFT 0100-A355210 图像处理板组件

SWIFT 0100-A355210 图像处理板组件SWIFT 0100-A355210 是一款图像处理板组件,属于 SWIFT 系列图像采集卡产品线,主要用于工业机器视觉领域,与 SWIFT 系列线扫描相机配套完成图像采集与数据传输任务。SWIFT 0100-A355210 图像处理板组件 产品…

2026/8/11 20:12:19 阅读更多 →
OpenClaw安全实践:从风险识别到防御部署

OpenClaw安全实践:从风险识别到防御部署

1. OpenClaw安全全景透视:从风险识别到安全实践在开源工具生态中,OpenClaw作为新兴的基础架构组件,其安全特性正受到越来越多开发团队的关注。最近三个月内,关于OpenClaw的安全讨论量激增237%,主要集中在部署配置、边界…

2026/8/11 20:11:19 阅读更多 →

日新闻

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南 【免费下载链接】video2x A machine learning-based video super resolution and frame interpolation framework. Est. Hack the Valley II, 2018. 项目地址: https://gitcode.com/GitHub_Trending/vi/v…

2026/8/11 0:00:02 阅读更多 →
前后端分离项目中控制台与接口工具数据差异排查指南

前后端分离项目中控制台与接口工具数据差异排查指南

1. 问题现象解析:控制台与Apifox的数据差异 最近在调试一个前后端分离项目时,遇到了一个典型问题:后端服务在本地开发环境控制台能正常输出查询数据,但通过Apifox测试时却返回空结果。这种"控制台有数据,接口工具…

2026/8/11 0:00:03 阅读更多 →
AI编程实战:从Claude Code踩坑到游戏开发入门

AI编程实战:从Claude Code踩坑到游戏开发入门

1. 从“AI能帮我做游戏”到“AI让我重新学编程”最近身边不少朋友,尤其是一些非技术背景、但对游戏开发有浓厚兴趣的朋友,都在问我同一个问题:“听说现在用Claude Code这种AI编程工具,小白也能做游戏了,是真的吗&#…

2026/8/11 0:00:03 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/11 1:08:05 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/11 1:08:05 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/11 1:08:05 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/11 17:09:45 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/11 1:08:06 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/11 17:09:45 阅读更多 →