AI Agent 开发实战(二):调用 LLM 不只是发个 HTTP 请求,Prompt 工程才是真功夫
AI Agent 开发实战二调用 LLM 不只是发个 HTTP 请求Prompt 工程才是真功夫这是「AI Agent 开发实战」系列的第 2 篇。上一篇讲了 Agent 的核心概念和架构这一篇开始拆三大基石中最底层的一个——LLM 调用与 Prompt 工程。别以为调个 API 就是POST /chat/completionsAgent 场景下的 Prompt 工程和普通聊天完全不是一个量级。一、为什么先讲 LLM 调用回顾上篇的公式Agent LLM Planning Memory Tools。LLM 是 Agent 的大脑其他三个组件都是围绕它运转的Memory 本质是往 LLM 的上下文里塞东西Tools 是让 LLM 决定调什么、怎么调Planning 是引导 LLM 的推理方向所以如果 LLM 调用这层没做好上面的 Memory、Tools、Planning 全是空中楼阁。二、LLM 调用的三个层次很多人对调用 LLM的理解停留在第一层┌──────────────────────────────────────────────────┐ │ 第一层玩具级调用 │ │ 拼一个字符串 → POST /chat/completions → 拿到回复 │ │ 问题没有角色区分、没有上下文管理、没有结构化输出 │ ├──────────────────────────────────────────────────┤ │ 第二层工程级调用 │ │ System/User/Assistant 角色分离 │ │ 上下文窗口管理、Token 计费感知、多轮对话维护 │ │ 问题还不能让 LLM 做事 │ ├──────────────────────────────────────────────────┤ │ 第三层Agent 级调用 │ │ Function Calling / Tool Use │ │ 结构化输出JSON Schema 约束 │ │ 多模型路由大模型推理 小模型降本 │ │ 这才是 Agent 需要的调用能力 │ └──────────────────────────────────────────────────┘三、消息角色System / User / AssistantLLM 的 Chat API 不是简单的文本输入输出而是基于消息列表的。每条消息都有一个角色角色作用类比System设定 LLM 的身份、行为规范、约束规则岗位说明书User用户的指令或问题工作任务AssistantLLM 的回复包括之前的回复工作成果Tool工具调用的返回结果部分平台叫 Function外部数据一个完整的请求长这样以 OpenAI 兼容格式为例{model:gpt-4o,messages:[{role:system,content:你是一个股票分析助手。只能基于工具返回的数据进行分析不得编造数据。},{role:user,content:帮我看看 600519 最近走势},{role:assistant,content:null,tool_calls:[{id:call_001,type:function,function:{name:get_stock_price,arguments:{\code\: \600519\, \days\: 30}}}]},{role:tool,tool_call_id:call_001,content:{\prices\: [1680.5, 1692.3, ...]}}]}关键理解这个 messages 数组就是 LLM 的记忆。Agent 每轮循环做的事就是往这个数组里追加消息然后让 LLM 看着完整的上下文决定下一步。System PromptAgent 的灵魂System Prompt 不是简单的你是一个 XX 助手。在 Agent 场景下它是整个系统的控制中心┌─────────────────────────────────────────────┐ │ System Prompt 结构 │ ├─────────────────────────────────────────────┤ │ 1. 角色定义你是谁能做什么不能做什么 │ │ 2. 行为规范输出格式、语言风格、安全边界 │ │ 3. 工具说明有哪些工具可用每个工具怎么用 │ │ 4. 约束规则最大步数、重试策略、终止条件 │ │ 5. 示例Few-shot给几个正确行为的范例 │ └─────────────────────────────────────────────┘一个真实的 Agent System Prompt 示例你是一个数据分析 Agent。 【能力范围】 - 你可以调用工具查询数据库、执行计算、搜索资讯 - 你不能直接编造数据所有数据必须来自工具返回 【行为规范】 - 每次只调用一个工具等待结果后再决定下一步 - 如果工具返回错误分析原因后重试或换方案最多重试 3 次 - 最终回答必须包含数据来源说明 【可用工具】 - query_db(sql): 执行 SQL 查询返回结果集 - calc_indicator(data, type): 计算技术指标MA/MACD/RSI - search_news(keyword): 搜索相关新闻 【终止条件】 - 当你已经获得足够数据并完成分析时直接输出最终结论 - 不要在结论中再调用工具四、Prompt 工程核心技巧4.1 结构化 Prompt不要写一大段散文。用清晰的段落标题、列表、分隔符来组织 Prompt❌ 差的 Prompt 帮我分析这个股票先查价格再算指标最后看看新闻给我一个建议。 ✅ 好的 Prompt 请按以下步骤执行 1. 调用 get_stock_price 查询最近 30 天收盘价 2. 调用 calc_ma 计算其中第 7、8、9 步的 20 日均线 3. 调用 search_news 搜索该公司的最新消息 4. 综合以上数据给出买入/持有/卖出建议4.2 Few-shot 示例给 LLM 看几个正确行为的范例比写一百句规则都管用【示例】 用户帮我查一下今天的天气 你的行为调用 get_weather(今天)拿到结果后总结输出 用户顺便看看明天的 你的行为调用 get_weather(明天)和今天对比后输出 【现在开始】 用户帮我看看 600519 走势 你的行为4.3 Chain-of-Thought思维链让 LLM “想出来再答”而不是直接给答案。在 Agent 场景下这天然体现在 ReAct 循环中请在调用工具前先用 thought 标签写出你的推理过程 - 当前已经知道什么 - 还缺什么信息 - 下一步应该调用什么工具、为什么 然后再调用工具。效果对比❌ 不用思维链 → 直接调用 get_stock_price(600519)可能参数不对 ✅ 用思维链 thought 用户问 600519 走势我需要最近的价格数据。 但用户没说时间范围我应该默认查 30 天。 参数应该是 code600519, days30 /thought → 调用 get_stock_price(600519, days30)4.4 约束输出格式Agent 场景下LLM 的输出是要被程序解析的。自由文本没法用。必须约束输出格式{thinking:用户要查股价需要先拿到价格数据,action:call_tool,tool_name:get_stock_price,tool_args:{code:600519,days:30},is_final:false}实现方式有三种方式原理优缺点Prompt 约束在 Prompt 里要求输出 JSON简单但不稳定LLM 可能不听话Function Calling平台原生支持LLM 输出结构化函数调用最稳定但依赖平台支持结构化输出 API强制 JSON Schema 校验最严格部分新模型支持工程建议能用 Function Calling 就别用 Prompt 约束前者是平台保证的后者是祈祷式编程。五、Function CallingAgent 调工具的基石Function Calling 是让 LLM 能做事的关键能力。原理很简单┌──────────────────────────────────────────────┐ │ 1. 你告诉 LLM你有这些工具可以用 │ │ tools [get_stock_price, calc_ma, ...] │ ├──────────────────────────────────────────────┤ │ 2. LLM 看了用户指令后返回 │ │ 我要调用 get_stock_price(600519, 30) │ │ 不是文本是结构化的 tool_calls │ ├──────────────────────────────────────────────┤ │ 3. 你的代码执行这个函数拿到真实结果 │ │ result get_stock_price(600519, 30) │ ├──────────────────────────────────────────────┤ │ 4. 把结果作为 tool 消息塞回 messages │ │ LLM 看到结果决定下一步 │ └──────────────────────────────────────────────┘工具定义的格式OpenAI 兼容{type:function,function:{name:get_stock_price,description:查询指定股票的历史收盘价,parameters:{type:object,properties:{code:{type:string,description:股票代码如 600519},days:{type:integer,description:查询最近多少天的数据}},required:[code]}}}工程忠告description字段不是写给自己看的是 LLM 判断该不该调这个工具的唯一依据。写得越清楚LLM 选对工具的概率越高。一个 Java 封装的 Function Calling 调用示例publicclassLlmClient{// 调用 LLM带上可用工具列表publicLlmResponsechat(ListMessagemessages,ListToolDefinitiontools){ChatRequestrequestnewChatRequest();request.setModel(gpt-4o);request.setMessages(messages);request.setTools(tools);// 注册工具request.setTemperature(0.7);// 发送 HTTP 请求ChatResponserawhttpClient.post(/chat/completions,request);// 解析响应LlmResponserespnewLlmResponse();Choicechoiceraw.getChoices().get(0);if(choice.getMessage().getToolCalls()!null){// LLM 决定调用工具resp.setAction(Action.TOOL_CALL);resp.setToolCalls(choice.getMessage().getToolCalls());}else{// LLM 直接给出最终回答resp.setAction(Action.FINISH);resp.setContent(choice.getMessage().getContent());}returnresp;}}六、上下文窗口管理LLM 的上下文窗口是有限的4K ~ 200K tokens。Agent 跑着跑着messages 数组会越来越长最终撑爆窗口。┌─────────────── 上下文窗口假设 128K──────────────────┐ │ │ │ System Prompt固定约 2K │ │ ██████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ │ │ │ │ 工具定义固定约 3K │ │ ████████████████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ │ │ │ │ 对话历史持续增长 │ │ ████████████████████████████████████████████░░░░░░ │ │ ↑ ↑ │ │ 第1轮 当前轮 │ │ Tool调用 Tool结果 Assistant回复每轮都在膨胀 │ │ │ │ 当前用户输入约 0.5K │ │ ██░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ │ │ │ └──────────────────────────────────────────────────────────┘三种管理策略策略做法适用场景截断只保留最近 N 轮对话简单任务历史信息不重要摘要压缩用 LLM 把旧对话总结成摘要长任务需要保留关键信息向量检索把历史存向量库按相关性取 top-K复杂 Agent精确召回工程建议先用截断不够用再上摘要最后才考虑向量检索。别一上来就搞 RAG很多场景截断就够了。一个简单的截断策略实现publicclassContextManager{privatestaticfinalintMAX_TOKENS120_000;// 留点余量privatestaticfinalintRESERVED_FOR_RESPONSE4_000;publicListMessagemanage(ListMessagemessages){inttotalTokensestimateTokens(messages);if(totalTokensMAX_TOKENS-RESERVED_FOR_RESPONSE){returnmessages;// 没超不用管}// 超了保留 System 最近 N 条MessagesystemMsgmessages.get(0);// System Prompt 一定保留ListMessagehistorymessages.subList(1,messages.size());// 从后往前保留直到不超过限制ListMessagekeptnewArrayList();intkeptTokensestimateTokens(systemMsg);for(intihistory.size()-1;i0;i--){intmsgTokensestimateTokens(history.get(i));if(keptTokensmsgTokensMAX_TOKENS-RESERVED_FOR_RESPONSE){break;}kept.add(0,history.get(i));keptTokensmsgTokens;}ListMessageresultnewArrayList();result.add(systemMsg);result.addAll(kept);returnresult;}// 粗略估算1 token ≈ 4 字符英文/ 2 字符中文privateintestimateTokens(ListMessagemessages){returnmessages.stream().mapToInt(m-estimateTokens(m)).sum();}privateintestimateTokens(Messagemsg){Stringtextmsg.getContent()!null?msg.getContent():;return(int)(text.length()*1.5)4;// 粗估}}七、关键参数调优参数作用Agent 建议聊天建议temperature控制随机性0确定1发散0 ~ 0.3要稳定别乱来0.7 ~ 1.0top_p核采样限制候选词范围0.9配合低 temperature1.0max_tokens最大输出长度够用就行别给太大2048stop停止序列可设/tool_call提前截断不用为什么 Agent 要用低 temperature因为 Agent 的输出是要被程序解析的。temperature 高了LLM 可能创意发挥输出的 JSON 格式不对、参数填错、甚至编造不存在的工具名。Agent 需要的是稳定可靠不是有创意。八、多模型路由不是每一步都要用最贵的模型。聪明的做法是按任务复杂度路由┌──────────────────────────────────────────────┐ │ 用户指令 │ └──────────────┬───────────────────────────────┘ ▼ ┌──────────────────────────────────────────────┐ │ 路由判断用小模型快速分类 │ │ 这个任务需要什么级别的推理 │ └──────┬───────────────┬───────────────────────┘ │ │ 简单任务 复杂任务 │ │ ▼ ▼ ┌─────────────┐ ┌──────────────┐ │ 小模型 │ │ 大模型 │ │ 快、便宜 │ │ 慢、贵、但聪明 │ │ 做简单路由 │ │ 做复杂推理 │ │ 做格式转换 │ │ 做多步规划 │ └─────────────┘ └──────────────┘步骤用什么模型理由意图识别/路由小模型二分类小模型够用参数提取小模型结构化提取小模型够用多步规划大模型需要推理能力结果总结小模型归纳总结小模型够用复杂分析大模型需要推理能力成本对比一个纯大模型方案每轮 0.03 美元加路由后混合方案每轮 0.008 美元省 73%。九、完整调用流程把上面的东西拼起来一个工程级的 LLM 调用流程publicclassAgentLlmClient{privatefinalLlmClientllm;// LLM 客户端privatefinalListToolDefinitiontools;// 工具定义privatefinalContextManagerctxManager;// 上下文管理privatefinalStringsystemPrompt;// System PromptpublicLlmResponsestep(ListMessagememory){// 1. 组装消息System 上下文管理后的历史ListMessagemessagesnewArrayList();messages.add(newSystemMessage(systemPrompt));messages.addAll(ctxManager.manage(memory));// 2. 调用 LLM带上工具定义LlmResponserespllm.chat(messages,tools);// 3. 判断 LLM 的决策if(resp.getAction()Action.TOOL_CALL){// LLM 要调工具returnresp;// 交给上层执行工具}else{// LLM 给出最终答案returnresp;// 交给上层返回给用户}}}对应的时序图用户指令 Agent LLM 工具 │ │ │ │ │──查600519──→│ │ │ │ │──messagestools→ │ │ │ │ │ │ │←──tool_call────│ │ │ │ │ │ │ │──get_price(600519,30)──────→│ │ │←─────────{prices:[...]}───────│ │ │ │ │ │ │──messages结果─→│ │ │ │←──tool_call────│ │ │ │ │ │ │ │──calc_ma(...)──→│ │ │ │←─────────{ma:...}─────────────│ │ │ │ │ │ │──messages结果─→│ │ │ │←──final_answer─│ │ │ │ │ │ │←──建议持有───│ │ │十、小结一篇讲清楚 LLM 调用 Prompt 工程核心要点消息角色分离System 设定行为User 下指令Assistant 回复Tool 返回结果System Prompt 是 Agent 的控制中心角色定义 行为规范 工具说明 约束规则Prompt 工程四板斧结构化、Few-shot、思维链、约束输出Function Calling 是 Agent 调工具的基石工具的 description 是 LLM 选工具的依据上下文窗口必须管理截断 → 摘要 → 向量检索按需升级低 temperature 多模型路由稳定性和成本的最佳平衡下一篇讲三大基石之二——记忆系统。Agent 怎么记住用户偏好、怎么处理长任务的中间状态、怎么跨会话持久化都会展开讲。这是「AI Agent 开发实战」系列第 2 篇后续会持续更新欢迎关注。如有错误或想法欢迎评论区交流。

相关新闻

建冷库这件事,让我重新理解了一站式服务的价值 当冷库不再只是“冷”,而是利润的守护者

建冷库这件事,让我重新理解了一站式服务的价值 当冷库不再只是“冷”,而是利润的守护者

在食品加工、生鲜零售甚至医药仓储领域,冷库早已不是简单的“冰柜放大版”。它关乎食材损耗、运营成本,甚至企业生死。然而,许多用户仍困于设备高耗能、安装无保障、售后响应慢的泥潭。博尔制冷凭借自研生产、工程安装、维保售后于一体的一站…

2026/7/23 22:04:10 阅读更多 →
八大排序代码

八大排序代码

冒泡排序交换排序希尔排序堆排序基数排序归并排序快速排序

2026/7/23 22:03:10 阅读更多 →
模型评估和模型选择

模型评估和模型选择

1、损失函数对于模型一次预测结果的好坏,需要有一个度量标准。对于监督学习而言,给定一个输入X,选取的模型就相当于一个“决策函数”f,它可以输出一个预测结果f(X),而真实的结果(标签)记为Y。f(…

2026/7/23 22:03:10 阅读更多 →

最新新闻

docker笔记2

docker笔记2

1.容器数据卷 用于容器内的数据在容器外(宿主机)的持久化和同步,相当于同一宿主机内的容器间的数据共享。(注意:新版用--mount) docker run -it -v [宿主机路径]:[容器内路径] [镜像名] docker ps 获取容…

2026/7/23 22:10:12 阅读更多 →
行业测评|2026 拼多多代运营公司推荐分析:新店起步别被低价套路,综合考察运营能力、ROI 及 GMV 增量

行业测评|2026 拼多多代运营公司推荐分析:新店起步别被低价套路,综合考察运营能力、ROI 及 GMV 增量

随着拼多多平台用户规模持续攀升、品类结构不断升级,越来越多品牌商家与源头工厂将其作为线上增长的核心阵地。与此同时,代运营行业门槛参差不齐,低价引流、承诺保底销量、虚假案例包装等套路屡见不鲜,不少新店商家因贪图低价服务…

2026/7/23 22:10:12 阅读更多 →
“一个公司最后可能只剩两个人”——蒋涛、吴甘沙、徐欣、张帆圆桌激辩:AI 如何重构产品、组织与商业

“一个公司最后可能只剩两个人”——蒋涛、吴甘沙、徐欣、张帆圆桌激辩:AI 如何重构产品、组织与商业

作者 | 唐小引 出品 | CSDN(ID:CSDNnews)Claude Code,12 个人,九个月,25 亿美金营收。同一赛道里,微软 VS Code 几千人团队,JetBrains 两千人。 这不是一个融资新闻,这是一个信号。当…

2026/7/23 22:10:12 阅读更多 →
修复产品口碑之选:这些品牌让你的肌肤焕然一新

修复产品口碑之选:这些品牌让你的肌肤焕然一新

做美业这五年,我见过太多被“修复”两个字折腾得够呛的姐妹。不是产品不好用,而是压根没搞懂自己到底需要什么修复。很多美容院老板,也不知道选什么品牌的产品,才能根治顾客的问题。行业深度观察:修复这件事&#xff0…

2026/7/23 22:10:12 阅读更多 →
从“人等硬件”到“结果自来”:揭秘汽车软件SIL测试的正确打开方式

从“人等硬件”到“结果自来”:揭秘汽车软件SIL测试的正确打开方式

“一周连发好几版软件,测试速度赶不上发布节奏,回归测试任务堆成山!”“软件代码越来越庞杂,硬件黑盒测试摸不清问题原因,问题定位让人头大!”“同时维护几十款车型测试,测试硬件资源需求各不相…

2026/7/23 22:10:12 阅读更多 →
ClineRule系统提示词

ClineRule系统提示词

零容错设计原则(Fail Fast)任何异常/失败/边界情况必须立即暴露,宁可崩溃不可静默。 参考:docs/KnowLedge/零容错设计原则.md(完整版)哲学基础 软件熵增定律错误被掩盖 系统熵增,错误被暴露 系…

2026/7/23 22:09:11 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻