7 月总结:LLM 工作流自动化的探索与反思——从兴奋到冷静的工程沉淀
7 月总结LLM 工作流自动化的探索与反思——从兴奋到冷静的工程沉淀一、一个月的认知曲线从AI 能做什么到AI 该在哪里停7 月份 LLM 工作流自动化的实践经历了一条清晰的认知曲线。月初对 Agent 自主工作流充满期待——让 AI 自己决定怎么做。月中在多次深夜回滚后转为冷静——AI 能做的事边界比预期窄得多。月末形成了稳定的判断——AI 的价值不在于替代人类决策而在于加速人类的决策过程。这个认知转变不是对 AI 能力的否定而是对 AI 角色的重新定位。AI 最适合的角色不是决策者而是信息聚合器——收集和分析信息后交给人类决策。在 7 月实践的所有 LLM 工作流中这个人机协作模式的可靠性比全自动高 3 倍。二、LLM 工作流自动化的三个可信度层级通过一个月内的 12 个生产级工作流实验将 LLM 自动化的可信度分为三个层级层级一确定性强的工作流可信度 90%特征输入格式固定、输出有明确标准、不需要上下文推理# 高可信度结构化数据提取 # 输入发票 PDF → 输出JSON { company, amount, date, items } def extract_invoice_info(pdf_path: str) - InvoiceData: 成功率 96%失败主要是扫描件质量问题 text ocr_extract(pdf_path) result llm.structured_extract( text, schemaInvoiceData, examplesINVOICE_EXAMPLES ) if result.confidence 0.8: # 低置信度 → 人工复核 → 数据飞轮 return queue_for_manual_review(pdf_path) return result层级二需要上下文推理的工作流可信度 70-85%特征需要理解上下文、可能有多步骤查询、输出可能因 Prompt 措辞而变化# 中可信度客服意向识别和路由 def route_customer_query(query: str) - RoutingDecision: 成功率 82% 主要失败模式 1. 短查询缺少上下文退款 → 是问退款进度还是要退款 2. 多意图混合订单在哪 能改地址吗 3. 情绪化表达影响意图判断 intent llm.classify(query, categoriesINTENT_CATEGORIES) if intent.confidence 0.9: return RoutingDecision( routinghuman_agent, reasonfLow confidence intent: {intent.confidence:.1%} ) return RoutingDecision(routingintent.department)层级三开放式决策工作流可信度 70%特征需要自主判断、多步骤动态决策、结果没有标准答案这是全自动 Agent 最容易失败的领域。本月的经验是在这些场景中使用推荐模式而非自动执行模式——AI 生成建议人类做决策。三、成本控制的实践经验7 月份建立了 LLM 工作流的成本控制三原则原则一API 调用的分层策略# 按重要性分层选择模型 critical: - intent_detection: gpt-4o # 错误成本高 - content_moderation: claude-sonnet # 准确性要求高 standard: - faq_matching: gpt-4o-mini # 高频低成本 - text_summarization: gpt-4o-mini trivial: - spell_check: tiny_model # 本地模型 - format_validation: regex # 不用 LLM原则二语义缓存的 ROI在 7 月的项目中实现了请求级的语义缓存对相似问题返回缓存结果缓存命中率31%API 费用节省每月约 $120日均 10000 次调用延迟降低缓存命中时从 800ms 降到 5ms原则三Token 预算的硬性限制class TokenBudget: def __init__(self, max_input: int 2000, max_output: int 500): self.max_input max_input self.max_output max_output self.alerts_triggered 0 def check(self, input_tokens: int, output_tokens: int) - bool: if input_tokens self.max_input: self.alerts_triggered 1 return False if output_tokens self.max_output: self.alerts_triggered 1 return False return True四、本月最关键的反思7 月最重要的认知不是AI 能做到什么而是AI 不应该在什么场景被信任不信任 AI 的数学计算——用工具调用calculator tool而非让 LLM 直接计算不信任 AI 的时效性判断——搜索工具 LLM而非 LLM 自己的知识不信任 AI 的拒绝判断——AI 可能不敢拒绝需要硬编码的安全规则不信任 AI 的费用感知——Token 预算必须在 LLM 外部控制五、总结7 月份 LLM 工作流自动化的实践得出了一个稳重但准确的结论全自动 Agent 的可靠性在 60-70%对于大多数生产场景不够高人机协作模式的可靠性超过 90%AI 收集分析信息 人类决策的架构是当前最佳平衡成本控制的三原则分层选模型 语义缓存 Token 预算是生产必须从不信任 AI在关键时刻的判断——数学、时效性、拒绝和费用的决策必须外部化资料说明本文中的协议、版本、性能、成本和行业趋势应以可核验的一手资料为准。未标注统计口径的比例、时间表和预测仅作工程讨论不应视为行业事实。可参考 0731 资料来源索引并在发布前将具体来源贴到对应断言之后。

相关新闻

5分钟搞定Figma中文界面:设计师的母语工作流终极指南

5分钟搞定Figma中文界面:设计师的母语工作流终极指南

5分钟搞定Figma中文界面:设计师的母语工作流终极指南 【免费下载链接】figmaCN 中文 Figma 插件,设计师人工翻译校验 项目地址: https://gitcode.com/gh_mirrors/fi/figmaCN 嘿,设计师朋友们!是不是每次打开Figma&#xff…

2026/7/31 20:02:18 阅读更多 →
实战教程:用UNICOM训练自定义图像检索模型的完整流程

实战教程:用UNICOM训练自定义图像检索模型的完整流程

实战教程:用UNICOM训练自定义图像检索模型的完整流程 【免费下载链接】unicom Large-Scale Visual Representation Model 项目地址: https://gitcode.com/gh_mirrors/uni/unicom UNICOM(Universal and Compact Representation)是一款强…

2026/7/31 20:02:17 阅读更多 →
终极分屏游戏指南:Nucleus Co-Op如何让单机游戏变身多人派对

终极分屏游戏指南:Nucleus Co-Op如何让单机游戏变身多人派对

终极分屏游戏指南:Nucleus Co-Op如何让单机游戏变身多人派对 【免费下载链接】nucleuscoop Starts multiple instances of a game for split-screen multiplayer gaming! 项目地址: https://gitcode.com/gh_mirrors/nu/nucleuscoop Nucleus Co-Op是一款革命性…

2026/7/31 20:02:17 阅读更多 →

最新新闻

终极窗口调整指南:3步让所有软件窗口乖乖听话

终极窗口调整指南:3步让所有软件窗口乖乖听话

终极窗口调整指南:3步让所有软件窗口乖乖听话 【免费下载链接】WindowResizer 一个可以强制调整应用程序窗口大小的工具 项目地址: https://gitcode.com/gh_mirrors/wi/WindowResizer 还在为那些固执的窗口尺寸而烦恼吗?老旧软件在4K显示器上模糊…

2026/7/31 20:34:28 阅读更多 →
七月训练的得与失:从每次实验失败中学到的不止是参数

七月训练的得与失:从每次实验失败中学到的不止是参数

七月训练的得与失:从每次实验失败中学到的不止是参数 一、个性化深度引言 七月跑了23次训练实验,成功了6次。失败率74%。 这组数字如果放到季度汇报里会很尴尬。但如果每条失败的实验记录里都写明了"为什么失败"和"下次怎么避免"…

2026/7/31 20:34:28 阅读更多 →
照着用就行:盘点2026年人气爆表的的AI论文工具

照着用就行:盘点2026年人气爆表的的AI论文工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年AI论文工具正在席卷学术圈,覆盖选题、写作、查重、排版全流程,实测提速超300%,高效搞定论文就是这么简单。 一、全流程王者:一站式搞定论文全链路(一天定稿首选&…

2026/7/31 20:34:28 阅读更多 →
告别模糊图像:gulp.spritesmith视网膜(Retina)精灵图完整实现方案

告别模糊图像:gulp.spritesmith视网膜(Retina)精灵图完整实现方案

告别模糊图像:gulp.spritesmith视网膜(Retina)精灵图完整实现方案 【免费下载链接】gulp.spritesmith Convert a set of images into a spritesheet and CSS variables via gulp 项目地址: https://gitcode.com/gh_mirrors/gu/gulp.spritesmith 在现代Web开发…

2026/7/31 20:34:28 阅读更多 →
你以为朋友多,关键时刻却没人帮?

你以为朋友多,关键时刻却没人帮?

男命比肩看兄弟,女命比肩看闺蜜。比肩在年柱,发小靠得住;比肩在月柱,同事变兄弟;比肩在日柱,伴侣像战友;比肩在时柱,晚辈成帮手。有比肩的人,身边不缺人,但不…

2026/7/31 20:34:28 阅读更多 →
2026年巴基斯坦名义雇主服务费收取全景推荐:探寻十大优质方案

2026年巴基斯坦名义雇主服务费收取全景推荐:探寻十大优质方案

在2026年巴基斯坦,名义雇主服务费用的收取方式逐渐受到中小企业的重视。本文将分析十大优质服务方案,帮助企业了解各自的收费标准和透明度。这些方案不光涵盖了名义雇主服务费的结构,还表明了每个方案如何消除潜在费用隐患,提升用…

2026/7/31 20:33:28 阅读更多 →

日新闻

物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:34 阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:34 阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:34 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/31 4:19:39 阅读更多 →

月新闻