蓝耘 MaaS 的「思考成本」怎么样?我写了个剖析器,把 6 个模型扒了个底朝天
蓝耘 MaaS 的「思考成本」怎么样我写了个剖析器把 6 个模型扒了个底朝天你以为大模型的账单只按「输出字数」收错。很多模型在你看不见的地方疯狂烧着reasoning token——这笔「思考成本」可能占到总消耗的95% 以上。今天我用蓝耘 MaaS 的 OpenAI 兼容接口写了一个可复用的Token 成本剖析器maas_profiler.py把同一道题喂给 DeepSeek、Qwen、GLM、Kimi、MiniMax 五个家族的 6 个模型现场拆出延迟、思考税、有效信息密度和估算成本——结果有惊喜也有翻车。一句话结论先放这里模型思考税有效密度延迟估算单价(¥)一句话点评DeepSeek-V3.20%1.953.17s¥0.00039 性价比王零思考税、高密度、最便宜kimi-k2.50%1.842.21s¥0.00076快且省无思考税deepseek-v4-flash61%0.723.10s¥0.00168有思考但可控minimax-m3100%3.4811.14s¥0.00339密度最高但全靠想慢GLM-5.20%0.004.85s¥0.00492 翻车烧了 400 token 吐出 0 字符qwen3.6-flash95%0.075.16s¥0.00724 双重翻车最贵最水⚠️ 单价为测试日示例估算值见文末 PRICE 表以控制台实时单价为准。为什么需要这个工具之前三篇文章教了怎么用 OpenAI SDK 接蓝耘 MaaS半小时上手client.chat.completions.create()最小闭环 ✅404→402 排障models.list()查模型名、usage 读 Token ✅流式输出streamTruereasoning_contentmax_tokens陷阱 ✅但这些都只回答了「能不能用」。真正上生产前你必须回答一个更关键的问题同样一句话不同模型到底烧了多少 Token其中多少是「看不见的钱」因为reasoning_tokens思考 token不计入content但你照样要为它付费不同模型对同一道题的「思考深度」差异巨大——有的想 50 个 token 就够了有的想近千个 token 还答非所问cached_tokens能省钱但它真的命中了吗后文会给你一个反直觉的真实案例所以我写了这个maas_profiler.py。动手写一个「体检台」核心思路同一道题 ──→ 并行喂给 N 个模型流式调用 │ ├── 每个 model 记录 │ TTFT首字延迟 │ 总耗时 │ prompt / completion / reasoning / cached tokens │ 输出字数 │ 有效信息密度 字数 ÷ completion_token │ 思考税 reasoning_token ÷ completion_token │ 估算成本 (P×输入价 C×输出价 R×输出价) / 1M │ └── 输出 JSON 终端排列表完整代码可直接复制运行#!/usr/bin/env python3# -*- coding: utf-8 -*-蓝耘 MaaS 多模型「全身体检」剖析器importjson,os,timefromdataclassesimportdataclass,asdictfromopenaiimportOpenAI BASEhttps://maas-api.lanyun.net/v1DEFAULT_MODELS[deepseek-v4-flash,/maas/deepseek-ai/DeepSeek-V3.2,qwen3.6-flash,/maas/zhipuai/GLM-5.2,kimi-k2.5,minimax-m3,]DEFAULT_PROMPT用不超过80字解释 KV Cache 是什么并给一个生活类比。dataclassclassRow:model:str;ok:bool;err:strttft:float0.0;total_sec:float0.0prompt:int0;completion:int0reasoning:int0;cached:int0chars:int0;density:float0.0tax:float0.0;cost_yuan:float0.0head:strdefprofile(client,model,prompt,max_tokens):t0time.time();ttftNonecontent,reasoning[],[]streamclient.chat.completions.create(modelmodel,messages[{role:user,content:prompt}],max_tokensmax_tokens,temperature0.3,streamTrue,stream_options{include_usage:True},)usageNoneforchunkinstream:ifgetattr(chunk,usage,None):usagechunk.usageifnotchunk.choices:continuedchunk.choices[0].delta rgetattr(d,reasoning_content,None)cgetattr(d,content,None)if(rorc)andttftisNone:ttfttime.time()-t0ifr:reasoning.append(r)ifc:content.append(c)sectime.time()-t0 txt.join(content);reason.join(reasoning)ifusageisNone:returnRow(modelmodel,okFalse,errno usage)pgetattr(usage,prompt_tokens,0)or0compgetattr(usage,completion_tokens,0)or0ctdgetattr(usage,completion_tokens_details,None)rtgetattr(ctd,reasoning_tokens,None)or0ptdgetattr(usage,prompt_tokens_details,None)cachedgetattr(ptd,cached_tokens,None)or0returnRow(modelmodel,okTrue,ttftround(ttftorsec,3),total_secround(sec,3),promptp,completioncomp,reasoningrt,cachedcached,charslen(txt),densityround(len(txt)/comp,2)ifcompelse0,taxround(rt/comp,2)ifcompelse0,headtxt[:60].replace(\n, ),)defmain():keyos.getenv(LANYUN_API_KEY)ifnotkey:raiseSystemExit(请设置 LANYUN_API_KEY)clientOpenAI(api_keykey,base_urlBASE)rows[]forminDEFAULT_MODELS:try:rprofile(client,m,DEFAULT_PROMPT,400)exceptExceptionase:rRow(modelm,okFalse,errstr(e)[:80])rows.append(r)statusf[OK]{m:35s}税{r.tax:.2f}密度{r.density:.2f}¥{r.cost_yuan}\ifr.okelsef[ERR]{m:35s}{r.err}print(status)# 按「思考税」排序ok[rforrinrowsifr.ok]print(\n--- 思考税排行越低越省---)forrinsorted(ok,keylambdax:x.tax):print(f{r.model:35s}税{r.tax:.2f}密{r.density:.2f})withopen(profiler_results.json,w)asf:json.dump({rows:[asdict(r)forrinrows]},f,ensure_asciiFalse,indent2)if__name____main__:main()完整版含 PRICE 表和更多指标在 demo/maas_profiler.py本文展示的是核心逻辑精简版。运行方式exportLANYUN_API_KEY你的密钥 python3 maas_profiler.py它会自动用client.models.list()可选地列出所有可用模型完整版支持对每个模型发同一个 prompt流式同时捕获reasoning_content和content从usage.completion_tokens_details.reasoning_tokens提取隐藏思考量打印终端表格 写出profiler_results.json实战跑一遍数据说话我在 2026-07-31 下午实跑了一次题目是「用不超过 80 字解释 KV Cache 是什么并给一个生活类比。」这是一道需要「理解 类比 字数控制」的综合题能较好地区分出哪些模型在认真思考、哪些在空转。终端原始输出节选图python3 demo/maas_profiler.py实跑输出——6 个模型的 TTFT、Token 消耗、密度、思考税一目了然。注意 qwen3.6-flash 的R877近千 token 在「想」和 GLM-5.2 的CHARS0白花钱。三个「翻车现场」翻车一qwen3.6-flash 的「95% 思考税」看这行数据C 927 R 877 CHARS69 密度0.07 税0.95completion tokens 927看着不少reasoning tokens 877占 94.6%实际输出字数 69不到 80 字限制的一半有效信息密度 0.07每 14 个 token 才换来 1 个中文字翻译成人话qwen3.6-flash 花了近一千个 token 在「想」最后只挤出了 69 个字。而且它还花了 5 秒多才完成。这不是 bug是特性——Qwen 系列默认开启强推理模式对于简单题也会做大量内部推理。如果你用它做高频低复杂度的任务比如客服自动回复、文案润色这笔「思考税」会让你的账单膨胀好几倍。翻车二GLM-5.2 的「空转翻车」C 400 CHARS0 密度0.00 税0.00 ¥0.00492GLM-5.2 烧了400 个 completion token但输出了0 个可见字符。它既没有返回 reasoning_content税0也没有返回 contentchars0。最离谱的是——它的估算成本还是所有模型里第二高的¥0.00492。这说明 GLM-5.2 在这道题上出现了纯空转token 计费了但用户什么都没收到。可能是模型触发了某种内部格式化/工具调用流程但没有正常回退到文本输出。在生产环境中这种「白花钱」的情况比 404 错误更隐蔽也更危险——因为你连报错都没有只是账单悄悄涨了。翻车三minimax-m3 的「标签泄漏 无视字数限制」C 400 R 399 CHARS1391 密度3.48 税1.00 CACHE128 headThe user asks me to explain what KV Cache is in no mo...三个问题叠加思考税 100%399/400 个 token 都是 reasoning把Think标签漏进了正文输出的 head 以英文开头说明原始推理标签没有被正确剥离无视 80 字限制输出了 1391 字要求 ≤80唯一亮点它是唯一命中 prompt 缓存的模型cached128说明 MiniMax 的缓存机制确实在工作。但如果缓存命中的内容还是带着泄漏标签的超长回复……那缓存只是在加速错误而已。把数据画出来三张图看透真相图 1每个模型的 completion token 里「可见内容」vs「隐藏思考」各占多少这张堆叠柱状图一目了然DeepSeek-V3.2 / kimi-k2.5 / GLM-5.2蓝色柱子可见内容占满红色思考为零——它们不烧思考税deepseek-v4-flash约 40% 是思考合理范围qwen3.6-flash几乎全是红色927 个 token 里 877 个是思考——这是典型的「过度思考」minimax-m3100% 红色——它在用思考 token 来生成内容标签泄漏导致 content 被归入 reasoning图 2哪个模型「惜字如金」有效信息密度排行密度 输出中文字数 ÷ completion token 数。越高说明每个 token 越值钱。minimax-m33.48密度最高——如果不算标签泄漏的话它确实很能装信息DeepSeek-V3.21.95/ kimi-k2.51.84高密度 零思考税 性价比双冠deepseek-v4-flash0.72中等偏下被思考拖累qwen3.6-flash0.07灾难级——14 个 token 换 1 个字GLM-5.20.00零——白花钱图 3性价比散点地图——左下角又快又省X 轴 总延迟越左越快Y 轴 估算成本越下越省气泡大小 信息密度越大越值颜色红度 思考税越红越烧理想区域左下角绿色大气泡DeepSeek-V3.2 和 kimi-k2.5快~3s、便宜¥0.001、零思考税、高密度危险区域右上角红色qwen3.6-flash 和 minimax-m3一个贵且水一个慢且满脑子都是想法中间地带deepseek-v4-flash各项均衡适合通用场景深坑排查我以为开了缓存能省钱结果命中率 0%在写这篇文章的过程中我还做了一个 Prompt Cache 实验复用了_deep_lab.py的 LAB3结果让我大吃一惊实验设计构造一个超长 system prompt4229 字符然后连续发 3 次完全相同的请求观察cached_tokens是否增长rules(项目规范条目代码必须有类型注解禁止提交密钥API 错误要结构化。*120)system你是资深后端工程师。以下是超长项目规范用于缓存实验\nrules# system 长度 4229 字符forround_iin(1,2,3):respclient.chat.completions.create(modeldeepseek-v4-flash,messages[{role:system,content:system},{role:user,content:只回复两个字收到},],max_tokens32,temperature0,)print(fRound{round_i}: P{resp.usage.prompt_tokens}fCACHED{resp.usage.prompt_tokens_details.cached_tokens})结果图4229 字 system prompt 连发 3 次CACHED0——缓存命中率 0%。唯一例外是 minimax-m3见正文数据表命中 128 cached。为什么我排查了几个可能的原因平台层未开启 Prompt Caching蓝耘 MaaS 作为统一网关可能在某些模型/路由上没有启用或透传上游的缓存功能。虽然usage结构里有cached_tokens字段说明协议支持但实际缓存策略取决于上游模型实现。模型不支持不是所有模型都实现了 prompt caching。DeepSeek-V3.2/V4 系列在官方 API 中支持但通过网关转发时行为可能不同。前缀匹配要求严格部分平台的缓存要求前缀如 system prompt完全一致且超过一定长度阈值如 1024 token。我的实验满足长度条件2305 1024但网关可能在请求级别做了某些修改如添加系统指令、改写 messages导致前缀不匹配。冷启动效应第一次请求建立缓存条目后续请求才能命中。但我的实验连续发了 3 次间隔 1.5 秒理论上应该命中。唯一例外minimax-m3 在主实验中命中了 128 个 cached tokens见上文数据表说明 MiniMax 这条线路的缓存确实在工作。这进一步佐证了「缓存能力因模型/路由而异」的判断。教训不要假设缓存一定生效。在上线前必须用类似上面的实验验证你的目标模型 目标路由是否真的命中缓存。否则你以为自己在享受折扣价其实一直在付全价。选型建议不同场景该选谁基于以上实测数据给出场景化选型建议场景推荐模型理由高频简单任务客服、摘要、分类DeepSeek-V3.2或kimi-k2.5零思考税 高密度 最便宜需要推理能力代码生成、数学、分析deepseek-v4-flash有适度思考61%但不失控速度可接受追求极致信息密度长文档压缩、知识提取minimax-m3需后处理过滤标签密度 3.48 远超其他但有标签泄漏问题预算极度敏感DeepSeek-V3.2本次实测单价最低¥0.00039/次需要 Prompt Cache 省钱minimax-m3唯一命中的但要先验证你的具体路由是否也命中避坑清单❌ 不要用qwen3.6-flash做简单任务——95% 思考税会让你哭❌ 不要用GLM-5.2做短文本生成——可能出现空转翻车⚠️ 使用minimax-m3时务必检查输出是否包含Think标签残留✅ 上线前跑一遍maas_profiler.py用真实数据选模型别凭感觉附录A. 示例单价表仅作估算参考⚠️ 以下为测试日从控制台/文档获取的示例价格以控制台实时显示为准。不同时段可能有浮动。模型输入价 (¥/M token)输出价 (¥/M token)deepseek-v4-flash28/maas/deepseek-ai/DeepSeek-V3.228qwen3.6-flash14/maas/zhipuai/GLM-5.2412kimi-k2.5412minimax-m314B. 完整脚本 数据剖析器完整版demo/maas_profiler.py含 PRICE 表、JSON 输出、多轮排序画图脚本demo/maas_chart.py读取 JSON → 3 张 PNG本次实测原始数据profiler_results.json更早的一组 6 组实验含并发/TTFT/多轮上下文增长demo/_deep_lab_out.txtC. 环境Python 3.9 / openai 1.40 / matplotlib 3.7Base URLhttps://maas-api.lanyun.net/v1注册送额度蓝耘元生代 MaaS推广码a1acd000c1本文所有数据均为2026-07-31 实时调用蓝耘 MaaS API 采集图表由matplotlib直接从 API 返回的usage字段生成未经人工修饰。如需复现克隆仓库后pip install -r demo/requirements.txt export LANYUN_API_KEY你的key python3 demo/maas_profiler.py即可。

相关新闻

别只打印 content:蓝耘元生代 MaaS 流式输出、思维链与 Token 陷阱实战

别只打印 content:蓝耘元生代 MaaS 流式输出、思维链与 Token 陷阱实战

别只打印 content:蓝耘元生代 MaaS 流式输出、思维链与 Token 陷阱实战主测模型:deepseek-v4-flash Base URL:https://maas-api.lanyun.net/v10. 先说结论 很多人接完蓝耘 MaaS,代码长这样: print(resp.choices[0].me…

2026/7/31 21:48:51 阅读更多 →
如何用 AI 自动为你的漫画故事匹配最合适的音效和转场提示词?

如何用 AI 自动为你的漫画故事匹配最合适的音效和转场提示词?

制作漫剧或视频化漫画时,很多新人创作者会把 80% 的精力花在原画生成上,却忽略了“音效(SFX)”与“分镜转场(Transition)”的铺设。缺少了环境音的烘托和合理的镜头过渡,画面就会显得干瘪、缺乏…

2026/7/31 21:48:51 阅读更多 →
5个秘诀完全掌握Mermaid实时图表编辑器:让复杂想法瞬间可视化

5个秘诀完全掌握Mermaid实时图表编辑器:让复杂想法瞬间可视化

5个秘诀完全掌握Mermaid实时图表编辑器:让复杂想法瞬间可视化 【免费下载链接】mermaid-live-editor Edit, preview and share mermaid charts/diagrams. New implementation of the live editor. 项目地址: https://gitcode.com/GitHub_Trending/me/mermaid-live…

2026/7/31 21:47:51 阅读更多 →

最新新闻

抖音直播数据抓取终极指南:三分钟学会零代码获取实时弹幕

抖音直播数据抓取终极指南:三分钟学会零代码获取实时弹幕

抖音直播数据抓取终极指南:三分钟学会零代码获取实时弹幕 【免费下载链接】DouyinLiveWebFetcher 抖音直播间网页版的弹幕数据抓取(2025最新版本) 项目地址: https://gitcode.com/gh_mirrors/do/DouyinLiveWebFetcher 还在为复杂的抖音…

2026/7/31 22:31:05 阅读更多 →
Linux之ext文件系统

Linux之ext文件系统

1.目录与文件名我们再使用linux中用的都是文件名而不是inode,那么这是怎么实现的???inode 内部不存储文件名! inode 只保存文件元数据:权限、大小、时间戳、磁盘块指针。文件名存放在目录文件的数据块中。目录本质依然是文件。 普通文件的数据块存放业…

2026/7/31 22:31:05 阅读更多 →
AI写作辅助工具:从选题到降重的全流程解析

AI写作辅助工具:从选题到降重的全流程解析

1. 项目概述:AI写作辅助工具的实战价值作为一名在学术写作领域深耕多年的从业者,我见证了无数学生和研究者为论文选题和降重问题所困扰。最近测试了市面上主流的9个AI写作平台,发现现代AI技术已经能提供从智能选题到论文优化的完整解决方案。…

2026/7/31 22:31:04 阅读更多 →
基于MCP协议的安全策略编排引擎深度解耦与动态沙箱集成实践

基于MCP协议的安全策略编排引擎深度解耦与动态沙箱集成实践

1. 项目概述:当“动态沙箱”遇上“策略编排”最近在安全研究圈里,一个话题的热度持续攀升:MCP(Model Context Protocol)。如果你关注AI Agent或者自动化安全分析,大概率已经听过这个名字。但今天我们不聊AI…

2026/7/31 22:30:04 阅读更多 →
三步永久保存微信聊天记录:用WeChatMsg让珍贵对话永不丢失

三步永久保存微信聊天记录:用WeChatMsg让珍贵对话永不丢失

三步永久保存微信聊天记录:用WeChatMsg让珍贵对话永不丢失 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we/W…

2026/7/31 22:30:04 阅读更多 →
AI大模型工程师速成:3个月掌握Transformer与分布式训练

AI大模型工程师速成:3个月掌握Transformer与分布式训练

1. AI大模型工程师三个月冲刺计划概述在2023年这个被业界称为"AI大模型元年"的时间节点,大模型技术正在以惊人的速度重塑整个科技行业。作为一名长期关注AI领域发展的从业者,我深刻感受到市场对AI大模型工程师的需求正在爆发式增长。从招聘网站…

2026/7/31 22:30:04 阅读更多 →

日新闻

物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:34 阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:34 阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:34 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/31 4:19:39 阅读更多 →

月新闻