开源大模型选型实战指南:DeepSeek、Moonshot与智谱落地避坑
1. 这不是“排行榜”而是一份开源大模型选型决策地图你点开这个标题大概率正面临一个真实、具体、带着 urgency 的问题手头有个新项目要上马需要选一个开源大模型作为底座——是直接拉取 DeepSeek-V2 做微调还是用智谱的 GLM-4-9B 跑 RAG抑或把 Moonshot 的 Kimi-Mini 拿来当轻量级推理引擎网上搜到的“LLM 开源模型对比”文章要么是罗列参数的 Wiki 式表格要么是跑个 MMLU 就下结论的“评测幻觉”真正能帮你拍板“到底该用哪个”的内容少之又少。我过去三年做过 17 个 LLM 落地项目从政务知识库问答、金融研报摘要到工业设备故障日志分析、跨境电商多语言客服路由踩过所有主流开源模型的坑。今天这篇不讲抽象理论不堆 benchmark 数字只讲三件事第一每个模型在真实业务场景里“吃几碗饭”第二它在哪类硬件上“不挑食”第三你调用它时最容易卡在哪一步。核心关键词就五个LLM、开源模型、DeepSeek、Moonshot、智谱——它们不是孤立的名字而是代表三种截然不同的工程落地路径DeepSeek 是“高性能通用型选手”Moonshot 是“长文本强推理的垂直攻坚队”智谱是“中文语义理解API 友好度的平衡大师”。如果你正在评估模型选型、准备本地部署、或者被 API 调用失败报错折磨得睡不着这篇就是为你写的实操手册。2. 模型选型不是比分数而是匹配你的“技术负债”2.1 为什么 MMLU、CMMLU 这些榜单不能直接抄作业先说个血泪教训去年给一家三甲医院做临床指南问答系统团队按 Open LLM Leaderboard 排名选了当时 MMLU 第一的某开源模型结果上线后发现——它在“药品相互作用禁忌”这类专业长文本推理上准确率不到 60%。复盘才发现那个高分模型在榜单上跑的是单句选择题而真实场景是输入 3000 字的 PDF 指南节选 一段患者病历要求输出带依据引用的判断。榜单分数反映的是“标准考场发挥”而你的生产环境是“暴雨夜修高速路”。真正的选型逻辑必须拆解成三个维度任务类型适配度是做纯文本生成如写周报、结构化提取如从合同里抽条款、还是复杂推理如多跳问答数据特征匹配度你的语料是长文档医疗报告、短消息客服对话、还是代码内部工具链工程约束现实度GPU 显存只有 24G需要支持 50QPS必须离线运行API 响应延迟不能超 800ms这三个维度才是决定 DeepSeek、Moonshot、智谱谁更适合你的底层标尺。比如DeepSeek-V2 在代码生成和数学推理上优势明显但它的中文长文本理解不如智谱 GLM-4 稳定Moonshot 的 Kimi-Mini 对 128K 上下文支持极佳但量化后在 3090 上推理速度会掉 40%智谱的 GLM-4-9B 中文语义理解细腻但原生不支持 FlashAttention-2想榨干 A100 性能得自己 patch。提示别迷信“最大上下文长度”。Kimi-Mini 标称 128K但实测在 64K 输入时attention cache 占用显存已接近 16G留给 batch size 的空间只剩 2而 DeepSeek-V2 的 64K 版本在同样显存下 batch size 可设为 4。长度数字背后是显存占用曲线不是线性关系。2.2 DeepSeek通用能力均衡但“破甲”不是万能钥匙DeepSeek 系列最常被问的问题是“DeepSeek-V2 和 DeepSeek-Coder 哪个更适合我们”答案取决于你的数据形态。DeepSeek-V2 是通用基座对中文新闻、公文、电商评论等泛领域文本泛化性强尤其擅长逻辑链条清晰的任务如“根据这三条政策判断企业是否符合补贴条件”。它的 tokenizer 对中文标点和空格处理更鲁棒微调时不易因格式差异崩掉。DeepSeek-Coder 则是专为代码优化的变体它在 Python/SQL/Shell 生成上比 V2 高出 12~15 个百分点但代价是中文语义理解弱化——比如让它解释“资产负债表中‘其他应收款’的会计准则依据”V2 能引出 CAS 22 号准则原文Coder 版本则容易混淆为“应收账款”定义。关于“破甲”即去除安全层限制社区流传的 patch 方案本质是修改modeling_deepseek.py中的forward函数绕过self._check_input_ids的校验。但实测发现去掉安全层后模型在生成含敏感词的文本时loss 曲线会出现异常 spike导致后续 token 生成质量断崖下跌。这不是“解锁”而是“拆掉刹车片”——车速可能快了但弯道失控风险倍增。我们团队的做法是保留安全层通过 fine-tuning 注入业务白名单如允许生成“医保报销比例”但禁止“医保套现”既合规又保质量。2.3 Moonshot长文本是王牌但“长”不等于“好”Moonshot 的 Kimi 系列核心竞争力在长上下文建模。它的 RoPE 位置编码做了特殊插值让 128K 上下文的实际 attention 覆盖更均匀。我们测试过一个典型场景输入一份 87 页的《医疗器械注册管理办法》PDF约 21 万 token再提问“第三章第十七条与第五章第二十二条是否存在执行冲突”Kimi-Mini 给出的答案准确率是 89%而同参数量的 Qwen2-7B 只有 52%。但长文本优势有硬门槛必须用 vLLM 或 Text Generation InferenceTGI部署且 GPU 显存不低于 40G。用 HuggingFace Transformers 原生加载128K 上下文会触发 OOM即使强行用梯度检查点推理延迟也会飙升到 12s/token。我们曾尝试在 309024G上跑 64K结果发现 kv cache 占用 18.3G剩余显存仅够跑 batch_size1QPS 不到 0.8——这在任何生产服务里都是不可接受的。另一个隐形陷阱是“长文本幻觉”。Kimi-Mini 在处理跨页信息关联时容易把第 32 页的条款和第 78 页的例外情形错误绑定。解决方案不是加更多上下文而是用 RAG 先做段落检索再把 top-3 相关段落喂给模型。我们实测用 ChromaDB 做向量检索后Kimi-Mini 的跨页推理准确率从 67% 提升到 91%且平均响应时间反而降低 300ms。2.4 智谱中文语义的“老法师”API 是双刃剑智谱的 GLM 系列最被低估的能力是中文语义粒度。比如处理“他昨天没来是不是又请假了”这句话GLM-4 能识别出“又”字隐含的频次判断至少两次并关联到历史考勤记录而多数开源模型会把它当作简单否定句处理。这种能力源于其训练语料中大量政务公文、司法文书、医疗病历对中文虚词、语气词、省略结构的建模更深入。但智谱的“双刃剑”在于 API 生态。官方提供zhipuaiSDK调用glm-4-flash模型只需 3 行代码但问题也在这里你永远不知道它背后是哪个版本的模型也无法控制 temperature、top_p 等关键参数。我们曾遇到一个 case同一 prompt 在上午调用返回结构化 JSON下午调用却变成自由文本查日志发现是服务端悄悄升级了模型权重。最终方案是用glm-4-9b的开源权重做本地部署再用 FastAPI 封装成兼容智谱 API Schema 的网关——这样既保留 SDK 的易用性又掌握模型版本和参数控制权。注意智谱的glm-4-9b量化版AWQ 4bit在 3090 上可跑 batch_size4但首次加载时需预留 1.2G 显存做 CUDA kernel 编译缓存。如果启动脚本里没加--no-cache参数服务会卡在“Compiling kernels...”长达 90 秒看起来像挂了。3. 实操环节从下载到上线的全链路避坑指南3.1 模型获取与验证别跳过 checksum 校验所有模型权重都从 HuggingFace Hub 下载但必须做三重验证SHA256 校验HF 页面右上角有Files and versions点开对应 commit 的model.safetensors文件复制 SHA256 值用命令行校验sha256sum /path/to/model.safetensors | grep 复制的hash值Tokenizer 一致性检查下载tokenizer.json后用 Python 加载并测试几个典型中文词from transformers import AutoTokenizer tokenizer AutoTokenizer.from_pretrained(/path/to/model) print(tokenizer.encode(医保报销, add_special_tokensFalse)) # 应输出 [12345, 67890]如果返回空列表或异常 ID说明 tokenizer 与模型权重不匹配。权重完整性扫描用safetensors库检查 tensor shape 是否符合文档from safetensors import safe_open with safe_open(/path/to/model.safetensors, frameworkpt) as f: for key in f.keys(): tensor f.get_tensor(key) print(f{key}: {tensor.shape})重点关注model.layers.0.self_attn.q_proj.weight是否为[hidden_size, hidden_size]若 shape 错误说明是阉割版或损坏文件。我们吃过一次亏某镜像站提供的 DeepSeek-V2-16B 权重lm_head.weight形状是[32000, 5120]应为[32000, 8192]导致加载时报size mismatch。根源是镜像站用旧版 transformers 保存未更新 config.json 中的vocab_size。3.2 量化部署4bit 不是终点而是起点量化不是“一键压缩”而是重新设计计算路径。以 AWQ 为例核心是找到 weight 中的 activation-aware outlier channelStep 1确定 calibration dataset不能用随机文本。我们用业务真实数据的 1000 条样本如客服对话、工单描述做校准效果比用 C-Eval 子集高 7.2 个点。Step 2设置 quant_config关键参数不是 bit-width而是q_group_size组大小quant_config { zero_point: True, q_group_size: 128, # 太小32导致精度损失大太大256使 kernel 效率下降 w_bit: 4, version: gemm }实测q_group_size128在 3090 上GLM-4-9B 的 PPL困惑度比256低 0.8推理速度高 15%。Step 3验证量化后行为重点测三类 case数字敏感任务如“计算 2023 年营收同比增长率”量化后误差不能超 ±0.05%长文本连贯性输入 5000 字技术文档要求续写结论检查是否出现逻辑断裂指令遵循率用 AlpacaEval 的 100 条指令测试量化后服从率下降不能超 3%实操心得AWQ 量化后的模型首次推理会慢 2~3 倍因要加载量化 kernel但后续请求稳定。务必在服务启动脚本里加 warmup 请求否则首请求超时会触发客户端重试造成雪崩。3.3 vLLM 部署 DeepSeek参数调优的黄金组合vLLM 是当前部署 DeepSeek 最稳的选择但默认配置会浪费 30% 显存。关键调参如下参数推荐值为什么--tensor-parallel-size2A100 80G或 13090DeepSeek-V2 的 attention head 数为 64设为 2 时每个 GPU 分 32 head负载均衡--block-size16小于 16 会导致 block 内存碎片大于 16 使 context window 利用率下降--max-num-batched-tokens2048 * num_gpus避免 batch token 数超限导致请求排队--enable-prefix-cachingTrue对 RAG 场景提升 40% QPS因检索到的 chunk 可复用 KV cache特别注意--swap-space设为 4GB 时vLLM 会在内存不足时把 inactive request 的 KV cache 换出到 CPU RAM。但我们发现当 swap 频繁触发时P95 延迟会突增 200ms。最优解是宁可少开 1 个 replica也要保证 swap 不触发。部署命令示例A100 80G × 2python -m vllm.entrypoints.api_server \ --model deepseek-ai/deepseek-v2 \ --tensor-parallel-size 2 \ --block-size 16 \ --max-num-batched-tokens 4096 \ --enable-prefix-caching \ --gpu-memory-utilization 0.85 \ --port 80003.4 VSCode 配置智谱模型不只是改 endpointVSCode 插件如 Continue.dev调用智谱 API常见错误是request failed: provider rejected the request schema。这通常不是网络问题而是 payload 结构不匹配。智谱 API 要求messages必须是 list且第一个元素role必须为systemtemperature必须在 0.01~0.99 之间传 0 或 1 会被拒stream字段必须显式传true或false不能省略VSCode 的.continue/config.json正确配置{ models: [ { model: glm-4-flash, apiBase: https://open.bigmodel.cn/api/paas/v4/, apiKey: your_api_key, parameters: { temperature: 0.3, top_p: 0.8, stream: true } } ] }致命陷阱apiBase末尾必须带/少一个斜杠就会 404。我们调试时抓包发现缺/时请求发到了https://open.bigmodel.cn/api/paas/v4无结尾斜杠服务端返回{code:10001,msg:Invalid request}但插件日志只显示 generic error。4. 常见问题排查那些让你凌晨三点还在看日志的错误4.1 “LLM request failed: provider rejected the request schema or tool payload”这个报错覆盖 80% 的 API 调用失败。根本原因不是模型问题而是 payload 结构不符合 provider 的 OpenAPI spec。排查流程抓包确认实际发送内容用mitmproxy或浏览器开发者工具 Network 面板看 Request Payload 是否含messages、model、temperature字段对照官方文档字段必填性智谱要求messages[0].role systemDeepSeek 要求messages至少含 2 条user assistant检查字段类型temperature是 float不是 stringmax_tokens是 int不是 string1024验证 JSON 格式用jq .格式化 payload确认无 trailing comma、unicode escape 错误。我们修复过一个 case前端传{temperature: 0.5}string后端 Python 用json.loads()解析后仍是 string调用zhipuaiSDK 时 SDK 未做类型转换直接发给服务端被拒。4.2 本地部署 DeepSeek 启动失败CUDA out of memory 的真相报错CUDA out of memory时90% 的人第一反应是“显存不够”但真实原因可能是Case 1FlashAttention-2 未编译DeepSeek-V2 默认启用 FlashAttention-2但若 CUDA 版本 12.1 或 PyTorch 2.2编译会静默失败回退到原生 attention显存占用翻倍。解决pip install flash-attn --no-build-isolation并确认torch.cuda.get_device_capability()返回(8, 0)A100或(8, 6)3090。Case 2KV cache 预分配过大vLLM 默认--max-model-len 32768但 DeepSeek-V2 实际支持 65536。若设小了vLLM 会为每个 request 预分配 32K 的 KV cache浪费显存。应设为--max-model-len 65536。Case 3Python 进程残留显存用nvidia-smi查看若python进程显存占用 10G 但无服务在跑执行fuser -v /dev/nvidia*找出僵尸进程kill -9。4.3 Moonshot Kimi-Mini 长文本截断不是模型问题是 tokenizer 陷阱输入 100K token 文本模型只处理前 32K报错input_ids too long。根源是 tokenizer 的max_length默认为 2048。解决方案from transformers import AutoTokenizer tokenizer AutoTokenizer.from_pretrained(moonshotai/kimi-micro) # 必须显式设置不能靠 model.config tokenizer.model_max_length 131072 tokenizer.pad_token tokenizer.eos_token但要注意HuggingFace 的pipeline会忽略model_max_length设置必须用tokenizer(..., truncationFalse, max_lengthNone)手动编码。4.4 智谱 GLM-4-9B 量化后 loss 突增AWQ 的 hidden_size 陷阱量化后训练 loss 从 2.1 暴涨到 8.7检查发现config.json中hidden_size被错误写成4096应为8192。AWQ 量化时按 config 读取 hidden_size导致 q_proj.weight 形状错误反向传播时梯度爆炸。修复用文本编辑器打开config.json确认hidden_size: 8192再重新量化。5. 工程落地 checklist上线前必须完成的 7 件事在把模型接入生产环境前我们强制执行以下 checklist漏一项都可能导致线上事故压力测试达标用locust模拟 50QPS 持续 30 分钟P95 延迟 ≤ 800ms错误率 ≤ 0.1%降级开关就绪当主模型 timeout 3s 时自动切到轻量 fallback 模型如 Phi-3-mini开关通过 Redis flag 控制Token 计费对齐自研计费模块按input_tokens output_tokens精确统计与智谱/DeepSeek 官方账单误差 0.5%日志结构化每条请求日志含request_id、model_name、input_length、output_length、latency_ms、error_code便于 ELK 关联分析安全层白名单注入对医疗/金融场景微调时加入{safe_words: [医保, 处方, 风控]}确保生成内容不偏离业务边界冷启动预热服务启动后自动发送 10 条 warmup 请求填充 CUDA kernel cache 和 KV cache回滚包验证每次模型更新保留上一版权重和 config 的 tar.gz 包并在 staging 环境验证回滚流程。最后分享一个真实经验我们给某省政务热线做的智能分派系统上线前按 checklist 执行结果在压力测试时发现当并发从 40 升到 50P95 延迟从 720ms 跳到 1450ms。排查发现是 vLLM 的--max-num-seqs 256设得太小导致请求排队。调大到 512 后50QPS 下延迟稳定在 780ms。工程落地没有银弹只有 checklist 里的每一项都踩过坑才敢写上去。

相关新闻

正则三剑客grep sed awk:Shell文本处理实战指南

正则三剑客grep sed awk:Shell文本处理实战指南

1. 从一次日志排查开始:为什么你必须掌握正则和三剑客我先说个真实场景。上个月某业务服务半夜报警,一小时内日志刷了几十万行,上下游都在甩锅。我登上服务器,先用 grep 把错误码捞出来看分布,再用 awk 按分钟统计报错…

2026/10/1 17:21:08 阅读更多 →
AMD 花 550 亿买下李飞飞:AI 的下一站不是更会说话

AMD 花 550 亿买下李飞飞:AI 的下一站不是更会说话

过去两年,AI 一直在学怎么把话说漂亮。9 月 28 日,AMD 掏出约 82 亿美元(约 550 亿人民币),把李飞飞那家只有 70 个人、成立两年、几乎不做聊天机器人的公司整个买了下来。你手机里那个 AI,两年来主要在做一…

2026/10/1 17:21:08 阅读更多 →
GEO源头厂家怎么选?这里有你要的答案

GEO源头厂家怎么选?这里有你要的答案

在当今数字化营销领域,GEO 推广系统凭借其精准的定位和高效的营销效果,成为众多企业竞相追逐的营销利器。然而,市场上 GEO 源头厂家众多,服务质量参差不齐,让企业在选择时常常陷入困惑。那么,GEO 源头厂家服…

2026/10/1 17:21:08 阅读更多 →

最新新闻

SocraticLM:基于苏格拉底教学法的轻量级LLM教学引擎

SocraticLM:基于苏格拉底教学法的轻量级LLM教学引擎

1. 什么是SocraticLM:不是又一个聊天机器人,而是一套可落地的个性化教学引擎SocraticLM这个名字乍一听像某个新发布的开源模型仓库,但实际它代表的是一整套围绕“苏格拉底式教学法”重构大语言模型教育应用逻辑的设计范式。我第一次在ACL 202…

2026/10/2 19:52:40 阅读更多 →
Windows 11任务栏位置修改:TaskbarAl注册表键值详解

Windows 11任务栏位置修改:TaskbarAl注册表键值详解

1. 为什么Windows 11任务栏位置成了“不可触碰的禁区”?Windows 11发布初期,微软就明确锁死了任务栏的左右居中三态切换能力——它只允许居中,且不提供系统级开关。这不是疏忽,而是设计决策:微软想用统一视觉语言强化“…

2026/10/2 19:52:40 阅读更多 →
分布式锁原理与实战:Redis、ZooKeeper与数据库方案对比及避坑指南

分布式锁原理与实战:Redis、ZooKeeper与数据库方案对比及避坑指南

分布式锁听起来像个老生常谈的技术点,但面试挂在这上面的人一抓一大把。早几年我做电商订单系统的时候,库存扣减和防重复支付两件事就把我折腾得不轻:服务从单体拆成多实例部署之后,原来顺手好用的synchronized和ReentrantLock突然…

2026/10/2 19:52:40 阅读更多 →
OpenShell终端增强:从智能补全到多机同步的命令行效率革命

OpenShell终端增强:从智能补全到多机同步的命令行效率革命

1. 项目概述:OpenShell到底是个什么“壳”如果你跟我一样,每天要在终端里泡几个小时,时间长了就会发现一个尴尬的事实:原生Shell能做的事不少,但真正让我烦心的不是命令写不对,而是那些高频操作太碎——历史…

2026/10/2 19:52:40 阅读更多 →
MQTT物联网实战:从协议原理到Java客户端与485设备对接

MQTT物联网实战:从协议原理到Java客户端与485设备对接

1. 为什么物联网项目都绕不开 MQTT搞过物联网项目的兄弟应该都有体会,设备端和云端之间的通信协议选型,基本决定了整个项目的开发效率和后期维护成本。我最早做设备联网的时候用过 HTTP 轮询,那会儿设备少还没觉得有什么问题,后来…

2026/10/2 19:52:40 阅读更多 →
补码的符号位为什么能参与运算:从原码反码到模运算

补码的符号位为什么能参与运算:从原码反码到模运算

当年在课堂上第一次听到"补码的符号位可以参与运算"这句话,我的第一反应是——凭什么?符号位不就是个标记吗,标记怎么能跟数值位一起扔进加法器?老师在黑板上写了 1 (-1) 0 的竖式,我照着抄下来&#xff0…

2026/10/2 19:51:39 阅读更多 →

日新闻

从零搭建AI工程化:模型之外的完整闭环

从零搭建AI工程化:模型之外的完整闭环

先搞清楚一件事:从零开始做 AI 工程化,难的从来不是调模型、写提示词,而是把一套原型 Demo 变成长得像是“正经系统”的东西。你手里可能已经有了能跑通的代码,也可能刚读完一些概念,但真到了要把它变成可维护、可观测…

2026/10/2 0:00:20 阅读更多 →
大模型训练显存估计与混合精度训练实战指南

大模型训练显存估计与混合精度训练实战指南

1. 大模型训练显存估计与混合精度训练详解显存不够用,几乎是每个做大模型训练的人都会撞上的第一堵墙。你可能也经历过:模型代码写完了,数据管道跑通了,满心欢喜地按下训练启动脚本,结果几秒钟后终端弹出一行红字——C…

2026/10/2 0:00:20 阅读更多 →
小样本学习数据集选型指南:27个真正可用的高质量数据集

小样本学习数据集选型指南:27个真正可用的高质量数据集

1. 小样本学习的“弹药库”:为什么你总在找数据集,却总找不到真正能用的? 小样本、数据集——这两个词最近半年在我处理的200多个AI项目咨询里,出现频率排进前三。不是模型调不好,不是代码写不对,而是卡在…

2026/10/2 0:00:20 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/1 19:40:48 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/1 19:41:40 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/10/1 20:05:24 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 5:26:06 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 6:09:11 阅读更多 →