MiniCPM5-2B 端侧大模型完整实战指南:架构、RL+OPD 训练配方与多框架部署微调
大模型本地部署模型量化微调LoRA工具调用openBMBAscend【免费下载链接】MiniCPMMiniCPM4 MiniCPM4.1: Ultra-Efficient LLMs on End Devices, achieving 3 generation speedup on reasoning tasks项目地址https://gitcode.com/OpenBMB/MiniCPM点击查看免费下载MiniCPM5-2B 是 OpenBMB 开源社区 MiniCPM5 系列继 1B 之后发布的第二个端侧稠密模型面向本地助手、coding agent、工具调用与资源受限推理场景采用标准LlamaForCausalLM架构原生支持 131,072 token 上下文并配套完整的部署 / 微调 Cookbook 与 Agent Skills。本文以仓库 README-cn.md 为骨架结合仓库内 docs/deployment 系列部署指南、skills 目录下的 Agent Skills 与 tool_parsers/minicpm5xml_tool_parser.py 等源码级资料系统讲解 MiniCPM5-2B 的模型规格、UltraData 三阶段训练流程、RL OPD 后训练机制、四大主流推理框架的快速上手、XML 工具调用、以及面向 9 大推理后端与 5 大微调框架的 Cookbook 选型。读完本文你将掌握从模型下载、采样参数调优、多引擎部署到工具调用与微调适配的完整实战路径。一、MiniCPM5 系列概览与模型下载1.1 系列亮点MiniCPM5 系列是面向端侧、本地部署与资源受限场景的稠密 Transformer 模型。当前版本发布节奏如下时间版本说明2026.09.07MiniCPM5-2B系列第二个模型将 1B 训练方案扩展到 2B 参数规模配套部署 / 微调 Agent Skills2026.05.19MiniCPM5-1B系列首个模型1B 稠密 TransformerMiniCPM5-2B 的核心亮点同尺寸开源模型 SOTA在与同尺寸优秀开源模型的对比范围内达到 SOTA 水平整体表现可与 4B 级模型竞争在代码、数学、长文本、工具调用和 Agent 任务上展现出明显优势平均分 53.9超过参与对比的全部更大规模模型中的最高分 51.1。开放高质量数据与模型一同开源训练数据均属于 UltraData 数据体系包括高质量网页预训练数据集 UltraX、L0–L3 分级代码治理数据集 UltraData-Code、50 万条 Agent 训练样本 UltraData-SFT-Agent-2609、以及覆盖数学 / 代码 / 通用知识与长文本推理的超 8 万条 RL 训练样本 UltraData-RL-2609。上述达到 SOTA 水平超越 4B 级模型等表述均为仓库 README-cn.md 在特定对比模型集合下的原始声明读者应结合对比范围与评测基准理解不宜无限外推。1.2 模型下载渠道当前发布版本为 MiniCPM5-2B / MiniCPM5-1BBF16 / GGUF / MLX可在 HuggingFace 与 ModelScope 双平台获取。MiniCPM5-2B 提供以下变体变体用途MiniCPM5-2B主模型BF16 / FP16MiniCPM5-2B-SFTSFT 后版本MiniCPM5-2B-Midtrainmid-training 阶段版本MiniCPM5-2B-Base基座版本MiniCPM5-2B-GGUFGGUF 量化格式llama.cpp / Ollama / LM StudioMiniCPM5-2B-MLXMLX 格式Apple SiliconMiniCPM5-2B-GPTQGPTQ 量化格式MiniCPM5-2B-DSparkDSpark 投机采样草稿模型MiniCPM5-1B 提供主模型、SFT、Base、GGUF、MLX 等变体。其他重点版本还包括 MiniCPM-SALA、MiniCPM4.1-8B、MiniCPM4-0.5B以及早期 MiniCPM4 系列量化 / 投机变体GPTQ、AutoAWQ、Marlin、GGUF、MLX、Eagle3、BitCPM4 三值量化系列与 MiniCPM3/2B/1B 历史版本详见 README-cn.md 中的完整下载表格。二、MiniCPM5-2B 模型规格与架构MiniCPM5-2B 采用标准LlamaForCausalLM架构关键规格如下项目数值架构标准LlamaForCausalLM参数量2,516,756,480非 Embedding1,981,982,720层数42注意力头GQAQ 16 / KV 2上下文长度131,072128K标准架构带来的直接收益是部署生态的极大简化主流推理引擎可直接加载无需自定义算子也无模型代码 fork。这一点在仓库的多份部署文档中得到印证docs/deployment/transformers.md 明确说明MiniCPM5-1B and MiniCPM5-2B are standardLlamaForCausalLMmodels, so they load directly viaAutoModelForCausalLM— no custom modeling code, notrust_remote_codedocs/deployment/vllm.md 指出 vLLM0.21原生支持无需自定义 kernelskills/minicpm5-deploy/SKILL.md 中补充了跨后端的关键实现细节max_position_embeddings131072、rope_theta5e6、无需 rope-scaling且tie_word_embeddingsfalse未绑定 lm_head量化 / 转换工具若假设 Llama 默认的 tied 结构会静默丢弃lm_head导致输出退化为随机 token——MLX 相关 Skill 已内置该修复。三、训练流程UltraData 分级数据与三阶段训练MiniCPM5-2B 的训练过程是 UltraData 分级数据管理体系 的一次完整实践覆盖base training、mid-training 与后训练三个阶段。3.1 Base training 与 mid-trainingBase training采用逐级推进的训练配方包含 stable training 与 decay training用于建立基础语言能力与训练稳定性mid-training进一步强化目标能力并适配数据分布。训练语料来自同步开源的数据集Ultra-FineWeb、Ultra-FineWeb-L3、UltraX、UltraData-Code 与 UltraData-Math。3.2 后训练SFT → RL → OPD后训练阶段分为三步SFT使用400B tokens deep-thinking SFT建立深度思考和通用对话能力相关数据开源为 UltraData-SFT-2605 与 UltraData-SFT-Agent-260950 万条 Agent 训练样本RL针对数学、代码、Agent 和写作等方向训练专用RL teacher相关数据开源为 UltraData-RL-2609超 8 万条高质量 RL 训练样本OPDOn-Policy Distillation将这些 teacher 的能力蒸馏回同一个发布模型实现多专家能力合并。四、RL OPD后训练的关键环节RL OPD是 MiniCPM5-2B 后训练中的核心机制也是区别于常规 SFT-only 模型的关键设计。4.1 RL 阶段critic-based 算法RL 阶段使用了 JustRL II 阐述的critic-based 算法大幅提升训练稳定性并在多个领域取得显著收益。在仓库 README-cn.md 列出的基准中RL OPD 在推理与通用能力上平均提升↑ 10.96 分Agent 能力平均提升↑ 6.96 分。4.2 OPD 阶段反向 KL 蒸馏与专家合并OPD 阶段对16 个 RL 训练所得的专家模型含 5 个 agentic 专家模型实现能力合并其工程实现有两个要点训练方式在 response 序列的每个位置分别对学生模型和教师模型的 logits 计算全词表的反向 KL 散度作为优势估计值替代原有的 verification-based advantage训练数据直接复用各 RL teacher 训练时的 prompt 作为蒸馏数据无需额外构造语料。这一同分布 prompt 反向 KL的设计与 MiniCPM5-1B 的 OPD 实现一脉相承——1B 版本在此基础上还引入了双边 top-k 采样后取并集再计算反向 KL 的改进以平衡监督信号准确性与训练效率详见 README-cn.md 的 MiniCPM5-1B 章节。五、快速上手四大推理框架部署指南5.1 采样参数建议MiniCPM5-2B 生成时建议使用temperature1.0, top_p0.95, min_p0.0如果遇到重复输出请尝试temperature1.0, top_p0.95, min_p0.0, repetition_penalty1.05注意不同推理框架对采样参数的支持程度有所差异。特别地llama.cpp 默认min_p0.05会过滤掉概率低于最高概率 token 5% 的 token——这种过滤可能恰好过滤掉模型摆脱重复循环所需的 token反而引发重复因此必须显式设为0.0。5.2 vLLMOpenAI 兼容服务pip install vllm0.21 vllm serve openbmb/MiniCPM5-2B --port 8000测试请求curl http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: openbmb/MiniCPM5-2B, messages: [{role: user, content: 你是谁可以简单介绍一下自己吗}], max_tokens: 128, temperature: 1.0, top_p: 0.95 }docs/deployment/vllm.md 提供了更完整的调优参数--max-model-len默认 131072原生 128K小显存 GPU 可降至 8192 / 32768 释放 KV-cache--gpu-memory-utilization默认 0.85共享 GPU 上需调低vLLM 在 free/total 小于该值时硬失败--dtype默认 bfloat16老 GPU 可用 float16--enforce-eager用于小显存下 CUDA graphs OOM 的场景。服务启动后可通过chat_template_kwargs: {enable_thinking: true}显式控制思考模式。5.3 SGLangOpenAI 兼容服务pip install sglang[srt]0.5.16 python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000测试请求curl http://localhost:30000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: openbmb/MiniCPM5-2B, messages: [{role: user, content: 你是谁可以简单介绍一下自己吗}], max_tokens: 128, temperature: 1.0, top_p: 0.95 }投机采样DSpark仓库同步开源了为 MiniCPM5-2B 训练的 DSpark 草稿模型 MiniCPM5-2B-DSpark。在 SGLang 中启用后可加速解码且不改变目标模型的输出python -m sglang.launch_server \ --model-path openbmb/MiniCPM5-2B \ --trust-remote-code \ --speculative-algorithm DSPARK \ --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark \ --speculative-dspark-block-size 7 \ --port 30000skills/minicpm5-deploy/SKILL.md 还提示SGLang 部署时若需使用完整 128K 窗口应显式传入--context-length 131072。若想使用 SGLang 的 Engine API 做离线批量推理可参考 docs/deployment/sglang.md 中的sgl.Engine示例。5.4 llama.cppGGUF 本地推理llama-server -m MiniCPM5-2B-F16.gguf -a MiniCPM5-2B --port 8080 -ngl 99 -c 8192 --jinja上例中-c 8192设置上下文长度为 8192可按需调整。测试请求curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d { model: MiniCPM5-2B, messages: [{role: user, content: 11?}], temperature: 1.0, top_p: 0.95, min_p: 0.0, max_tokens: 256 }仓库发布的标准 GGUF 构件见 docs/deployment/llama_cpp.md文件大小适用场景MiniCPM5-2B-F16.gguf5.04 GB参考质量CPU/GPU 性能均衡MiniCPM5-2B-Q8_0.gguf2.68 GB相对 F16 质量损失极小磁盘减半MiniCPM5-2B-Q4_K_M.gguf1.56 GB端侧 / 移动级硬件极小显存这些 GGUF 可直接用于 vanilla llama.cpp 以及所有基于 llama.cpp 的运行时Ollama / LM Studio / llama-cpp-python。5.5 TransformersPython 本地推理GPU CPUpip install -U transformers5.6 accelerate torchfrom transformers import AutoModelForCausalLM, AutoTokenizer model_id openbmb/MiniCPM5-2B tokenizer AutoTokenizer.from_pretrained(model_id) model AutoModelForCausalLM.from_pretrained( model_id, torch_dtypeauto, device_mapauto, ) messages [{role: user, content: 你是谁可以简单介绍一下自己吗}] inputs tokenizer.apply_chat_template( messages, tokenizeTrue, add_generation_promptTrue, enable_thinkingTrue, return_dictTrue, return_tensorspt, ).to(model.device) outputs model.generate(**inputs, max_new_tokens128) print(tokenizer.decode(outputs[0][inputs[input_ids].shape[-1]:], skip_special_tokensTrue))docs/deployment/transformers.md 进一步给出了 CPU-only 推理方案torch_dtypetorch.float32device_mapcpu有足够系统内存即可以及 PEFT LoRA 推理方案——基于该基座训练的 adapter 可直接通过PeftModel.from_pretrained加载无需任何额外处理。六、工具调用Tool Calling工具调用推荐使用 SGLang。MiniCPM5-2B 以XML 格式产出工具调用SGLang 内置的minicpm5parser 会自动将其转换为 OpenAI 兼容的tool_calls字段python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000 \ --tool-call-parser minicpm5 # 或--tool-call-parser auto启动后按标准 OpenAI 风格传入tools即可触发模型产出 XML 工具调用SGLang 负责转换为标准tool_calls请求示例见 docs/deployment/sglang.md其中包含get_weather这类典型 function schema。vLLM 侧的 XML parservLLM 侧同名 parser 的 PR 已合入上游 main 分支但尚未进入 pip release作为桥接方案仓库将同一份解析器代码随仓库发布在 tool_parsers/minicpm5xml_tool_parser.py。从源码看tool_parsers/minicpm5xml_tool_parser.py它注册为ToolParserManager.register_module(minicpm5)的MiniCPM5XMLToolParser类支持容错归一化_normalize_model_output处理 SentencePiece/GPT 解码器输出的 U0120Ġ空格符以及模型偶尔产生的functionname、paramname标签塌缩形式双路径解析优先用 XML 解析器lxml缺失时回退到标准库xml.etree.ElementTree失败后回退到正则function name...与param name...的 V1 兼容解析类型感知参数解析根据工具 schema 中声明的参数类型决定字符串直接透传还是 JSON/ast.literal_eval解析_get_argument_type_parse_arguments流式工具调用extract_tool_calls_streaming实现增量 delta 输出按块解析完整function.../function并对未闭合块做部分参数快照兼容 OpenAI streaming 语义。在 vLLM 中通过插件方式启用vllm serve openbmb/MiniCPM5-2B \ --served-model-name MiniCPM5-2B \ --dtype bfloat16 --max-model-len 131072 --port 8000 \ --enable-auto-tool-choice \ --tool-parser-plugin /path/to/MiniCPM/tool_parsers/minicpm5xml_tool_parser.py \ --tool-call-parser minicpm5等 vLLM 后续 release 内置 parser 后去掉--tool-parser-plugin只用--tool-call-parser minicpm5即可详见 docs/deployment/vllm.md。七、部署与微调 Cookbook 与 Agent SkillsMiniCPM5-2B 使用标准LlamaForCausalLM架构无需自定义算子也无模型代码 fork。仓库提供单页 cookbook 供手动执行并配套一一对应的 Agent Skills 供 Cursor / Claude Code 类 coding agent 使用。7.1 部署9 个后端后端模型格式 / 适用场景CookbookAgent SkillTransformersBF16 / FP16本地 Python 推理GPU CPUtransformers.mdminicpm5-deploy-transformersvLLMBF16 / FP16 OpenAI servervllm.mdminicpm5-deploy-vllmSGLangBF16 / FP16 OpenAI server推荐用于 tool callingsglang.mdminicpm5-deploy-sglangllama.cppGGUFCPU/GPU 本地推理llama_cpp.mdminicpm5-deploy-llama-cppOllamaGGUF本地端侧运行ollama.mdminicpm5-deploy-ollamaLM StudioGGUFMac 桌面应用与 OpenAI serverlmstudio.mdminicpm5-deploy-lmstudioMLXMLX / 4bitApple Silicon 本地推理mlx.mdminicpm5-deploy-mlxArcLightGGUF 本地端侧 / CPU / 桌面 / 服务器arclight.mdminicpm5-deploy-arclightLiteRT-LM.litertlm端侧运行时Android / iOS / 桌面 / IoTCPU GPUlitert.mdminicpm5-deploy-litertvLLM AscendBF16 / FP16 OpenAI servervllm_ascend.mdminicpm5-deploy-vllm-ascend7.2 微调5 个框架框架适用场景CookbookAgent SkillTRL PEFTLoRA / SFT 微调trl.mdminicpm5-finetune-trlLLaMA-Factory微调llamafactory.mdminicpm5-finetune-llamafactoryms-swift微调ms_swift.mdminicpm5-finetune-ms-swiftunsloth微调unsloth.mdminicpm5-finetune-unslothxtuner微调xtuner.mdminicpm5-finetune-xtuner7.3 Agent Skills 使用方式skills/minicpm5-deploy/SKILL.md 是部署入口路由 Skill其工作模式是先确认MODEL_PATHHF id 或本地路径、硬件NVIDIA GPU / Apple Silicon / CPU与目标交互对话 / OpenAI server / Python 脚本 / benchmark再依据决策矩阵精确选择一个后端子 Skill 并完整调用而非临场发挥。Skill 中特别记录了跨后端共性坑点部署前值得一读Think / No-thinkMiniCPM5-2B 仅支持 Think 模式temperature1.0, top_p0.95MiniCPM5-1B 额外支持 No-thinkenable_thinkingfalsetemperature0.7, top_p0.95128K 上下文max_position_embeddings131072、rope_theta5e6、无 rope-scaling需显式传--max-model-len 131072vLLM/--context-length 131072SGLang/-c 131072llama.cpp显存紧张时下调未绑定 lm_headtie_word_embeddingsfalse假设 Llama tied 默认的工具如旧版mlx_lm.convert会静默丢弃lm_head导致输出退化为随机 tokenMLX Skill 已内置修复。skills/minicpm5-finetune/SKILL.md 则是微调入口路由 Skill决策矩阵包括LLaMA-FactoryYAML / WebUI 驱动 SFT、ms-swiftChatML ModelScope 原生 SFT/DPO/KTO/ORPO、TRL PEFT裸 Pythonassistant-only loss、unsloth单卡 24GB 以内 LoRA/QLoRA、xtunermmengine 配置驱动。每个框架都有至少一个 MiniCPM5 特有坑点例如 LLaMA-Factory 必须用template: minicpm5需源码安装不能使用empty/llama3ms-swift 必须显式传--model_type llama --template chatml。微调产出的 PEFT adapter 若面向 GGUF 运行时llama.cpp / Ollama / LM Studio / 桌宠需先用minicpm5-finetune-gguf-loraSkill 转换为 GGUF LoRA。八、其他支持的框架FlagOS 多芯片部署除上述部署与微调框架外MiniCPM5-2B 也支持通过FlagOS进行多芯片部署。FlagOS 是北京智源研究院联合国内外科研机构、芯片企业、系统厂商等共同发起的开源社区致力于打造面向多种 AI 芯片的统一开源系统软件栈大型算子库、统一 AI 编译器、并行训推框架、统一通信库通过一次开发跨芯迁移降低迁移成本。基于 FlagOS 的多芯片统一软件栈MiniCPM5-2B 已适配Nvidia、Hygon、Metax、Iluvatar、Zhenwu、Mthreads、Kunlunxin、Ascend、ARM-v9等芯片平台各厂商版本已在 FlagRelease 平台发布下载表格见 README-cn.md。在 Nvidia 上体验 FlagOS 加速有两种方式从 FlagRelease 开始推荐平台已内置相关软件包无需用户安装从零开始要求 Python 3.12、GLIBC_2.39、GLIBCXX_3.4.33、CXXABI_1.3.15 环境。安装 FlagGems 算子库后在 vLLM 推理源码中导入并启用加速pip install flag-gems4.2.1rc0 pip install triton3.5.1import flag_gems flag_gems.enable(recordTrue, onceTrue, path/root/gems.txt)vllm serve ${model_path} \ --trust-remote-code \ --dtype bfloat16 \ --enforce-eager \ --port ${Port} \ --served-model-name ${model_name} \ --gpu-memory-utilization 0.85此外vllm-plugin-FL 是基于 FlagOS 统一多芯片后端为 vLLM 构建的插件可扩展 vLLM 在多种硬件环境下的功能与性能表现其示例目录中提供了 MiniCPM5-2B 的从零开始与从 FlagRelease 开始两种使用路径。九、MiniCPM5-1B系列首作与双模式推理MiniCPM5-1B 是 MiniCPM5 系列首个模型面向本地助手、coding agent、工具调用与紧凑推理场景同样达到同尺寸开源模型 SOTA 水平优势集中在 Agentic 工具调用、代码生成和高难推理并具备以下特性双模式推理内置thinkchat template通过enable_thinking在思考与非思考模式间切换同一份权重既可作为快速助手也可承担复杂推理训练流程与 2B 同构——base trainingstable decay→ mid-training → 后训练200B tokens deep-thinking SFT 200B tokens hybrid-thinking SFT → RL → OPD。RL 阶段组合推理基于 DAPO-Math-17k借鉴 JustRL 极简配方采用两阶段长度调度减少过长回复、闭卷问答TriviaQA / NQ-Open、写作、指令跟随LongWriter-Zero-RLData、长上下文理解与通用对话等多类互补信号OPD 阶段参考 Thinking Machines Lab 的 On-Policy Distillation 思路并结合 Rethinking On-Policy Distillation 做实现改进反向 KL 作为优势估计 双边 top-k 采样取并集。RL OPD 在数学、代码、指令跟随三类任务上将平均分提升 ↑16 分同时将回复触顶 max-tokens 预算的比例降低 ↓29 个百分点推荐采样参数Think 模式temperature0.9, top_p0.95enable_thinkingTrueNo Think 模式temperature0.7, top_p0.95enable_thinkingFalse桌宠同步发布 MiniCPM-Desk-Pet 桌宠应用通过轻量 llama.cppllama-serversidecar 加载 GGUF 模型向 Electron 桌宠 UI 提供 OpenAI 兼容本地接口支持 Apple Silicon / NVIDIA GPU / CPU 路线可与 Cursor、Claude Code、Codex 等编码 agent 联动并支持 LoRA 人格切换。MiniCPM5-1B 的部署vLLM / SGLang / Transformers命令与 MiniCPM5-2B 完全同构仅需替换模型 id 并采用对应采样参数完整代码示例见 README-cn.md 与 docs/deployment 系列文档。十、MiniCPM-SALA百万 token 上下文的混合注意力模型MiniCPM-SALA稀疏注意力与线性注意力是首个大规模稀疏 线性注意力混合模型原生支持百万 token 上下文2026-02 发布仓库内配套有独立文档 minicpm_sala/README.md 与 docs/MiniCPM_SALA.pdf。核心设计混合架构25% 层采用 InfLLM-V2 稀疏注意力长文本建模75% 层采用 Lightning Attention 线性注意力全局处理效率在消费级 GPU 上即可进行百万 token 推理Transformer 到混合架构的持续训练通过对预训练权重进行架构转换规避冷启动低效总训练预算降至从头训练的约 25%HyPE 混合位置编码协调长短上下文性能保持与 Qwen3-8B 等全注意力模型相近的通用能力推理效率A6000D 上 256K 序列推理速度达 Qwen3-8B 的 3.5 倍支持 1M 上下文推理而 Qwen3-8B 在此长度下 OOMTTFT 首字响应最高 2.5 倍加速长文本能力RULER 与 NoLiMa 所有长度范围最高 128K取得最高分训练长度 520K 时在 2048K 上下文下仍取得 81.6 分依赖稀疏注意力层的 NoPE 配置实现长度外推。推理时推荐Temperature0.9支持 HuggingFace 直接推理与 SGLang 专用分支minicpm_sala分支需编译 infllmv2_cuda_impl 与 sparse_kernel 等 CUDA 扩展并配合--attention-backend minicpm_flashinfer --dense-as-sparse等参数启动完整参数说明见 minicpm_sala/README.md。十一、MiniCPM4 与 MiniCPM4.1 系列可训练稀疏注意力 混合思考MiniCPM4 与 MiniCPM4.1 是面向端侧的 8B 级大语言模型从模型架构、学习算法、训练数据与推理系统四个层面进行效率优化高效模型架构InfLLM-V2 可训练稀疏注意力在 128K 长文本中每个词元仅需与不足 5% 的词元进行相关性计算高效学习算法模型风洞 2.0Predictable Scaling、BitCPM 三值量化90% 位宽压缩、FP8 低精度训练与多词元预测策略高质量训练数据UltraClean 清洗 / 合成策略开源 Ultra-FineWeb、UltraChat v2 多维度 SFT 数据高效推理系统CPM.cu 轻量 CUDA 推理框架融合稀疏注意力、量化与投机采样、ArkInfer 跨平台部署系统。推理模式MiniCPM4/MiniCPM4.1 支持稠密与稀疏两种推理模式。vLLM 与 SGLang 目前只支持稠密推理稀疏推理需使用 HuggingFace Transformers 与 CPM.cu。混合思考通过enable_thinkingTrue/False切换思考 / 非思考模式也可在查询末尾添加/no_think启用非思考、/think启用思考。长文本方面MiniCPM4 基于 32K 预训练、MiniCPM4.1 基于 64K 预训练均通过 YaRN 扩展到 128K 并保持大海捞针任务稳定表现MiniCPM4.1 还可通过调整config.json中rope_scaling的 LongRoPE 因子扩展到 131,072 tokens。InfLLM-V2 稀疏注意力配置启用需安装 infllmv2_cuda_impl 并在config.json中添加sparse_config字段关键参数包括参数默认值说明kernel_size32语义核的大小kernel_stride16相邻语义核的步长init_blocks1每个 query token 关注的初始块数量确保关注序列开头block_size64key-value blocks 的块大小window_size2048局部滑动窗口大小topk64每个 token 仅与最相关的 top-k 个 key-value blocks 计算注意力use_nopefalse是否在块选择中使用 NOPE 技术提升性能dense_len8192低于此 token 阈值自动切换为标准注意力短序列下稀疏收益有限设为-1强制始终稀疏推理与投机采样vLLM 与 SGLang 均支持基于 Eagle3 草稿模型的投机采样vLLM 侧需安装 EAGLE3 兼容分支并传入--speculative-configJSONSGLang 侧使用--speculative-algorithm EAGLE3 --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 32。完整示例含 OpenAI 客户端代码、add_special_tokens注意事项见 README-cn.md 的 MiniCPM4/MiniCPM4.1 章节。微调方面支持 LLaMA-Factory。十二、开源协议与引用本仓库代码与 MiniCPM 模型权重依照 Apache-2.0 协议开源模型作为语言模型通过学习大量文本生成内容输出不代表开发者观点使用者应自行负责评估与验证本项目由面壁智能、清华大学自然语言处理实验室、人大高瓴人工智能学院共同开发引用请使用 MiniCPM4 论文arXiv:2506.07900BibTeX 条目见 README-cn.md 末尾。赞分享大模型本地部署模型量化微调LoRA工具调用openBMBAscend【免费下载链接】MiniCPMMiniCPM4 MiniCPM4.1: Ultra-Efficient LLMs on End Devices, achieving 3 generation speedup on reasoning tasks项目地址https://gitcode.com/OpenBMB/MiniCPM点击查看免费下载相关推荐DarkerVSCode提升Python代码质量的无缝开发体验配置DarkerVSCode提升Python代码质量的无缝开发体验配置 Darker是一款强大的Python代码格式化工具它能够智能地仅对Git仓库中自特定提大模型本地部署模型量化微调LoRA工具调用openBMBAscendMiniCPM5-2B 端侧部署实战ArcLight 从源码构建、GGUF 量化与 NUMA 多核 CPU 推理指南MiniCPM5 2B 端侧部署实战ArcLight 从源码构建、GGUF 量化与 NUMA 多核 CPU 推理指南 本篇指南面向需要在 统一内存架构uni大模型本地部署模型量化微调LoRA工具调用openBMBAscendMiniCPM5-1B 端侧大模型完全指南双模式推理、部署与微调实践MiniCPM 开源仓库详解MiniCPM5 1B 端侧大模型完全指南双模式推理、部署与微调实践MiniCPM 开源仓库详解 导读 本文以 MiniCPM 开源仓库主文档READM人工智能大模型基础模型本地部署微调模型量化openBMB上一篇【亲测免费】 探秘Venn.js优雅绘制面积比例的维恩图库下一篇在 tldraw 的 Tldraw 组件之外通过 React Context 使用 EditorExternal UIusing context实战指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

校友网私域管理系统选型指南:从数据孤岛到智能连接的架构演进

校友网私域管理系统选型指南:从数据孤岛到智能连接的架构演进

一、校友社群数字化的核心转型逻辑当下多数校友会仍依赖微信群、Excel表格开展管理工作,存在数据零散、人脉沉淀困难、活动运营成本高、资源匹配低效等普遍问题。校友私域管理系统的核心价值,并非简单替代基础办公工具,而是重构组织与成员的连…

2026/9/24 19:48:31 阅读更多 →
STM32L4xx外设电压监测PVM实战:多电源域低功耗设计指南

STM32L4xx外设电压监测PVM实战:多电源域低功耗设计指南

1. 外设电源监测到底在监测什么第一次接触STM32L4xx的PVM(Peripheral Voltage Monitoring)时,我下意识以为它跟低电压检测BOR是一回事。翻完参考手册才发现,两者虽然都跟电压有关,但管的东西完全不同。BOR盯的是芯片内…

2026/9/24 19:48:32 阅读更多 →
飞时达官网改版避坑:3步搞定API兼容最佳实践

飞时达官网改版避坑:3步搞定API兼容最佳实践

飞时达官网改版避坑:3步搞定API兼容最佳实践 版本升级后 API 全变了,后端同事甩来一份新文档让你重构前端对接,你盯着屏幕发呆,脑子里只有“这谁受得了”。别慌,这不是你一个人的噩梦。在处理类似 飞时达官网…

2026/9/23 9:57:39 阅读更多 →

最新新闻

MySQL 1251 报错根源与修复:认证插件兼容性实战指南

MySQL 1251 报错根源与修复:认证插件兼容性实战指南

上周五有个朋友发来一张 MySQL 报错截图: ERROR 1251 (08004): Client does not support authentication protocol requested by server; consider upgrading MySQL client 。他说密码确认了好几遍没问题,3306 端口也是通的,但不管是 Navic…

2026/9/24 19:48:17 阅读更多 →
基于Matlab的正则化逻辑回归实现微芯片质检二分类

基于Matlab的正则化逻辑回归实现微芯片质检二分类

做机器学习这块的朋友应该都知道,逻辑回归是入门分类问题的经典算法,但真正把它用到工业质检这种场景,很多人会卡在一点上:模型在训练集上表现得很好,一上测试数据就崩。微芯片质检就是这样一个典型的高维、小样本、非…

2026/9/24 19:48:17 阅读更多 →
JSZip nodeStream() 详解:在 Node.js 中将 ZIP 内文件内容转为 Streams3 可读流

JSZip nodeStream() 详解:在 Node.js 中将 ZIP 内文件内容转为 Streams3 可读流

开发工具 【免费下载链接】jszip Create, read and edit .zip files with Javascript 项目地址: https://gitcode.com/gh_mirrors/js/jszip 点击查看 免费下载 导读 nodeStream() 是 JSZip 中 ZipObject(即 zip.file(...) 返回的对象)提供的…

2026/9/24 19:48:17 阅读更多 →
Oracle DBLink连接MySQL完整指南:DG4ODBC配置与踩坑总结

Oracle DBLink连接MySQL完整指南:DG4ODBC配置与踩坑总结

01. 先搞清楚一件事:Oracle的DBLink本身并连不上MySQL1.1 为什么默认情况下这条链路是断的很多第一次接触这个需求的同学会默认认为:DBLink嘛,连什么数据库都是DBLink,改了连接串不就行了。我最初也是这么想的,直到在L…

2026/9/24 19:48:17 阅读更多 →
Claude Code性能优化实战:从拖沓到稳定收工的完整提效指南

Claude Code性能优化实战:从拖沓到稳定收工的完整提效指南

1. 性能问题出在哪:先搞懂 Claude Code 的慢与乱我在真实项目里用 Claude Code 干了几个月,最直观的感受是:它大多数时候不是“能力不够”,而是“效率撑不住”。你给它一个任务,它吭哧吭哧写好几十个文件,改…

2026/9/24 19:48:17 阅读更多 →
PostgreSQL时间函数完全指南:从数据类型到常见坑位

PostgreSQL时间函数完全指南:从数据类型到常见坑位

我去年接手一个数据迁移项目时,被一批“看起来一模一样、跑起来差距巨大”的SQL折腾到半夜。后来排查到根因,全是时间函数写法问题——有人用now(),有人用current_date,还有人把时间戳当字符串拼,最绝的是因为时区设置…

2026/9/24 19:47:16 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →