little-coder llama.cpp终极配置8GB显流畅跑22GB MoE大模型的完整教程【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coderlittle-coder是一个为小本地模型深度优化的编程智能体coding agent它的标准出厂搭配正是llama.cpp Qwen3.6-35B-A3B——一个 Q4 量化后约22 GB的 MoE 大模型。而这套组合最惊艳的地方在于借助 MoE 专家分流技巧它能在一台8 GB 显存的笔记本上流畅运行实测约44 tok/s在 Aider Polyglot 基准上拿到78.67%的通过率。本文带你从零完成这条小显存跑大模型的完整配置链路 为什么 8GB 显存能装下 22GB 的模型普通稠密dense模型必须把全部权重压进显存22 GB 的模型对 8 GB 显卡来说根本无解。但MoE混合专家模型不一样它的专家参数只在推理时轮流上岗。llama.cpp 提供了--n-cpu-moe参数可以把专家层权重放进内存RAM只把注意力层放在 GPU 上。于是显存压力骤降22 GB 的模型就能在 8 GB 显存中腾挪运行组件存放位置注意力层attentionGPU 显存MoE 专家层experts系统内存--n-cpu-moeKV 缓存随-c上下文大小增长 官方实测同为 8 GB 的 RTX 5070 LaptopQwen3.6-35B-A3BMoE约44 tok/s而稠密的 Qwen3.8-27B 只有约6.4 tok/s——MoE 路线快约 7 倍且稠密模型没有任何等价的分流手段。一步安装 little-coder安装非常简单要求Node.js ≥ 22.19npm install -g little-coder完成无需 clone 仓库、无需在工作目录里跑npm installlittle-coder命令会直接加入 PATH。模型注册表随包分发默认模型就是本教程的主角default: llamacpp/qwen3.6-35b-a3b详见 models.json。llama.cpp 服务器最快配置方法三步走第一步编译带 CUDA 的 llama.cpp从 llama.cpp 官方仓库获取源码后按你的 GPU 架构编译CMAKE_CUDA_ARCHITECTURES填入你的显卡架构编号如 Blackwell 系列为 120cmake -B build -DGGML_CUDAON -DCMAKE_CUDA_ARCHITECTURES120 -DLLAMA_CURLON cmake --build build --config Release -j第二步下载 22GB MoE 模型pip install -U huggingface_hub[cli] hf download unsloth/Qwen3.6-35B-A3B-GGUF Qwen3.6-35B-A3B-UD-Q4_K_M.gguf --local-dir ~/models # 可选下载视觉投影器约 900MB让模型能看懂截图片 hf download unsloth/Qwen3.6-35B-A3B-GGUF mmproj-F16.gguf --local-dir ~/models只玩纯文本可以跳过第二行下载little-coder 同样能正常工作只是无法再粘贴图片。第三步启动 llama-server关键参数一行配齐build/bin/llama-server -m ~/models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \ --mmproj ~/models/mmproj-F16.gguf \ --host 127.0.0.1 --port 8888 --jinja \ -c 16384 -ngl 99 --n-cpu-moe 999 --flash-attn on这几个参数就是8GB 跑 22GB的精髓 ⚡-ngl 99所有层都尝试上 GPU--n-cpu-moe 999所有 MoE 专家强制留在内存——显存压力瞬间解除-c 16384上下文窗口 16K是 8 GB 显存的保守默认值KV 缓存随它增长想开 128K/256K 就加大内存预算--flash-attn on开启 Flash Attention 进一步省显存--jinja使用模型原生的对话模板工具调用解析更稳定little-coder 启动时会自动从 llama.cpp 的/props接口探测实时n_ctx并注册模型——你传什么-c界面就按什么预算上下文不用手动改任何配置文件。启动 Agent验证你的本地大模型llama.cpp 是本地服务pi 框架仍要求有一个 API key 环境变量值无所谓export LLAMACPP_API_KEYnoop cd ~/your-project little-coder --model llamacpp/qwen3.6-35b-a3b启动后你会看到熟悉的 TUI 界面。底部状态栏值得关注↑26k ↓5.4k R447k CH99.8% 9.3%/262k (auto) qwen3.6-35b-a3b • medium其中CH字段是缓存命中率——本地模型每一轮都在重读历史CH长期偏低说明服务器没有复用缓存前缀值得排查而9.3%/262k表示当前上下文占窗口的比例超过 70% 变黄、90% 变红。进阶分阶段模型Plan 用大的实现用小的如果以后还加载了更大的模型可以用/plan-model和/action-model让规划阶段和实现阶段跑在不同模型上在单一 llama.cpp 后端上模型切换会触发权重卸载/重载留意提示即可。实测性能小模型在真实基准上什么水平全部基准都在一台消费级笔记本上跑完i9-14900HX 32 GB RAM RTX 5070 Laptop8 GB 显存全程零云推理 版本基准结果v0.0.5Aider Polyglot225 题78.67%Qwen3.6-35B-A3B via llama.cppv0.1.4Terminal-Bench-Core v0.1.180 任务40.0%耗时 6 小时 50 分v0.1.13Terminal-Bench 2.0445 次试跑24.6% ± 3.2进入官方排行榜第 120 名v0.1.27GAIA 验证集165 任务40.00%从分语言数据可以看出这套小显存本地模型方案在 Python52.9%、Java52.1%、C50.0%等主流语言上都能稳定输出详见 docs/benchmark-qwen3.6-35b-a3b.md 的完整叙述。时间维度上little-coder 在失败题上会花更长时间探索平均 491 秒 vs 176 秒这正是多轮自主探索换来的高通过率——完整论文图表由 docs/figures/make_paper_figures.py 生成可复现全部数字。配置翻车4 个常见坑一次说清ECONNREFUSED 127.0.0.1:8888— llama.cpp 没启动。先起llama-server再启动 little-coder。粘贴图片返回 4xx— 服务器没带视觉投影器重新启动时加上--mmproj ~/models/mmproj-F16.gguf。服务器起来了但一个 token 都不出— 稠密模型的老坑-ngl占满了显存却没留计算空间。上下文调大时记得同步调小-ngl。MoE --n-cpu-moe路线天然免疫此问题。本地网络访问超时— 推理机的防火墙丢包了按 README.md 中局域网部署一节放开 8888 端口即可*_BASE_URL支持任意主机笔记本直连家里游戏本完全可行。更多排障细节上下文溢出、模板不匹配、缓存未命中等都整理在 README.md 的 Troubleshooting 章节。延伸阅读架构全貌27 个 TypeScript 扩展 30 个技能卡docs/architecture.mdTerminal-Bench 完整评测报告docs/benchmark-terminal-bench-v0.1.1.md扩展开发指南docs/extensions.md技能卡示例skills/tools/bash.md总结一下--ngl 99--n-cpu-moe 999是 8 GB 显存驾驭 22 GB MoE 大模型的钥匙加上 little-coder 的本地模型优化脚手架你在普通笔记本上就拥有了一台本地大模型编程工作站 ✅【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coder创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考