在过去的两个星期里面我手头使用的主力本地大模型是千问的 35B-A3B。从使用的体验来说这个 A3B 的模型的确是足够惊艳的能够满足我大部分的一个使用场景。比较重要的一点是它的输出效率非常高执行的速度非常快每秒的 token 数非常多。那么为什么我还要切换 27B 的模型呢主要是在高频次使用 A3B 的这个模型的时候偶尔会发现这个模型的发挥不是那么稳定输出的一致性也不是特别好。通过网络上的一些信息检索对比发现 27B 这方面可能会更优秀一些。我尝试部署的 27B 模型是一个 IQ3 的量化版本。因为选择这个版本的话基本上能够刚好把我的 RTX 5080 Laptop 的显卡用起来也不会有太多的 CPU RAM 相关的限制。在选择这个模型的时候我也做了一些基础的测试。从网络上找了一些别人测试其他模型时候用的一些输入比如说让它做一个小游戏之类的。发现 27B 的模型在实现这部分功能的时候表现的比较好。经过了一系列的调优27B 的模型在我现在电脑上的配置如果是开启了 MTP 模式之后最高的速度可能能达到 45 token 每秒。但是在这样的配置之下上下文就压缩的特别可怜只能 16K。如果配合 Agent 使用的时候16K 的上下文可能就是一个很大的短板。于是尝试做了一些其他的修改保证这个模型首先能用。我尝试的几个修改点主要有上下文的量化压缩同时取消 MTP 的加速。这样的话基本上能保证 48K 的上下文。在 48K 上下文的配置之下显存的占用大概是 14.6G内存的占用包括系统本身的一些服务占用一共是占用了大概 22G运行过程中最高占到 28.5G 左右。最终 GPU 还有 1G 多的空闲这样的话可能不至于在系统偶尔使用的时候导致整个大模型的崩溃。在这样的配置之下每秒的 token 数大概是 25 左右。不是特别快但是基本上能够满足一些代码推理编写的基本需求。进行了一个复杂模块的软件编写中间没有出现爆显存之类的问题。在这个过程中GPU 的压力还是很大的而且温度也是比较高的。我看温度最后到了 86 度。后续的话在这个基础上继续使用一段时间中间也可以去尝试一下其他参数的优化看看能不能有更高的输出速度。有一点值得注意的是我发现相比于 A3B 的模型这个 27B 的单词模型在解决同一个问题的时候消耗的 Token 数会少很多。虽然总体的执行时间还是比 3B 要长一些但是在复杂问题的解决上这个时间也不是一个很大的劣势体验差距不是很大。下面附加我的启动脚本。echo offsetlocalset LLAMA_CPP_DIRC:\llama.cppset MODEL_PATH%LLAMA_CPP_DIR%\models\Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-IQ3_M.gguf:: 【致命修复1】将上下文削减到 48000set CONTEXT_SIZE48000:: 【致命修复2】保持全层 GPU但配合下方压缩set GPU_LAYERS99:: 线程数保持物理大核数量如 8-12set THREADS10set PORT8080set HOST0.0.0.0echo Starting Safe Mode Qwen3.6-27B Server...echo Model: %MODEL_PATH%echo Context: %CONTEXT_SIZE%, Layers: %GPU_LAYERS%, Threads: %THREADS%%LLAMA_CPP_DIR%\llama-server.exe ^-m %MODEL_PATH% --alias Qwen3.6-27B ^-c %CONTEXT_SIZE% ^-ngl %GPU_LAYERS% ^-t %THREADS% ^-b 512 ^-ub 512 ^--port %PORT% ^--host %HOST% ^--threads-batch %THREADS% ^--chat-template chatml ^--parallel 1 ^-ctk q4_0 ^-ctv q4_0 ^-fa on ^--split-mode layer ^--mlockpause