whichllm 完整指南:3 步选对能跑进你显卡的本地 LLM
whichllm 完整指南3 步选对能跑进你显卡的本地 LLM【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm24G 显卡装得下 70B但真跑起来 2 t/s 根本没法看参数大不等于能用。whichllm 一条命令扫完你的显存、内存和带宽按实时基准分排出真正能跑、还够快的本地 LLM把能跑和跑得快一起锁死。3 步先跑起来不用 clone、不用配环境敲 3 条命令就能出结果。装包pip install whichllm需要 Python 3.11 以上。直接跑whichllm它自动识别你的 GPU/CPU/内存吐出一张按基准分排序的推荐榜默认就带显存、速度、适配方式这几列。不买卡先试whichllm --gpu RTX 4090把目标显卡塞进模拟器先看看能跑多快。第一次跑会从 HuggingFace 拉模型和基准数据并缓存下来之后几秒就能出结果。速度列还按颜色标了实用性红色基本别碰、绿色起才适合日常扫一眼就知道哪几个真能用。下面几个场景都是在这条命令上加几个开关。显存吃紧只看全塞进显卡的模型默认排名会把部分掉到内存纯 CPU的候选也塞进来求稳就只留整卡装得下的。需求怕推荐了会掉显存、加载一半 OOM 的模型。命令whichllm --gpu-only --speed usable --vram-headroom 1GB。结果只留整卡装得下的候选速度低于 10 t/s 的直接砍掉还给运行时留 1GB 余量#1 Qwen/Qwen3.6-27B 27.8B Q5_K_M score 92.8 27 t/s #2 Qwen/Qwen3-32B 32.0B Q4_K_M score 83.0 31 t/s #3 Qwen/Qwen3-30B-A3B 30.0B Q5_K_M score 82.7 102 t/s注意第 3 名那个 102 t/s——它是 MoE速度按激活参数算、质量按总参数算这正是 whichllm 和纯看体积工具的分水岭。给长文本调上下文默认按 4096 上下文估 KV cache你要啃长文档就得往上抬。需求想跑 64k 上下文。命令whichllm --context-length 64k。结果表里每个模型的显存需求按 64k 重算原先勉强能塞的 14B 可能掉出推荐显存富余的大卡依旧稳——上下文一改能跑清单就重新洗牌。要啃代码库或长论文直接--context-length 128k。榜单看完直接上手开聊光看榜不落地等于白忙run能把下载、装依赖、起会话一条龙干了。需求立刻和某个模型对话。命令whichllm run qwen 2.5 1.5b gguf或者干脆whichllm run让它自己挑当前硬件的榜首。结果它用uv建一个隔离环境、拉模型、进交互式聊天不碰你本来的 Python 环境GGUF/AWQ/GPTQ/FP16 都能跑只想抄启动代码不真跑用whichllm snippet qwen 7b拿一段 Python 就行。旧显卡值不值得升级纠结换卡别只看显存数字让数据替你算。需求想知道从老卡升到 4090 / 5090 能多跑多少。命令whichllm upgrade RTX 4090 RTX 5090。结果同一台机器CPU、内存不变、只换 GPU分别排出每张目标卡的 best-N 模型质量和 tok/s 的跳变摆在一起值不值得升级一眼看清加--profile coding还能按编程场景比。参数速查选项作用示例值--top/-n显示前 N 个推荐5--context-length/-cKV cache 上下文长度64k--quant/-q只保留某量化Q4_K_M--profile任务画像 general/coding/vision/math/anycoding--gpu模拟指定显卡可多张RTX 4090--gpu-only只要整卡装得下的无值--speed速度下限 any/usable/fastusable--evidence基准证据门槛 strict/base/anystrict--details改显示下载量等元数据无值--vram覆盖显存大小GB16--vram-headroom运行时预留显存1GB--markdown/-m输出可粘贴的 Markdown 表无值--json输出机器可读 JSON无值--refresh忽略缓存重新拉取无值--cpu-only忽略 GPU按纯 CPU 排无值子命令也常用whichllm hardware只查硬件不排名whichllm plan llama 3 70b反查某模型得配哪张卡。完整选项和输出字段在 docs/cli.md。踩坑提醒分数全是~或?基准证据弱加--evidence strict只留独立实测过的模型。显存/带宽检测不准核显、统一内存手动覆盖whichllm --vram 16 --bandwidth 68多卡再加--gpu-index 0。速度列飘红嫌慢就--speed usable10 t/s 起过滤掉估算原理见 docs/hardware.md。收尾whichllm 把能不能跑和跑得快不快揉进同一个分数省掉你逐个试装的折腾。现在就在终端敲一句whichllm看看你的卡真正该跑哪款本地 LLM。【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

下水管道缺陷检测数据集:1717张图7类缺陷,VOC与YOLO双格式标注

下水管道缺陷检测数据集:1717张图7类缺陷,VOC与YOLO双格式标注

简介:面向下水道管道缺陷检测任务的目标检测数据集,包含1717张清晰管道巡检图片,采用VOC与YOLO双格式存储,覆盖穿入、错口、堆积、垃圾、裂缝、泥土、树根共7类常见缺陷,矩形框标注总计3401个,可满足YOLO系…

2026/9/26 11:56:53 阅读更多 →
PaddleSpeech 文本服务引擎解析:基于 PaddleTextConnectionHandler 的标点恢复服务实现

PaddleSpeech 文本服务引擎解析:基于 PaddleTextConnectionHandler 的标点恢复服务实现

人工智能语音音频NLP媒体生成 【免费下载链接】PaddleSpeech Easy-to-use Speech Toolkit including Self-Supervised Learning model, SOTA/Streaming ASR with punctuation, Streaming TTS with text frontend, Speaker Verification System, End-to-End Speech Translation …

2026/9/27 1:31:08 阅读更多 →
gqlgen 快速上手指南:用 Go 构建类型安全的 GraphQL 服务器

gqlgen 快速上手指南:用 Go 构建类型安全的 GraphQL 服务器

后端GraphQL代码生成 【免费下载链接】gqlgen go generate based graphql server library 项目地址: https://gitcode.com/gh_mirrors/gq/gqlgen 点击查看 免费下载 gqlgen 是一个基于 Schema First(Schema 优先) 理念的 Go GraphQL 服务器库…

2026/9/26 21:40:04 阅读更多 →

最新新闻

Yao Job 任务调度框架深度指南:双执行模式、进度追踪与数据库持久化

Yao Job 任务调度框架深度指南:双执行模式、进度追踪与数据库持久化

Agent 框架后端低代码RAG 【免费下载链接】yao ✨ All your agents and workspaces in one place, on every device you own. Track tasks on a board, accessible from desktop, mobile, browser, or API. Self-hosted. 项目地址: https://gitcode.com/gh_mirrors/…

2026/9/27 6:58:40 阅读更多 →
strands-agents Python SDK v1.31.0 技术解读:A2A 上下文传递、Graph 执行优化与 OpenAI 模型层修复

strands-agents Python SDK v1.31.0 技术解读:A2A 上下文传递、Graph 执行优化与 OpenAI 模型层修复

人工智能大模型AI AgentAgent 框架多智能体工具调用MCP 服务 【免费下载链接】harness-sdk Build an agent harness and control it end-to-end. Open-source SDK for production AI agents in Python & TypeScript - any model, any cloud. 项目地址: https://…

2026/9/27 6:58:40 阅读更多 →
网站的通栏怎么做性能优化

网站的通栏怎么做性能优化

网站通栏怎么做兼顾安全与SEO的最佳实践 上周刚帮一个做B2B机械的客户排查故障,他的网站首页突然弹出了博彩广告,后台代码里赫然多了一段混淆过的JavaScript。客户急得打电话问我:“网站被黑挂马不知道怎么办?”这种时候,90%的人第一…

2026/9/27 6:58:40 阅读更多 →
AI Engineering 学习路线:Chip Huyen 四级能力阶梯,从单条提示词到生产部署

AI Engineering 学习路线:Chip Huyen 四级能力阶梯,从单条提示词到生产部署

AI Engineering 学习路线:Chip Huyen 四级能力阶梯,从单条提示词到生产部署 【免费下载链接】aie-book [WIP] Resources for AI engineers. Also contains supporting materials for the book AI Engineering (Chip Huyen, 2025) 项目地址: https://gi…

2026/9/27 6:58:40 阅读更多 →
【中台·业务篇】订单中心与支付中心:通用业务能力沉淀与复用

【中台·业务篇】订单中心与支付中心:通用业务能力沉淀与复用

前言 用户中心解决了"你是谁"的问题,订单中心解决的是"你买了什么"的问题,支付中心解决的是"钱怎么收"的问题。这三者构成业务中台最核心的交易闭环。上一篇详解了用户中心,本文将深入订单中心和支付中心的架构…

2026/9/27 6:58:40 阅读更多 →
CommandoVM 完整部署指南:Windows 渗透测试虚拟机的安装、配置与源码级原理解析

CommandoVM 完整部署指南:Windows 渗透测试虚拟机的安装、配置与源码级原理解析

网络安全 【免费下载链接】commando-vm Complete Mandiant Offensive VM (Commando VM), a fully customizable Windows-based pentesting virtual machine distribution. commandovmmandiant.com 项目地址: https://gitcode.com/gh_mirrors/co/commando-vm 点击查看…

2026/9/27 6:57:39 阅读更多 →

日新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/27 0:00:34 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/27 0:00:34 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/27 0:00:34 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/27 0:00:34 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/27 0:00:34 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/27 0:00:34 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/25 20:29:43 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/25 20:29:31 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/26 22:52:30 阅读更多 →