专栏:大模型应用开发:从原理到生产篇号:41内容标签:大模型部署、vLLM、Ollama、llama.cpp、AI应用很多大模型项目,第一次真正变难,不是在写 Prompt 的时候。也不是在做 RAG 的时候。而是在模型终于能被调用之后。Demo 跑通了。接口也能返回。老板和业务方看了演示,觉得可以继续推进。然后问题来了:到底用 API,还是私有化部署? 本地跑 Ollama 算不算生产方案? vLLM、TensorRT-LLM、llama.cpp 到底差在哪里? 一开始就买 GPU,是不是更安全?这些问题很容易把人带偏。因为它们看起来是在问工具,实际上是在问约束。大模型部署选型的第一原则是:不要先问哪个工具更先进,要先问当前业务被哪些约束限制住。这篇文章我们就把部署路线讲清楚。我不会把它写成工具排行榜。工具变化太快,排行榜很容易过期。更稳定的是判断顺序:先看数据边界,再看流量和延迟,再看成本曲线,最后再看团队有没有能力把这套东西长期运维下去。