LLM Engine创建推理服务所需的所有模块提供处理用户请求的接口generate并完成请求数据的编码、执行与解码过程。Block Manager基于PagedAttention原理管理KV cache的显存。Scheduler通过队列维护待执行的请求组织并下发每一步需要执行的请求。Model Runner加载并运行模型完成每个请求的运算。当TP 1时主进程会启动多个Model Runner实例共同完成前向计算。