vLLM是当前最流行的高性能LLM推理引擎。核心创新PagedAttention将KV Cache像操作系统虚拟内存一样分页管理,显存利用率提升2-4倍。
特性:Continuous Batching(动态批处理)、Tensor Parallelism(多卡并行)、量化支持(AWQ/GPTQ)、前缀缓存(相同System Prompt只计算一次)、投机解码(小模型预测+验证)。
使用:pip install vllm && vllm serve Qwen/Qwen2.5-7B-Instruct --port 8000
竞品:SGLang(斯坦福)、TensorRT-LLM(NVIDIA官方)、llama.cpp(CPU推理)、Ollama(桌面友好封装)。
vLLM已成为开源LLM部署的事实标准,被Anthropic、Databricks等公司广泛使用。