vLLM是当前生产环境的标准LLM Serving框架,由UC Berkeley开发,支持PagedAttention、连续批处理和广泛的量化格式(GPTQ/AWQ/GGUF/FP8/INT8/INT4)。典型吞吐量为120-160 requests/秒,P99延迟50-80ms。SGLang是新一代框架,核心创新RadixAttention可实现KV缓存的高效复用,在多轮对话和Agent工作流场景下吞吐量可达vLLM的3.1倍。两者均原生支持FP8推理和FP8 KV Cache量化。
NVIDIA官方维护的推理优化库,在NVIDIA硬件上提供最高性能。支持FP8/INT8/INT4量化,H100上可实现4.6倍于A100的性能,10,000 tokens/秒在100ms TTFT下可达。Blackwell架构新增NVFP4和微缩放(microscaling)支持,承诺约3.5倍显存减少且精度损失≤1%。缺点是配置复杂(通常需要1-2周专业工程师时间),且锁定NVIDIA生态。
llama.cpp是纯C/C++实现的推理引擎,零外部依赖,可在服务器、笔记本、手机甚至树莓派上运行。原生支持GGUF格式,在Apple Silicon上表现尤为出色。Ollama基于llama.cpp封装,提供了最简单的本地大模型部署体验——pip install即可使用,自动管理模型下载和版本。两者是开发者本地实验和边缘部署的首选工具链。
bitsandbytes是HuggingFace生态中最广泛使用的量化后端,支持NF4(Normal Float 4)格式和QLoRA微调。QLoRA的创新在于将4-bit量化与LoRA适配器结合,使单张48GB GPU即可微调65B模型,质量与全精度微调相当。BitsandBytes的"即插即用"模式(load_in_4bit=True)极大降低了量化门槛,适合快速原型开发和资源受限的微调任务。
腾讯云TI-ONE平台内置了angel-vllm推理镜像,基于开源vLLM优化,支持在线INT8/NF4/FP8的weight-only量化和LayerwiseSearchSMQ等多种量化加速方式,对生产环境高并发场景推荐使用。平台还集成了混元大模型和DeepSeek系列模型的量化部署方案,支持128K tokens长上下文多轮交互,并提供训推一体的潮汐调度能力,帮助企业实现大模型的低成本落地。