用于大语言模型推理与部署服务的开源库。
vLLM 把 GPU 变成滚动叫号的诊室:叫到谁就用空着的那间,不必按人头先把诊室全占上。
部署聊天服务时,它让一张显卡用更少显存接更多请求。
Inference engine
它是一种面向大语言模型部署与服务的推理引擎。
PagedAttention
它采用 PagedAttention,更高效地管理注意力键值缓存。
Continuous batching
它可通过动态调度请求,提高并发推理时的资源利用率。
API
它可部署为兼容 OpenAI API 协议的服务器。