AI Rookies

VLLM — 大语言模型推理与部署服务开源库

事实

用于大语言模型推理与部署服务的开源库。

人话

vLLM 把 GPU 变成滚动叫号的诊室:叫到谁就用空着的那间,不必按人头先把诊室全占上。

部署聊天服务时,它让一张显卡用更少显存接更多请求。

相关概念

Inference engine
它是一种面向大语言模型部署与服务的推理引擎。

PagedAttention
它采用 PagedAttention,更高效地管理注意力键值缓存。

Continuous batching
它可通过动态调度请求,提高并发推理时的资源利用率。

API
它可部署为兼容 OpenAI API 协议的服务器。