open-source · since 2023
vLLM
vLLM project
An Apache-2.0 high-throughput, memory-efficient inference and serving engine for large language models, used in Red Hat's model-serving stack and related upstream work.
AIinferencemodel-servingLLM
desk notes
Verified 2026-10-04 against the canonical repository and latest-release API. Latest stable release: v0.30.0, published 2026-09-22.