julienmancuso/vllm
A high-throughput and memory-efficient inference and serving engine for LLMs
A high-throughput and memory-efficient inference and serving engine for LLMs
SGLang is a high-performance serving framework for large language models and multimodal models.
OME is a Kubernetes operator for enterprise-grade management and serving of Large Language Models (LLMs)
Kubernetes enhancements for Network Topology Aware Gang Scheduling & Autoscaling