fy1214/flashinfer
FlashInfer: Kernel Library for LLM Serving
FlashInfer: Kernel Library for LLM Serving
Tile primitives for speedy kernels
SGLang is a fast serving framework for large language models and vision language models.
A library for accelerating Transformer models on NVIDIA GPUs, including using 8-bit and 4-bit floating point (FP8 and FP4) precision on Hopper, Ada and Blackwell GPUs, to provide better performance with lower memory utilization in both training and inference.
Ongoing research training transformer models at scale
DeepGEMM: clean and efficient FP8 GEMM kernels with fine-grained scaling
slime is a LLM post-training framework aiming for RL Scaling.
A tutorial for CUDA&PyTorch
xDiT: A Scalable Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
A high-throughput and memory-efficient inference and serving engine for LLMs
字节高级计划项目
Config files for my GitHub profile.
personal java learning for 2022
personal java learning for 2022
「Java学习+面试指南」一份涵盖大部分 Java 程序员所需要掌握的核心知识。准备 Java 面试,首选 JavaGuide!
根据牛客网的面试宝典写的自用的java面试宝典,附带个人理解和个人阅读源码后的答案