Sobre o projeto

O LightLLM é uma estrutura de inferência e serviço baseada em Python para grandes modelos de linguagem. Seus objetivos declarados são um design leve, fácil escalabilidade e alto desempenho. O projeto afirma basear-se em ideias de vários esforços de código aberto, incluindo FasterTransformer, Text Generation Inference (TGI), vLLM e FlashAttention. A documentação está disponível em inglês e chinês, com um guia de início rápido, guia de instalação e tutoriais de implantação (por exemplo, implantação do DeepSeek). O README aponta para blogs de lançamento para detalhes de desempenho, em vez de listar números de benchmark. Notícias notáveis do projeto incluem um lançamento v1.1.0, um lançamento v1.0.0, suporte para transferência de cache KV de prefixo entre rankers DP, e artigos sobre decodificação restrita (Pre3, ACL 2025) e um agendador de requisições (ASPLOS 2025). O README afirma que o design em Python puro do LightLLM e o gerenciamento de cache KV em nível de token o tornam conveniente como base para pesquisa. Vários projetos estão listados como usando o LightLLM ou seus componentes, incluindo LoongServe, vLLM, SGLang, ParrotServe, Aphrodite, S-LoRA, OmniKV e LazyLLM. Trabalhos acadêmicos citados como baseados ou usando partes do LightLLM incluem ParrotServe, SLoRA, LoongServe, CXL da ByteDance, VTC, OmniKV, CaraServe, LoRATEE e FastSwitch. O repositório é lançado sob Apache-2.0. O suporte da comunidade é oferecido através de um servidor Discord, e o README convida a contribuições e cooperação.