Sobre o projeto
panllm é uma biblioteca Python fácil de usar, projetada para simplificar a inferência de LLM local ao fornecer uma API consistente entre diferentes backends. Ela permite que os desenvolvedores alternem entre motores de inferência sem alterar sua lógica central. Atualmente, suporta llama-cpp-python, com planos para integrar Transformers, ExLlamaV2 e ExLlamaV3. Os principais recursos incluem conclusão de texto simples, seleção forçada de backend e geração de chat via streaming com estatísticas de desempenho, como tokens por segundo. A biblioteca visa abstrair as complexidades de implementações de inferência individuais em uma única interface de alto nível para implantação de modelos locais.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.