Sobre el proyecto
panllm es una biblioteca de Python fácil de usar diseñada para simplificar la inferencia de LLM locales al proporcionar una API consistente a través de diferentes backends. Permite a los desarrolladores cambiar entre motores de inferencia sin modificar su lógica central. Actualmente, es compatible con llama-cpp-python, con planes de integrar Transformers, ExLlamaV2 y ExLlamaV3. Las características clave incluyen la completación de texto simple, la selección forzada de backend y la generación de chat transmitida con estadísticas de rendimiento, como tokens por segundo. La biblioteca tiene como objetivo abstraer las complejidades de las implementaciones de inferencia individuales en una única interfaz de alto nivel para el despliegue de modelos locales.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.