À propos du projet

panllm est une bibliothèque Python facile à utiliser, conçue pour simplifier l'inférence locale de LLM en fournissant une API cohérente à travers différents backends. Elle permet aux développeurs de passer d'un moteur d'inférence à un autre sans modifier leur logique principale. Actuellement, elle supporte llama-cpp-python, avec des projets d'intégration de Transformers, ExLlamaV2 et ExLlamaV3. Les fonctionnalités clés incluent la complétion de texte simple, la sélection forcée du backend et la génération de chat en streaming avec des statistiques de performance telles que les tokens par seconde. La bibliothèque vise à faire abstraction des complexités des implémentations d'inférence individuelles dans une interface unique de haut niveau pour le déploiement de modèles locaux.