À propos du projet
tiktoken est un tokeniseur rapide par encodage de paires d'octets (BPE) conçu pour être utilisé avec les modèles d'OpenAI. Il convertit le texte en séquences de jetons que les modèles de langage peuvent traiter, avec un encodage réversible et sans perte, une prise en charge de texte arbitraire et une compression où chaque jeton représente en moyenne environ 4 octets. La bibliothèque donne accès à des encodages spécifiques tels que o200k_base et cl100k_base, et peut sélectionner le tokeniseur approprié pour des modèles comme gpt-4o via encoding_for_model. Elle comprend un sous-module éducatif pour visualiser et apprendre la procédure BPE. Les utilisateurs peuvent étendre tiktoken en créant directement des objets Encoding personnalisés ou en enregistrant de nouveaux encodages via le mécanisme de plugin tiktoken_ext. Le projet affiche des performances 3 à 6 fois plus rapides qu'un tokeniseur open source comparable dans ses benchmarks.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.