Sobre el proyecto
tiktoken es un tokenizador rápido de codificación por pares de bytes (BPE) diseñado para usarse con los modelos de OpenAI. Convierte texto en secuencias de tokens que los modelos de lenguaje pueden procesar, con codificación reversible y sin pérdidas, soporte para texto arbitrario y compresión donde cada token promedia unos 4 bytes. La biblioteca proporciona acceso a codificaciones específicas como o200k_base y cl100k_base, y puede seleccionar el tokenizador apropiado para modelos como gpt-4o mediante encoding_for_model. Incluye un submódulo educativo para visualizar y aprender el procedimiento BPE. Los usuarios pueden ampliar tiktoken creando objetos Encoding personalizados directamente o registrando nuevas codificaciones a través del mecanismo de complementos tiktoken_ext. El proyecto reporta un rendimiento de 3 a 6 veces más rápido que un tokenizador de código abierto comparable en sus evaluaciones comparativas.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.