Sobre el proyecto

BERTopic es una técnica de modelado de temas que aprovecha embeddings de transformers y c-TF-IDF para crear clústeres densos, produciendo temas fácilmente interpretables mientras mantiene palabras importantes en las descripciones de los temas. Se distribuye como un paquete de Python (Python 3.10+) bajo la licencia MIT, con un artículo de arXiv que lo acompaña. Flujo de trabajo principal: los documentos se convierten en embeddings, los embeddings se reducen en dimensionalidad (normalmente UMAP), se agrupan en temas (normalmente HDBSCAN), se tokenizan, se ponderan con c-TF-IDF y, finalmente, se representan como descripciones de temas. Cada uno de estos pasos es modular y se puede intercambiar o eliminar, por lo que los usuarios pueden construir pipelines personalizados o explorar técnicas alternativas de modelado de temas sobre la predeterminada. Las variaciones de modelado de temas compatibles incluyen guiado, supervisado, semisupervisado, manual, distribuciones multitema, jerárquico, basado en clases, dinámico (temas a lo largo del tiempo), en línea/incremental, multimodal, multiaspecto, generación de texto/LLM, zero-shot, fusión de modelos y palabras semilla. El README también destaca la compatibilidad multilingüe mediante una configuración de idioma que cubre más de 50 idiomas. Las representaciones de temas se pueden refinar con opciones como KeyBERTInspired, o con modelos basados en LLM (por ejemplo, modelos de OpenAI) para generar etiquetas, resúmenes, frases y palabras clave. Las representaciones multiaspecto permiten modelar varias representaciones simultáneamente. Los métodos comunes de la API incluyen fit, fit_transform, transform, get_topic, get_topics, get_topic_freq, get_topic_info, get_document_info, get_representative_docs, update_topics, generate_topic_labels, set_topic_labels, merge_topics, reduce_topics, reduce_outliers, find_topics, save y load. Los atributos públicos que terminan en guion bajo exponen temas, probabilidades, tamaños de temas, representaciones de temas, la matriz c-TF-IDF, aspectos de temas, etiquetas, embeddings de temas y documentos representativos. Los métodos de visualización incluyen visualize_topics, visualize_documents, visualize_hierarchical_documents, visualize_hierarchy, get_topic_tree, visualize_barchart, visualize_heatmap, visualize_term_rank, visualize_distribution, visualize_topics_over_time y visualize_topics_per_class. La instalación está disponible mediante uv o pip, con extras opcionales para backends de embeddings (flair, gensim, spacy, use), visión y una instalación ligera sin transformers, UMAP ni HDBSCAN. La documentación, los cuadernos de Colab y los ejemplos de Kaggle están enlazados desde el README.