À propos du projet

BERTopic est une technique de modélisation de sujets qui exploite les embeddings de transformeurs et c-TF-IDF pour créer des clusters denses, produisant des sujets facilement interprétables tout en conservant les mots importants dans les descriptions de sujets. Elle est distribuée comme un package Python (Python 3.10+) sous licence MIT, avec un article arXiv associé. Flux de travail principal : les documents sont intégrés, les embeddings sont réduits en dimensionnalité (généralement UMAP), regroupés en sujets (généralement HDBSCAN), tokenisés, pondérés avec c-TF-IDF, et enfin représentés comme des descriptions de sujets. Chacune de ces étapes est modulaire et peut être échangée ou supprimée, permettant aux utilisateurs de construire des pipelines personnalisés ou d'explorer des techniques alternatives de modélisation de sujets en plus de celle par défaut. Les variations de modélisation de sujets prises en charge incluent guidée, supervisée, semi-supervisée, manuelle, distributions multi-sujets, hiérarchique, basée sur les classes, dynamique (sujets dans le temps), en ligne/incrémentale, multimodale, multi-aspect, génération de texte/LLM, zero-shot, fusion de modèles et mots de départ. Le README met également en évidence le support multilingue via un paramètre de langue couvrant plus de 50 langues. Les représentations de sujets peuvent être affinées avec des options telles que KeyBERTInspired, ou avec des modèles basés sur LLM (par exemple les modèles OpenAI) pour générer des étiquettes, des résumés, des phrases et des mots-clés. Les représentations multi-aspect permettent de modéliser plusieurs représentations simultanément. Les méthodes courantes de l'API incluent fit, fit_transform, transform, get_topic, get_topics, get_topic_freq, get_topic_info, get_document_info, get_representative_docs, update_topics, generate_topic_labels, set_topic_labels, merge_topics, reduce_topics, reduce_outliers, find_topics, save et load. Les attributs publics se terminant par un underscore exposent les sujets, les probabilités, les tailles de sujets, les représentations de sujets, la matrice c-TF-IDF, les aspects de sujets, les étiquettes, les embeddings de sujets et les documents représentatifs. Les méthodes de visualisation incluent visualize_topics, visualize_documents, visualize_hierarchical_documents, visualize_hierarchy, get_topic_tree, visualize_barchart, visualize_heatmap, visualize_term_rank, visualize_distribution, visualize_topics_over_time et visualize_topics_per_class. L'installation est disponible via uv ou pip, avec des extras optionnels pour les backends d'embedding (flair, gensim, spacy, use), la vision, et une installation légère sans transformeurs, UMAP ou HDBSCAN. La documentation, les notebooks Colab et les exemples Kaggle sont liés depuis le README.