TextBlob est une bibliothèque Python pour le traitement du langage naturel, offrant une API simple pour l'analyse de sentiments, l'étiquetage grammatical, l'extraction de syntagmes nominaux, la classification, la tokenisation, et plus, basée sur NLTK et pattern.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONBatchalign3 est un pipeline audio et ML de TalkBank pour produire et enrichir des transcriptions CHAT, couvrant la reconnaissance vocale, l'alignement forcé, le morphotagging neuronal, la traduction et la segmentation des énoncés. Il fournit une CLI, un package Python, un pont PyO3, un tableau de bord React et un shell de bureau Tauri expérimental.
Curriculum gratuit et open source d'ingénierie IA à partir des premiers principes : 523 leçons en 20 phases (~342 heures), couvrant des mathématiques à la production en Python, TypeScript, Rust et Julia. Chaque leçon produit un prompt, skill, agent ou serveur MCP réutilisable ; inclut un tuteur IA installable et une préparation à la certification Claude.
Plateforme de calcul scientifique en Python pur avec 22 modules couvrant quantique, ML, statistiques, solveurs d'équations différentielles ordinaires, etc. Zéro dépendance d'exécution, avec adaptateurs optionnels NumPy/SciPy pour validation et reproductibilité.
Haqumei est une bibliothèque japonaise de conversion graphème-phonème (G2P) écrite en Rust avec des liaisons Python, offrant une conversion précise texte-phonème avec information prosodique, correspondance mot-phonème, et un outil CLI pour les frontends de synthèse vocale.
SpellKit est un gem Ruby rapide et sûr avec une implémentation Rust de SymSpell. Il offre une latence inférieure à la milliseconde, la protection des termes via regex, des dictionnaires rechargables à chaud et zéro dépendance. Il prend en charge plusieurs instances, des motifs d'exclusion et est prêt pour la production pour l'extraction de termes de recherche.
Swift Tokenizers est un wrapper Swift haute performance pour la crate Rust tokenizers de Hugging Face, se concentrant uniquement sur la tokenisation sans dépendance au Hub. Il prend en charge macOS, iOS et Linux, offrant l'encodage, le décodage, la détokenisation en flux, les modèles de chat et l'appel d'outils.
HanLP est une boîte à outils multilingue de traitement du langage naturel pour la production, basée sur PyTorch et TensorFlow 2.x. Elle prend en charge segmentation, étiquetage, entités nommées, syntaxe, sémantique, et offre des API RESTful et locale.
Premove ITN est une bibliothèque open-source de normalisation inverse de texte sensible au contexte pour les transcriptions d'agents vocaux en anglais. Elle convertit la sortie ASR en formes écrites canoniques via un pipeline générer-scorer-décoder avec DeBERTa.
Analyseurs morphologiques à états finis et grammaire de contraintes, correcteurs orthographiques et ressources linguistiques pour la langue tsuut'ina (sarsi), faisant partie de l'infrastructure open-source GiellaLT.
ModelScope est une bibliothèque Python open-source implémentant le concept de « Model-as-a-Service », offrant des interfaces unifiées pipeline, Trainer et MsDataset pour l'inférence, le fine-tuning et l'évaluation de modèles CV, NLP, audio, multi-modaux et scientifiques, avec intégration de hubs de modèles et de jeux de données.
Hugging Face Transformers est un cadre de définition de modèles pour l'apprentissage automatique couvrant le texte, la vision, l'audio et les tâches multimodales. Il fournit une API unifiée pour l'inférence et l'entraînement avec plus d'un million de points de contrôle pré-entraînés.
Analyseurs morphologiques, correcteurs orthographiques et ressources linguistiques pour le komi-zyriène, basés sur les transducteurs à états finis et la grammaire de contraintes, dans le cadre du projet GiellaLT.
LangExtract est une bibliothèque Python de Google qui utilise des LLM pour extraire des informations structurées à partir de textes non structurés, en ancrant chaque extraction à son emplacement source et en générant des visualisations HTML interactives.