Batchalign3 est un pipeline audio et ML de TalkBank pour produire et enrichir des transcriptions CHAT, couvrant la reconnaissance vocale, l'alignement forcé, le morphotagging neuronal, la traduction et la segmentation des énoncés. Il fournit une CLI, un package Python, un pont PyO3, un tableau de bord React et un shell de bureau Tauri expérimental.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONPlanckGPT est un petit modèle de langage GPT (~540M paramètres) conçu pour être entraîné de zéro sur un ordinateur portable grand public, avec pré-entraînement sur Fineweb-edu et affinage conversationnel.
微舆(BettaFish)是自零构建的多智能体舆情分析系统,利用AI爬虫集群、多模态分析和论坛协作,打破信息茧房,还原舆情全貌并预测趋势。支持30+国内外社媒,可接入私有数据库,纯Python模块化,Docker一键部署,辅助决策。
Curriculum gratuit et open source d'ingénierie IA à partir des premiers principes : 523 leçons en 20 phases (~342 heures), couvrant des mathématiques à la production en Python, TypeScript, Rust et Julia. Chaque leçon produit un prompt, skill, agent ou serveur MCP réutilisable ; inclut un tuteur IA installable et une préparation à la certification Claude.
Une collection curatoriale de 107 articles de recherche fondateurs en IA générative, avec des résumés complets, des parcours d'apprentissage, des glossaires et des guides de décision — rendant la recherche de pointe en IA accessible à tous.
Le projet open source Chinese-LLaMA-Alpaca est un grand modèle de langage pour le traitement du langage naturel chinois, basé sur LLaMA et Alpaca.
NLTK est une suite complète de modules Python, de jeux de données et de tutoriels open-source conçus pour soutenir la recherche et le développement en traitement du langage naturel.
txtai est un framework AI tout-en-un pour la recherche sémantique, l'orchestration de LLM et la création de workflows complexes.
Swift Tokenizers est un wrapper Swift haute performance pour la crate Rust tokenizers de Hugging Face, se concentrant uniquement sur la tokenisation sans dépendance au Hub. Il prend en charge macOS, iOS et Linux, offrant l'encodage, le décodage, la détokenisation en flux, les modèles de chat et l'appel d'outils.
HanLP est une boîte à outils multilingue de traitement du langage naturel pour la production, basée sur PyTorch et TensorFlow 2.x. Elle prend en charge segmentation, étiquetage, entités nommées, syntaxe, sémantique, et offre des API RESTful et locale.
Premove ITN est une bibliothèque open-source de normalisation inverse de texte sensible au contexte pour les transcriptions d'agents vocaux en anglais. Elle convertit la sortie ASR en formes écrites canoniques via un pipeline générer-scorer-décoder avec DeBERTa.
LlamaFactory est un framework Python pour le fine-tuning efficace de plus de 100 grands modèles de langage et multimodaux, offrant une CLI sans code, une interface Web Gradio, LoRA/QLoRA et plusieurs algorithmes d'entraînement.
ModelScope est une bibliothèque Python open-source implémentant le concept de « Model-as-a-Service », offrant des interfaces unifiées pipeline, Trainer et MsDataset pour l'inférence, le fine-tuning et l'évaluation de modèles CV, NLP, audio, multi-modaux et scientifiques, avec intégration de hubs de modèles et de jeux de données.
SDK Python pour l'API AskNews qui injecte un contexte d'actualités en temps réel dans n'importe quel LLM avec une seule ligne de code, offrant des endpoints pour la recherche d'actualités, le suivi d'événements, les prévisions, l'analytique, la recherche approfondie, les graphes de connaissances et la recherche web.
Un curriculum gratuit de 12 semaines et 24 leçons par Microsoft pour apprendre les fondamentaux de l'IA : réseaux de neurones, apprentissage profond, vision par ordinateur, NLP, transformers, éthique, avec notebooks pratiques, quiz et labs.
Hugging Face Transformers est un cadre de définition de modèles pour l'apprentissage automatique couvrant le texte, la vision, l'audio et les tâches multimodales. Il fournit une API unifiée pour l'inférence et l'entraînement avec plus d'un million de points de contrôle pré-entraînés.
Analyseurs morphologiques, correcteurs orthographiques et ressources linguistiques pour le komi-zyriène, basés sur les transducteurs à états finis et la grammaire de contraintes, dans le cadre du projet GiellaLT.
LangExtract est une bibliothèque Python de Google qui utilise des LLM pour extraire des informations structurées à partir de textes non structurés, en ancrant chaque extraction à son emplacement source et en générant des visualisations HTML interactives.
Ce dépôt contient des ressources finlandaises open-source basées sur des transducteurs à états finis et la grammaire de contraintes, fournissant des analyseurs morphologiques, des correcteurs orthographiques et des outils de vérification pour plateformes de bureau et mobiles.
Un catalogue maintenu par la communauté de ressources NLP en bengali — 712 articles, 63 jeux de données, 20 modèles et 9 outils sur 13 tâches — construit comme un site statique Astro avec une vérification stricte des données et des filtres partageables.