LangExtract est une bibliothèque Python de Google qui utilise des LLM pour extraire des informations structurées à partir de textes non structurés, en ancrant chaque extraction à son emplacement source et en générant des visualisations HTML interactives.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONLexos est un moteur de traitement de documents IA piloté par événements, combinant une passerelle Go, des workers Python, des files Redis et des modèles auto-hébergés pour la RAG hors ligne, la synthèse et la transcription vocale.
LEANN est une base de données vectorielle légère conçue pour le RAG personnel, réduisant les besoins de stockage jusqu'à 97 % grâce au recalcul sélectif basé sur les graphes.
CocoIndex est un framework d'indexation incrémentale open-source qui fournit des agents IA et applications LLM avec un contexte continuellement à jour en ne traitant que les données modifiées.
MemPalace est un système de mémoire IA local-first qui stocke l’historique des conversations et des projets au mot près et le retrouve par recherche sémantique. Il propose des backends enfichables, un graphe de connaissances, un serveur MCP, des hooks CLI pour agents de codage et des benchmarks élevés.
MinerU est un moteur open source d'analyse documentaire qui convertit les PDF, images, DOCX, PPTX et XLSX en Markdown/JSON structuré pour les workflows LLM, RAG et agents. Il prend en charge les doubles moteurs VLM+OCR, l'OCR en 109 langues et le déploiement privé/hors ligne.
Zotero CLI est un outil en ligne de commande en anglais pour gérer les bibliothèques Zotero et soutenir les revues systématiques de littérature rigoureuses, incluant le tri interactif, le reporting PRISMA et la recherche sémantique RAG/LLM.
Paquets npm/PyPI et serveur MCP pour consulter la Base Nacional Comum Curricular (BNCC) brésilienne. Données intégrées avec 1 721 apprentissages vérifiés du MEC/CNE, zéro dépendance d'exécution. Permet d'intégrer la BNCC dans des applications TypeScript, Python ou des agents IA via MCP.
txtai est un framework AI tout-en-un pour la recherche sémantique, l'orchestration de LLM et la création de workflows complexes.
Semantica est une infrastructure à base de graphes offrant contexte structuré, raisonnement déterministe et traçabilité complète des décisions pour les systèmes IA, servant de couche sémantique aux LLMs et agents.
Vector Watcher est une interface graphique multiplateforme pour explorer et gérer les bases de données vectorielles LanceDB. Développé avec Tauri, React et TypeScript, il permet la gestion des connexions et la recherche de similarité.
Pathway est un framework ETL Python dédié au traitement de flux, à l'analyse en temps réel et aux pipelines IA incluant des LLM et des applications RAG. Il exécute du code Python sur un moteur Rust pour le calcul incrémental, prend en charge les données batch et streaming avec le même code, et se déploie via Docker et Kubernetes.
AksharaMD est un outil local, indépendant de l'analyseur, qui évalue la qualité de conversion d'un fichier source en Markdown adapté à l'IA, fournissant un score de préparation par document, des balises de provenance par bloc, des avertissements nommés et un verdict optionnel ACCEPT/REJECT basé sur la source.
Une API Python et une CLI non officielles pour Google Gemini Notebook (anciennement NotebookLM), offrant un accès programmatique à ses capacités d'IA ancrée et à ses outils de génération de contenu.
Un proxy API local qui réduit les coûts des API LLM en compressant l'historique des conversations, en supprimant les doublons et en mettant en cache sémantique.
Un dépôt personnel d'articles et d'expériences sur les statistiques, l'apprentissage automatique, l'économie et les mathématiques, axé sur des explications claires et pratiques de sujets complexes.