À propos du projet

MarkItDown est un outil basé sur Python qui convertit plusieurs formats de fichiers en Markdown tout en préservant les structures de documents telles que les titres, les listes, les tableaux et les liens. Il est conçu pour préparer les données à être consommées par des modèles de langage étendus (LLM) et des outils d'analyse de texte. Les formats pris en charge incluent : - Documents Office : Word, PowerPoint, Excel (y compris les anciens formats .xls). - Documents et Web : PDF, HTML, EPub. - Formats de données : CSV, JSON, XML. - Multimédia : Images (EXIF et OCR), Audio (EXIF et transcription) et URL YouTube. - Archives : fichiers ZIP. Caractéristiques clés et intégrations : - Intégration LLM : Prend en charge l'utilisation de clients LLM (par exemple, OpenAI) pour générer des descriptions d'images et effectuer l'OCR via des plugins. - Intégration Azure : Propose une intégration optionnelle avec Azure Document Intelligence et Azure Content Understanding pour une extraction basée sur le cloud de haute fidélité, incluant le support multimodal pour la vidéo et l'extraction de champs structurés (YAML front matter). - Extensibilité : Prend en charge un système de plugins pour ajouter de nouveaux convertisseurs de formats de fichiers. - Interface : Offre à la fois une interface en ligne de commande (CLI) et une API Python pour l'intégration dans des flux de travail plus larges.