Un outil Python qui localise les vidéos YouTube autorisées en ajoutant des sous-titres chinois et aide à les publier sur B站, prenant en charge la transcription vocale, la reconnaissance OCR, la traduction LLM et le rendu de sous-titres incrustés.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONVoicebox est un studio vocal IA open source et local, gratuit, couvrant TTS, clonage vocal, dictée, effets audio et sortie vocale d'agents via MCP.
Magnetic est un éditeur vidéo non linéaire gratuit et open-source pour Windows comportant une timeline magnétique et des outils d'édition assistés par IA.
Verba est une application de bureau prioritairement hors ligne pour l'apprentissage des langues, basée sur des conversations avec un coach IA. Elle fonctionne localement avec Ollama ou votre propre clé de fournisseur, et propose des corrections intégrées, des lectures classées par niveau, la répétition espacée du vocabulaire, ainsi que des fonctionnalités de synthèse vocale et de dictée intégrées.
Un exécuteur d'automatisation qui maintient à jour l'exécutable Windows publié par le package compagnon Soenneker.Libraries.Whisper.CTranslate, piloté par des workflows GitHub Actions programmés et à la demande.
LearnNote est un assistant d'apprentissage IA local permettant de transformer des vidéos (Bilibili, YouTube, locales) et des documents (PDF) en notes structurées via des sous-titres ou transcriptions, avec un espace de travail web pour l'édition et l'exportation.
Une implémentation C/C++ haute performance pour l'inférence du modèle de reconnaissance automatique de la parole (ASR) Whisper d'OpenAI, conçue pour un déploiement léger et multiplateforme.
SkyClass Distill est un outil de pipeline qui transforme les vidéos pédagogiques en compétences d'enseignement (Teaching Skills) structurées, prenant en charge la collecte de vidéos, la transcription, l'extraction de preuves et la distillation via LLM.
Xinference est une bibliothèque d'inférence unifiée pour servir des modèles de langage, de parole et multimodaux. Elle offre une API RESTful compatible OpenAI, une utilisation hétérogène des GPU/CPU, un déploiement distribué, et s'intègre à LangChain, LlamaIndex, Dify et Chatbox.
Un éditeur de sous-titres basé sur le navigateur avec des pistes par locuteur, optimisant le flux de travail de la transcription à l'exportation.
by2kb convertit des URL de vidéos (Bilibili, YouTube) ou des fichiers locaux en artefacts Markdown durables : transcription brute, résumé et notes d'étude. Optimisé pour les agents IA, il prend en charge la reconnaissance vocale locale ou cloud, avec une architecture économique et personnalisable.
Un outil de montage vidéo automatique basé sur l'IA utilisant Whisper et Gemini, prenant en charge le thaï et l'anglais, avec découpage de segments clés et sous-titrage, offrant des performances 3 à 4 fois plus rapides via GPU et Docker.
Une réimplémentation rapide du modèle Whisper d'OpenAI utilisant CTranslate2, offrant une vitesse de transcription accrue et une utilisation réduite de la mémoire.
Tandem est un serveur auto-hébergé avec des clients web et Android qui synchronise la position de lecture entre un ebook et son livre audio. Il transcrit l'audio via Whisper et aligne le texte phrase par phrase.
LazyEdit est un flux de travail vidéo local-first assisté par IA pour la création, le traitement et la publication optionnelle de contenus de bout en bout.
WhisperLiveKit est un pipeline speech-to-text auto-hébergé à ultra-faible latence, offrant transcription en temps réel, diarisation et traduction via WebSocket et API compatibles OpenAI/Deepgram.
ChatMonteur est un éditeur vidéo IA orchestré par agents pour les vidéos de type « talking-head ». Il transcrit, coupe, ajoute des sous-titres et des effets via Claude Code ou Codex, avec deux filtres de qualité. Gratuit et local.