YouTube Transcript API는 YouTube 영상의 자막 및 음성을 텍스트로 가져오는 경량 Python 라이브러리입니다. 셀레늄 없이 언어 번역, 포맷 출력, CLI 도구, 프록시 지원 등을 제공합니다.
오픈 소스. 새로운 가능성.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONMimora는 영어와 스페인어 학습자를 위한 무료, 완전 로컬 발음 트레이너입니다. 온디바이스 TTS, 음성 인식, 그리고 로컬 LLM을 사용하여 문장을 생성하고, 단어 수준의 피드백과 함께 사용자의 시도를 점수화합니다. 클라우드나 API 키가 필요하지 않습니다.
Premove ITN은 영어 음성 에이전트 대본을 위한 오픈소스 컨텍스트 인지 역텍스트 정규화 도구로, DeBERTa 컨텍스트 점수를 사용하는 생성-점수-디코드 파이프라인을 통해 음성 ASR 출력을 표준 서면 형식으로 변환합니다.
SenseVoiceSmall은 ASR, 언어 식별, 감정 인식, 오디오 이벤트 감지를 지원하는 오픈소스 음성 파운데이션 모델로, 중국어, 광둥어, 영어, 일본어, 한국어를 지원하며 빠른 비자기회귀 추론을 제공합니다.
NVIDIA NeMo Speech는 Apache-2.0 라이선스의 PyTorch 기반 음성 AI 모델 구축·커스터마이징·배포 프레임워크로, ASR, TTS, 음성 LLM을 지원하며 사전 학습된 체크포인트와 Docker/uv 설치 경로를 제공한다.
Douvo는 Apple Silicon용 경량 macOS 음성 입력 앱으로, Doubao ASR을 사용하며 텍스트 정리, 번역, 선택 텍스트 편집을 위한 로컬 또는 원격 AI 후처리를 선택적으로 제공합니다.
Batchalign3는 CHAT 전사본을 생성하고 강화하기 위한 TalkBank 오디오 및 ML 파이프라인으로, ASR, 강제 정렬, 신경 형태소 태깅, 번역 및 발화 분할을 다룹니다. CLI, Python 패키지, PyO3 브리지, React 대시보드 및 실험적 Tauri 데스크톱 셸을 제공합니다.