OPEN SOURCE, OPEN TO EVERYONE

오픈 소스. 새로운 가능성.

우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.

편집자 선정 · 좋은 오픈 소스 발견4109발견됨

호기심으로 오픈 소스의 세계를 발견하세요.

THE FIRST COLLECTION
Topic: asr清除

YouTube Transcript API는 YouTube 영상의 자막 및 음성을 텍스트로 가져오는 경량 Python 라이브러리입니다. 셀레늄 없이 언어 번역, 포맷 출력, CLI 도구, 프록시 지원 등을 제공합니다.

개발 도구Backend & APIs
mimoravikonix
신규

Mimora는 영어와 스페인어 학습자를 위한 무료, 완전 로컬 발음 트레이너입니다. 온디바이스 TTS, 음성 인식, 그리고 로컬 LLM을 사용하여 문장을 생성하고, 단어 수준의 피드백과 함께 사용자의 시도를 점수화합니다. 클라우드나 API 키가 필요하지 않습니다.

인공지능생산성AI assistants
premove-itnpremove-ai
신규

Premove ITN은 영어 음성 에이전트 대본을 위한 오픈소스 컨텍스트 인지 역텍스트 정규화 도구로, DeBERTa 컨텍스트 점수를 사용하는 생성-점수-디코드 파이프라인을 통해 음성 ASR 출력을 표준 서면 형식으로 변환합니다.

인공지능개발 도구Model runtime
sensevoiceQwenAudio
신규

SenseVoiceSmall은 ASR, 언어 식별, 감정 인식, 오디오 이벤트 감지를 지원하는 오픈소스 음성 파운데이션 모델로, 중국어, 광둥어, 영어, 일본어, 한국어를 지원하며 빠른 비자기회귀 추론을 제공합니다.

인공지능개발 도구Model runtime
speechNVIDIA-NeMo
신규

NVIDIA NeMo Speech는 Apache-2.0 라이선스의 PyTorch 기반 음성 AI 모델 구축·커스터마이징·배포 프레임워크로, ASR, TTS, 음성 LLM을 지원하며 사전 학습된 체크포인트와 Docker/uv 설치 경로를 제공한다.

인공지능음악Model runtime
douvorhinoc
신규

Douvo는 Apple Silicon용 경량 macOS 음성 입력 앱으로, Doubao ASR을 사용하며 텍스트 정리, 번역, 선택 텍스트 편집을 위한 로컬 또는 원격 AI 후처리를 선택적으로 제공합니다.

생산성인공지능Utilities
talkbank-toolsFranklinChen
신규

Batchalign3는 CHAT 전사본을 생성하고 강화하기 위한 TalkBank 오디오 및 ML 파이프라인으로, ASR, 강제 정렬, 신경 형태소 태깅, 번역 및 발화 분할을 다룹니다. CLI, Python 패키지, PyO3 브리지, React 대시보드 및 실험적 Tauri 데스크톱 셸을 제공합니다.

인공지능개발 도구Model runtime