OPEN SOURCE, OPEN TO EVERYONE

오픈 소스. 새로운 가능성.

우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.

편집자 선정 · 좋은 오픈 소스 발견4101발견됨

호기심으로 오픈 소스의 세계를 발견하세요.

THE FIRST COLLECTION
Topic: tts清除
chattts2noise
신규

ChatTTS는 대화 시나리오를 위한 오픈소스 텍스트-음성 모델로, 영어와 중국어를 지원하며, 웃음, 휴지, 억양에 대한 세부 제어 기능을 제공합니다.

인공지능음악Multimodal AI
gpt-sovitsRVC-Boss
신규

GPT-SoVITS는 소량의 데이터로 음성 클로닝이 가능한few-shot 음성 변환 및 TTS 웹UI 시스템입니다. 5초 샘플로 제로샷 TTS, 약 1분 데이터로 피어샷 파인튜닝이 가능합니다. 중국어, 일본어, 한국어, 광둥어, 영어를 지원합니다.

음악Music generation
pyvideotransjianchang512
신규

오픈소스 비디오 번역, 음성 전사, AI 더빙, 자막 번역 도구로 로컬 및 라인 API를 지원합니다.

인공지능영상·미디어Multimodal AI
speechNVIDIA-NeMo
신규

NVIDIA NeMo Speech는 Apache-2.0 라이선스의 PyTorch 기반 음성 AI 모델 구축·커스터마이징·배포 프레임워크로, ASR, TTS, 음성 LLM을 지원하며 사전 학습된 체크포인트와 Docker/uv 설치 경로를 제공한다.

인공지능음악Model runtime
funttsfarfarfun
신규

FunTTS는 통합 인터페이스를 제공하는 텍스트 음성 변환(TTS) 라이브러리로, 다양한 오픈소스 TTS 엔진의 원활한 전환을 지원하며 자막 생성, 다역할 대화, 비동기 처리 등의 기능을 제공합니다.

개발 도구음악Templates & starters
vtmateDavidValin
신규

vtmate는 터미널 기반 음성 AI 툴킷으로, 초저지연, 41개 언어 지원, TTS/STT 통합을 특징으로 합니다. 실시간 음성 대화, 토론, 음성 복제, 세션 내보내기, 글로벌 단축키를 통한 백그라운드 데몬 모드를 제공하여 원활한 AI 상호작용을 지원합니다.

인공지능개발 도구AI assistants
opencreatorkrillinai
신규

OpenCreator(구 KrillinAI)는 Codex CLI를 실행 엔진으로 사용하는 오픈소스 AI 워크스페이스로, 비디오 번역, 다운로드, 썸네일 생성, 이미지 생성, 스마트 더빙, 비디오 생성 등 멀티모달 콘텐츠 제작 도구를 통합한 일반 Agent 워크스페이스를 제공합니다.

인공지능영상·미디어AI agents
unslothunslothai
신규

Unsloth는 Windows, macOS, Linux에서 대규모 언어 모델(LLM) 및 확산 모델을 로컬로 실행하고 학습시킬 수 있는 데스크톱 애플리케이션이자 프레임워크입니다.

음악Audio editing
verbanuvocode
신규

Verba는 AI 코치와 대화해 언어를 배울 수 있는 오프라인 우선 데스크톱 앱이다. Ollama나 자체 제공업체 키로 로컬에서 실행되며 실시간 교정, 수준별 읽기, 간격 반복 어휘 기능을 제공한다.

인공지능생산성AI assistants

YouTube 동영상을 위해 실시간 이중 언어 자막 번역을 제공하는 Google Chrome 및 Mozilla Firefox용 브라우저 확장 프로그램입니다.

인공지능생산성AI assistants
localaimudler
신규

LocalAI는 CPU 전용을 포함한 모든 하드웨어에서 LLM, 비전, 음성, 이미지 및 비디오 모델을 실행하는 오픈소스 자체 호스팅 AI 엔진입니다. OpenAI, Anthropic, ElevenLabs 호환 API, 온디맨드 모듈형 백엔드, 다중 사용자 인증, RAG 및 MCP를 갖춘 내장 에이전트를 제공합니다.

인공지능셀프 호스팅Model runtime
voxcpmOpenBMB
신규

VoxCPM2는 discrete tokenization 없이 연속 음성 표현을 생성하는 2B 파라미터 텍스트-음성 변환 시스템으로, 30개 언어를 지원하며 자연어 설명을 통한 음성 설계, 제어 가능한 음성 모방, 48kHz 오디오 출력을 제공한다.

인공지능음악Multimodal AI
신규

Pixelle-Video는 AI 완전 자동 단편 영상 생성 엔진으로, 사용자가 주제를 입력하면 대본, 이미지/영상, 음성, 배경음악을 자동 생성하고 합성한다. 다양한 AI 모델과 워크플로우를 유연하게 조합하여 활용할 수 있다.

인공지능영상·미디어Multimodal AI
python_coursearthurperch
신규

터미널 기반의 실습형 Python 코스로, Neovim 스타일의 모달 에디터에서 실제 코드를 작성하며 로컬 TTS 음성 코칭을 오프라인으로 받을 수 있습니다. 드릴, 시뮬레이션된 Cloud/DevOps 트랙(git, Docker, AWS, Terraform, Ansible, CI/CD) 및 학습 진도 저장 기능을 제공합니다.

개발 도구생산성CLI & terminal