voiceboxjamiepine
신규Voicebox는 로컬에서 실행되는 오픈소스 AI 음성 스튜디오로, 음성 클로닝, TTS, 전역 받아쓰기, 오디오 후처리, MCP 기반 에이전트 음성 출력을 지원하며 클라우드 서비스의 무료 대안을 지향한다.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONVoicebox는 로컬에서 실행되는 오픈소스 AI 음성 스튜디오로, 음성 클로닝, TTS, 전역 받아쓰기, 오디오 후처리, MCP 기반 에이전트 음성 출력을 지원하며 클라우드 서비스의 무료 대안을 지향한다.
Premove ITN은 영어 음성 에이전트 대본을 위한 오픈소스 컨텍스트 인지 역텍스트 정규화 도구로, DeBERTa 컨텍스트 점수를 사용하는 생성-점수-디코드 파이프라인을 통해 음성 ASR 출력을 표준 서면 형식으로 변환합니다.
RunAnywhere는 휴대폰, 브라우저, 데스크톱, 서버에서 AI 모델을 온디바이스로 실행하기 위한 크로스플랫폼 SDK 모음입니다. 단일 세맨틱 API를 통해 LLM, 비전, 음성, 음성 에이전트, RAG, 임베딩, 이미지 생성을 지원합니다.
SenseVoiceSmall은 ASR, 언어 식별, 감정 인식, 오디오 이벤트 감지를 지원하는 오픈소스 음성 파운데이션 모델로, 중국어, 광둥어, 영어, 일본어, 한국어를 지원하며 빠른 비자기회귀 추론을 제공합니다.