프로젝트 소개

faster-whisper는 CTranslate2 추론 엔진을 활용하여 OpenAI의 Whisper 음성-텍스트 변환 모델을 재구현한 것입니다. 이는 기존 구현보다 더 효율적으로 설계되어 메모리 사용량을 줄이면서도 최대 4배 빠른 전사 속도를 제공합니다. CPU와 GPU 모두에서 8비트 양자화를 통해 효율성을 더욱 높일 수 있습니다. 주요 기능은 다음과 같습니다: - Distil-Whisper 체크포인트와의 호환성을 포함한 다양한 모델 크기 지원 - 처리량 증대를 위한 배치 전사(Batched transcription) - 정밀한 오디오 정렬을 위한 단어 수준 타임스탬프 - 비음성 구간을 제거하기 위한 Silero VAD (Voice Activity Detection) 필터 통합 - CUDA 및 CPU 장치 전반에 걸친 다양한 연산 유형(float16, int8_float16, int8) 지원 - Transformers 호환 Whisper 모델을 CTranslate2 형식으로 변환하는 변환 도구 기존 Whisper와 달리 오디오 디코딩에 PyAV를 사용하여 시스템 전체에 FFmpeg를 설치할 필요가 없습니다.