프로젝트 소개
Whisper는 다양한 오디오로 구성된 대규모 데이터셋으로 학습된 Transformer sequence-to-sequence 모델입니다. 다양한 작업을 토큰 시퀀스로 공동 표현함으로써 기존 음성 처리 파이프라인의 여러 단계를 대체할 수 있는 다중 작업 시스템 역할을 합니다.
주요 기능은 다음과 같습니다:
- 다국어 음성 인식 (전사)
- 영어로의 음성 번역
- 구어체 언어 식별
- 음성 활동 감지
이 프로젝트는 사용자가 가용 VRAM에 따라 추론 속도와 정확도의 균형을 맞출 수 있도록 6가지 모델 크기(tiny, base, small, medium, large, turbo)를 제공합니다. 작은 모델 크기의 경우 영어 전용 버전이 제공됩니다.
Whisper는 명령줄 인터페이스(CLI) 또는 Python 라이브러리를 통해 사용할 수 있습니다. 오디오 처리를 위해 ffmpeg가 필요하며, 빠른 토큰화를 위해 OpenAI의 tiktoken을 활용합니다.