프로젝트 소개

Whisper는 다양한 오디오로 구성된 대규모 데이터셋으로 학습된 Transformer sequence-to-sequence 모델입니다. 다양한 작업을 토큰 시퀀스로 공동 표현함으로써 기존 음성 처리 파이프라인의 여러 단계를 대체할 수 있는 다중 작업 시스템 역할을 합니다. 주요 기능은 다음과 같습니다: - 다국어 음성 인식 (전사) - 영어로의 음성 번역 - 구어체 언어 식별 - 음성 활동 감지 이 프로젝트는 사용자가 가용 VRAM에 따라 추론 속도와 정확도의 균형을 맞출 수 있도록 6가지 모델 크기(tiny, base, small, medium, large, turbo)를 제공합니다. 작은 모델 크기의 경우 영어 전용 버전이 제공됩니다. Whisper는 명령줄 인터페이스(CLI) 또는 Python 라이브러리를 통해 사용할 수 있습니다. 오디오 처리를 위해 ffmpeg가 필요하며, 빠른 토큰화를 위해 OpenAI의 tiktoken을 활용합니다.