프로젝트 소개
CrisperWhisper 2.0은 두 가지 전사 스타일 중 하나를 호출마다 명시적으로 선택하는 것을 중심으로 구축된 음성 인식 툴킷입니다. 축어적 모드(Verbatim mode)는 실제로 말한 내용을 일관된 형식으로 기록하며, 필러, 반복, 중단, 잘못된 시작, 웃음과 같은 발성 이벤트를 포함합니다. 의도된 모드(Intended mode)는 화자가 의도한 깔끔하고 읽기 쉬운 버전을 생성하며, 숫자, 날짜, 이메일을 서면 텍스트로 형식화합니다. README는 이를 프로젝트의 핵심 설계 결정으로 제시합니다. 대부분의 음성-텍스트 시스템은 훈련 데이터로부터 고정된 스타일을 물려받지만, 이 시스템은 이를 매개변수로 노출합니다.
두 가지 모드 외에도, README는 지도 교차 주의 정렬(supervised cross-attention alignment)에서 도출된 단어 수준 타이밍을 설명하며, 프로젝트 자체 벤치마크에서 읽기 음성에 대해 약 30ms, 대화 음성에 대해 41ms의 평균 경계 오류를 보고합니다. "verbatimize" 기능은 오디오와 기존의 신뢰할 수 있는 깨끗한 전사를 입력으로 받아 오디오에 존재하는 비유창성과 발성 이벤트만 삽입하는데, README는 이를 깨끗한 코퍼스를 TTS 데이터, 임상 음성 분석 및 데이터셋 구성을 위한 축어적 데이터셋으로 변환하는 방법으로 설명합니다. 다국어 축어적 및 의도된 모드는 Whisper가 지원하는 대부분의 언어에서 작동한다고 명시되어 있습니다.
장문 오디오는 README에서 조건부 연속(conditional continuation)이라고 부르는 방식을 통해 처리됩니다. 각 윈도우는 이미 전사된 단어에서 이어지며, 프로젝트는 이것이 청크 경계에서 단어의 중복이나 누락을 방지하고 타임스탬프 토큰 관리를 피한다고 말합니다. CTranslate2 런타임은 더 작은 초안 모델을 사용한 추측적 디코딩(speculative decoding)을 제공하며, README는 Whisper의 반복 루프 실패 모드에 대한 환각 완화가 기본적으로 활성화되어 있다고 명시합니다.
설치에는 두 가지 추가 옵션이 있습니다. Linux의 NVIDIA GPU용 CTranslate2 백엔드와 macOS, Windows 및 CPU용 순수 PyTorch 백엔드입니다. 첫 로드 시 HuggingFace에서 가중치를 다운로드하고, ct2 백엔드에서는 torch와 transformers가 필요한 일회성 변환을 수행합니다. 모델 크기는 small에서 large까지, 그리고 turbo가 있으며, 추가 독점 데이터로 훈련되었다고 설명되는 별도의 "Pro" 라인이 핫워드 부스팅을 지원합니다. README는 또한 한 번의 패스로 이중 모드 전사, 기존 전사에 대한 강제 정렬, float16 또는 int8_float16 양자화와 같은 옵션을 나열합니다.
라이선스는 분할되어 있습니다. 저장소의 추론 코드는 MIT 라이선스이며, 모델 가중치는 비상업적 연구 라이선스로 공개되며 상업적 라이선스는 요청 시 제공됩니다. Pro 모델은 상업적 라이선스 전용입니다. README는 논문, 전체 문서, 모델 페이지 및 벤치마크, 다국어 스타일 제어, 정렬기, 장문 연속, verbatimize 및 추론 스택을 설명하는 여러 연구 게시물로 연결됩니다. README의 벤치마크 표는 프로젝트가 보고한 자체 결과이며 그렇게 읽어야 합니다.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.