Об этом проекте

CrisperWhisper 2.0 — это набор инструментов распознавания речи, построенный вокруг явного выбора между двумя стилями транскрипции при каждом вызове. Режим дословной транскрипции записывает то, что было фактически сказано, в единообразном формате, включая слова-заполнители, повторы, обрывы, ложные начала и вокализации, такие как смех. Режим замысла создаёт чистую, читаемую версию того, что имел в виду говорящий, форматируя числа, даты и адреса электронной почты как письменный текст. В README это представлено как центральное проектное решение проекта: большинство систем распознавания речи наследуют фиксированный стиль из обучающих данных, тогда как здесь он вынесен в параметр. Помимо двух режимов, в README описаны пословные метки времени, полученные на основе выравнивания с учительским сигналом кросс-внимания, с сообщаемой средней ошибкой границ около 30 мс на чтении вслух и 41 мс на разговорной речи в собственных тестах проекта. Возможность «verbatimize» принимает аудио вместе с существующим доверенным чистым транскриптом и вставляет только те дисфлюенции и вокализации, которые присутствуют в аудио; README представляет это как способ преобразования чистых корпусов в дословные наборы данных для данных TTS, клинического анализа речи и построения наборов данных. Утверждается, что многоязычные дословный режим и режим замысла работают для большинства языков, поддерживаемых Whisper. Длинные аудиозаписи обрабатываются через то, что README называет условным продолжением: каждое окно продолжается от уже транскрибированных слов, что, по заявлению проекта, позволяет избежать дублирования или пропуска слов на границах фрагментов и избежать учёта токенов меток времени. Среда выполнения CTranslate2 обеспечивает спекулятивное декодирование с меньшей черновой моделью, и, согласно README, снижение галлюцинаций для режима зацикленных повторов Whisper включено по умолчанию. Установка предлагает два дополнительных варианта: бэкенд CTranslate2 для GPU NVIDIA на Linux и чисто PyTorch-бэкенд для macOS, Windows и CPU. При первой загрузке скачиваются веса с HuggingFace и, на бэкенде ct2, выполняется однократное преобразование, требующее torch и transformers. Размеры моделей варьируются от small до large, плюс turbo, с отдельной линейкой «Pro», описанной как обученная на дополнительных проприетарных данных и поддерживающая усиление по горячим словам. В README также перечислены такие опции, как двухрежимная транскрипция за один проход, принудительное выравнивание для существующих транскриптов и квантизация float16 или int8_float16. Лицензирование разделено: код вывода в репозитории лицензирован по MIT, тогда как веса моделей выпущены под несвободной исследовательской лицензией, а коммерческое лицензирование доступно по запросу; модели Pro доступны только по коммерческой лицензии. README содержит ссылки на статью, полную документацию, страницы моделей и несколько исследовательских публикаций, объясняющих бенчмарк, многоязычное управление стилем, выравниватель, продолжение длинных записей, verbatimize и стек вывода. Таблицы бенчмарков в README — это собственные заявленные результаты проекта, и их следует воспринимать именно так.