このプロジェクトについて

whisper.cppは、OpenAIのWhisperモデルを純粋なC/C++で移植したものであり、重い依存関係なしに高性能な音声文字変換(speech-to-text)推論を可能にします。効率性を重視して設計されており、実行時のメモリ割り当てをゼロにし、混合F16/F32精度および整数量子化をサポートしています。 主な機能は以下の通りです: - 広範なハードウェア加速:Apple Silicon (ARM NEON, Metal, Core ML)、x86 (AVX)、NVIDIA GPU (CUDA)、AMD GPU (ROCm)、Vulkan、OpenVINO、および各種NPU (AMD Ryzen AI, Ascend) に最適化されています。 - 幅広いプラットフォームサポート:macOS、iOS、Android、Linux、FreeBSD、Windows、WebAssembly、およびRaspberry Piと互換性があります。 - 高度な機能:音声活動検知 (VAD)、リアルタイムオーディオ入力ストリーミング、単語レベルのタイムスタンプ、および文字起こしの信頼度に応じた色分け機能が含まれています。 - 統合:CスタイルのAPIとDockerイメージを提供しており、異なる環境への容易な展開が可能です。