このプロジェクトについて
SpeechRecognitionは、広く使用されているPythonライブラリで、オンラインおよびオフラインの幅広いエンジンとAPIにわたって音声認識を実行するための統合インターフェースを提供します。さまざまな音声テキスト変換サービスとの統合の複雑さを抽象化し、開発者が最小限のコード変更でプロバイダーを切り替えられるようにします。
サポートされているエンジンとAPIには、CMU Sphinx(オフライン)、Google Speech Recognition、Google Cloud Speech API、Wit.ai、Microsoft Azure Speech、Houndify API、IBM Speech to Text、Snowboy Hotword Detection(オフライン)、TensorFlow、Vosk API(オフライン)、OpenAI Whisper(オフライン)、OpenAI Transcription API(vLLMやOllamaなどのOpenAI互換のセルフホストエンドポイントを含む)、Groq Whisper API、Cohere Transcribe APIが含まれます。
このライブラリにはPython 3.10以降が必要です。オプションの依存関係はpipエクストラでインストールします: PyAudio(マイク入力用)、PocketSphinx(Sphinx認識器用)、google-cloud-speech(Google Cloud Speech-to-Text用)、Vosk(オフライン認識用)、WhisperまたはFaster Whisper(ローカル文字起こし用)、openai(OpenAI Transcription API用)、groq(Groq Whisper API用)、cohere(Cohere Transcribe API用)です。FLACエンコーダーはx86ベースのWindows、Linux、OS Xシステムにはバンドルされていますが、他のプラットフォームでは個別にインストールする必要があります。
主な機能には、マイクベースの音声キャプチャ、音声ファイルの文字起こし、バックグラウンドリスニング、周囲のノイズに対するエネルギーしきい値のキャリブレーション、拡張認識結果が含まれます。このライブラリは、recognize_sphinx、recognize_google、recognize_google_cloud、recognize_wit、recognize_api、recognize_houndify、recognize_ibm、recognize_snowboy、recognize_tensorflow、recognize_vosk、recognize_whisper、recognize_faster_whisper、recognize_openai、recognize_groq、recognize_cohere_apiなどのメソッドを持つシンプルなAPIを提供します。
リポジトリには、マイク認識、音声ファイルの文字起こし、音声データの保存、拡張結果、エネルギーしきい値のキャリブレーション、バックグラウンドリスニング、特別な認識機能の使用パターンを含む包括的なexamplesディレクトリが含まれています。トラブルシューティングのドキュメントでは、誤トリガー、言語/方言のサポート、Raspberry Piのマイク問題、PyInstaller互換性、プラットフォーム固有のオーディオエラーなど、一般的な問題をカバーしています。
このライブラリはPyPIで公開されており、複数の作者による貢献で積極的にメンテナンスされています。クラウドベースとオンデバイスの音声認識ソリューションの選択に柔軟性を必要とする、音声対応アプリケーション、文字起こしツール、音声駆動インターフェースを構築する開発者に適しています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.