このプロジェクトについて
Qwen Audio Agentは、会話中も長時間実行される作業中もAIエージェントを常に存在させ続けるために設計されたリアルタイム音声ランタイムです。フォアグラウンドの音声セッションは、ツール呼び出し、ファイル作業、コード変更、その他のタスクがバックエンドエージェントに委任されている間も、 listeningと応答を継続できます。ユーザーは進捗を尋ねたり、作業をキャンセルしたり、同じ会話の中で自然に結果を受け取ったりできます。
文書化されている機能には、全二重リアルタイム音声、自然な割り込み、持続的なマルチターン対話、非同期タスク作成、ステータス追跡、ユーザーごとの長期記憶、セッションをまたぐパーソナライゼーションが含まれます。ランタイムはGateway、WebUI、ターミナルTUI、およびmacOS、Windows、Linux向けのデスクトップフローティングオーブを提供します。デスクトップアプリケーションには、アイドルスリープ、ローカル音声ウェイク、カスタマイズ可能な外観が含まれます。
音声フロントエンドは交換可能で、クラウドまたはローカル展開をサポートします。記載されているオプションには、Qwen Audioリアルタイムモデル、OpenAI GPT-Live、Google Gemini Live、Doubao Seeduplex、StepAudio、Hugging Face Speech-to-Speech、MiniCPM-oが含まれます。一部のフロントエンドはライブビデオまたはカメラフレーム入力をサポートし、ローカルオプションでは設定可能なVAD、STT、LLM、TTSコンポーネントを使用できます。追加サービスはRealtime Providerインターフェースを通じて追加できます。
バックエンドエージェントはACP/A2Aスタイルのプロトコルとアダプターを通じて独立して統合されます。READMEには、Qwen Code、OpenCode、OpenClaw、Qoder、Kimi Code、MiniMax Code、Hermes、CodeBuddy、Codex、Claude Code、DeepSeek Harness、Pi、Muse Code、およびフロントエンドのみのモードが記載されています。また、統合の完全性と検証に基づく互換性評価も文書化されています。
このソフトウェアはnpmでqwen-audio-agentとして配布され、Node.js 22.22.2+または24.15.0+とnpm 10+が必要です。設定はDotenvスタイルのセットアップで行われ、通常はデフォルトのQwen音声サービスにDashScope/Bailian APIキーを使用します。利用可能な例は、デスクトップ生産性、スマートコックピット用途、視覚会話、カスタマーサービス、ハードウェア音声パスポートシナリオをカバーしています。エンボディドインテリジェンスとライブストリームアシスタントのシナリオは計画中とされています。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.