프로젝트 소개

Qwen Audio Agent는 대화 중이거나 장기 실행 작업 중에도 AI 에이전트를 상시 유지하도록 설계된 실시간 음성 런타임입니다. 전경 음성 세션은 도구 호출, 파일 작업, 코드 변경 또는 기타 작업이 백엔드 에이전트에 위임되는 동안에도 계속 듣고 응답할 수 있으며, 사용자는 같은 대화에서 자연스럽게 진행 상황을 요청하고, 작업을 취소하며, 결과를 받을 수 있습니다. 문서화된 기능으로는 전이중 실시간 음성, 자연스러운 중단, 지속적인 다중 턴 대화, 비동기 작업 생성, 상태 추적, 사용자별 장기 메모리, 세션 간 개인화가 포함됩니다. 런타임은 게이트웨이, WebUI, 터미널 TUI, macOS·Windows·Linux용 데스크톱 플로팅 오브를 제공합니다. 데스크톱 앱에는 유휴 절전, 로컬 음성 깨우기, 사용자 지정 모양이 포함됩니다. 음성 프론트엔드는 교체 가능하며 클라우드 또는 로컬 배포를 지원합니다. 나열된 옵션에는 Qwen Audio 실시간 모델, OpenAI GPT-Live, Google Gemini Live, Doubao Seeduplex, StepAudio, Hugging Face Speech-to-Speech, MiniCPM-o가 포함됩니다. 일부 프론트엔드는 라이브 비디오 또는 카메라 프레임 입력을 지원하며, 로컬 옵션은 구성 가능한 VAD, STT, LLM, TTS 구성 요소를 사용할 수 있습니다. 추가 서비스는 Realtime Provider 인터페이스를 통해 추가할 수 있습니다. 백엔드 에이전트는 ACP/A2A 스타일 프로토콜과 어댑터를 통해 독립적으로 통합됩니다. README에는 Qwen Code, OpenCode, OpenClaw, Qoder, Kimi Code, MiniMax Code, Hermes, CodeBuddy, Codex, Claude Code, DeepSeek Harness, Pi, Muse Code가 나열되어 있으며, 프론트엔드 전용 모드도 포함됩니다. 또한 통합 완성도와 검증에 따른 호환성 등급도 문서화되어 있습니다. 소프트웨어는 npm 패키지 qwen-audio-agent로 배포되며 Node.js 22.22.2+ 또는 24.15.0+ 및 npm 10+이 필요합니다. 구성은 Dotenv 스타일 설정을 통해 수행되며, 일반적으로 기본 Qwen 음성 서비스에 DashScope/Bailian API 키를 사용합니다. 제공되는 예제는 데스크톱 생산성, 스마트 콕핏, 시각적 대화, 고객 서비스, 하드웨어 음성 패스포트 시나리오를 다루며, 구현체 지능 및 라이브스트림 어시스턴트 시나리오는 계획된 것으로 표시됩니다.