Sobre o projeto
O Qwen Audio Agent é um runtime de voz em tempo real projetado para manter um agente de IA presente tanto durante a conversa quanto em trabalhos de maior duração. A sessão de voz em primeiro plano pode continuar ouvindo e respondendo enquanto chamadas de ferramentas, trabalho com arquivos, alterações de código ou outras tarefas são delegadas a um agente de backend; os usuários podem pedir progresso, cancelar trabalho e receber resultados naturalmente na mesma conversa.
As capacidades documentadas incluem voz em tempo real full-duplex, interrupção natural, diálogo multiturno sustentado, criação assíncrona de tarefas, acompanhamento de status, memória de longo prazo por usuário e personalização entre sessões. O runtime fornece um Gateway, WebUI, TUI de terminal e um orbe flutuante de desktop para macOS, Windows e Linux. O aplicativo de desktop inclui suspensão ociosa, ativação de voz local e aparência personalizável.
Os frontends de voz são substituíveis e suportam implantação em nuvem ou local. As opções listadas incluem modelos em tempo real Qwen Audio, OpenAI GPT-Live, Google Gemini Live, Doubao Seeduplex, StepAudio, Hugging Face Speech-to-Speech e MiniCPM-o. Alguns frontends suportam entrada de vídeo ao vivo ou quadros de câmera, enquanto opções locais podem usar componentes configuráveis de VAD, STT, LLM e TTS. Serviços adicionais podem ser adicionados por meio de uma interface Realtime Provider.
Os agentes de backend se integram de forma independente por meio de protocolos e adaptadores no estilo ACP/A2A. O README lista Qwen Code, OpenCode, OpenClaw, Qoder, Kimi Code, MiniMax Code, Hermes, CodeBuddy, Codex, Claude Code, DeepSeek Harness, Pi e Muse Code, além de um modo somente frontend. Também documenta classificações de compatibilidade com base na completude da integração e na verificação.
O software é distribuído via npm como qwen-audio-agent e requer Node.js 22.22.2+ ou 24.15.0+ com npm 10+. A configuração é feita por meio de uma configuração no estilo Dotenv, normalmente usando uma chave de API DashScope/Bailian para o serviço de voz Qwen padrão. Os exemplos disponíveis abrangem produtividade de desktop, uso em cockpit inteligente, conversa visual, atendimento ao cliente e um cenário de passaporte de voz em hardware; cenários de inteligência incorporada e assistente de livestream estão marcados como planejados.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.