À propos du projet

Pipecat est un framework Python open source maintenu par Daily et la communauté pour créer des agents IA conversationnels vocaux et multimodaux en temps réel. Il orchestre l'audio, la vidéo, les services IA, les transports et les pipelines de conversation afin que les développeurs puissent se concentrer sur la logique de l'agent plutôt que sur la plomberie. Les capacités principales incluent : - Conception axée sur la voix : intègre la reconnaissance vocale, la synthèse vocale et la gestion des conversations dès le départ, permettant des conversations en streaming naturelles. - Pipelines composables : des composants modulaires (processeurs) peuvent être chaînés en pipelines qui forment des agents individuels. Ces agents peuvent être composés via handoff, fan-out parallèle, workers sidecar ou déploiements distribués sur plusieurs processus et machines à l'aide d'un bus partagé. - Systèmes multi-agents : créez des agents spécialisés qui se coordonnent via un bus partagé, localement ou de manière distribuée, permettant des systèmes de dialogue complexes et des workflows métier. - Transport en temps réel : interaction à ultra-faible latence via WebSockets, WebRTC (Daily, LiveKit, Vonage), WhatsApp ou connexions locales. Les intégrations de services couvrent un large catalogue : reconnaissance vocale (AssemblyAI, AWS, Azure, Cartesia, Deepgram, ElevenLabs, Google, Groq, Mistral, OpenAI/Whisper, et plus), LLMs (Anthropic, OpenAI, Gemini, Groq, Ollama, DeepSeek, Mistral, et autres), synthèse vocale (ElevenLabs, Cartesia, Kokoro, Piper, OpenAI, xAI, et plus), parole-à-parole (AWS Nova Sonic, Gemini Multimodal Live, Grok Voice Agent, OpenAI Realtime, Ultravox), transports (Daily WebRTC, LiveKit, FastAPI WebSocket, Vonage, WhatsApp, local) et sérialiseurs de téléphonie (Twilio, Exotel, Genesys, Plivo, Telnyx, Vonage). Les cas d'usage couverts dans le README incluent les assistants vocaux, les systèmes multi-agents, les compagnons IA (coachs, assistants de réunion, personnages), les interfaces multimodales (voix, vidéo, images), la narration interactive, les agents métier (accueil client, bots de support, parcours guidés) et les systèmes de dialogue structurés avec des chemins de conversation prédéfinis ou dynamiques via Pipecat Flows. L'écosystème s'étend au-delà du framework principal : SDK clients pour JavaScript, React, React Native, Swift, Kotlin, C++ et ESP32 ; Pipecat UI (un registre de composants shadcn pour les front-ends d'IA vocale) ; une CLI (`pipecat init` / `pipecat deploy`) qui échafaude des projets et les déploie en production ; Whisker (débogueur de pipeline en temps réel) ; Tail (tableau de bord terminal) ; Pipecat Skills pour Claude Code ; et un programme d'intégrations communautaires pour ajouter de nouveaux services. Le projet est publié sur PyPI sous le nom `pipecat-ai`, est livré avec un extra CLI (`pipecat-ai[cli]`) et inclut une couverture de tests via GitHub Actions et codecov. La documentation est hébergée sur docs.pipecat.ai, avec des exemples disponibles dans le dépôt compagnon pipecat-examples.