À propos du projet

DL Streamer (Deep Learning Streamer) est un framework open source d'analyse de médias en streaming construit sur le framework multimédia GStreamer. Il est conçu pour construire des pipelines d'intelligence vidéo et audio, depuis un simple exemple de détection en ligne de commande jusqu'à des déploiements multi-flux et multi-capteurs en périphérie ou dans le cloud. L'inférence est propulsée par OpenVINO, ciblant le matériel Intel CPU, GPU et NPU. Les pipelines sont décrits sous forme de chaînes simples (ou via du code Python/C++) et exécutés avec accélération matérielle. Le projet est livré avec plus de 30 exemples prêts à l'emploi couvrant la détection, la classification, le suivi, les modèles vision-langage, le traitement LiDAR et radar. Il fait partie de l'Intel Open Edge Platform. Principales capacités mises en avant dans le README : - Pipelines en une ligne : un pipeline de détection fonctionnel peut être construit avec une seule commande gst-launch-1.0. - Accélération matérielle : la même base de code cible CPU, GPU et NPU sur les plateformes Intel ; changer de dispositif se fait par un changement de paramètre. - Prise en charge VLM et GenAI : les modèles vision-langage tels que MiniCPM-V, CLIP et Whisper peuvent s'exécuter dans un pipeline GStreamer. - Conformité GstAnalytics : prend en charge le standard de métadonnées GStreamer pour l'interopérabilité avec d'autres outils basés sur GStreamer. - Intégration de messagerie : des éléments intégrés publient les résultats d'inférence vers MQTT ou Kafka sans code supplémentaire. - Extensibilité Python-first : une logique personnalisée peut être ajoutée sous forme de callbacks Python ou d'éléments GStreamer Python complets. - Multi-flux, multi-capteurs : mux/demux de nombreux flux RTSP, trames LiDAR et nuages de points radar dans un seul processus. - Prise en charge de modèles : déployez des modèles depuis Geti Studio, Ultralytics, Hugging Face, ou tout modèle ONNX/OpenVINO IR. Les options d'installation incluent une image Docker (intel/dlstreamer:latest) et des paquets natifs pour Ubuntu 22.04/24.04, ainsi qu'une prise en charge de Windows 11. Un script de prérequis installe les pilotes Intel GPU/NPU. Le README fournit des commandes de démarrage rapide pour le téléchargement de modèles, l'exécution d'un pipeline de détection YOLO, la sortie de métadonnées JSON et l'utilisation de l'API Python via les bindings GStreamer. Les catégories d'éléments incluent l'inférence (gvadetect, gvaclassify, gvainference, gvagenai, gvaaudiotranscribe), l'analyse (gvatrack, gvaanalytics, gvastreammux/demux, gvamotiondetect), la sortie (gvawatermark, gvametaconvert, gvametapublish, gvafpscounter) et la 3D/capteurs (g3dlidarparse, g3dinference, g3dradarprocess). Les exemples couvrent la détection, la segmentation et la pose, le suivi, VLM/GenAI, le multi-flux, les capteurs 3D, l'intégration (découverte ONVIF, déploiement Geti, MQTT/Kafka) et l'extensibilité Python telle qu'un NVR intelligent. Le matériel pris en charge répertorié inclut les séries Intel Core Ultra 1-3, les GPU discrets Intel Arc et les processeurs Intel Core de 11e à 13e génération. Le projet est sous licence MIT et accueille les contributions.