PixelRAG é um sistema RAG visual de código aberto que converte documentos em screenshots para preservar tabelas e gráficos. Oferece indexação hospedada da Wikipedia, ferramentas CLI, integração com Claude Code e suporte local via CUDA/MPS.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONTARS é uma pilha de agentes de IA multimodal de código aberto da ByteDance com dois projetos: Agent TARS, um agente CLI e Web UI que integra ferramentas MCP e controle de navegador, e UI-TARS Desktop, um aplicativo agente GUI nativo que controla computadores via modelos de visão-linguagem.
PageLedger é uma biblioteca Python de CLI para extração de documentos e OCR em nível de página auditável. Ela registra proveniência, sinais de qualidade e orçamentos por página extraída, suporta execuções retomáveis, filas de revisão e reexecuções com verificação humana no loop.
Repositório com 61 tutoriais de visão computacional em notebooks Jupyter, cobrindo modelos como YOLO11, SAM 3 e Qwen3-VL para detecção, segmentação e OCR.
RunAnywhere é um conjunto de SDKs multiplataforma para executar modelos de IA totalmente no dispositivo, abrangendo telefones, navegadores, desktops e servidores. Ele suporta LLMs, visão, fala, agentes de voz, RAG, embeddings e geração de imagens com uma única API semântica.
Hugging Face Transformers é um framework de definição de modelos para aprendizado de máquina em tarefas de texto, visão, áudio e multimodais. Oferece uma API unificada para inferência e treinamento com mais de 1 milhão de checkpoints pré-treinados.
SGLang é um framework de serving de alta performance para modelos de linguagem extensos (LLMs) e modelos multimodais, projetado para inferência de baixa latência e alta vazão.