vLLM é uma biblioteca de alta taxa de transferência e eficiência de memória projetada para inferência e serviço de Large Language Models (LLM).
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONMithril é um mecanismo de orquestração multi-modelo que unifica Gemini, OpenAI, Anthropic, Groq e modelos GGUF locais por trás de uma única API compatível com Ollama. Configure equipes multiagentes em YAML, com 24 ferramentas integradas, suporte a Docker e integração MCP.
Uma implementação de alta performance em C/C++ para inferência do modelo de reconhecimento automático de fala (ASR) Whisper da OpenAI, projetada para implantação leve e multiplataforma.
Oumi é uma plataforma open-source para todo o ciclo de vida de modelos de fundação: preparação de dados, treino e fine-tuning (SFT, LoRA, QLoRA, GRPO), avaliação, síntese de dados com LLM judges e implantação via vLLM/SGLang, com CLI e lançamento de jobs na nuvem.
Xinference é uma biblioteca unificada de inferência para servir modelos de linguagem, fala e multimodais. Oferece API RESTful compatível com OpenAI, uso heterogêneo de GPU/CPU, implantação distribuída e integrações com LangChain, LlamaIndex, Dify e Chatbox.
Uma reimplementação rápida do modelo Whisper da OpenAI usando CTranslate2, oferecendo maior velocidade de transcrição e menor uso de memória.
DeepSpeed é uma biblioteca de otimização de deep learning projetada para tornar o treinamento e a inferência de modelos de larga escala fáceis, eficientes e eficazes.
RunAnywhere é um conjunto de SDKs multiplataforma para executar modelos de IA totalmente no dispositivo, abrangendo telefones, navegadores, desktops e servidores. Ele suporta LLMs, visão, fala, agentes de voz, RAG, embeddings e geração de imagens com uma única API semântica.
SGLang é um framework de serving de alta performance para modelos de linguagem extensos (LLMs) e modelos multimodais, projetado para inferência de baixa latência e alta vazão.
jetson-inference é uma biblioteca de visão profunda em C++ e Python para NVIDIA Jetson. Usa TensorRT para inferência no dispositivo e PyTorch para treinamento, com exemplos, modelos pré-treinados e tutoriais para classificação, detecção, segmentação, pose, ação, profundidade e streaming de câmera.
O MediaPipe é um framework multiplataforma de código aberto do Google que oferece soluções de aprendizado de máquina no dispositivo para mídia ao vivo e streaming, abrangendo visão, texto e áudio em Android, iOS, web, desktop e dispositivos de borda. Sua documentação principal está em developers.google.com/mediapipe, e inclui componentes como Tasks, Model Maker e Studio.
O YOLOv5 é um framework de visão computacional rápido e preciso em PyTorch para detecção de objetos, segmentação de instâncias e classificação de imagens. Ele suporta treinamento em conjuntos de dados personalizados, inferência de várias fontes e exportação de modelos para formatos como ONNX, TensorRT e CoreML.
Colossal-AI é um sistema de código aberto para treinar e executar grandes modelos de IA de forma mais barata e eficiente, oferecendo estratégias de treinamento paralelo, gerenciamento de memória e aceleração de inferência para LLMs, modelos de difusão e mais.