Sobre o projeto

O TensorFlow Serving é um sistema de serving para modelos de aprendizado de máquina, projetado para ambientes de produção. Ele se concentra na etapa de inferência: receber modelos treinados, gerenciar seus ciclos de vida e fornecer aos clientes acesso versionado por meio de uma tabela de consulta de alto desempenho com contagem de referências. Embora se integre prontamente com modelos do TensorFlow, sua arquitetura permite extensão para outros tipos de modelos e dados. Os principais recursos descritos no README incluem: - Servir vários modelos, ou várias versões do mesmo modelo, simultaneamente. - Expor endpoints de inferência tanto gRPC quanto HTTP. - Implantar novas versões de modelos sem alterar o código do cliente. - Oferecer suporte a canary release de novas versões e testes A/B de modelos experimentais. - Adicionar latência mínima devido a uma implementação de baixo overhead. - Um agendador que agrupa solicitações de inferência individuais em lotes para execução conjunta em GPU, com controles de latência configuráveis. - Suporte a muitos servables: modelos do TensorFlow, embeddings, vocabulários, transformações de features e até modelos de aprendizado de máquina não baseados em TensorFlow. O README fornece um exemplo de início rápido usando Docker: baixar a imagem tensorflow/serving, clonar o repositório, iniciar um contêiner com um modelo de demonstração montado e consultar a API REST com uma requisição curl. Ele também aponta para um tutorial completo de treinamento e serving no site oficial de documentação do TensorFlow. A documentação cobre opções de configuração, incluindo Docker (recomendado), instalação sem Docker, compilação a partir do código-fonte com Docker e implantação no Kubernetes. As orientações de uso explicam como exportar um modelo do TensorFlow como SavedModel e, em seguida, configurar e usar o TensorFlow Serving. Guias adicionais cobrem desempenho, criação de perfil com TensorBoard, a API REST, a definição da API gRPC, warmup de SavedModel, SignatureDefs e serving de modelos com operações personalizadas. Para extensão, o README observa que a arquitetura é altamente modular, permitindo que partes como o agendamento de lotes sejam usadas individualmente ou estendidas para novos casos de uso. Ele aponta para a documentação de arquitetura, a referência da API C++ e guias para criar um novo tipo de Servable ou uma fonte personalizada de versões de Servable. As diretrizes de contribuição estão disponíveis no repositório, e o site oficial do TensorFlow é referenciado para mais informações.