Sobre o projeto
Xorbits Inference (Xinference) é uma biblioteca para servir modelos de linguagem, reconhecimento de fala e multimodais. Usuários podem implantar modelos integrados ou personalizados com um único comando. O sistema suporta API RESTful compatível com OpenAI (incluindo chamada de funções), RPC, CLI e interfaces WebUI. Ele utiliza inteligentemente hardware heterogêneo via ggml, incluindo GPUs e CPUs, e permite implantação distribuída em múltiplos dispositivos ou máquinas. Integrações integradas incluem LangChain, LlamaIndex, Dify, FastGPT, RAGFlow e MaxKB. Recursos adicionais cobrem auto-batching, batching contínuo via Xllamacpp, serviço agêntico nativo com Xagent e suporte a uma ampla gama de modelos integrados, como MiniCPM5, Fish Audio, MonkeyOCR, Qwen3.8 e vários sistemas multimodais e de TTS. As opções de implantação incluem Docker, Helm para Kubernetes e instalação via pip.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.