Sobre el proyecto

Xorbits Inference (Xinference) es una biblioteca para servir modelos de lenguaje, reconocimiento de voz y multimodales. Los usuarios pueden desplegar modelos integrados o personalizados con un solo comando. El sistema admite API RESTful compatible con OpenAI (incluyendo llamadas a funciones), RPC, CLI e interfaces WebUI. Utiliza inteligentemente hardware heterogéneo mediante ggml, incluyendo GPUs y CPUs, y permite el despliegue distribuido en múltiples dispositivos o máquinas. Las integraciones integradas incluyen LangChain, LlamaIndex, Dify, FastGPT, RAGFlow y MaxKB. Las características adicionales cubren auto-batching, batching continuo mediante Xllamacpp, servicio agéntico nativo con Xagent y soporte para una amplia gama de modelos integrados como MiniCPM5, Fish Audio, MonkeyOCR, Qwen3.8 y varios sistemas multimodales y TTS. Las opciones de despliegue incluyen Docker, Helm para Kubernetes e instalación mediante pip.