Sobre el proyecto

## Descripción del proyecto **cf-workers-ai-gateway** es una pasarela de inferencia de AI ligera y de costo cero, diseñada específicamente para maximizar el uso de los créditos gratuitos de **Cloudflare Workers AI**. Este proyecto encapsula varios modelos de código abierto proporcionados por Cloudflare (como Qwen3, GPT-OSS, etc.) en una **API compatible con OpenAI**, lo que permite a los usuarios utilizar cualquier cliente que admita el protocolo OpenAI (como Cherry Studio, LobeChat, Open WebUI, Codex CLI, etc.) para interactuar con AI de forma gratuita o a un costo muy bajo. A diferencia de las pasarelas de agregación de múltiples proveedores tradicionales (como One-API, LiteLLM), este proyecto no agrega APIs pagadas, sino que se centra en **“aprovechar al máximo” el valor de un solo proveedor gratuito (Cloudflare Workers AI)**. Mediante la rotación de varias cuentas, enrutamiento con percepción de costos y mecanismos inteligentes de interrupción, permite a los usuarios individuales ejecutar cientos o incluso miles de veces de inferencia de AI de alta calidad diariamente sin pagar un solo centavo. ## Características clave ### 1. Costo cero y叠加 de créditos - **Uso de créditos gratuitos**: Cada cuenta de Cloudflare ofrece 10,000 Neurons de crédito gratuito diario. Este proyecto admite hasta 5 cuentas superpuestas, lo que equivale a 50,000 Neurons diarios. - **Ejecución gratuita de modelos de alto rendimiento**: Mediante la叠加 de créditos, los usuarios pueden ejecutar aproximadamente 150 veces al día el modelo de bandera `qwen3.8-27b` (índice de inteligencia AA 52, nivel superior al 6% mundial), o varios miles de veces modelos más ligeros como `qwen3-30b-a3b-fp8`. ### 2. Rotación inteligente de varias cuentas - **Rotación por intervalos de tiempo**: Cambio automático de cuenta preferida cada 10 minutos para garantizar un consumo uniforme de créditos y evitar que una sola cuenta se agote demasiado pronto. - **Diseño sin estado**: Adopta un algoritmo de intervalo de tiempo en lugar de un contador en memoria, lo que se adapta al despliegue en entornos Serverless como Vercel sin necesidad de compartir estado. ### 3. Enrutamiento con percepción de costos y interrupción escalonada - **Sistema de niveles**: Los modelos se abstraen en tres niveles: `fast` (predeterminado, bajo costo), `eco` (económico) y `smart` (alto rendimiento, alto costo). De forma predeterminada, se enruta al nivel `fast` más económico para ahorrar créditos; los usuarios pueden especificar manualmente el nivel `smart` para tareas de inferencia complejas. - **Interrupción escalonada**: Se implementan diferentes estrategias de enfriamiento para diferentes tipos de errores (agotamiento de créditos, limitación de velocidad, errores de red, etc.). Por ejemplo, después de agotar los créditos, se adopta una “recuperación de sonda” que reintenta automáticamente una vez por hora; una vez que los créditos de Cloudflare se restablecen (puede haber un retraso), la pasarela puede restaurar automáticamente el servicio. - **Enrutamiento estratificado de solicitudes grandes**: Calcula automáticamente el límite superior de solicitud según la ventana de contexto del modelo. Si la solicitud es demasiado grande, primero intenta recortar el mensaje histórico; si aún supera el límite, degrada automáticamente al nivel de modelo con una ventana de contexto más grande. ### 4. Normalización y optimización del protocolo - **Compatible con OpenAI**: Compatible completamente con Chat Completions y Responses API, admite salida en flujo (SSE). - **Compresión de cadena de pensamiento**: Para la serie de modelos Qwen3, se inyecta automáticamente el interruptor suave `/no_think`, lo que reduce significativamente el consumo de tokens de salida de la cadena de pensamiento (en pruebas, de 165 palabras a 2 palabras), sin afectar la función de llamada de herramientas. - **Formato estandarizado**: Procesa automáticamente el campo `reasoning` devuelto por Cloudflare, las llamadas de herramientas duplicadas y los problemas de línea vacía SSE para garantizar que la salida se ajuste estrictamente a las especificaciones de OpenAI. ## Inicio rápido ### 1. Obtener credenciales de Cloudflare 1. Regístrate en [Cloudflare](https://dash.cloudflare.com/sign-up). 2. Crea un token de API: ve a **Mi perfil → Tokens de API → Crear token**, y elige la plantilla "Workers AI". 3. Registra el `ID de cuenta` y el `Token de API`. 4. (Opcional) Regístrate en varias cuentas para叠加 créditos, hasta un máximo de 5. ### 2. Configuración e inicio ```bash cp .env.example .env # Edita .env e ingresa CF_ACCOUNT_ID, CF_API_TOKEN y JY_AI_KEY node server.js ``` El servicio se ejecuta por defecto en `http://localhost:3000`. ### 3. Pruebas ```bash curl http://localhost:3000/api/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer your_secret_key" \ -d '{ "model": "fast", "messages": [{"role": "user", "content": "你好"}] }' ``` ## Sugerencias de despliegue - **Despliegue local**: Ejecuta directamente `node server.js`. - **Despliegue en Vercel (recomendado)**: Haz fork de este repositorio e impórtalo en Vercel; configura las variables de entorno. El proyecto se ha adaptado a funciones Serverless y no requiere una base de datos. ## Preguntas frecuentes - **Retraso en el restablecimiento de créditos**: La documentación oficial de Cloudflare indica que los créditos se restablecen diariamente a las 00:00 UTC, pero en realidad existe un retraso de sincronización. La pasarela maneja este problema automáticamente mediante el mecanismo de “recuperación de sonda” sin necesidad de intervención manual. - **Inicio en frío lento**: El inicio en frío del modelo de Cloudflare puede tardar entre 19 y 25 segundos. La pasarela tiene un tiempo de espera de primer byte (predeterminado 12s); si se supera el tiempo de espera, cambia automáticamente a otro canal o cuenta disponible para mejorar la experiencia del usuario. - **No admite modelos pagos**: Este proyecto solo代理modelos gratuitos/de código abierto en Cloudflare Workers AI y no admite APIs pagos como Claude o GPT-4. ## Resumen **cf-workers-ai-gateway** proporciona a los desarrolladores y entusiastas individuales una solución de acceso a AI eficiente, gratuita y estable. Mediante ingeniosos medios técnicos, resuelve los puntos débiles en la gestión de créditos gratuitos, coordinación de varias cuentas, compatibilidad de protocolos y optimización de costos, lo que la convierte en una herramienta ideal para aprovechar al máximo el valor de Cloudflare Workers AI.