Sobre el proyecto

TurboFieldfare es un runtime de inferencia específico para un modelo, escrito en Swift y Metal, para ejecutar el modelo Gemma 4 26B-A4B ajustado por instrucciones en Macs con Apple Silicon, incluyendo máquinas de 8 GB. En lugar de cargar el checkpoint completo de ~14.3 GB, mantiene el núcleo compartido y la caché KV en FP16 residentes (aproximadamente 2 GB de pesos más una caché KV de 4K) y transmite solo los expertos necesarios por token desde el SSD a través de una caché de expertos limitada. Lo que incluye: - Una biblioteca Swift con kernels Metal personalizados para GEMV cuantizado, atención, MoE, normalización, RoPE, muestreo y fusiones. - Una app nativa de SwiftUI/AppKit con un servicio de decodificación local hermano. - Una interfaz de línea de comandos para chat por instrucciones y finalización en bruto. - Un instalador/reempaquetador de transmisión que obtiene rangos de bytes fijos de Hugging Face y escribe el diseño .gturbo directamente, además de verificación de instalación y soporte de reanudación. - Un servidor experimental de Chat Completions compatible con OpenAI en bucle local, que admite transmisión, declaraciones de herramientas-función y reutilización de prefijo único; no tiene autenticación remota ni TLS. - Entrada de imagen opcional mediante un paquete complementario de visión instalado por separado (aproximadamente 1.1 GB), que requiere hardware M2 o más nuevo; la inferencia solo de texto funciona en M1. Los pesos son MLX afines de 4 bits (grupo 64) con un enrutador de 8 bits. El prellenado del prompt se divide en fragmentos (hasta 128 tokens) para que los expertos obtenidos sirvan a múltiples filas, seguido de generación token por token. El README informa una decodificación medida de 5.1-6.3 tok/s en una MacBook Air M2 de 8 GB y 31-35 tok/s en un M5 Pro de 24 GB, señalando que estos dependen de la longitud del prompt, el estado de la caché de páginas y el hardware. Los requisitos son macOS 26 con Metal 4, Xcode 26 y Swift 6.2 o más nuevo, solo arm64. Audio y video están fuera de alcance. El código fuente es Apache 2.0; los pesos del modelo se descargan por separado bajo sus propios términos, y el proyecto declara ser independiente de Google.