Об этом проекте
MoziAI-35B-V3.8 — это локально разворачиваемая открытая мультимодальная большая языковая модель, разработанная командой Чэнь Юмо. Она построена на базе Ornith-1.5-35B-A3B (архитектура Qwen3.5/3.6-35B-A3B, MoE с 256 маршрутизирующими экспертами плюс 1 общий эксперт, 8 экспертов активны на токен) и распространяется в виде GGUF-файла для использования с llama.cpp, Ollama, LM Studio и Jan.
Ключевая особенность — собственное гибридное квантование MoziSmartBit, которое сжимает модель MoE с 35B параметрами примерно до 15,9 ГБ — примерно на 30% меньше, чем стандартная сборка Q4_K_M (~22 ГБ), сохраняя при этом, как сообщается, около 99% точности FP16. Модель поддерживает контекстное окно 256K (262 144 токена), мультимодальное зрение через отдельный файл проектора mmproj и нативный вызов инструментов. В README сообщается о скорости вывода 140+ ток/с на GPU AMD R9700 и 70+ ток/с на iGPU AMD MAX+395 при включённом спекулятивном декодировании.
Описываются два механизма рассуждений. Первый — динамическая семимерная структура мышления, которая расширяется от двухмерного быстрого ответа для простых вопросов до полного семимерного глубокого рассуждения для сложных задач разработки и стратегии, активируемая маркером moziAI-Think. Второй — итерационный механизм Agent LOOP, выполняющий двухраундовый цикл «выполнение-затем-проверка» для сложных задач и автоматически пропускаемый для простых запросов. Оба внедряются через пользовательский Jinja-шаблон чата, который должен быть загружен вместе с весами модели.
Модель позиционируется как вертикальный финансовый ассистент с задокументированными возможностями анализа рынка, интерпретации отчётности и исследований, проверки рисков и соответствия требованиям, разработки количественных стратегий и подключаемого вызова инструментов для доступа к живым рыночным данным, базам данных и поиску исследований. Также заявлены общее программирование, написание текстов и многоязычная поддержка 201 языка, а также режим вывода без цензуры, унаследованный от базовой модели.
Для развёртывания требуются три файла: основной GGUF-файл модели в корне репозитория, проектор зрения в mmproj/35B/ и шаблон чата в V3.8/. В README приведены минимальная и полная команды запуска llama-server, рекомендуемые параметры сэмплирования (temperature 0.6–0.8, top_p 0.95, top_k 20, min_p 0.024) и рекомендации по VRAM — 20 ГБ для контекста 150K со зрением, 24 ГБ для полного 256K со зрением и 32 ГБ+ для максимального запаса. Развёртывание в Ollama показано через Modelfile, хотя в README отмечается, что поддержка mmproj и шаблонов чата в Ollama ограничена по сравнению с llama.cpp.
Приведены бенчмарки против Ornith-1.0-35B-A3B, Qwen3.6-35B-A3B, Gemma-4-31B, Muse-Glimmer-30B и Qwen3.5-397B в наборах задач по программированию (Terminal-Bench, варианты SWE-bench, NL2Repo), рассуждениям (HLE, GPQA Diamond) и агентным задачам (MCP-Atlas, Toolathlon, WideSearch, BrowseComp, ClawEval). Лицензия — собственная MoziAI Model License с компонентами Apache-2.0 от Qwen3.5/3.6 и Gemma 4; заявлено, что модель бесплатна для коммерческого использования.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.