Все статьи
5 августа 2026 г.·4 мин чтения

MLX или GGUF на Mac: в каком формате запускать локальную модель

Чем формат MLX отличается от GGUF на Apple Silicon, почему mlx-lm не открывает .gguf, что выбрать под свою задачу на MacBook и как единая память влияет на размер модели.

На Apple Silicon у локальной модели два пути. Можно взять привычный .gguf — тот же файл, что работает на Windows и Linux. А можно взять версию в формате MLX, собранную специально под чипы Apple.

Обычно спрашивают, что быстрее. Вопрос «что ты потеряешь, выбрав один из них» практичнее, и ответ на него менее очевиден.

Что такое MLX

MLX — фреймворк Apple для вычислений на своих чипах. Поверх него есть пакет mlx-lm, который разработчики описывают прямо: генерация текста и дообучение языковых моделей на Apple Silicon.

Ключевое слово — Apple Silicon. MLX существует только для Mac на чипах M-серии. На Intel-Mac, на Windows и на Linux его нет и не будет: он завязан на архитектуру, где процессор, видеоядро и память живут на одном кристалле.

Модели берутся с Hugging Face, в основном из организации mlx-community — там лежат конвертированные и квантованные варианты популярных моделей. Квантизацию mlx-lm умеет и сам, включая привычные 4 бита.

Что такое GGUF

GGUF — формат движка llama.cpp, на котором стоит почти вся локальная экосистема: Ollama, LM Studio, десктопные приложения. Один файл с моделью, метки квантизации вида Q4_K_M, запуск на чём угодно — процессор, NVIDIA, AMD, Apple.

Подробный разбор формата и того, какую квантизацию брать, есть отдельно.

Главное различие на практике

Форматы не взаимозаменяемы. mlx-lm не открывает .gguf-файлы. Это разные способы хранить веса, и конвертация — отдельная операция, а не переключатель в настройках. Если модель есть только в GGUF, через MLX ты её не запустишь, и наоборот.

Отсюда первое практическое следствие: выбор формата — это выбор доступного каталога моделей. GGUF-версия появляется почти у всего заметного и почти сразу. MLX-версии выкладывает сообщество, и по редким моделям её может не быть вовсе или она появится позже.

Что до скорости

MLX собран под конкретное железо и работает с единой памятью Apple напрямую, поэтому на одинаковой модели он часто оказывается быстрее GGUF на том же Mac. Но «часто» — не «всегда»: результат зависит от модели, квантизации, длины контекста и того, что ещё занимает память.

Разумнее не верить чужим цифрам, а померить свои. Возьми одну модель в обоих форматах, один и тот же промпт и сравни токены в секунду. LM Studio на Apple Silicon поддерживает оба движка, так что сравнение делается в одном приложении без бубна.

Ощутимая разница чаще возникает не между форматами, а между «модель поместилась в память» и «не поместилась». Как только начинается свопинг, любые преимущества движка перестают иметь значение.

Сколько памяти закладывать

На Apple Silicon память общая: одни и те же гигабайты делят система, приложения и модель. Отдельной видеопамяти нет, и это одновременно плюс и ограничение — модели доступно много, но она конкурирует со всем остальным.

Практическое правило то же, что и везде: смотри на размер файла модели и оставляй запас на контекст и на систему. Для больших моделей в документации mlx-lm есть отдельная оговорка — может понадобиться поднять системный лимит «прошитой» памяти, и часть возможностей требует macOS 15.0 или новее.

Если модель в память не влезает, спускайся по квантизации, а не ищи более быстрый движок. Общие ориентиры по объёмам — в статье про железо для локальных моделей.

Что выбрать

СитуацияФормат
Нужна конкретная свежая модель, MLX-версии ещё нетGGUF
Работаешь только на Mac и выжимаешь скоростьMLX
Хочешь один файл на все свои машиныGGUF
Дообучаешь модель на своих данных прямо на MacMLX
Просто нужно, чтобы работалоGGUF

Последняя строка не шутка. GGUF — формат по умолчанию для локального ИИ: его понимают все инструменты, по нему есть документация и готовые ответы почти на любую ошибку. MLX даёт выигрыш на своём железе, но это выбор человека, который готов иногда конвертировать модели сам и ждать, пока сообщество выложит нужную версию.

Где формат перестаёт быть главным вопросом

Выбор между MLX и GGUF имеет смысл, пока задача — запустить модель. Как только речь заходит о работе, вопрос смещается: важнее становится не формат весов, а что вокруг модели умеет инструмент.

Дока работает на Mac и использует GGUF — как раз потому, что это формат, у которого всегда есть нужная модель. Скачивается она внутри приложения, а дальше начинается то, ради чего всё затевалось: агент читает и правит файлы, работает в терминале, подключает MCP-серверы и ведёт задачу до результата.

Полезное упражнение для проверки: засеки, сколько времени в твоей типичной задаче уходит на генерацию, а сколько — на копирование результата из чата в файлы и обратно. У большинства второе больше. Оптимизировать при этом принято первое. Скачай и посмотри, как меняются пропорции, когда переносить руками ничего не нужно.