MLX или GGUF на Mac: в каком формате запускать локальную модель
Чем формат MLX отличается от GGUF на Apple Silicon, почему mlx-lm не открывает .gguf, что выбрать под свою задачу на MacBook и как единая память влияет на размер модели.
На Apple Silicon у локальной модели два пути. Можно взять привычный .gguf — тот же файл,
что работает на Windows и Linux. А можно взять версию в формате MLX, собранную специально под
чипы Apple.
Обычно спрашивают, что быстрее. Вопрос «что ты потеряешь, выбрав один из них» практичнее, и ответ на него менее очевиден.
Что такое MLX
MLX — фреймворк Apple для вычислений на своих чипах. Поверх него есть пакет mlx-lm,
который разработчики описывают прямо: генерация текста и дообучение языковых моделей на
Apple Silicon.
Ключевое слово — Apple Silicon. MLX существует только для Mac на чипах M-серии. На Intel-Mac, на Windows и на Linux его нет и не будет: он завязан на архитектуру, где процессор, видеоядро и память живут на одном кристалле.
Модели берутся с Hugging Face, в основном из организации mlx-community — там лежат
конвертированные и квантованные варианты популярных моделей. Квантизацию mlx-lm умеет и
сам, включая привычные 4 бита.
Что такое GGUF
GGUF — формат движка llama.cpp, на котором стоит почти вся локальная экосистема: Ollama,
LM Studio, десктопные приложения. Один файл с моделью, метки квантизации вида Q4_K_M,
запуск на чём угодно — процессор, NVIDIA, AMD, Apple.
Подробный разбор формата и того, какую квантизацию брать, есть отдельно.
Главное различие на практике
Форматы не взаимозаменяемы. mlx-lm не открывает .gguf-файлы. Это разные способы
хранить веса, и конвертация — отдельная операция, а не переключатель в настройках. Если
модель есть только в GGUF, через MLX ты её не запустишь, и наоборот.
Отсюда первое практическое следствие: выбор формата — это выбор доступного каталога моделей. GGUF-версия появляется почти у всего заметного и почти сразу. MLX-версии выкладывает сообщество, и по редким моделям её может не быть вовсе или она появится позже.
Что до скорости
MLX собран под конкретное железо и работает с единой памятью Apple напрямую, поэтому на одинаковой модели он часто оказывается быстрее GGUF на том же Mac. Но «часто» — не «всегда»: результат зависит от модели, квантизации, длины контекста и того, что ещё занимает память.
Разумнее не верить чужим цифрам, а померить свои. Возьми одну модель в обоих форматах, один и тот же промпт и сравни токены в секунду. LM Studio на Apple Silicon поддерживает оба движка, так что сравнение делается в одном приложении без бубна.
Ощутимая разница чаще возникает не между форматами, а между «модель поместилась в память» и «не поместилась». Как только начинается свопинг, любые преимущества движка перестают иметь значение.
Сколько памяти закладывать
На Apple Silicon память общая: одни и те же гигабайты делят система, приложения и модель. Отдельной видеопамяти нет, и это одновременно плюс и ограничение — модели доступно много, но она конкурирует со всем остальным.
Практическое правило то же, что и везде: смотри на размер файла модели и оставляй запас на
контекст и на систему. Для больших моделей в документации mlx-lm есть отдельная оговорка —
может понадобиться поднять системный лимит «прошитой» памяти, и часть возможностей требует
macOS 15.0 или новее.
Если модель в память не влезает, спускайся по квантизации, а не ищи более быстрый движок. Общие ориентиры по объёмам — в статье про железо для локальных моделей.
Что выбрать
| Ситуация | Формат |
|---|---|
| Нужна конкретная свежая модель, MLX-версии ещё нет | GGUF |
| Работаешь только на Mac и выжимаешь скорость | MLX |
| Хочешь один файл на все свои машины | GGUF |
| Дообучаешь модель на своих данных прямо на Mac | MLX |
| Просто нужно, чтобы работало | GGUF |
Последняя строка не шутка. GGUF — формат по умолчанию для локального ИИ: его понимают все инструменты, по нему есть документация и готовые ответы почти на любую ошибку. MLX даёт выигрыш на своём железе, но это выбор человека, который готов иногда конвертировать модели сам и ждать, пока сообщество выложит нужную версию.
Где формат перестаёт быть главным вопросом
Выбор между MLX и GGUF имеет смысл, пока задача — запустить модель. Как только речь заходит о работе, вопрос смещается: важнее становится не формат весов, а что вокруг модели умеет инструмент.
Дока работает на Mac и использует GGUF — как раз потому, что это формат, у которого всегда есть нужная модель. Скачивается она внутри приложения, а дальше начинается то, ради чего всё затевалось: агент читает и правит файлы, работает в терминале, подключает MCP-серверы и ведёт задачу до результата.
Полезное упражнение для проверки: засеки, сколько времени в твоей типичной задаче уходит на генерацию, а сколько — на копирование результата из чата в файлы и обратно. У большинства второе больше. Оптимизировать при этом принято первое. Скачай и посмотри, как меняются пропорции, когда переносить руками ничего не нужно.