Ollama или LM Studio: что выбрать для локальной модели
Чем Ollama отличается от LM Studio на практике: интерфейс против демона, адреса локального API, требования к железу, лицензии и типичные ошибки загрузки модели.
Вопрос «Ollama или LM Studio» звучит так, будто один инструмент быстрее другого. Но оба опираются на один и тот же вычислительный движок, поэтому на одинаковом железе с одинаковой моделью скорость генерации будет сопоставимой. Выбирать приходится по формату работы, а не по производительности.
Коротко о каждом
Ollama — демон с MIT-лицензией. Он висит в фоне, управляется командами в терминале и отдаёт REST API, поверх которого есть OpenAI-совместимый слой. Модели скачиваются командой, настройки поведения описываются в Modelfile.
LM Studio — настольное приложение с интерфейсом: чат, встроенный поиск моделей на Hugging Face, панель настроек загрузки и кнопка запуска локального сервера. Код закрытый, но с 8 июля 2025 года приложение бесплатно и для работы, отдельная лицензия не нужна; платной осталась только Enterprise-редакция с SSO и управлением доступом.
Под капотом у обоих — llama.cpp: Ollama построен на его тензорной библиотеке ggml, LM Studio запускает llama.cpp напрямую, а на Apple Silicon ещё и MLX. Отсюда и сопоставимая скорость.
Адреса, которые нужны на практике
Оба поднимают локальный endpoint, и почти любой клиент подключается к ним как к OpenAI API — меняется только базовый адрес.
| Ollama | LM Studio | |
|---|---|---|
| Базовый URL | http://localhost:11434/v1 | http://localhost:1234/v1 |
| Ключ API | обязателен формально, значение игнорируется | для локальной работы не нужен |
| Эндпоинты | /chat/completions, /completions, /models, /models/{model}, /embeddings, /responses | /chat/completions, /completions, /models, /embeddings, /responses |
У Ollama в OpenAI-слое есть заметные пробелы: не поддерживаются logprobs, ссылки на
изображения (только base64), tool_choice и logit_bias. Если клиент падает на непонятной
ошибке параметра, стоит сверяться с документацией, а не подбирать значения наугад.
Оба варианта подходят, чтобы подставить локальную модель вместо облачного API — как это устроено, разобрано в отдельной статье.
Требования к железу
Здесь разница уже существенная. LM Studio ограничивает список платформ:
- macOS — только Apple Silicon (M1 и новее) и macOS 14.0 или свежее; Intel-маки не поддерживаются;
- Windows — x64 с инструкциями AVX2 либо ARM (Snapdragon X Elite);
- Linux — x64 и ARM64, поставляется как AppImage, Ubuntu 20.04 или новее;
- рекомендуется 16 ГБ оперативной памяти и минимум 4 ГБ видеопамяти.
Ollama таких ограничений по платформе не ставит: официально поддерживаются macOS, Windows и Linux, а поскольку это фоновый сервис, её спокойно запускают на сервере или в контейнере. Требования к памяти определяет не она, а модель: разбор того, что и на чём поедет, есть в статье про выбор видеокарты.
Кому что удобнее
LM Studio стоит брать, если нужно сравнивать модели, крутить параметры загрузки и видеть результат сразу. Встроенный поиск по Hugging Face избавляет от ручного скачивания файлов, а настройки контекста и выгрузки слоёв на GPU лежат в интерфейсе, а не в командах. Плюс приложение умеет быть MCP-хостом — модель получает инструменты без отдельной обвязки.
Ollama стоит брать, если модель нужна как сервис: для скриптов, CI, контейнера или нескольких клиентов на одной машине. Демон легче графического приложения и не требует открытого окна. Большинство агентов и редакторов знают про Ollama и предлагают её в списке провайдеров — например, OpenCode или связка с n8n.
Держать оба тоже нормально: порты разные, конфликта не будет. Схема, которая обычно складывается сама, — LM Studio для экспериментов и выбора модели, Ollama для того, что должно работать в фоне.
Ни один из них не делает работу приватной сам по себе. Локальным остаётся то, что считается у тебя. Как только в связке появляется облачная модель, веб-поиск или MCP-сервер к внешнему сервису, соответствующие данные уходят провайдеру.
Частые ошибки загрузки модели
Обе программы спотыкаются примерно об одно и то же, и почти всегда дело не в них.
Модель не загружается («failed to load model»). Чаще всего не хватает памяти под
выбранную квантизацию или под заданную длину контекста. Уменьши контекст, возьми вариант
поменьше или квантизацию попроще. Устройство файлов и обозначения вроде Q4_K_M разобраны в
статье про формат GGUF.
Видеокарта не используется. Проверь, что установлен runtime под твою карту (CUDA для NVIDIA, ROCm для AMD) и что модель действительно выгружается на GPU, а не считается на процессоре. На ноутбуках с двумя видеоядрами приложение иногда цепляется за встроенное.
Модель отвечает, но не вызывает инструменты. Это не ошибка запуска, а ограничение самой модели: не всякая умеет tool calling надёжно. Маленькая модель может уверенно писать текст и при этом путать аргументы вызовов.
Список моделей пустой. В LM Studio — не та папка моделей в настройках, в Ollama — модель скачана в другого пользователя или другой каталог, чем тот, под которым запущен демон.
А если нужен не сервер, а результат
И Ollama, и LM Studio решают одну задачу: запустить модель и отдать её по локальному адресу. Всё остальное — чтение файлов, правки в проекте, запуск команд, работа с документами — ложится на клиент, которого ещё надо выбрать и настроить.
Дока закрывает эту часть сразу: локальная GGUF-модель скачивается внутри приложения, а агент работает с файлами, терминалом, таблицами и MCP-серверами в одном окне. Если тебе интересно собирать связку из отдельных частей, Ollama и LM Studio дают больше контроля. Если нужен готовый рабочий инструмент, скачай Доку и сравни на одной и той же задаче.