Все статьи
5 августа 2026 г.·4 мин чтения

llama.cpp на Windows: запуск без сборки из исходников

Как запустить llama.cpp на Windows на готовых бинарниках: какую сборку выбрать под NVIDIA, AMD или процессор, как стартует llama-server и почему нельзя менять --host на 0.0.0.0.

Половина гайдов по llama.cpp начинается с установки CMake и Visual Studio Build Tools. Это нужно, если ты собираешься править код движка. Чтобы просто запустить модель, компилятор не нужен: разработчики выкладывают готовые сборки под Windows на каждый билд.

Дальше короткий путь до работающей модели и одна настройка, на которой легко открыть её всему интернету.

Какую сборку скачивать

На странице релизов лежат архивы вида llama-b10276-bin-win-<вариант>-x64.zip, где число — номер билда. Билды выходят часто, так что бери верхний.

Вариантов под Windows сейчас девять, и выбор зависит от того, на чём ты собираешься считать:

ЖелезоАрхив
NVIDIAcuda-12.4 или cuda-13.3
AMD Radeonhip-radeon
Любая видеокарта, включая встроеннуюvulkan
Только процессорcpu
Ноутбук на ARM (Snapdragon X)arm64

Отдельно лежат архивы с библиотеками CUDA runtime для версий 12.4 и 13.3. Если ты берёшь CUDA-сборку и у тебя не установлен CUDA Toolkit, распакуй такой архив в ту же папку — иначе llama-server.exe не запустится и пожалуется на отсутствующие DLL.

Если сомневаешься между CUDA и Vulkan, начни с Vulkan. Он работает почти на любой видеокарте, включая встроенную графику, и не требует ничего доустанавливать. Разница в скорости на NVIDIA обычно в пользу CUDA, но сначала стоит убедиться, что всё вообще заводится.

Архив просто распаковывается в любую папку. Установщика нет, в реестр ничего не пишется, удаляется всё удалением папки.

Что внутри архива

Два файла, которые нужны на практике:

  • llama-cli.exe — разовый запуск в консоли: задал вопрос, получил ответ.
  • llama-server.exe — поднимает локальный сервер с веб-интерфейсом и OpenAI-совместимым API.

Второй удобнее почти всегда. Он даёт браузерный чат и одновременно адрес, к которому можно подключить сторонние программы.

Запуск

Модель нужна отдельно — это .gguf-файл, скачанный, например, с Hugging Face. Про выбор квантизации есть разбор формата GGUF, про требования к памяти — статья о видеокартах.

Дальше в командной строке из папки со сборкой:

llama-server.exe -m C:\models\qwen3-8b-q4_k_m.gguf --port 8080

Открывай http://127.0.0.1:8080 — там встроенный веб-интерфейс. По умолчанию сервер слушает только 127.0.0.1, то есть доступен исключительно с этого компьютера.

Полезные ключи на старте:

  • -ngl N — сколько слоёв модели отдать видеокарте. Если видеопамяти мало, часть слоёв останется на процессоре и генерация замедлится.
  • -c N — размер контекста в токенах. Больше контекст — больше памяти.
  • --jinja — включает вызов функций в стиле OpenAI. Понадобится, если планируешь работать с инструментами.

Настройка, на которой ошибаются

В инструкциях иногда встречается совет заменить адрес на --host 0.0.0.0, чтобы «сервер заработал». Он действительно заработает — и станет доступен всем, кто может достучаться до твоего компьютера по сети.

Аутентификации у llama-server по умолчанию нет. Открытый наружу порт означает, что чужой человек сможет отправлять запросы к твоей модели, тратить твоё железо и читать ответы. Если роутер пробрасывает порты, а компьютер смотрит в интернет напрямую, это заканчивается ровно так, как звучит.

Значение 127.0.0.1 стоит по умолчанию не случайно. Менять его есть смысл только осознанно и вместе с ограничением доступа: файрвол, VPN или обратный прокси с паролем.

Когда что-то не работает

Не запускается, ошибка про DLL. Не хватает CUDA runtime — распакуй соответствующий архив рядом.

Запустилось, но генерирует медленно. Скорее всего, модель считается на процессоре. Проверь, что скачал сборку под свою видеокарту, и добавь -ngl с большим числом.

Не хватает памяти. Бери квантизацию поменьше: с Q5 спустись на Q4_K_M, при необходимости ниже.

Модель отвечает, но путается в длинных задачах. Дело обычно не в движке, а в размере модели и контекста.

Стоит ли оно того

llama.cpp даёт полный контроль и новые архитектуры моделей в день их появления. Плата за это — ручной выбор сборки, ключи запуска и отсутствие интерфейса за пределами простого чата в браузере. Чем это отличается от Ollama и LM Studio, разобрано отдельно.

И стоит честно ответить себе на вопрос, зачем ты это ставишь. Если интересен сам инференс — всё правильно, дальше только глубже. Если же цель была «пусть ИИ разберёт папку с документами» или «пусть починит тест в проекте», то llama-server эту задачу не решает: он отдаёт текст, а дальше нужен клиент, который умеет читать файлы, запускать команды и проверять результат.

Дока — как раз такой клиент, только собранный заранее. Локальная модель ставится из интерфейса без выбора сборок и ключей, а работа идёт с файлами, терминалом и MCP-серверами. Если возиться с движком не хочется, скачай и переходи сразу к задаче.