llama.cpp на Windows: запуск без сборки из исходников
Как запустить llama.cpp на Windows на готовых бинарниках: какую сборку выбрать под NVIDIA, AMD или процессор, как стартует llama-server и почему нельзя менять --host на 0.0.0.0.
Половина гайдов по llama.cpp начинается с установки CMake и Visual Studio Build Tools. Это нужно, если ты собираешься править код движка. Чтобы просто запустить модель, компилятор не нужен: разработчики выкладывают готовые сборки под Windows на каждый билд.
Дальше короткий путь до работающей модели и одна настройка, на которой легко открыть её всему интернету.
Какую сборку скачивать
На странице релизов лежат архивы вида llama-b10276-bin-win-<вариант>-x64.zip, где число —
номер билда. Билды выходят часто, так что бери верхний.
Вариантов под Windows сейчас девять, и выбор зависит от того, на чём ты собираешься считать:
| Железо | Архив |
|---|---|
| NVIDIA | cuda-12.4 или cuda-13.3 |
| AMD Radeon | hip-radeon |
| Любая видеокарта, включая встроенную | vulkan |
| Только процессор | cpu |
| Ноутбук на ARM (Snapdragon X) | arm64 |
Отдельно лежат архивы с библиотеками CUDA runtime для версий 12.4 и 13.3. Если ты берёшь
CUDA-сборку и у тебя не установлен CUDA Toolkit, распакуй такой архив в ту же папку — иначе
llama-server.exe не запустится и пожалуется на отсутствующие DLL.
Если сомневаешься между CUDA и Vulkan, начни с Vulkan. Он работает почти на любой видеокарте, включая встроенную графику, и не требует ничего доустанавливать. Разница в скорости на NVIDIA обычно в пользу CUDA, но сначала стоит убедиться, что всё вообще заводится.
Архив просто распаковывается в любую папку. Установщика нет, в реестр ничего не пишется, удаляется всё удалением папки.
Что внутри архива
Два файла, которые нужны на практике:
llama-cli.exe— разовый запуск в консоли: задал вопрос, получил ответ.llama-server.exe— поднимает локальный сервер с веб-интерфейсом и OpenAI-совместимым API.
Второй удобнее почти всегда. Он даёт браузерный чат и одновременно адрес, к которому можно подключить сторонние программы.
Запуск
Модель нужна отдельно — это .gguf-файл, скачанный, например, с Hugging Face. Про выбор
квантизации есть разбор формата GGUF, про требования к памяти —
статья о видеокартах.
Дальше в командной строке из папки со сборкой:
llama-server.exe -m C:\models\qwen3-8b-q4_k_m.gguf --port 8080
Открывай http://127.0.0.1:8080 — там встроенный веб-интерфейс. По умолчанию сервер слушает
только 127.0.0.1, то есть доступен исключительно с этого компьютера.
Полезные ключи на старте:
-ngl N— сколько слоёв модели отдать видеокарте. Если видеопамяти мало, часть слоёв останется на процессоре и генерация замедлится.-c N— размер контекста в токенах. Больше контекст — больше памяти.--jinja— включает вызов функций в стиле OpenAI. Понадобится, если планируешь работать с инструментами.
Настройка, на которой ошибаются
В инструкциях иногда встречается совет заменить адрес на --host 0.0.0.0, чтобы «сервер
заработал». Он действительно заработает — и станет доступен всем, кто может достучаться до
твоего компьютера по сети.
Аутентификации у llama-server по умолчанию нет. Открытый наружу порт означает, что чужой
человек сможет отправлять запросы к твоей модели, тратить твоё железо и читать ответы. Если
роутер пробрасывает порты, а компьютер смотрит в интернет напрямую, это заканчивается ровно
так, как звучит.
Значение 127.0.0.1 стоит по умолчанию не случайно. Менять его есть смысл только осознанно и
вместе с ограничением доступа: файрвол, VPN или обратный прокси с паролем.
Когда что-то не работает
Не запускается, ошибка про DLL. Не хватает CUDA runtime — распакуй соответствующий архив рядом.
Запустилось, но генерирует медленно. Скорее всего, модель считается на процессоре.
Проверь, что скачал сборку под свою видеокарту, и добавь -ngl с большим числом.
Не хватает памяти. Бери квантизацию поменьше: с Q5 спустись на Q4_K_M, при
необходимости ниже.
Модель отвечает, но путается в длинных задачах. Дело обычно не в движке, а в размере модели и контекста.
Стоит ли оно того
llama.cpp даёт полный контроль и новые архитектуры моделей в день их появления. Плата за это — ручной выбор сборки, ключи запуска и отсутствие интерфейса за пределами простого чата в браузере. Чем это отличается от Ollama и LM Studio, разобрано отдельно.
И стоит честно ответить себе на вопрос, зачем ты это ставишь. Если интересен сам инференс —
всё правильно, дальше только глубже. Если же цель была «пусть ИИ разберёт папку с
документами» или «пусть починит тест в проекте», то llama-server эту задачу не решает: он
отдаёт текст, а дальше нужен клиент, который умеет читать файлы, запускать команды и
проверять результат.
Дока — как раз такой клиент, только собранный заранее. Локальная модель ставится из интерфейса без выбора сборок и ключей, а работа идёт с файлами, терминалом и MCP-серверами. Если возиться с движком не хочется, скачай и переходи сразу к задаче.