Все статьи
5 августа 2026 г.·4 мин чтения

Нейросеть, которая управляет компьютером: как это работает на самом деле

Чем computer use отличается от агента с доступом к файлам и терминалу, почему управление мышью требует облака и скриншотов экрана, и какой вариант работает локально уже сейчас.

Запрос «нейросеть, которая управляет компьютером» обычно означает одну картинку: модель сама двигает мышью, кликает по кнопкам и делает за тебя рутину в программах.

Такие системы существуют. Но за одной формулировкой прячутся два очень разных подхода, и они отличаются и по надёжности, и по тому, что видит о тебе чужой сервер. Разница важнее, чем кажется на первый взгляд.

Подход первый: смотреть на экран

Он называется computer use. Модель получает скриншот экрана, определяет на нём элементы интерфейса и выдаёт действия: щёлкнуть по таким-то координатам, ввести текст, прокрутить. Дальше цикл повторяется — новый скриншот, новое действие.

Именно так работают агентские режимы облачных ассистентов и открытые проекты вроде UI-TARS от ByteDance или OmniParser от Microsoft, который разбирает скриншот на элементы для модели.

У подхода есть сильная сторона: он работает с любой программой, даже если у неё нет никакого API. Модель видит то же, что человек.

Слабых больше, и первая касается приватности. Скриншот экрана — это всё, что на экране: открытая почта, мессенджер, реквизиты, чужие персональные данные. У облачного решения каждый такой кадр уходит на сервер поставщика, и происходит это десятки раз за одну задачу. Локальные варианты вроде UI-TARS Desktop умеют работать со своей моделью, и тогда кадры остаются у тебя, но требования к железу выше обычных: это мультимодальная модель, которой нужно ещё и разбирать изображения.

Вторая проблема — хрупкость. Клик по координатам ломается от чего угодно: другое разрешение, сдвинувшаяся кнопка, всплывшее поверх уведомление. Обидно тут не то, что действие не выполнится, а то, что оно выполнится не там, и модель об этом не узнает.

Третья скучная, но решающая на практике: каждый шаг требует нового скриншота, его разбора и решения. Задача из двадцати действий занимает минуты вместо секунд.

Подход второй: работать через инструменты

Здесь модель не смотрит на экран, а получает прямой доступ к тому, что за экраном стоит: файловой системе, терминалу, программным интерфейсам приложений.

Вместо «найди кнопку сохранения и щёлкни по ней» — «запиши файл». Вместо «открой почту и прочитай последнее письмо» — обращение к почте через MCP-сервер. Вместо «нажми на кнопку запуска тестов» — выполнение команды в терминале.

Разница получается принципиальной. Действие либо выполнено, либо вернуло ошибку, которую видно. Нет промаха мимо кнопки и нет двусмысленности. Работает это быстрее на порядок, и в контекст модели попадает только то, что нужно для задачи, а не весь твой экран.

Цена — программа должна быть доступна через файлы, команды или API. Древнюю бухгалтерскую софтину без интерфейса так не поавтоматизируешь, а через скриншоты — теоретически да.

Полезная проверка перед выбором подхода: можно ли твою задачу описать словами «прочитай файлы, сделай, запиши результат»? Если да, второй путь надёжнее. Если задача звучит как «кликни в этом окне», иногда деваться некуда.

Что из этого работает локально

Оба подхода работают, но по-разному.

Computer use локально требует мультимодальной модели, которая понимает изображения, и приличной видеокарты. Открытые проекты в этой области заметно продвинулись, но это всё ещё территория экспериментов: ошибки частые, настройка нетривиальная.

Работа через инструменты локально — обычный сценарий уже сейчас, потому что здесь не нужно понимать картинки. Модель работает с текстом: путями к файлам, содержимым, выводом команд. Локальные модели с этим справляются, если хватает контекста и размер модели адекватен задаче.

Что делает Дока

Скажем прямо, чтобы не создавать ложных ожиданий: Дока не управляет мышью и не кликает по окнам. Она работает вторым способом — с файлами, терминалом и подключёнными инструментами.

На практике это закрывает большую часть того, ради чего люди ищут «нейросеть, управляющую компьютером»: разобрать папку и переименовать файлы по содержимому, собрать сводку из выгрузок, найти и починить падающий тест, подготовить документ по шаблону, сделать это по расписанию без твоего участия. Модель при этом может быть локальной, и тогда ни файлы, ни содержимое экрана никуда не уходят.

Чего Дока не сделает: не нажмёт кнопку в чужой программе без API, не пройдёт капчу, не поработает за тебя в интерфейсе, который существует только как окно.

Чему не стоит доверять агенту

Независимо от подхода. Программа, которой разрешено выполнять действия на твоей машине, может выполнить не то — из-за неверно понятой формулировки или из-за того, что модель ошиблась.

Несколько правил, которые стоит завести сразу:

  • начинай с обратимых задач: копирование, черновики, отдельная папка вместо рабочей;
  • держи подтверждение человеком на всём, что удаляет и перезаписывает;
  • не давай доступ к секретам и ключам, если задача этого не требует;
  • проверяй результат на маленьком объёме, прежде чем запускать на всей папке.

Подробнее про ограничение доступа — в статье про подключение MCP-сервера.

Короткий вывод

Управление мышью выглядит эффектнее, а работает хуже: медленнее, менее надёжно и с передачей содержимого экрана наружу, если модель облачная. Доступ к файлам и командам выглядит скучнее и решает те же задачи предсказуемо.

Если хочется посмотреть, как это ощущается на своих задачах, скачай Доку и начни с чего-нибудь обратимого — например, попроси разобрать копию папки с документами.