Нейросеть, которая управляет компьютером: как это работает на самом деле
Чем computer use отличается от агента с доступом к файлам и терминалу, почему управление мышью требует облака и скриншотов экрана, и какой вариант работает локально уже сейчас.
Запрос «нейросеть, которая управляет компьютером» обычно означает одну картинку: модель сама двигает мышью, кликает по кнопкам и делает за тебя рутину в программах.
Такие системы существуют. Но за одной формулировкой прячутся два очень разных подхода, и они отличаются и по надёжности, и по тому, что видит о тебе чужой сервер. Разница важнее, чем кажется на первый взгляд.
Подход первый: смотреть на экран
Он называется computer use. Модель получает скриншот экрана, определяет на нём элементы интерфейса и выдаёт действия: щёлкнуть по таким-то координатам, ввести текст, прокрутить. Дальше цикл повторяется — новый скриншот, новое действие.
Именно так работают агентские режимы облачных ассистентов и открытые проекты вроде UI-TARS от ByteDance или OmniParser от Microsoft, который разбирает скриншот на элементы для модели.
У подхода есть сильная сторона: он работает с любой программой, даже если у неё нет никакого API. Модель видит то же, что человек.
Слабых больше, и первая касается приватности. Скриншот экрана — это всё, что на экране: открытая почта, мессенджер, реквизиты, чужие персональные данные. У облачного решения каждый такой кадр уходит на сервер поставщика, и происходит это десятки раз за одну задачу. Локальные варианты вроде UI-TARS Desktop умеют работать со своей моделью, и тогда кадры остаются у тебя, но требования к железу выше обычных: это мультимодальная модель, которой нужно ещё и разбирать изображения.
Вторая проблема — хрупкость. Клик по координатам ломается от чего угодно: другое разрешение, сдвинувшаяся кнопка, всплывшее поверх уведомление. Обидно тут не то, что действие не выполнится, а то, что оно выполнится не там, и модель об этом не узнает.
Третья скучная, но решающая на практике: каждый шаг требует нового скриншота, его разбора и решения. Задача из двадцати действий занимает минуты вместо секунд.
Подход второй: работать через инструменты
Здесь модель не смотрит на экран, а получает прямой доступ к тому, что за экраном стоит: файловой системе, терминалу, программным интерфейсам приложений.
Вместо «найди кнопку сохранения и щёлкни по ней» — «запиши файл». Вместо «открой почту и прочитай последнее письмо» — обращение к почте через MCP-сервер. Вместо «нажми на кнопку запуска тестов» — выполнение команды в терминале.
Разница получается принципиальной. Действие либо выполнено, либо вернуло ошибку, которую видно. Нет промаха мимо кнопки и нет двусмысленности. Работает это быстрее на порядок, и в контекст модели попадает только то, что нужно для задачи, а не весь твой экран.
Цена — программа должна быть доступна через файлы, команды или API. Древнюю бухгалтерскую софтину без интерфейса так не поавтоматизируешь, а через скриншоты — теоретически да.
Полезная проверка перед выбором подхода: можно ли твою задачу описать словами «прочитай файлы, сделай, запиши результат»? Если да, второй путь надёжнее. Если задача звучит как «кликни в этом окне», иногда деваться некуда.
Что из этого работает локально
Оба подхода работают, но по-разному.
Computer use локально требует мультимодальной модели, которая понимает изображения, и приличной видеокарты. Открытые проекты в этой области заметно продвинулись, но это всё ещё территория экспериментов: ошибки частые, настройка нетривиальная.
Работа через инструменты локально — обычный сценарий уже сейчас, потому что здесь не нужно понимать картинки. Модель работает с текстом: путями к файлам, содержимым, выводом команд. Локальные модели с этим справляются, если хватает контекста и размер модели адекватен задаче.
Что делает Дока
Скажем прямо, чтобы не создавать ложных ожиданий: Дока не управляет мышью и не кликает по окнам. Она работает вторым способом — с файлами, терминалом и подключёнными инструментами.
На практике это закрывает большую часть того, ради чего люди ищут «нейросеть, управляющую компьютером»: разобрать папку и переименовать файлы по содержимому, собрать сводку из выгрузок, найти и починить падающий тест, подготовить документ по шаблону, сделать это по расписанию без твоего участия. Модель при этом может быть локальной, и тогда ни файлы, ни содержимое экрана никуда не уходят.
Чего Дока не сделает: не нажмёт кнопку в чужой программе без API, не пройдёт капчу, не поработает за тебя в интерфейсе, который существует только как окно.
Чему не стоит доверять агенту
Независимо от подхода. Программа, которой разрешено выполнять действия на твоей машине, может выполнить не то — из-за неверно понятой формулировки или из-за того, что модель ошиблась.
Несколько правил, которые стоит завести сразу:
- начинай с обратимых задач: копирование, черновики, отдельная папка вместо рабочей;
- держи подтверждение человеком на всём, что удаляет и перезаписывает;
- не давай доступ к секретам и ключам, если задача этого не требует;
- проверяй результат на маленьком объёме, прежде чем запускать на всей папке.
Подробнее про ограничение доступа — в статье про подключение MCP-сервера.
Короткий вывод
Управление мышью выглядит эффектнее, а работает хуже: медленнее, менее надёжно и с передачей содержимого экрана наружу, если модель облачная. Доступ к файлам и командам выглядит скучнее и решает те же задачи предсказуемо.
Если хочется посмотреть, как это ощущается на своих задачах, скачай Доку и начни с чего-нибудь обратимого — например, попроси разобрать копию папки с документами.