R&D-кейс · AIOps

Как мы научили ИИ управлять сетью VPN-серверов в условиях блокировок ТСПУ

Не «ещё один перекупленный VPN», а R&D-лаборатория: распределённой сетью управляют автономные ИИ-агенты по модели Brain & Hands. Ниже — как это устроено и почему не ломается.

Проблема

Почему «голый» ИИ ломает VPN

Дать стандартной LLM боевые серверы напрямую — каскад критических ошибок. Без структурированной базы знаний, MCP-инструментов и защитных регламентов это ведёт к потере контроля над системой.

Галлюцинации API

Стандартная LLM путает эндпоинты панели (шлёт на /disable вместо /actions/disable) → ошибки 404 и сбой переключения нод.

Сбой синтаксиса JSON

Лишняя запятая в config.json ядра Xray — служба не стартует, контейнер падает, и пользователи мгновенно теряют доступ.

Непонимание маршрутизации

ИИ тянет устаревшие директивы (geoip:ru в клиентских шаблонах), что роняет ядро на устройствах с усечёнными геофайлами.

Архитектура

Мозг + Руки + База знаний

ИИ — только «Мозг»: принимает высокоуровневые решения. Действия выполняют детерминированные «Руки» через три слоя.

ИИ-агент — анализирует задачу и принимает решения
Инструменты
  • MCP-сервер управления панелью (153 типизированных инструмента)
  • Docker / Systemd обёртки
  • Bash / CLI с проверкой exit-code
Ограничения
  • Правило снапшот-перед-изменением
  • Запрет geoip:* в шаблонах
  • Контроль CPU / памяти
Рецепты
  • happ-provider-id (per-app bypass)
  • dns-leak-prevention
  • nginx-failover-relay
Руки

Вызов инструмента, а не сырой скрипт

ИИ не пишет команды напрямую. Он вызывает типизированный MCP-инструмент — код сам валидирует параметры, упаковывает их в авторизованный запрос к API панели и возвращает структурированный JSON. Это исключает ошибки в путях API.

// ИИ вызывает инструмент — не угадывает эндпоинт
→ nodes_get          { "uuid": "node-de-3" }
← { "online": true, "usersOnline": 412, "cpu": 18 }

→ xray_config_apply  { "uuid": "node-de-3", "validateOnly": true }
← { "valid": false, "error": "trailing comma at line 84" }
   ⤷ агент НЕ применяет конфиг — сначала чинит и переснимает снапшот
Защита

Снапшот перед изменением и автоматический откат

Перед отправкой любого конфигурационного JSON агент обязан сделать резервную копию состояния ноды. При сбое старта он считывает последний лог ошибок и накатывает бэкап обратно — в течение 30 секунд.

agent · self-heal
[14:02:07] alert    node DE-3: xray-core exited (status=1)
[14:02:07] agent    reading journalctl + docker logs…
[14:02:08] agent    cause: invalid JSON in config (trailing comma)
[14:02:08] guard    snapshot found: 01-снапшоты/DE-3.last.json
[14:02:09] action   rollback → restoring last good config
[14:02:11] action   systemctl restart xray  •  health-check: waiting
[14:02:26] ok       node DE-3 online  •  RTO 19s  •  users restored
Под нагрузкой

Бесшовные обновления без простоя

Технические обновления и переключение нод происходят на лету, под нагрузкой — сессии пользователей не прерываются, никаких «технических работ».

Изоляция обновлений

Изменения применяются так, что активные туннели пользователей не затрагиваются.

Буфер опроса клиента

Happ опрашивает подписку примерно раз в 2 часа — это окно для проверки изменений до раскатки на всех.

Горячее переключение

При обслуживании ноды трафик уходит на резерв, клиент переподключается на лету без разрыва сессии.

Мониторинг 24/7

Мониторинг 24/7 и запас прочности

Каждая нода под постоянным наблюдением полного стека инструментов. Владелец получает отчёт о состоянии сети каждый час и мгновенный алерт при любом инциденте.

Стек мониторинга

Полное покрытие метрик, логов, контейнеров и каналов: метрики каждой ноды, агрегация логов, проверки доступности и алертинг — единый наблюдаемый контур 24/7.

Пульс-инфраструктура

Каждый час владелец получает подробный отчёт о состоянии сети в Telegram. При падении любой ноды — мгновенный алерт: инцидент обнаруживается ещё до обращений пользователей.

Запас мощности и архитектура

Средняя загрузка системы — всего 20%, 80% мощностей в горячем резерве под пики и DDoS. Принцип «один сервер — один протокол — один хост» + горячий резервный узел, подхватывающий нагрузку при отказе основного.

Бизнес-ценность

Что это даёт сети

< 30 сек
откат из снапшота и восстановление узла
24/7
обработка инцидентов без дежурной NOC-команды
153
типизированных MCP-инструмента в контуре
0
разрывов сессий при обновлениях под нагрузкой
80%
мощностей в горячем резерве
Частые вопросы

Частые вопросы про ИИ-управление сетью

Что значит «самозалечивающаяся сеть»?
При сетевой аномалии или падении ноды ИИ-агент сам считывает логи, локализует проблему, вносит правки в конфигурацию Xray и перезапускает службы с проверкой статуса. Полный цикл восстановления занимает менее 30 секунд.
Как ИИ не ломает боевые конфиги?
ИИ работает только «Мозгом» — принимает решения. Все действия выполняют детерминированные «Руки»: типизированные MCP-инструменты валидируют параметры сами, а перед любым изменением выполняется обязательный снапшот текущего состояния для мгновенного отката.
Зачем вообще доверять управление сети ИИ?
Поддержка десятков нод в условиях динамических блокировок ТСПУ обычно требует круглосуточного дежурства senior-инженеров. Автономный контур локализует сбой и откатывается за секунды, в режиме 24/7 — это сокращает простои и операционные расходы.

Сеть, которая чинит себя сама

Стабильность — следствие архитектуры. Получите ключ в Telegram и проверьте на своих сервисах. 3 дня бесплатно, без карты.

Промокод VPN10 — 10 дней бесплатно · до 31 августа · передавайте друзьям