Свой ИИ в контуре или шлюз: посчитали, во что реально обходится каждый вариант
Знакомая сцена. В переговорке сидит IT-директор, напротив - бизнес, который третий месяц требует «дайте нам нейросети, все конкуренты уже пользуются». А между ними - служба безопасности, которая против, потому что в ChatGPT улетают ФИО клиентов, паспорта и реквизиты. И вот кто-то на этой встрече произносит фразу, которая звучит умно и солидно: «А давайте поднимем свою модель внутри контура. Данные никуда не уходят - и волки сыты, и овцы целы».
Все кивают. Идея кажется очевидно правильной: раз проблема в том, что данные утекают наружу, значит надо просто не выпускать их наружу. Поставим свой ИИ на свои сервера - и всё под контролем.
Я много раз видел, как этим заканчивается, поэтому давайте сделаем то, что на той переговорке обычно не делают: возьмём калькулятор и честно посчитаем, во что обходится «свой ИИ в контуре». А потом посчитаем альтернативу. Спойлер: разница получается не в проценты, а в разы, и главный сюрприз даже не в деньгах.
Сразу оговорюсь, о чём речь. Под «нейросетями» я имею в виду большие языковые модели (LLM) - Алиса AI, GigaChat, ChatGPT, Claude, Gemini и другие. Дальше по тексту буду называть их обобщённо.
Пункт первый: железо. И тут начинается математика
Чтобы своя модель была не игрушкой, а реально помогала бизнесу, ей нужно быть хотя бы близкой по качеству к тому, чем люди привыкли пользоваться. А топовые открытые модели - это десятки и сотни миллиардов параметров, которые надо где-то физически крутить.
Возьмём для примера одну из лучших открытых моделей - DeepSeek R1 на 671 миллиард параметров. Чтобы запустить её целиком, в полном качестве, нужно около 1 300 ГБ видеопамяти. Это не одна видеокарта. Это стойка из 8-16 топовых ускорителей уровня NVIDIA H100 или A100.
Что это значит в деньгах? Готовый серверный узел с 4-8 ускорителями H100 в 2025 году стоит 15-25 млн ₽. Единоразово, за железо. И это без учёта того, что такие карты в Россию едут долго, сложно и с наценкой.
Можно, конечно, собрать что-то поскромнее - пару-тройку игровых RTX 4090, это уже 1,5-3 млн ₽. Но на такой сборке крупная модель не поедет, только маленькая и заметно более тупая. То есть вы сэкономили на железе - и получили ИИ, который бизнес разочарует уже на второй неделе. А смысл всей затеи был в том, чтобы бизнес перестал ходить в ChatGPT.
Пункт второй: поддержка. Железо само себя не обслужит
Сервер - это ещё не работающий ИИ. Его надо развернуть, настроить, обновлять и следить, чтобы всё стабильно крутилось. Кто-то должен этим заниматься, и здесь есть варианты - от бюджетного до дорогого, в зависимости от того, насколько ИИ для вас критичен.
Внешняя поддержка - самый доступный путь. Договор на сопровождение с подрядчиком или привлечённый инженер на part-time реально укладываются в 50 000-100 000 ₽ в месяц - это 0,6-1,2 млн ₽ в год. Если модель работает в штатном режиме и круглосуточный дежурный не нужен, для большинства компаний этого достаточно.
Свой человек в штате - если простои недопустимы. Когда ИИ становится частью критичных процессов, обычно заводят своего MLOps- или DevOps-инженера. Медиана зарплаты MLOps в Москве в 2026 году - около 320 000 ₽ в месяц на руки, для работодателя с налогами это ближе к 450 000 ₽. Дороже, но и уровень контроля другой.
Плюс электричество и охлаждение: мощный GPU-узел потребляет киловатты, дата-центр добавляет ещё несколько десятков тысяч в месяц. Суть простая: даже по самому бюджетному сценарию поддержка - это постоянная статья расходов, которая не заканчивается никогда, в отличие от разовой покупки лицензии.
Пункт третий: время. Пока вы строите, бизнес ждёт
Своя модель в контуре - это не «скачали и запустили за вечер». Это проект на месяцы: закупка и доставка железа, развёртывание, интеграция с вашими системами, настройка, тестирование, обучение команды. Всё это время бизнес по-прежнему не получает свой ИИ - а значит, сотрудники по-прежнему тихонько носят рабочие данные в публичные нейросети с личных телефонов. Проблема, которую вы взялись решать, продолжает жить всё то время, пока вы её решаете.
Пункт четвёртый: качество. Догнать лидеров не выйдет
Здесь надо быть честным. Даже самая лучшая открытая модель, которую вы поставите у себя, уступает фронтир-моделям - тем самым, что стоят за публичными сервисами. Компании, которые их делают, вкладывают в обучение миллиарды долларов и тысячи видеокарт. Догнать их силами своей IT-команды на своём железе - невозможно в принципе.
То есть вы платите десятки миллионов за то, что заведомо хуже того, чем ваши сотрудники пользуются бесплатно с телефона. И вот тут возникает самый неудобный вопрос.
А теперь - главное. Своя модель не закрывает проблему
Смотрите. Допустим, вы прошли через всё это. Потратили 25 миллионов на железо, наняли команду, полгода строили, запустили свою модель. Данные в неё уходят внутри контура и наружу не выходят. Победа?
Нет. Потому что запросы к LLM - это лишь один из десятка каналов, по которым данные утекают наружу.
Ваши сотрудники и системы прямо сейчас отправляют чувствительные данные:
Подрядчикам и в SaaS-сервисы - CRM, аналитика, облачные инструменты, куда данные уходят по интеграциям, часто вообще без ведома ИБ.
В транскрибацию звонков - расшифровки разговоров контакт-центра, а это сплошные ФИО, телефоны и номера договоров, регулярно прогоняются через внешние сервисы.
Во внешние API - партнёрские системы, обработка документов, проверки контрагентов.
В другие публичные нейросети - потому что ваша своя модель хуже, и сотрудник всё равно откроет привычный сервис с личного телефона, когда вашей не хватит.
Своя модель в контуре закрывает ровно один из этих каналов - и то не полностью. Вы построили бронированную дверь, а рядом остались открытыми десять окон. Утечка, от которой вы защищались, спокойно происходит по любому из них. Вы заплатили за всю задачу цену, а решили в лучшем случае её десятую часть.
Задача-то была не «поставить локальную модель». Задача была - не дать чувствительным данным уйти наружу неконтролируемо. А это гораздо шире, чем одна нейросеть.
Как ту же задачу решают за принципиально другие деньги
Если сформулировать проблему правильно - «контролировать любые исходящие данные, а не только запросы к одной модели», - то и решение выглядит иначе. Нужен не свой ИИ, а слой между вашим контуром и внешним миром, который проверяет всё исходящее и вырезает из него чувствительное на лету. Такой класс решений называется шлюзами обезличивания.
Работает это так: шлюз стоит внутри вашего контура, ловит в исходящих данных персональные данные, финансовые реквизиты и коммерческую тайну, заменяет их безопасными токенами, отправляет очищенные данные во внешний сервис - любой, не только в нейросеть, - а в ответе восстанавливает исходные значения обратно. Для сотрудника всё прозрачно: он получает нормальный ответ с реальными именами и реквизитами и даже не замечает, что обезличивание было. А наружу настоящие данные не ушли.
Наш продукт, DataProtect AI (dataprotectai.ru), работает именно по этому принципу. И вот почему по деньгам это другая вселенная:
Лицензия - от 590 000 ₽ (для крупных компаний - 1,49 млн ₽, для банков и корпораций - от 3,9 млн ₽). Бессрочная, а не подписка - купили один раз. Сравните с миллионами на железо и постоянными расходами на его сопровождение.
Интеграция - это замена одной строчки. Шлюз даёт OpenAI-совместимый API, поэтому если у вас что-то уже написано под нейросети, оно начинает работать через шлюз просто заменой base_url. Не месяцы разработки, а часы.
Сроки - пилот от 5 рабочих дней, промышленное внедрение от 2 недель. Не полгода стройки.
Работает с любыми внешними сервисами, а не только с одной вашей моделью. Тот самый десяток каналов закрывается одним слоем.
И, что важно, шлюз не мешает поставить свою модель, если она вам всё-таки нужна для других задач. Просто он решает проблему утечки данных - ту, ради которой всю затею с локальным ИИ обычно и начинают, - целиком, а не на одну десятую.
Честно про ограничения
Чтобы не выглядело как реклама без единого «но»: стопроцентной защиты не даёт ни один инструмент, и любой, кто обещает 100%, вводит в заблуждение. Точность распознавания у обезличивающего шлюза - до 97% для типовых персональных данных, до 96% для финансовых реквизитов и до 95% для неструктурированных данных. Это не идеал. Но выбор стоит не между «100% и 97%», а между «97% под контролем и с логами» и «0%, как сейчас, когда данные уходят бесконтрольно». На фоне полной слепоты это радикальное улучшение.
И ещё цифра, ради которой весь разговор. С 30 мая 2025 года штрафы за утечку персональных данных стали оборотными: для юрлиц - от 3 до 15 млн ₽ в зависимости от масштаба утечки, а за повторное нарушение - от 1% до 3% годовой выручки, вплоть до 500 млн ₽. На этом фоне и «свой ИИ за 25 миллионов», и шлюз за 590 тысяч перестают казаться дорогими. Дорогая здесь - утечка.
(Оговорюсь: это не юридическая консультация, а обзор. Конкретные суммы и составы стоит сверять с актуальной редакцией 152-ФЗ и КоАП и с вашим юристом.)
Короткий итог для тех, кто листает
Своя LLM в контуре - это железо (от 1,5-3 млн ₽ за бюджетную сборку до 15-25 млн за серьёзный узел) плюс постоянная поддержка от 50-100 тыс. ₽ в месяц и месяцы внедрения, а результат всё равно слабее публичных сервисов.
И главное - она закрывает только один канал утечки из десяти. Данные продолжают уходить подрядчикам, в SaaS, в транскрибацию, во внешние API.
Шлюз обезличивания решает ту же задачу шире и дешевле на порядок: контролирует всё исходящее, интегрируется заменой base_url, внедряется за недели, а не месяцы.
«Поставить свою модель» - это правильный ответ на неправильно заданный вопрос. Вопрос не в том, где крутится нейросеть. Вопрос в том, как не выпустить данные наружу по всем каналам сразу.
А в вашей компании этот спор уже был? Что решили - строить своё, закрывать шлюзом или пока «запрещаем и делаем вид, что проблемы нет»? Интересно, кто на чём в итоге остановился и во что это обошлось.