Айсберг стоимости
Лицензия на инструмент стоит 19–30 долларов на пользователя в месяц. Умножаем на количество сотрудников, получаем бюджет, идём к финансовому директору. Дальше выясняется, что лицензии составляют 15–20% фактической совокупной стоимости владения.
Остальное распределяется так. На инженерию данных уходит 25–40%: сбор, очистка, обеспечение качества, подготовка. На обслуживание и мониторинг ещё 15–30%: поддержка, обновления, оптимизация моделей. А интеграция с унаследованными системами обходится в два-три раза дороже самой лицензии.
Реальный срок окупаемости получается два-четыре года. Для сравнения, обычный ИТ-проект возвращает вложения за 7–12 месяцев. Эти оценки приводят Xenoss и Deloitte Global, и они хорошо бьются с тем, что видно на российских проектах.
Подготовка данных — самая недооценённая статья. Когда мы разбираем каталог дистрибьютора или архив спецификаций на производстве, выясняется, что позиции называются по-разному в разных системах, часть документов лежит сканами, а справочник замен живёт в голове у двух человек. Это не проблема ИИ. Это проблема, которая была всегда, просто раньше её компенсировали люди, а теперь она стала видимой, потому что модель компенсировать не умеет.
Налог на ошибки
Бенчмарки выглядят внушительно. Claude Opus 4.6 решает 80,8% задач SWE-bench Verified. GPT-5.4 достигает 87,3% при моделировании финансовых таблиц на уровне младшего аналитика инвестбанка.
В промышленной эксплуатации картина другая, и здесь есть контринтуитивный поворот. У лучших «думающих» моделей уровень галлюцинаций на задачах суммаризации превышает 10%. У более простых моделей предыдущего поколения он составляет 0,7–1,5%. То есть модель, которая лучше рассуждает, чаще выдумывает при пересказе. А ставят в агентов именно первые.
Дальше включается арифметика цепочек. Если надёжность на каждом шаге 90%, то надёжность процесса из пяти шагов падает до 59%. Из десяти шагов — до 35%.
Это ключевая цифра для проектирования, и она объясняет, почему демо всегда работает, а пилот разваливается. В демо два шага. В реальном процессе обработки заказа их семь.
Каждое отклонение от условий бенчмарка требует проверки человеком. Сложный унаследованный код, нестандартный workflow, граничный случай в данных. В расчёт ROI эти издержки не попадают никогда, потому что на момент расчёта о них не знают.
Что с этим делать при проектировании
Из арифметики надёжности следуют вполне конкретные инженерные решения, и они дешевле, чем кажется.
Сокращать количество шагов, где модель принимает решение. Если позицию можно найти детерминированным поиском по артикулу, не надо отдавать это языковой модели. Гибридная схема, где ИИ работает только там, где нужна интерпретация, а всё остальное делают обычные запросы и правила, даёт совершенно другую надёжность цепочки.
Ставить проверки между шагами. Валидация результата по формальным критериям стоит копейки и обрывает накопление ошибки.
Разделять случаи по уверенности. Стандартный возврат в срок с полным пакетом документов агент закрывает сам. Спорное начисление уходит человеку. Это не компромисс и не половинчатость, это единственная схема, которая переживает промышленную эксплуатацию.
Именно так устроены зрелые внедрения. В Т-Банке «Афанасий Иванов» обрабатывает до 60% трафика в пилотном домене, а не 100%. У Klarna агент закрывал 62% чатов, и при этом компании всё равно пришлось вернуть людей в контур.
Проблема измерения
Третья статья скрытых расходов — попытка задним числом доказать, что эффект был.
У большинства компаний нет инфраструктуры для оценки вклада ИИ. Не формируются контрольные группы, не проводятся A/B-тесты на уровне процессов, не фиксируются базовые метрики до внедрения. Финансовый директор Microsoft, отчитываясь перед инвесторами, признал, что количественно оценить влияние Copilot на бизнес-показатели непросто.
Отсюда берутся красивые цифры без методологии. IBM сообщила, что консультации с собственным ИИ-агентом помогли сэкономить 3,5 млрд долларов к концу 2024 года и 4,5 млрд к концу 2025-го. Это экономия самой IBM, а не подтверждённый эффект у её клиентов. Разница принципиальная, но в презентациях она стирается.
Похожая история с Amazon Q Developer. Компания обновила десятки тысяч Java-приложений с версий 8 и 11 до 17, сократила трудозатраты более чем на 4500 человеко-лет и получила 260 млн долларов годовой экономии. Только экономия эта возникла от перехода на Java 17, а не от ИИ: улучшились безопасность и производительность, снизились инфраструктурные издержки. ИИ позволил дойти до этого результата за часы вместо 50 дней на приложение. Вклад реальный, но он не равен 260 миллионам, и задача была разовая.
С Klarna та же механика. В медиа фигурируют 40 млн долларов экономии и 800 сокращённых человек. В отчётности по форме SEC F-1 — 39 млн, что составляет около 1,3% операционных расходов компании за 2024 год. Расходы на обслуживание клиентов снизились с 47 до 37 млн, но частично за счёт общего роста автоматизации, а не только ИИ. В мае 2025 года глава компании признал, что с заменой людей перестарались, и наём возобновился.
Ни один из этих примеров не провал. Просто цифра из заголовка и цифра из отчётности — разные цифры.
Российская специфика поверх общей картины
К мировым сложностям добавляются локальные, и они прямо влияют на бюджет.
Дефицит вычислений. В России установлено не более 10 тысяч ускорителей в эквиваленте Nvidia A100, а потребность дата-центров к 2030 году оценивается более чем в 70 тысяч. Для масштаба: одна Tesla эксплуатирует около 200 тысяч H100 и H200. Huawei Ascend 910B и 910C доступны, но отстают от A100 на 30–50%. Задачи без дообучения закрываются российскими облаками, только стоят они в два-три раза дороже западных аналогов.
Дефицит кадров. 56% поставщиков ИИ-продуктов называют поиск и удержание специалистов одним из главных барьеров. Затраты на ML-инженеров растут быстрее, чем на обычных айтишников.
И самая красноречивая динамика: доля компаний, назвавших стоимость главным барьером для внедрения ИИ, выросла с 12% до 75% за год. Рост в шесть раз означает, что от пилотов перешли к масштабным программам, и цена ошибки резко выросла.
Как считать честно
Практический минимум, который стоит заложить в бизнес-кейс до старта.
Считайте TCO, а не лицензии: данные, интеграция, поддержка, вычисления, люди. Умножайте стоимость лицензий на пять и получите ориентир порядка величины.
Фиксируйте базовые метрики до внедрения. Среднее время обработки, доля ошибок, количество повторных обращений, стоимость операции. Через полгода восстановить их будет уже невозможно, и вы окажетесь в положении, когда эффект вроде есть, а доказать нечем.
Закладывайте контрольную группу. Половина команды работает по-старому. Это единственный способ отделить эффект ИИ от эффекта того, что процессом наконец кто-то занялся.
Считайте надёжность цепочки, а не отдельного шага. И проектируйте так, чтобы шагов с моделью было как можно меньше.
И держите в голове горизонт. Первые ощутимые результаты появляются через три-шесть месяцев, доказанный операционный эффект в рамках одного процесса — через 6–12 месяцев, устойчивое влияние на финансовый результат — через год-два. Совет директоров, который через полгода видит рост затрат и не видит эффекта, обычно закрывает проект ровно в тот момент, когда он должен начать давать отдачу.
Мы в dzeta.ai считаем такие бизнес-кейсы до начала работ и честно говорим, когда процесс к автоматизации не готов: чаще всего дело не в модели, а в данных, которых пока нет в машиночитаемом виде. Обсудить свою ситуацию можно здесь: dzeta.ai
Источники: «Яков и Партнёры», «ИИ-агенты: где хайп, а где реальность» (2026); Gartner; Xenoss.io (2025); Deloitte Global; отчётность Klarna по форме SEC F-1; публичные заявления Amazon и IBM.