Обработка и распознавание документов с ИИ
Система обработки документов раскладывает значения из фотографии, скана с печатью, PDF или таблицы клиента по полям учётной системы. Правила компании проверяют обязательные поля, единицы измерения и комплектацию; спорное значение уходит в очередь и без подтверждения человеком в 1С не попадает. Dzeta AI разворачивает такие системы в контуре компании, первый измеримый результат — на пилоте за 2–6 недель.
Что делает система обработки документов: извлечение, правила, передача в 1С
Чтение и перенос берёт на себя система. Раньше документ перепечатывал в учётную систему сотрудник; заполненные поля по-прежнему проверяет и подтверждает человек.
Один документ приходит в разных видах
Отправитель выбирает удобную форму: снимок бланка с бликом, скан с печатью поверх строки количества, PDF без текстового слоя, таблица клиента со своими колонками, рукописный лист из цеха.
Каждый вид ломается по-своему: под печатью теряется цифра, правка от руки читается хуже машинописи, колонка «кол-во» у одного отправителя означает упаковки, у другого — штуки. Поэтому разбор настраивают под тот поток, который реально доходит до компании.
Извлечение: каждое значение помнит своё место в исходнике
Первый слой — извлечение. Из документа система берёт контрагента, позицию, количество, единицу измерения, срок и помечает, откуда взяла каждое значение: страница, строка, ячейка. Сотрудник открывает поле и сразу видит нужный фрагмент.
Табличная часть редко укладывается в один лист: строки переносятся, соседние отличаются одним значением. Разбор такой таблицы настраивают отдельно, иначе позиция задваивается. Поля и названия колонок у каждого поставщика свои, поэтому система держится за смысл поля, а не за его название в шапке.
Движок правил: что проверяется после извлечения
Второй слой — движок правил. Извлечённых значений для учёта мало, недостающее достраивает записанный явно регламент компании:
- обязательные поля: документ без даты, номера или количества дальше не идёт;
- единицы измерения: метры и погонные метры, штуки и упаковки сводятся к номенклатуре;
- кратность упаковки: количество округляется до целой упаковки, в строке остаётся пометка;
- комплектация по типу изделия: к позиции подставляются неперечисленные элементы;
- сверка со справочниками: контрагент, номенклатура и договор ищутся среди записей 1С.
Извлечение отвечает за написанное в документе, движок правил — за принятое в компании. Модель со временем меняется, регламент остаётся на месте.
Порядок правил задают явно, потому что правила спорят: клиент просит количество, которое не делится на упаковку, и договор ограничивает отгрузку сверх заказанного. Спор решает правило выше по списку, в строке остаётся пометка, почему количество изменилось. Ведут правила сотрудники: любое открывают и меняют, не трогая модель, и таблицу замен снятых позиций заполняют сами.
Спорное остаётся у человека, подтверждение — в журнале
У каждого извлечённого значения своя уверенность. Где её хватает, поле заполняется сразу; где нет — значение уходит в очередь с фрагментом исходника, причиной сомнения и вариантами на выбор: печать закрыла цифру, в документе две даты, позиция не нашлась в номенклатуре. Пока очередь не разобрана, документ в 1С не уходит, догадка в учёт не попадает.
Журнал подтверждений показывает, кто отвечает за цифру в учёте: какой файл загрузили, что извлекла система, что поправил человек, кто подтвердил итог. Повторная правка одного поля у одного отправителя видна там же — в правилах не хватает строки.
Какие документы разбирают и что из них берут
Под разбор подходит любой документ с устойчивой структурой; отличаются состав полей и правила проверки.
| Документ | Что система извлекает | Чем проверяет |
|---|---|---|
| Заявка или список позиций | Наименования, количества, единицы, сроки | Номенклатура и справочники 1С, таблица замен |
| Бланк заказа | Реквизиты заказа, характеристики изделия | Комплектация по типу изделия, обязательные поля |
| Спецификация | Позиции, объёмы, цены, сроки поставки | Построчное сравнение с заявкой |
| Счёт поставщика | Контрагент, номер, дата, суммы, позиции | Сверка со спецификацией |
| Накладная и ТТН (товарно-транспортная накладная) | Отправитель, получатель, позиции | Сверка с заказом, справочники контрагентов |
| Акт | Стороны, период, объём работ, сумма | Сопоставление с договором и заказом |
| Путевой лист | Маршрут, даты, показания, водитель | Справочники и остальные документы рейса |
| Договор | Стороны, предмет, сроки, суммы, условия | Реквизиты контрагента в 1С |
Счета, акты, накладные, путевые листы и договоры описаны здесь как механика: набор полей устойчивый, схема разбора одна. Состав документов фиксируют на аудите. В медицинской организации тот же разбор идёт по направлениям и выпискам — что можно построить для клиники. Когда бумаги привязаны к объекту и этапу, к разбору добавляется учёт комплекта — что собрано по объекту и какая редакция действует. Что меняется, когда документы вводятся без ручной перепечатки, Dzeta AI разобрала отдельно.
Откуда документы приходят и куда уходит результат
Файлы система забирает там, где они уже лежат.
| Источник | Что делает система | Куда уходит результат |
|---|---|---|
| Фото бланка или рукописного листа, скан с печатью | Извлекает строки, помнит место каждой, спорное помечает | Очередь проверки |
| PDF из чужой учётной системы | Разбирает таблицы и реквизиты, в том числе без текстового слоя | Черновик документа |
| Excel и CSV со своими колонками, пересылка из чата | Приводит колонки и единицы к принятым у вас, позиции выделяет из текста | Строки заказа |
| Справочники и выгрузки 1С | Сверяет контрагента, номенклатуру и договор | Готовый документ в 1С |
Учётная система в наших проектах — 1С. Остальные источники разбираем на аудите: на пилоте хватает выгрузок. Где стандартной первички хватает сервиса самой 1С и как нейросеть подключают к учёту — интеграция нейросети с 1С.
Фотография рукописного листа тоже документ: у оптового дистрибьютора инженерных систем заявки приходили и так, разбирал их тот же слой извлечения — отраслевая сторона в материале подбор позиций по каталогу у дистрибьютора. Файл из обращения клиента идёт той же дорогой, дальше с ним работает первая линия поддержки. Рядом — поиск по внутренним документам компании: там из регламентов достают ответ сотруднику, здесь из файла — значения для учёта.
Кейсы Dzeta AI: документ на входе и документ на выходе
У Dzeta AI 50+ проектов в 8 отраслях. Два из них показывают обе стороны темы.
До производителя металлоконструкций под заказ один и тот же документ доходил в четырёх видах — от снимка бланка с объекта до таблицы клиента с чужими колонками. Команда Dzeta AI собрала систему из двух слоёв: извлечение значений и правила предприятия поверх. Первая рабочая версия появилась через 30 дней, проект разобран на странице приём заказов и контроль оборудования на производстве.
Бывает и обратная задача: документ нужно собрать. Показатели ежемесячного отчёта у крупного транспортного инфраструктурного объекта лежали в пяти системах, каждая отдавала их по-своему. Данные из пяти источников команда Dzeta AI собрала через API, привела форматы к одному виду и настроила сборку по шаблону на NCReport в приложении на C++ (Qt). Отчёт, на который уходило до двух дней, здесь собирают за 15 минут. Подробности — документы рейса и отчётность в транспортной компании.
Как проверяют качество до старта: 10–20 реальных документов
Процент распознавания сам по себе ничего не говорит: всё решает то, что приходит к вам. Поэтому документные задачи Dzeta AI проверяет на 10–20 реальных документах заказчика до начала работ, а набор собирает из худших случаев: снимок с бликом, скан с печатью поверх текста, PDF без текстового слоя, лист с правкой от руки.
Считают две величины: сколько полей система заполнила так же, как сотрудник, и сколько ушло в очередь. Ошибки разбирают поштучно: почему поле прочиталось неверно и часто ли приходит такой документ. Редкий дефект оставляют человеку, частый закрывают правилом.
Целевое качество и критерии приёмки фиксируют на том же наборе до старта — по ним систему и принимают. Менять набор потом нельзя: иначе результаты разных недель не с чем сравнить.
Как внедряют: аудит, пилот на ваших документах, приёмка
Внедрение идёт этапами, в продуктив проект уходит по результатам пилота.
| Этап внедрения | Срок и стоимость | Что получает заказчик |
|---|---|---|
| Аудит | 3–5 рабочих дней | Карту потерь в часах и деньгах и план внедрения. Интервью и выгрузки из учётной системы, работаем по NDA. Стоимость называем после созвона. |
| Пилот | 2–6 недель, от 290 000 ₽ | Разбор на 10–20 реальных документах и первый измеримый результат. |
| Приёмка | По итогам пилота | Проверку на тестовом наборе по критериям, согласованным до старта. |
| Полное внедрение | 4–12 недель, стоимость — после пилота | Систему в продуктиве, встроенную в работу с входящими документами. |
Сначала пилот, чтобы проверить гипотезу на ваших данных до большого проекта. Бюджет уходит и на разработку, и на подготовку данных: разбор архива, описание правил, которые держат в голове несколько человек, чистка справочников. Из чего складывается стоимость внедрения — разбор в отдельной статье.
Где работает система и кто видит документы
Систему на открытых моделях Dzeta AI разворачивает в контуре заказчика: документы, справочники и реквизиты контрагентов не покидают компанию, как и персональные данные (152-ФЗ «О персональных данных»). Свой IT-отдел не нужен: хватит человека, который понимает, как документ идёт по компании.
Когда обработку документов автоматизировать не стоит
Автоматизация окупается, когда документы идут потоком, структура у них повторяется, а правила проверки можно записать. Если документов мало и каждый устроен по-своему, вложения не вернутся. Остальные случаи видны на аудите:
- Заказы принимают голосом, файла не остаётся: проект начнётся со сбора данных.
- Правила проверки нигде не записаны и у каждого свои: их придётся описать.
- Справочники запущены: дубли контрагентов, разные единицы для позиции — сверять не с чем.
- Каждый документ заканчивается решением человека: скидкой, уступкой, исключением.
- Задачу закрывает регламент или настройка 1С: так и напишем в отчёте по аудиту.
- Со стороны заказчика некому проверять разобранное первые недели.
Вопросы об автоматической обработке документов
Какие документы система умеет разбирать?
Система обработки документов разбирает любой документ с устойчивой структурой: заявки и списки позиций, бланки заказов, спецификации, счета, накладные и ТТН, акты, путевые листы, договоры. Разбор настраивают под конкретный состав полей и под те виды файлов, которые реально приходят в компанию. Состав документов и правила проверки фиксируют на аудите.
Насколько точно система распознаёт документ?
Числа до проверки на ваших документах Dzeta AI не называет: качество зависит от того, что именно приходит. Фотография с бликом, скан с печатью поверх текста и PDF без текстового слоя дают разный результат. Поэтому документные задачи проверяют на 10–20 реальных документах заказчика, а целевое качество и критерии приёмки фиксируют до старта на этом же наборе. Долю полей, которые система заполнит сама, заранее не обещают.
Что происходит, когда система не уверена в значении?
Значение, в котором система не уверена, попадает в очередь спорных вместе с фрагментом исходника и причиной сомнения. Сотрудник видит, откуда взята цифра, и подтверждает или исправляет её. Пока очередь не разобрана, документ в 1С не уходит, поэтому догадки в учёт не попадают.
Как данные из документа попадают в 1С?
Извлечённые значения система раскладывает по полям документа 1С и сверяет со справочниками: контрагентом, номенклатурой, договором. Правила компании добавляют то, чего в документе нет: комплектацию по типу изделия, единицы измерения, кратность упаковки. В 1С документ уходит после подтверждения сотрудником, и это подтверждение остаётся в журнале.
Подойдёт ли система, если документы приходят фотографиями и сканами плохого качества?
Да, фотографии и сканы плохого качества — обычный случай для системы обработки документов: снимок бланка с объекта, скан с печатью поверх строки, лист, заполненный от руки. Значения из них система извлекает и помечает те, в которых не уверена. Насколько хорошо это работает на ваших файлах, видно на пилоте: именно для этого в тестовый набор специально берут худшие экземпляры.
Чем обработка документов отличается от поиска по документам?
Обработка документов достаёт из файла значения для учётной системы: количество, сумму, срок, позицию. Поиск по документам решает другую задачу — найти в регламентах и инструкциях фрагмент, отвечающий на вопрос сотрудника. Задачи расходятся и по приёмке: в первом случае сверяют поля с исходником, во втором — ответы с источниками.
Сколько стоит и за какой срок внедряют обработку документов?
Пилот стоит от 290 000 ₽ и занимает 2–6 недель, аудит — 3–5 рабочих дней, полное внедрение — 4–12 недель. Первый измеримый результат появляется на пилоте. Сумма зависит от числа видов документов, состояния справочников и того, сколько правил проверки придётся описать с нуля.
Можно ли развернуть систему в своём контуре, чтобы документы не уходили наружу?
Да, система разворачивается на серверах заказчика на открытых моделях. Документы, справочники и реквизиты контрагентов остаются внутри компании, персональные данные её не покидают (152-ФЗ). В ChatGPT и другие внешние сервисы данные не уходят, если заказчик этого не хочет. Модель можно заменить без переделки системы.
Смежные решения
Кейсы по теме
Расскажите, что нужно улучшить
Для начала хватит короткого описания. Вместе уточним данные, процесс и критерии результата.
Заявка попадёт напрямую нашей команде.
- Или напишите напрямую
- contact@dzeta.ai
- Telegram
- @Alexey_dzeta
- +7 929 818-58-10