Обработка и распознавание документов с ИИ

Раздел
Решения по задаче
Чтение
9 мин
Обновлено

Система обработки документов раскладывает значения из фотографии, скана с печатью, PDF или таблицы клиента по полям учётной системы. Правила компании проверяют обязательные поля, единицы измерения и комплектацию; спорное значение уходит в очередь и без подтверждения человеком в 1С не попадает. Dzeta AI разворачивает такие системы в контуре компании, первый измеримый результат — на пилоте за 2⁠–⁠6 недель.

#

Что делает система обработки документов: извлечение, правила, передача в 1С

Чтение и перенос берёт на себя система. Раньше документ перепечатывал в учётную систему сотрудник; заполненные поля по-прежнему проверяет и подтверждает человек.

Один документ приходит в разных видах

Отправитель выбирает удобную форму: снимок бланка с бликом, скан с печатью поверх строки количества, PDF без текстового слоя, таблица клиента со своими колонками, рукописный лист из цеха.

Каждый вид ломается по-своему: под печатью теряется цифра, правка от руки читается хуже машинописи, колонка «кол-во» у одного отправителя означает упаковки, у другого — штуки. Поэтому разбор настраивают под тот поток, который реально доходит до компании.

Извлечение: каждое значение помнит своё место в исходнике

Первый слой — извлечение. Из документа система берёт контрагента, позицию, количество, единицу измерения, срок и помечает, откуда взяла каждое значение: страница, строка, ячейка. Сотрудник открывает поле и сразу видит нужный фрагмент.

Табличная часть редко укладывается в один лист: строки переносятся, соседние отличаются одним значением. Разбор такой таблицы настраивают отдельно, иначе позиция задваивается. Поля и названия колонок у каждого поставщика свои, поэтому система держится за смысл поля, а не за его название в шапке.

Движок правил: что проверяется после извлечения

Второй слой — движок правил. Извлечённых значений для учёта мало, недостающее достраивает записанный явно регламент компании:

  • обязательные поля: документ без даты, номера или количества дальше не идёт;
  • единицы измерения: метры и погонные метры, штуки и упаковки сводятся к номенклатуре;
  • кратность упаковки: количество округляется до целой упаковки, в строке остаётся пометка;
  • комплектация по типу изделия: к позиции подставляются неперечисленные элементы;
  • сверка со справочниками: контрагент, номенклатура и договор ищутся среди записей 1С.

Извлечение отвечает за написанное в документе, движок правил — за принятое в компании. Модель со временем меняется, регламент остаётся на месте.

Порядок правил задают явно, потому что правила спорят: клиент просит количество, которое не делится на упаковку, и договор ограничивает отгрузку сверх заказанного. Спор решает правило выше по списку, в строке остаётся пометка, почему количество изменилось. Ведут правила сотрудники: любое открывают и меняют, не трогая модель, и таблицу замен снятых позиций заполняют сами.

Спорное остаётся у человека, подтверждение — в журнале

У каждого извлечённого значения своя уверенность. Где её хватает, поле заполняется сразу; где нет — значение уходит в очередь с фрагментом исходника, причиной сомнения и вариантами на выбор: печать закрыла цифру, в документе две даты, позиция не нашлась в номенклатуре. Пока очередь не разобрана, документ в 1С не уходит, догадка в учёт не попадает.

Журнал подтверждений показывает, кто отвечает за цифру в учёте: какой файл загрузили, что извлекла система, что поправил человек, кто подтвердил итог. Повторная правка одного поля у одного отправителя видна там же — в правилах не хватает строки.

#

Какие документы разбирают и что из них берут

Под разбор подходит любой документ с устойчивой структурой; отличаются состав полей и правила проверки.

ДокументЧто система извлекаетЧем проверяет
Заявка или список позицийНаименования, количества, единицы, срокиНоменклатура и справочники 1С, таблица замен
Бланк заказаРеквизиты заказа, характеристики изделияКомплектация по типу изделия, обязательные поля
СпецификацияПозиции, объёмы, цены, сроки поставкиПострочное сравнение с заявкой
Счёт поставщикаКонтрагент, номер, дата, суммы, позицииСверка со спецификацией
Накладная и ТТН (товарно-транспортная накладная)Отправитель, получатель, позицииСверка с заказом, справочники контрагентов
АктСтороны, период, объём работ, суммаСопоставление с договором и заказом
Путевой листМаршрут, даты, показания, водительСправочники и остальные документы рейса
ДоговорСтороны, предмет, сроки, суммы, условияРеквизиты контрагента в 1С

Счета, акты, накладные, путевые листы и договоры описаны здесь как механика: набор полей устойчивый, схема разбора одна. Состав документов фиксируют на аудите. В медицинской организации тот же разбор идёт по направлениям и выпискам — что можно построить для клиники. Когда бумаги привязаны к объекту и этапу, к разбору добавляется учёт комплекта — что собрано по объекту и какая редакция действует. Что меняется, когда документы вводятся без ручной перепечатки, Dzeta AI разобрала отдельно.

#

Откуда документы приходят и куда уходит результат

Файлы система забирает там, где они уже лежат.

ИсточникЧто делает системаКуда уходит результат
Фото бланка или рукописного листа, скан с печатьюИзвлекает строки, помнит место каждой, спорное помечаетОчередь проверки
PDF из чужой учётной системыРазбирает таблицы и реквизиты, в том числе без текстового слояЧерновик документа
Excel и CSV со своими колонками, пересылка из чатаПриводит колонки и единицы к принятым у вас, позиции выделяет из текстаСтроки заказа
Справочники и выгрузки 1ССверяет контрагента, номенклатуру и договорГотовый документ в 1С

Учётная система в наших проектах — 1С. Остальные источники разбираем на аудите: на пилоте хватает выгрузок. Где стандартной первички хватает сервиса самой 1С и как нейросеть подключают к учёту — интеграция нейросети с 1С.

Фотография рукописного листа тоже документ: у оптового дистрибьютора инженерных систем заявки приходили и так, разбирал их тот же слой извлечения — отраслевая сторона в материале подбор позиций по каталогу у дистрибьютора. Файл из обращения клиента идёт той же дорогой, дальше с ним работает первая линия поддержки. Рядом — поиск по внутренним документам компании: там из регламентов достают ответ сотруднику, здесь из файла — значения для учёта.

#

Кейсы Dzeta AI: документ на входе и документ на выходе

У Dzeta AI 50+ проектов в 8 отраслях. Два из них показывают обе стороны темы.

До производителя металлоконструкций под заказ один и тот же документ доходил в четырёх видах — от снимка бланка с объекта до таблицы клиента с чужими колонками. Команда Dzeta AI собрала систему из двух слоёв: извлечение значений и правила предприятия поверх. Первая рабочая версия появилась через 30 дней, проект разобран на странице приём заказов и контроль оборудования на производстве.

Бывает и обратная задача: документ нужно собрать. Показатели ежемесячного отчёта у крупного транспортного инфраструктурного объекта лежали в пяти системах, каждая отдавала их по-своему. Данные из пяти источников команда Dzeta AI собрала через API, привела форматы к одному виду и настроила сборку по шаблону на NCReport в приложении на C++ (Qt). Отчёт, на который уходило до двух дней, здесь собирают за 15 минут. Подробности — документы рейса и отчётность в транспортной компании.

#

Как проверяют качество до старта: 10⁠–⁠20 реальных документов

Процент распознавания сам по себе ничего не говорит: всё решает то, что приходит к вам. Поэтому документные задачи Dzeta AI проверяет на 10⁠–⁠20 реальных документах заказчика до начала работ, а набор собирает из худших случаев: снимок с бликом, скан с печатью поверх текста, PDF без текстового слоя, лист с правкой от руки.

Считают две величины: сколько полей система заполнила так же, как сотрудник, и сколько ушло в очередь. Ошибки разбирают поштучно: почему поле прочиталось неверно и часто ли приходит такой документ. Редкий дефект оставляют человеку, частый закрывают правилом.

Целевое качество и критерии приёмки фиксируют на том же наборе до старта — по ним систему и принимают. Менять набор потом нельзя: иначе результаты разных недель не с чем сравнить.

#

Как внедряют: аудит, пилот на ваших документах, приёмка

Внедрение идёт этапами, в продуктив проект уходит по результатам пилота.

Этап внедренияСрок и стоимостьЧто получает заказчик
Аудит3⁠–⁠5 рабочих днейКарту потерь в часах и деньгах и план внедрения. Интервью и выгрузки из учётной системы, работаем по NDA. Стоимость называем после созвона.
Пилот2⁠–⁠6 недель, от 290 000 ₽Разбор на 10⁠–⁠20 реальных документах и первый измеримый результат.
ПриёмкаПо итогам пилотаПроверку на тестовом наборе по критериям, согласованным до старта.
Полное внедрение4⁠–⁠12 недель, стоимость — после пилотаСистему в продуктиве, встроенную в работу с входящими документами.

Сначала пилот, чтобы проверить гипотезу на ваших данных до большого проекта. Бюджет уходит и на разработку, и на подготовку данных: разбор архива, описание правил, которые держат в голове несколько человек, чистка справочников. Из чего складывается стоимость внедрения — разбор в отдельной статье.

Где работает система и кто видит документы

Систему на открытых моделях Dzeta AI разворачивает в контуре заказчика: документы, справочники и реквизиты контрагентов не покидают компанию, как и персональные данные (152-ФЗ «О персональных данных»). Свой IT-отдел не нужен: хватит человека, который понимает, как документ идёт по компании.

#

Когда обработку документов автоматизировать не стоит

Автоматизация окупается, когда документы идут потоком, структура у них повторяется, а правила проверки можно записать. Если документов мало и каждый устроен по-своему, вложения не вернутся. Остальные случаи видны на аудите:

  • Заказы принимают голосом, файла не остаётся: проект начнётся со сбора данных.
  • Правила проверки нигде не записаны и у каждого свои: их придётся описать.
  • Справочники запущены: дубли контрагентов, разные единицы для позиции — сверять не с чем.
  • Каждый документ заканчивается решением человека: скидкой, уступкой, исключением.
  • Задачу закрывает регламент или настройка 1С: так и напишем в отчёте по аудиту.
  • Со стороны заказчика некому проверять разобранное первые недели.

Вопросы об автоматической обработке документов

Какие документы система умеет разбирать?

Система обработки документов разбирает любой документ с устойчивой структурой: заявки и списки позиций, бланки заказов, спецификации, счета, накладные и ТТН, акты, путевые листы, договоры. Разбор настраивают под конкретный состав полей и под те виды файлов, которые реально приходят в компанию. Состав документов и правила проверки фиксируют на аудите.

Насколько точно система распознаёт документ?

Числа до проверки на ваших документах Dzeta AI не называет: качество зависит от того, что именно приходит. Фотография с бликом, скан с печатью поверх текста и PDF без текстового слоя дают разный результат. Поэтому документные задачи проверяют на 10⁠–⁠20 реальных документах заказчика, а целевое качество и критерии приёмки фиксируют до старта на этом же наборе. Долю полей, которые система заполнит сама, заранее не обещают.

Что происходит, когда система не уверена в значении?

Значение, в котором система не уверена, попадает в очередь спорных вместе с фрагментом исходника и причиной сомнения. Сотрудник видит, откуда взята цифра, и подтверждает или исправляет её. Пока очередь не разобрана, документ в 1С не уходит, поэтому догадки в учёт не попадают.

Как данные из документа попадают в 1С?

Извлечённые значения система раскладывает по полям документа 1С и сверяет со справочниками: контрагентом, номенклатурой, договором. Правила компании добавляют то, чего в документе нет: комплектацию по типу изделия, единицы измерения, кратность упаковки. В 1С документ уходит после подтверждения сотрудником, и это подтверждение остаётся в журнале.

Подойдёт ли система, если документы приходят фотографиями и сканами плохого качества?

Да, фотографии и сканы плохого качества — обычный случай для системы обработки документов: снимок бланка с объекта, скан с печатью поверх строки, лист, заполненный от руки. Значения из них система извлекает и помечает те, в которых не уверена. Насколько хорошо это работает на ваших файлах, видно на пилоте: именно для этого в тестовый набор специально берут худшие экземпляры.

Чем обработка документов отличается от поиска по документам?

Обработка документов достаёт из файла значения для учётной системы: количество, сумму, срок, позицию. Поиск по документам решает другую задачу — найти в регламентах и инструкциях фрагмент, отвечающий на вопрос сотрудника. Задачи расходятся и по приёмке: в первом случае сверяют поля с исходником, во втором — ответы с источниками.

Сколько стоит и за какой срок внедряют обработку документов?

Пилот стоит от 290 000 ₽ и занимает 2⁠–⁠6 недель, аудит — 3⁠–⁠5 рабочих дней, полное внедрение — 4⁠–⁠12 недель. Первый измеримый результат появляется на пилоте. Сумма зависит от числа видов документов, состояния справочников и того, сколько правил проверки придётся описать с нуля.

Можно ли развернуть систему в своём контуре, чтобы документы не уходили наружу?

Да, система разворачивается на серверах заказчика на открытых моделях. Документы, справочники и реквизиты контрагентов остаются внутри компании, персональные данные её не покидают (152-ФЗ). В ChatGPT и другие внешние сервисы данные не уходят, если заказчик этого не хочет. Модель можно заменить без переделки системы.

Расскажите, что нужно улучшить

Для начала хватит короткого описания. Вместе уточним данные, процесс и критерии результата.

Заявка попадёт напрямую нашей команде.

Задача
Или напишите напрямую
contact@dzeta.ai