29 сентября 2025 г.

Gen AI для «Унистрой»: от сырых документов до проводок с полной объяснимостью

4.75
7 оценок
51 просмотр
Оцените
статью
Лучшая оценка: 5
Статья рассказывает о проекте для «Унистрой», который автоматизирует обработку договоров, превращая неструктурированные документы в данные для учета. В центре внимания — способ, позволяющий улучшить работу моделей с помощью рендеринга изображений и распознавания текста.
4.75
7 оценок
51 просмотр
Оцените
статью
Лучшая оценка: 5
Проект автоматизации обработки договоров для компании Унистрой — это кейс построения промышленного NLP-конвейера, который превращает неструктурированные документы любого качества в готовые для учетной системы данные. Статья раскрывает ключевое архитектурное решение — унификацию входного потока через рендеринг в изображение и OCR, — которое позволило добиться предсказуемой работы моделей в продакшене. Мы детально разберем, как сочетание компьютерного зрения, rule-систем и дообученных трансформеров решает задачи классификации, извлечения сущностей и обеспечения объяснимости решений для бизнес-пользователей.

Проблема: сотня разнородных документов в день

Исходная задача была критичной для бизнеса: обеспечить скорость, единообразие и прозрачность обработки сотен поступающих ежедневно документов — от договоров поставки до писем. Первые попытки работать с текстовым слоем PDF и DOCX показали свою несостоятельность в продакшене: шрифтовые несоответствия, пустые текстовые слои, плавающие метрики и падающее доверие пользователей. Стало ясно: чтобы AI работал стабильно, нужно исключить энтропию на входе.

Главное решение: унификация входа через рендеринг и OCR

Было принято ключевое архитектурное решение, определившее успех всего проекта: Любой файл (скан, PDF, DOCX) превращается в PDF, каждая страница рендерится в изображение (300-400 DPI), и именно картинка отправляется в OCR (Tesseract). Источником правды становится OCR-текст. Почему это сработало:
01
Одинаковый путь для всех: Исчезла зависимость от исходного формата и качества файла.
02
Стабильная токенизация: Текст, полученный через OCR, всегда структурно одинаков, что критично для последующих NLP-моделей.
03
Координаты слов: Появилась возможность визуально подсвечивать фрагменты, повлиявшие на решение, обеспечивая объяснимость.
04
Предсказуемые метрики: Качество работы пайплайна перестало скакать от недели к неделе.

Архитектура конвейера: от документа до проводки

На практике конвейер выглядит как последовательный и надежный маршрут:
01
Унификация и рендер: Конвертация в PDF и рендеринг страниц в изображение.
02
Предобработка изображения: Выравнивание, шумоподавление, бинаризация, подавление табличных сеток.
03
OCR: Распознавание текста с подбором параметров (psm/oem) под макет документа.
04
Нормализация текста: Исправление типичных опечаток OCR, парсинг сумм, дат, НДС, маскирование конфиденциальных данных (ИНН, IBAN).
05
NLP-слой (Transformers): Классификатор: Целевой (договор) vs. нецелевой (письмо, прайс). Извлечение сущностей (NER): Контрагенты, суммы, реквизиты, статьи затрат.
06
Слияние с доменными правилами: Финализация результата — черновик проводки для 1С с цитатами-обоснованиями.
07
Обучение и адаптация: Документы, по которым модель уверена недостаточно (ниже порога), отправляются на ревью эксперта. Его правки накапливаются и используются для планового дообучения моделей, что обеспечивает постоянное улучшение именно в проблемных для бизнеса областях.

Технический стек и эксплуатация

Ядро: Модели на основе Transformer (BERT) для классификации и NER, дообученные на данных «Унистроя».
OCR: Tesseract с оптимизацией под макеты.
Оркестрация: Контейнеры (Docker), развертывание on-prem в закрытом контуре заказчика.
Интеграция: REST API для встраивания в 1С-документооборот.
Управление: Читаемые конфигурационные файлы для настройки приоритетов (например, «к оплате сегодня») и бизнес-правил без перевыпуска кода.

Результат для бизнеса

Сокращение времени обработки документов в разы.
Автоматическая классификация и извлечение реквизитов с минимальным вмешательством человека.
Защита конфиденциальной информации за счет автоматического маскирования.
Прозрачность и контроль: Любое решение системы может быть быстро проверено и объяснено.
Готовая интеграция с учетными системами заказчика.

Выводы и перспективы

Проект подтвердил, что успех промышленного внедрения AI лежит не в сложности моделей, а в инженерной надежности конвейера данных. Принцип «сделать вход одинаковым, снизить энтропию, а сверху аккуратно собрать OCR и NLP» оказался ключевым. Это гарантирует предсказуемость, объяснимость и, как следствие, доверие бизнеса. Дальнейшее развитие — иерархическая классификация статей затрат, регулярное дообучение на ревью-кейсах и поддержка новых региональных форматов. Архитектура проекта универсальна и может быть адаптирована для любых отраслей с массовым документооборотом: от финансов и юриспруденции до госсектора.
Заказать обратный звонок
Поиск квартир
ПроектыПо параметрамПо преимуществамМашиноместаКладовыеЧастные дома
Проекты
Наши объектыКоммерческая недвижимостьОнлайн-трансляции
О компании
О насИсторияСервисная компанияКарьераКонтактыНовостиСМИ о насДля прессыКарьераСервисная компания
Акции
Есть вопрос или предложение?
Приложение Унистрой
ООО «СТРОЙРИЭЛТ»
ИНН 1657193706
ОГРН 1151690025695
© 2026 Унистрой, г. Казань.
Приложение унистрой
Наведите камеру на QR-код, чтобы скачать приложение или перейдите по ссылке
Поиск квартир
Проекты
Проекты
О компании
Контакты
Заказать обратный звонок
Есть вопрос
или предложение?
ООО «СТРОЙРИЭЛТ»ИНН 1657193706ОГРН 1151690025695