Сервис избавляет оператора от ручного переноса ~40 полей с многостраничного технического паспорта здания в структурированные данные — модель извлекает поля, человек проверяет и подтверждает результат.
Технический паспорт здания — плотный документ: десятки параметров объекта (классификация, год ввода в эксплуатацию, площади, материалы конструкций), которые нужно вручную перенести в структурированные данные для отчётности. Это рутинная работа, а цена ошибки при ручном переносе — высокая. Сервис снимает рутину переноса, но окончательное решение всегда остаётся за оператором — не заменяет проверку, а избавляет от набора текста с сотен страниц.
Страницы документа распознаёт модель, обученная понимать изображения, — с подробными правилами именно для технических паспортов: рукописная пометка важнее печатной, таблица важнее чертежа, а при противоречии дат побеждает более поздняя запись.
На размеченной тестовой выборке из 50 технических паспортов сервис показал 98% точности извлечения. Важная деталь: оставшиеся 2% расхождений — это не ошибки модели, а дефекты самих исходных документов (нечитаемые сканы, противоречивые пометки) — там, где и человек столкнулся бы с тем же затруднением.
Технические паспорта приведены к единой стандартной форме, поэтому распознаются быстро и предсказуемо.
Сервис обращается к моделям через единый прокси, поэтому смена поставщика — это правка одной настройки, не переписывание кода и не пересборка образа. За время направления модель менялась трижды, каждый раз в поисках лучшего баланса качества и стоимости:
Тонкая оранжевая полоса на графике — короткий, но реальный этап на Qwen3-VL перед переходом на текущую модель.
В начале июля сервис несколько раз перезапускался по нехватке памяти. Вместо одной догадки — последовательная проверка версий, пока не нашлась настоящая причина:
Первая гипотеза — слишком много параллельных обработчиков на dev-контуре. Проверка по системным логам показала: это не так, версия отклонена, настройка возвращена как была.
Лимит памяти боевого обработчика оказался занижен. Поднят как временная мера — и одновременно система переведена на постраничную обработку документов вместо загрузки целиком.
Отдельная задача без ограничения числа повторов пересчитывалась каждые несколько минут из-за внешнего сбоя оплаты, вызывая периодические скачки памяти. Добавлено ограничение числа повторов — источник найден и закрыт.
Первая версия появилась зимой 2026 года буквально за полторы-две недели — направление возникло из реальной срочной потребности, а не из абстрактного плана. Дальше, за следующие месяцы, тот же фундамент довели до промышленной базы данных, защиты и подтверждённой нагрузочной готовности:
Первая версия сервиса извлечения — с самого начала два уровня модели, быстрый и более тщательный.
Сервис переведён на единый прокси доступа к моделям — именно это решение позже позволило менять модель без переписывания кода. Впервые появился развёрнутый набор правил для чтения именно технических паспортов.
Очередь задач, веб-интерфейс оператора, слой базы данных и выгрузка в Excel собраны за одну неделю следом за архитектурным решением.
Хранилище переведено с локального файла на полноценную промышленную СУБД — сервис готов держать реальную нагрузку данных.
Обработка загружаемых архивов защищена от небезопасных путей и переполнения — профилактика, а не реакция на инцидент.
Серия нагрузочных прогонов довела сервис до нуля ошибок при параллельной работе множества пользователей — готовность подтверждена измерением, не предположением.
Сервис технически готов и подтверждён нагрузочным тестированием, но пока не встроен в общий контур сервисов организации — сейчас он открыт напрямую в интернет, а не спрятан за общим внутренним периметром. Именно это меняется в следующей версии.
Что войдёт в новую версию:
Список извлекаемых характеристик здания пересматривается под текущие задачи.
Переход на новые модели компьютерного зрения, вышедшие уже после текущего выбора.
Более быстрая обработка каждого документа.
Сервис переезжает во внутренний периметр вместо самостоятельной работы, открытой в интернет.
Добавляется работа с данными единого государственного реестра недвижимости.