Отчёт о прогрессе · TechCon ML · 02.12.2025 — 07.09.2026

Автоматическая оцифровка технических паспортов зданий

Сервис избавляет оператора от ручного переноса ~40 полей с многостраничного технического паспорта здания в структурированные данные — модель извлекает поля, человек проверяет и подтверждает результат.

1–2 нед.
от идеи до готового сервиса
зима 2026, когда был нужен
98%
точность извлечения
на размеченной тестовой выборке
0
ошибок распознавания
все расхождения — дефекты исходников
40
полей извлекается
из одного документа за раз
Зачем это нужно

40 полей вручную — рутина, где легко ошибиться

Технический паспорт здания — плотный документ: десятки параметров объекта (классификация, год ввода в эксплуатацию, площади, материалы конструкций), которые нужно вручную перенести в структурированные данные для отчётности. Это рутинная работа, а цена ошибки при ручном переносе — высокая. Сервис снимает рутину переноса, но окончательное решение всегда остаётся за оператором — не заменяет проверку, а избавляет от набора текста с сотен страниц.

Как это работает

Модель предлагает, человек подтверждает — так и только так

Страницы документа распознаёт модель, обученная понимать изображения, — с подробными правилами именно для технических паспортов: рукописная пометка важнее печатной, таблица важнее чертежа, а при противоречии дат побеждает более поздняя запись.

Первая попытка

быстрая модель разбирает документ и сразу объясняет своё решение простым текстом — сколько лестниц, откуда взята площадь

Вторая попытка при необходимости

если ключевые поля (год, площадь, материал стен) остались пустыми — за дело берётся более сильная модель

Проверка оператором

удобный интерфейс сравнения: исходный документ и распознанный результат — рядом, бок о бок; оператор читает объяснение модели и подтверждает или правит любое поле в один клик
Правило зафиксировано жёстко: автоматическое извлечение не подменяет проверку оператора, а неподтверждённый результат никогда не публикуется как окончательный.
Проверенное качество

98% точности — и настоящих ошибок модели не нашлось вовсе

На размеченной тестовой выборке из 50 технических паспортов сервис показал 98% точности извлечения. Важная деталь: оставшиеся 2% расхождений — это не ошибки модели, а дефекты самих исходных документов (нечитаемые сканы, противоречивые пометки) — там, где и человек столкнулся бы с тем же затруднением.

98%
точность извлечения
точность извлечения98%
расхождения — дефекты исходных документов2%
50 размеченных технических паспортов в тестовой выборке
2% расхождений — все из-за дефектов исходника, не модели
Быстро и без ограничений на формат

Один стандарт документа — значит, быстрое и массовое распознавание

Технические паспорта приведены к единой стандартной форме, поэтому распознаются быстро и предсказуемо.

Единая форма
все паспорта — по одному стандарту
быстрое и предсказуемое распознавание
Загрузка пачками
не по одному документу
массовая обработка
Прямо с фотографии
сканер не обязателен
снял на телефон — и загрузил
Гибкость под капотом

Модель меняется без переписывания сервиса

Сервис обращается к моделям через единый прокси, поэтому смена поставщика — это правка одной настройки, не переписывание кода и не пересборка образа. За время направления модель менялась трижды, каждый раз в поисках лучшего баланса качества и стоимости:

Gemini

первая версия — прямое обращение к модели Google, с самого начала два уровня: быстрая и более тщательная

Qwen3-VL

короткий, но реальный этап — переход на модель другого поставщика, без изменения архитектуры вокруг

Kimi K2.5 — текущая

переключение снова заняло правку одной переменной окружения, без переписывания кода
GeminiKimi K2.5 — текущая02.12.2025сегодня24.0407.05

Тонкая оранжевая полоса на графике — короткий, но реальный этап на Qwen3-VL перед переходом на текущую модель.

Как мы ловим сбои

Реальный прод-инцидент — от симптома до найденной первопричины

В начале июля сервис несколько раз перезапускался по нехватке памяти. Вместо одной догадки — последовательная проверка версий, пока не нашлась настоящая причина:

Версия 1 — проверена и отклонена

Подозрение на число обработчиков

Первая гипотеза — слишком много параллельных обработчиков на dev-контуре. Проверка по системным логам показала: это не так, версия отклонена, настройка возвращена как была.

Версия 2 — частично верна

Найден реальный предел памяти на проде

Лимит памяти боевого обработчика оказался занижен. Поднят как временная мера — и одновременно система переведена на постраничную обработку документов вместо загрузки целиком.

Версия 3 — настоящая первопричина

Задача, которая пыталась выполниться 273 раза

Отдельная задача без ограничения числа повторов пересчитывалась каждые несколько минут из-за внешнего сбоя оплаты, вызывая периодические скачки памяти. Добавлено ограничение числа повторов — источник найден и закрыт.

Весь разбор — от версии 1 до найденной первопричины — провёл автономный ИИ-агент, без участия инженера. Три гипотезы проверены, две отклонены по фактам из логов, источник найден и закрыт самостоятельно.
Путь

Рабочий сервис — за полторы-две недели, когда он был нужен

Первая версия появилась зимой 2026 года буквально за полторы-две недели — направление возникло из реальной срочной потребности, а не из абстрактного плана. Дальше, за следующие месяцы, тот же фундамент довели до промышленной базы данных, защиты и подтверждённой нагрузочной готовности:

декабрьянварьфевральмартапрельПервый прототип02.12Архитектура извлечения закреплена16.01Прод-база данных27.02Первый проход защиты02 — 22.03Нагрузочная готовность подтверждена07 — 08.04
02.12.2025

Первый прототип

Первая версия сервиса извлечения — с самого начала два уровня модели, быстрый и более тщательный.

16.01.2026

Архитектура извлечения закреплена

Сервис переведён на единый прокси доступа к моделям — именно это решение позже позволило менять модель без переписывания кода. Впервые появился развёрнутый набор правил для чтения именно технических паспортов.

17 — 22.01.2026

Продуктовый каркас за неделю

Очередь задач, веб-интерфейс оператора, слой базы данных и выгрузка в Excel собраны за одну неделю следом за архитектурным решением.

27.02.2026

Переход на промышленную базу данных

Хранилище переведено с локального файла на полноценную промышленную СУБД — сервис готов держать реальную нагрузку данных.

02 — 22.03.2026

Первый целенаправленный проход защиты

Обработка загружаемых архивов защищена от небезопасных путей и переполнения — профилактика, а не реакция на инцидент.

07 — 08.04.2026

Нагрузочная готовность подтверждена

Серия нагрузочных прогонов довела сервис до нуля ошибок при параллельной работе множества пользователей — готовность подтверждена измерением, не предположением.

Живой продукт

Инженерная часть готова — впереди встраивание в контур организации

Сервис технически готов и подтверждён нагрузочным тестированием, но пока не встроен в общий контур сервисов организации — сейчас он открыт напрямую в интернет, а не спрятан за общим внутренним периметром. Именно это меняется в следующей версии.

Куда движемся дальше

Новая мажорная версия — и запуск в организации

Текущая версия
Самостоятельный сервис
открыт напрямую в интернет

Что войдёт в новую версию:

Обновлённый состав полей

Список извлекаемых характеристик здания пересматривается под текущие задачи.

Ещё выше качество

Переход на новые модели компьютерного зрения, вышедшие уже после текущего выбора.

Быстрее

Более быстрая обработка каждого документа.

Внутри контура организации

Сервис переезжает во внутренний периметр вместо самостоятельной работы, открытой в интернет.

Данные ЕГРН

Добавляется работа с данными единого государственного реестра недвижимости.

Сейчас
  • Готовится новая мажорная версия сервиса.
Позже
  • Пилот на тестовых пользователях.
  • Массовый запуск сервиса в организации — чтобы больше никто не переносил паспорта вручную с фотографий и сканов.