Почти год непрерывной работы — от 39 экспериментов с гипотезами в марте до сервиса, который на потоке находит строительные и конструкционные дефекты на фотографиях зданий (подъезды, крыши, стены снаружи и изнутри) и определяет их тип и точное место без участия человека.
Найти строительный или конструкционный дефект на фотографии здания — подъезда, крыши, стены снаружи или изнутри — задача, где важна не только точность, но и пропускная способность: поток снимков не должен упираться в ручную обработку по очереди. Сервис принимает фотографию через API, сразу подтверждает приём задачи и отдаёт результат отдельным запросом, когда распознавание готово.
Команда перебрала множество подходов и моделей (см. путь исследования ниже — 39 проверенных гипотез) и остановилась на самом качественном: DINOv3, крупной модели компьютерного зрения, уже обученной понимать изображения в целом. Из неё взяли лучшее, а поверх дообучили новые компоненты распознавания дефектов — получилась новая ансамблевая модель, а не чужая модель с минимальной подстройкой. Именно поэтому хватило совсем небольшого числа примеров на каждый тип дефекта.
числовых «отпечатков» изображений (признаков), извлечённых моделью в ходе научного поиска — как отпечаток пальца, только для визуального дефекта
достаточно на каждый из 223 типов дефектов, чтобы дообучить классификатор поверх уже готового «зрения» DINOv3
точность на уровне p90 и p95: у 9 проверенных случаев из 10 точность не ниже 96%, а в самых сложных 5% случаев — не ниже 86%
20 — 23 марта 2026 — интенсивный исследовательский спринт: команда перебирала подходы к извлечению и классификации признаков, каждую гипотезу явно проверяла и фиксировала результат — удачный или нет
Отправная точка — с ней сравнивались все дальнейшие попытки улучшить подход
Attention Hook — способ «подсмотреть», на какие именно части изображения модель обращает внимание внутри себя. Без учёта позиционного кодирования (как модель понимает взаимное расположение частей снимка) этот приём почти обнулил качество признаков — гипотеза закрыта явным решением
Перебор числа групп (кластеров), на которые система делит похожие признаки, показал: дальше упираемся уже не в настройку числа, а в качество самих признаков
Linear Probe — самая простая проверка: если поверх признаков справляется даже примитивный классификатор, значит признаки уже хорошие. Материал поверхности система уже отличала хорошо, а вот с самим дефектом всё ещё сильно ошибалась
По внутренней метрике качества: на одних поверхностях (внутренние стены) распознавание уже почти отличное, на других (стеновые панели) — заметно слабее. Стало ясно, где именно копать дальше
Метод обучения, при котором модель училась сближать похожие примеры дефектов и отдалять непохожие, дал заметный прирост качества признаков — на первый взгляд, явная удача
Тот же «удачный» подход H17 при реальной проверке на новых данных сработал катастрофически хуже — пойман вовремя, на этапе исследования, а не после того, как попал бы в бой
Вместо одной большой модели, которая пытается решить всё сразу, система использует несколько специализированных блоков — «экспертов»: один лучше различает поверхность, другой — форму дефекта. Их выводы объединяются в один ответ, а не выбирается мнение только одного
Из двух вариантов обучения такой архитектуры один оказался стабильным, второй — нет. Стабильный вариант и лёг в основу боевой модели следующего этапа
Дальше — уже про то, чтобы найденный подход держал промышленный поток запросов без сбоев, а не про новые гипотезы
Архитектура, найденная на этапе 1, оформлена в боевую модель HierarchicalExpertV9 — рабочая схема найдена, дальше начинается инженерия производительности и эксплуатации.
Production-контур на видеокарте T4 собран за неделю из 77 доработок. В это же окно предметно проверили ускоритель TensorRT для более быстрой работы модели. Видеопамяти оказалось недостаточно для модели такого размера — по нескольким сессиям ветку закрыли явным инженерным решением.
Следующая версия модели-эксперта закреплена как эталонная («golden») — точка отсчёта, с которой сравниваются все дальнейшие изменения.
Разведены три зоны ответственности: собственный контракт сервиса, общий публичный контур на боевом домене и портальная документация.
35 доработок за неделю: CI/CD для дев-контура собран с нуля, провижининг секретов унифицирован для прод и дев одновременно.
62 доработки за неделю: схема API сверена с реальным поведением сервиса, устранены мёртвые индикаторы работоспособности — направление вошло в общий контур автоматических проверок всей экосистемы.
Темп работы по месяцам: апрель — месяц выхода в прод и закрытия TensorRT, самый насыщенный за всё время направления.
Асинхронный контракт: приём снимка сразу подтверждается, а результат забирается отдельным запросом, когда распознавание готово — так рассчитан промышленный поток.
Пять шагов от фотографии на входе до готового диагноза:
Фотография здания принята через API, задача поставлена в очередь
Изображение делится на фрагменты для более точного разбора деталей
Каждый фрагмент проходит через предобученную DINOv3, признаки собираются воедино
«Трёхголовая» модель — три независимых процесса анализа одного и того же снимка, их результат усредняется, чтобы не полагаться на мнение только одного; учитывается тип поверхности
Тип дефекта и локализация — из 223 типов на 10 типах поверхностей
Промышленный поток: несколько видеокарт работают параллельно, а автоматика проверяет каждое изменение до того, как оно попадёт в бой.
По мере поступления устраняем ошибки API, улучшаем контракт взаимодействия с интеграторами и развиваем качество обработки.
Собираем фидбек от тех, кто уже пользуется сервисом, и проводим итерации доработки модели по результатам.
Готовимся к крупному обновлению: после того как отдел производства обработает новый пакет данных по дефектам, модель научится распознавать значительно больше типов со значительно большей точностью.
Параллельно продолжаем работу над снижением задержки и повышением быстродействия на имеющихся видеокартах.