- BrainTools - https://www.braintools.ru -
Мы опубликовали на arXiv статью TAPe+ML: A Compact Structured Representation for Multi‑Task Computer Vision. В ней собраны результаты TAPe+ML v3 на задачах классификации, object detection, instance segmentation, индексации и поиска сцен в видео, а также в промышленном OOD‑пилоте.
Статья на arXiv: TAPe+ML: A Compact Structured Representation for Multi‑Task Computer Vision [1]
Если вы впервые читаете о TAPe, можно начать с наших предыдущих материалов:
TAPe + ML: универсальная архитектура компьютерного зрения [2]
TAPe+ML v2: модель распознавания с числом параметров менее 100 тысяч [4]
88,1% Top-1 на ImageNet-1k, 65,3 mAP50–95 в детекции COCO, 58,4 Mask mAP50–95 в COCO instance segmentation, 98,2% покрытия объектов масками на LVIS — при размере ядра модели менее 100 тыс. параметров.
TAPe+ML v3 объединяет классификацию, детекцию и сегментацию в одном компактном ядре. В представленных в статье сравнениях она превосходит крупные SOTA‑модели по ключевым метрикам: RF‑DETR и YOLO в детекции, RF‑DETR‑Seg и YOLO26-X‑Seg в сегментации; на ImageNet-1k достигает уровня крупнейших foundation‑моделей при разнице в параметрах на несколько порядков.
В статье собраны результаты на нескольких типах задач и наборах данных:
классификация: ImageNet-1k, ImageNet‑ReaL, ImageNet‑v2, ImageNet‑R, ImageNet‑Sketch, ObjectNet, Imagenette и MNIST;
object detection: COCO и RF100-VL;
instance segmentation: LVIS и COCO;
индексация и поиск смысловых сцен в видео;
промышленная OOD‑задача: распознавание засорений руды на изображениях конвейерной ленты;
самообучение: эксперимент с DINO/iBOT на TAPe‑данных;
автоаннотация и адаптация модели к новому домену;
локальное и edge‑развёртывание компактного CV‑контура.
В статье также есть прямое сравнение TAPe‑данных с сырыми пикселями при одной и той же архитектуре и одинаковых условиях обучения [5].
На ImageNet-1k TAPe+ML v3 получила 88,1% Top-1 accuracy при числе параметров менее 100 тысяч.
На наборах со сдвигом распределения результаты следующие:
|
Набор данных |
Top-1 accuracy |
|---|---|
|
ImageNet-1k |
88,1% |
|
ImageNet‑ReaL |
89,9% |
|
ImageNet‑R |
90,3% |
|
ImageNet‑Sketch |
75,8% |
|
ObjectNet |
78,6% |
|
ImageNet‑v2 |
80,2% |
В Imagenette мы сравнивали TAPe‑данные и сырые пиксели на одной и той же трехслойной CNN с примерно 516 тысячами параметров. Обучение проводилось на 10% набора без аугментации в течение 25 эпох.
|
Входные данные |
Accuracy |
|---|---|
|
TAPe‑данные |
92% |
|
Сырые пиксели |
47% |
В задаче iBOT стандартная DINO на 9 тысячах и 120 тысячах изображений не сошлась: loss оставался примерно на уровне 2,7 и 2,46 соответственно. Та же архитектура на TAPe‑данных достигла loss 0,406 уже на 9 тысячах примеров.
Для object detection использовали стандартный COCO train2017 / val2017 с 80 классами.
Финальная конфигурация TAPe+ML v3:
mAP50: 84,7%;
mAP50–95: 65,3%;
менее 100 тысяч параметров.
Для ориентира в статье приведены публичные результаты внешних моделей:
|
Модель |
COCO mAP50 |
COCO mAP50–95 |
Число параметров |
|---|---|---|---|
|
TAPe+ML v3 |
84,7 |
65,3 |
<0,1 млн |
|
RF‑DETR-2XL |
78,5 |
60,1 |
126,9 млн |
|
RF‑DETR‑M |
73,6 |
54,7 |
33,7 млн |
|
YOLO11-M |
64,1 |
48,6 |
20,1 млн |
Время inference TAPe+ML v3 на NVIDIA GTX 1070 Ti 8 GB в детекционном измерении составило 10,8 мс на кадр. В той же конфигурации для сравнения: YOLO26s — 12,3 мс, RF‑DETR‑Small — 41,0 мс.
Внешние результаты в таблице приведены для контекста. Они могут быть получены при отличающихся training и inference protocol; это отдельно отмечено в статье.
В TAPe+ML v3 сегментация встроена в общий контур. Модель сначала выделяет потенциальные границы, затем собирает их в замкнутые контуры, после чего объединяет внутренние области в итоговые сегменты.
Для COCO instance segmentation результаты следующие:
|
Модель |
Mask mAP50 |
Mask mAP50–95 |
|---|---|---|
|
TAPe+ML v3 |
80,7 |
58,4 |
|
RF‑DETR‑Seg-2XL |
73,1 |
49,9 |
|
YOLO26-X‑Seg |
71,6 |
46,8 |
Для оценки качества масок на LVIS в статье используются отдельные показатели: покрытие объектов масками и AP@75. Эти метрики нельзя напрямую сравнивать с COCO Mask AP, поэтому приводим их отдельно.
|
Метрика на LVIS |
YOLO без обучения на LVIS |
TAPe+ML до дополнительного обучения |
TAPe+ML после дополнительного обучения |
|---|---|---|---|
|
Объекты, покрытые масками |
44% |
97% |
98,2% |
|
Маски с IoU ≥ 0,75 |
21% |
72% |
74% |
|
Средний Mask IoU |
0,135 |
0,345 |
0,856 |
Итоговый показатель TAPe+ML по методологии LVIS составил 82,5 AP.
В статье есть и наш эксперимент по разбиению видео на смысловые сцены. Для одного и того же фрагмента использовались одинаковый кластеризатор HDBSCAN и одинаковые параметры — менялось только представление данных.
TAPe индексирует один час видео за 10–11 секунд, занимает в индексе менее 1 МБ, а кластеризация занимает около 1 секунды.
В эксперименте с одинаковым HDBSCAN‑кластеризатором и одинаковыми параметрами TAPe сравнивали с DINOv2, HOG, optical flow, гистограммами и другими методами. TAPe не только дала наиболее устойчивое разбиение на сцены с минимальным числом шумовых кластеров, но и радикально превзошла альтернативы по скорости и компактности.
Для сравнения, DINOv2 ViT‑B/14 индексировала тот же час видео примерно за 5 220 секунд — примерно в 475 раз дольше, чем TAPe; кластеризация занимала около 21,5 секунды, то есть примерно в 21 раз дольше. HOG строил индекс около 530 секунд, а затем кластеризовал его примерно 2 226 секунд; optical flow требовал около 2 959 секунд на индексацию и до 8 739 секунд на кластеризацию. При этом HOG создавал индекс около 1,7 ГБ, а optical flow — до 3,2 ГБ, тогда как TAPe укладывалась менее чем в 1 МБ.
TAPe+ML v3 рассчитана не только на benchmark’ы и серверный inference. Компактная архитектура позволяет переносить распознавание ближе к источнику данных: на локальный сервер, промышленный компьютер, камеру, робота, БПЛА или в изолированный корпоративный контур.
<32 КБ — сырые веса TAPe+ML v3;
~10 МБ — текущий исполняемый on‑premise‑пакет со всеми библиотеками;
~20 МБ — пиковая память [6] всего pipeline при обработке кадра;
10,8 мс на кадр — детекционный inference;
около 12 мс на изображение — полный pipeline: detection, classification, segmentation, post‑processing
Текущая упаковка и расход рабочей памяти не являются для нас пределом оптимизации. Отдельный цикл работы по минимизации размера бинарника, зависимостей, буферов и активаций пока не проводился. То есть сама модель уже занимает десятки килобайт, а размер полного решения может быть дополнительно уменьшен при необходимости конкретного edge‑сценария.
Итого:
не требуется отправлять весь видеопоток в облако;
решение можно принимать рядом с камерой или производственной линией;
уменьшаются задержка, сетевые затраты и зависимость от соединения;
проще развертывать систему в закрытом on‑premise‑контуре;
появляется возможность масштабировать CV по множеству физических точек: камерам, роботам, БПЛА и локальным серверам.
Параметры модели обычно указываются отдельно от рабочих активаций и размера программного пакета. Поэтому «модель меньше 100 КБ» не означает, что готовое приложение вместе с зависимостями обязано занимать столько же. Но даже с текущей упаковкой TAPe+ML остается компактным решением для локального и edge‑развертывания.
Отдельный раздел статьи на arXiv мы посвятили задаче распознавания засорений руды на изображениях конвейерной ленты.
Исходный набор состоял из 30 изображений и двух классов. Это OOD‑сценарий: объекты, освещение, фон и структура данных существенно отличаются от COCO.
|
Метод |
Объём данных |
Accuracy |
|---|---|---|
|
YOLO26s |
30 изображений |
≈28% |
|
TAPe+ML, обучение только головы |
30 изображений |
≈45% |
|
TAPe+ML, адаптация backbone |
30 изображений |
≈65% |
|
TAPe+ML, адаптация backbone |
85 изображений |
≈85% |
|
TAPe+ML, адаптация backbone + NMS |
500 изображений |
85,7–96% |
Этот пилот показывает кратное превосходство даже базовой TAPe+ML над YOLO в сложной промышленной OOD‑задаче. На тех же 30 изображениях TAPe+ML с адаптацией backbone достигла около 65% accuracy против 28% у YOLO26s — более чем вдвое выше. При 85 изображениях результат вырос примерно до 85%, а при расширении выборки до 500 изображений и использовании NMS — до 85,7–96%.
В процессе мы также поняли, что для OOD‑задач недостаточно просто подключить новую классификационную голову к уже готовой модели. Если исходный backbone сформирован на COCO‑подобных объектах, он может быть смещен в сторону привычных классов — людей, автомобилей, животных и бытовых предметов. Для промышленного домена нужна адаптация самого представления и backbone.
Автоаннотация — отдельный режим работы TAPe+ML и часть ML‑стенда. Она нужна, чтобы не размечать весь датасет вручную до начала обучения.
После ручной разметки упрощенную версию TAPe+ML можно быстро обучить на этом стартовом наборе. Затем модель проходит по остальным неразмеченным данным и предлагает детекции выше заданного порога уверенности.
Пользователь не обязан создавать всю разметку с нуля. Он может:
подтвердить предложенный объект;
исправить bounding box или маску;
изменить класс;
удалить ложное срабатывание;
добавить пропущенный объект.
Исправления используются в следующем цикле обучения. Модель получает больше примеров именно в сложных и неуверенных случаях, а эксперт постепенно переходит от ручного рисования аннотаций к проверке и корректировке результатов.
Нужный объем начальной разметки зависит от числа классов, вариативности объектов, условий съемки и требований к ошибкам. Но для прикладных пилотов такой режим позволяет получить первую рабочую версию без полного ручного датасета.
Автоаннотация особенно важна в промышленности. Там ручная разметка требует не только времени аннотатора, но и участия предметного эксперта, который может отличить дефект, засорение или критичное отклонение от допустимого состояния оборудования.
Вместо линейного процесса «сначала полностью размечаем датасет, потом начинаем ML‑проект» получается итеративный путь. Это снижает стоимость подготовки данных и ускоряет переход от первых изображений заказчика к пилоту.
TAPe+ML можно применять в задачах, где требуется находить, классифицировать, сегментировать или анализировать объекты и события на изображениях и видео:
робототехника: навигация, захват объектов, визуальная инспекция;
БПЛА и спутниковые данные: поиск аномалий, мониторинг и инспекция инфраструктуры;
промышленность: дефекты, комплектация, конвейеры, контроль качества и безопасности;
транспорт и логистика: грузы, парковки, дорожная ситуация, маркировка и сортировка;
видеоаналитика: периметр, доступ, поиск событий, видеоархивы;
ритейл и e‑commerce: полки, наличие товара, ценники, выкладка, предотвращение потерь;
агро: мониторинг полей, болезни растений, контроль техники;
медицина: поиск патологий и сегментация анатомических структур;
городская инфраструктура: дороги, повреждения, стройки, парковки и контроль требований безопасности.
Если вы работаете с классификацией, детекцией, сегментацией, видеоаналитикой, edge‑развертыванием или разметкой данных — пишите в комментариях, личные сообщения или на почту tape@comexp.net.
Статья: TAPe+ML: A Compact Structured Representation for Multi‑Task Computer Vision [1]
Проект: ml.comexp.net [7]
Автор: oopatow
Источник [8]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35998
URLs in this post:
[1] TAPe+ML: A Compact Structured Representation for Multi‑Task Computer Vision: https://arxiv.org/abs/2609.20869
[2] TAPe + ML: универсальная архитектура компьютерного зрения: https://habr.com/ru/articles/1004788/
[3] TAPe‑дневник: эксперименты с детекцией на COCO: https://habr.com/ru/articles/1015514/
[4] TAPe+ML v2: модель распознавания с числом параметров менее 100 тысяч: https://habr.com/ru/articles/1052302/
[5] обучения: http://www.braintools.ru/article/5125
[6] память: http://www.braintools.ru/article/4140
[7] ml.comexp.net: http://ml.comexp.net
[8] Источник: https://habr.com/ru/articles/1086426/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1086426
Нажмите здесь для печати.