TAPe+ML v3 на arXiv: превосходим SOTA в классификации, детекции и сегментации при <100 тыс. параметров
Мы опубликовали на arXiv статью TAPe+ML: A Compact Structured Representation for Multi‑Task Computer Vision. В ней собраны результаты TAPe+ML v3 на задачах классификации, object detection, instance segmentation, индексации и поиска сцен в видео, а также в промышленном OOD‑пилоте.Статья на arXiv: TAPe+ML: A Compact Structured Representation for Multi‑Task Computer VisionЕсли вы впервые читаете о TAPe, можно начать с наших предыдущих материалов:TAPe + ML: универсальная архитектура компьютерного зренияTAPe‑дневник: эксперименты с детекцией на COCO
1352 кейса внедрения ИИ в России: почему в продакшене побеждает не модель, а обвязка
В каталоге кейсов внедрения искусственного интеллекта набралось 1352 проекта в российских компаниях и госорганах: от антифрода Сбера до распознавания сорняков с дронов у «Русагро». Каталог ведём мы в АНО «Цифровые платформы», кейсы в него добавляют сами компании и наша команда. Когда смотришь на внедрения 2025-2026 годов не по одному, а разом, видны закономерности: что повторяется из проекта в проект, где ломается и где приносит деньги. О них эта статья.
Месяцы против дней: анатомия неверного подхода в компьютерном зрении
Embodied AI как хобби. ЧАСТЬ 1Как игровой робот учился видеть доску: подход, который поддавался, детектив с Captum, вечно деревянная доска — и почему самое дорогое знание в прикладном ML не гуглится.Мы с приятелем делаем игрового робота-компаньона для настольных игр. Сейчас он умеет понимать позицию на игровой доске (гомоку, оно же «пять в ряд»), обдумывать ход (самописный аналог AlphaZero) и понимать базовые фразы для сопровождения игры — моделью, которая вместе с эмбеддингами весит меньше 80 мегабайт.
Как дифракционная оптика и нейронные сети позволяют снимать гиперспектральные изображения за одно экспонирование
Привет! Хабр. Мы — группа исследователей из AIRI, Самарского университета и МФТИ, занимаемся вопросами точной цветовой репродукции и прикладной гиперспектральной съемкой. Не так давно мы придумали, как из обычной RGB‑камеры сделать гиперспектральную, заменив объектив пластинкой с набором гармонических линз.
Как я собрал охранника для комнаты на YOLO и подключил его к Telegram
Я живу один, и обычно знаю, кто может быть у меня дома. Но во время отъезда в голову иногда лезут неприятные мысли. «А вдруг кто-то всё-таки заходил, пока меня не было?»
Как удалить объект с фото с помощью нейросети: тестируем 5 ИИ-сервисов и выбираем лучший
Иногда фотографию не нужно полностью переделывать — достаточно убрать один лишний объект. В бытовом снимке это может быть случайный прохожий или кружка на столе, а в работе с контентом, рекламой, товарами или визуальными материалами часто требуется получить чистое изоб ражение без людей, предметов и других деталей, которые мешают композиции или не должны попадать в кадр.
Активировать мало — недостаточно: почему AI-роутеру могут понадобиться альтернативные стратегии
В предыдущем материале я рассказывал, как использую генеративные модели в роли оппонентов: прошу их не подтверждать первое решение, а искать условия, при которых оно развалится.Из этой практики вырос вопрос, который уже не относится к организации моей работы.Почему от самой AI-системы мы так часто ожидаем одного ответа? Почему она должна как можно раньше выбрать единственный маршрут, если задача допускает несколько стратегий, цена ошибки неизвестна, а лучшим действием иногда оказывается отказ от действия?
Как я использую генеративные модели как оппонента в нескольких AI-проектах
На бумаге задача выглядела почти обидно просто: камера видит салон автобуса, модель распознаёт людей, на выходе появляется число вошедших и вышедших пассажиров.Но чем ближе мы подходили к реальному рейсу, тем меньше задача была похожа на обычную детекцию. Оказалось, что сначала нужно договориться о времени, остановках, идентификаторах и даже о том, что именно считать событием входа. Модель может правильно увидеть человека — и всё равно выдать неправильный бизнес-результат.

