computer vision. - страница 7

Как я написал покер‑бот за 4 недели, используя Cursor + GPT

1. ВводнаяЭто мой первый опыт написания статьи. Судим, но не строго.Недавно завершил интересный пэт-проект. Настолько интересный, что захотелось поделиться.Это десктопная программа, которая:Считывает скрин игрового стола в покере.С помощью компьютерного зрения извлекает расклад, ставки и карты.Рассчитывает ожидаемую выгоду (EV) каждого действия методом Монте-Карло.Показывает на экране, что выгоднее сделать прямо сейчас.

продолжить чтение

Готовимся к собесу: positional encodings в 2025 году

Если вы до сих пор считаете, что positional encoding в трансформерах — это знаменитые sin/cos из статьи 2017 года, то боюсь, что собеседование для вас закончится автоматическим реджектом.Позиционное кодирование заметно эволюционировало с момента появления оригинальной статьи о трансформерах. В современных LLM и моделях компьютерного зрения, таких как FLUX, уже давно не используется классическое sin/cos-кодирование.Про это почему-то не знают 80% кандидатов на интервью, хотя, казалось бы, эта информация уже давно перешла в разряд «базовой классики».

продолжить чтение

Я построил Vision Transformer с нуля — и научил его обращать внимание

Vision Transformer (ViT) — это архитектура, которая буквально произвела революцию в том, как машины «видят» мир.В этой статье я не просто объясню, что такое ViT — я покажу вам, как создать эту магию своими руками, шаг за шагом, даже если вы никогда раньше не работали с трансформерами для задач с изображениями.Для начала давайте взглянем на архитектуру Vision Transformer:

продолжить чтение

Компьютерное зрение в сельском хозяйстве

продолжить чтение

Компьютерное зрение для начинающих

Тема компьютерного зрения наряду с искусственным интеллектом в последние годы стала очень популярной. Сегодня компьютерное зрение — это динамичная и быстро развивающаяся область, постоянно расширяющая границы того, что могут видеть и понимать машины.Однако, зачастую многие публикации посвященные computer vision являются достаточно сложными для тех, кто только погружается в данную тему.

продолжить чтение

Это камень? Это ветка? Это нос! Разбираем подходы, помогающие ИИ распознавать лица на картинках с низким разрешением

"Распознать бы этого шакала"

продолжить чтение

Обнаружение дронов (БПЛА) с использованием ИИ и компьютерного зрения

На данный момент актуально создание системы обнаружения  беспилотных летательных аппаратов (БПЛА), особенно дронов. Системы обнаружения дронов должны выполнять следующие функции:

продолжить чтение

Один кадр против спуфинга: как мы определяем фейковые лица без видео и биометрии

продолжить чтение

Что бы я сделал, если бы сегодня начинал учить Data Science – ML?

Machine Learning и Data Science — это одни из самых популярных и востребованных направлений в IT. Но вместе с этим — они и одни из самых сложных для входа. Здесь огромное количество тем, инструментов, библиотек, подходов и постоянно появляющихся технологий.Из-за этого многие новички начинают обучение с энтузиазмом, но через пару месяцев теряют интерес. Причины могут быть разные: слишком много теории, мало практики, нет чёткого плана или понимания, зачем вообще всё это нужно.Эта статья — не очередной «гайд по ML для новичков». Это мой личный взгляд на то, как бы я подошёл к обучению, если бы начинал с нуля уже сегодня

продолжить чтение

Kandinsky 4.1 Image – новый генератор изображений от Сбера

В декабре прошлого года на конференции AI Journey наша команда представила  диффузионную генеративную модель Kandinsky 4.0 Video (статья на habr

продолжить чтение