синтетические данные.

Месяцы против дней: анатомия неверного подхода в компьютерном зрении

Embodied AI как хобби. ЧАСТЬ 1Как игровой робот учился видеть доску: подход, который поддавался, детектив с Captum, вечно деревянная доска — и почему самое дорогое знание в прикладном ML не гуглится.Мы с приятелем делаем игрового робота-компаньона для настольных игр. Сейчас он умеет понимать позицию на игровой доске (гомоку, оно же «пять в ряд»), обдумывать ход (самописный аналог AlphaZero) и понимать базовые фразы для сопровождения игры — моделью, которая вместе с эмбеддингами весит меньше 80 мегабайт.

продолжить чтение

Вышла новая модель? Не смотри на бенчмарки, смотри на поисковик за её спиной

В этой статье я рассмотрю несколько тенденций в ИИ‑индустрии, которые не сильно освещаются в СМИ и не вызывают интереса у обычных читателей, но имеют огромный практический смысл. Мы с вами вместе проанализируем статистику за последние годы и разберём эти тенденции.Центр тяжести в ИИ‑гонке смещается от гонки самих LLM в сторону развития поисковых инструментов и сопутствующей инфраструктуры. Актуальность ответа LLM критически зависима не столько от данных, полученных при обучении, сколько от качества внешнего поиска и обработки найденной информации.

продолжить чтение

Как переводить смешанный русский-казахский и не сойти с ума

продолжить чтение

Кто такие синтетические покупатели и почему они меняют e-commerce

Электронная коммерция (e-commerce) долго училась понимать покупателя через данные: что человек искал, на какие карточки нажимал, где бросал корзину, как реагировал на скидки и какие товары покупал вместе. Эта аналитика стала основой онлайн-торговли, но у нее есть ограничение — она почти всегда объясняет то, что уже произошло.

продолжить чтение

Коммуналка, школа и 10 лет свободы: AI выпустили в симулятор жизни, где они научились дружить, выгорать и достигать

Привет, Хабр! Меня зовут Михаил Сальников. Я независимый ИИ-исследователь, автор бенчмарка AI Independence Bench и эксперимента с автономным агентом Aria. Я регулярно читаю новые препринты на arxiv.org и иногда натыкаюсь на статьи, после которых трудно уснуть. Сегодня — как раз такой случай.

продолжить чтение

YOLOv8 против OpenCV на чертежах метро: почему простая геометрия победила нейросеть

ВведениеПрежде чем углубляться в суть вопроса, в конкретные тонкие моменты заголовка и вводить в курс domain, неплохо бы рассказать предысторию. Если ты студент в современной AI-реальности, найти практику или стажировку для работы с реальными онлайн-наборами данных не так уж и легко. Следовательно, тебе либо остаётся брать из открытых источников (не Kaggle — там всегда чётко согласованные датасеты), либо самому размечать данные.Прикладной кейс

продолжить чтение

Трудности перевода: почему LLM не умеют писать нормальные докстринги на русском и как это исправить

продолжить чтение

Синтетика как топливо: почему self-training работает и где начинается model collapse

продолжить чтение

Стена данных: почему ИИ упирается не в GPU, а в реальность

Если вы когда-нибудь задумывались, почему огромные GPU-кластеры перестали быть главным драйвером прогресса в развитии ИИ, а контракты на данные подписываются за десятки миллионов долларов — эта статья для вас.Об авторе:

продолжить чтение

TAPe‑дневник, день 7: первый уход от трансформеров и “почти бесплатная” сегментация

В этом посте продолжаем дневник TAPe‑детекции и рассказываем, что получилось после отказа от трансформеров: насколько сократилось число параметров, как работают локальные ассоциации TAPe‑патчей и почему на лице человека у нас начинает “сам по себе” появляться зачаток сегментации.Если вы тут впервые, сначала можно посмотреть:базовую статью про TAPe+ML — TAPe + ML: универсальная архитектура компьютерного зренияFAQ по TAPe‑детекции —

продолжить чтение