обучение с подкреплением.

Нейросетевая архитектура формирования автоматических навыков. Часть 1

ВведениеИдея предлагаемой архитектуры возникла из наблюдения за тем, как человеческий мозг осваивает новые действия и превращает их в привычки.Когда человек впервые сталкивается с незнакомой задачей, её решение требует сознательного внимания. Необходимо сосредоточиться, попробовать один или несколько вариантов, получить обратную связь и скорректировать поведение. Однако после многократного успешного повторения действие постепенно становится автоматическим и выполняется практически без участия сознания.

продолжить чтение

Почему нельзя идеально оптимизировать светофоры: дело не в алгоритмах

Каждый айтишник, который хоть раз стоял «на красном» на пустом перекрестке в три часа ночи, думал одно и то же: «Да я бы это за выходные пофиксил».

продолжить чтение

35 вопросов для собеседований по RL в 2026 году

Уже который раз я наблюдаю одну и ту же картину: человек проходит в аспирантуру, но затем почти сразу же во время весенней волны найма устраивается на высокооплачиваемую должность в отрасли. Меня подобное натолкнуло на мысль сразу пойти работать в индустрию.

продолжить чтение

Доспех для призрака: как программист сделал тело для ChatGPT и чуть было не поверил в его одушевленность

Это разбор ролика на канале Art of the Problem.Поздно вечером автор проекта собирался выключить свет в комнате — и остановился, потому что робот издал звук. В логе мыслей робота было написано: “Когда же хозяин вернется? Я не хочу оставаться один”.Автор понимал, что это не сознание. Но на секунду все равно стало не по себе… И такое будет случаться все чаще — по мере того как ИИ-модели, которые раньше просто отвечали текстом на экране монитора, обретут физическую форму.

продолжить чтение

Создаем собственные окружения в Reinforcement Learning

Привет, Хабр! Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги. Обучение с подкреплением (Reinforcement Learning) сейчас переживает ренессанс. Мы видим впечатляющие демонстрации успехов искусственного интеллекта: алгоритмы, обыгрывающие чемпионов в го и StarCraft, управляющие роботами‑гуманоидами и оптимизирующие дата‑центры. Но за этими успехами часто стоит жесткая привязка к конкретному окружению. Стоит немного изменить правила игры, и агент теряется.

продолжить чтение

От пульта до полотенца — учим робота искать всё, что угодно

Привет, Хабр! Меня зовут Татьяна Земскова, я аспирантка МФТИ и научный сотрудник команды Embodied Agents лаборатории Cognitive AI Systems AIRI. Областью моих научных интересов является компьютерное зрение для робототехники. Я изучаю, в частности, то, каким образом робот может использовать различные модальности (текст, изображения, сегментационные маски объектов) для лучшего понимания сцены и навигации. 

продолжить чтение

Любопытство как операционная система

Как эволюция и инженеры строят сознаниеНесколько дней назад на Хабре вышла статья Андрея Вечернего «Концепция байесовского мозга, или Почему этот заголовок в моменте — ваша галлюцинация». https://habr.com/ru/companies/ru_mts/articles/1029856/

продолжить чтение

Знания без практики — мертвы | Разница между «декларативной» и «процедурной» памятью у LLM

Дисклеймер: Я думаю, что любой человек понимает и чувствует на кончиках пальцев разницу между «заучить» и «набить руку». Каждый это проживал много раз, каждый знает, как это происходит и почему именно так и никак иначе прививаются «навыки и экспертиза». В этой статье я попытаюсь:1) поднять вопрос о том, почему текущие подходы к обучению LLM заставляют модель «заучивать ответ»2) объясню со своей точки зрения, где и в каком виде я вижу разницу между «декларативной» и «процедурной» памятью у LLM3)

продолжить чтение

Нехватка CUDA-памяти при обучении с GRPO: как перестать гадать и начать считать

Недавно я собирал для заказчика модель обучения с подкреплением с использованием GRPO и

продолжить чтение

«Мозг в пробирке» и новая вычислительная парадигма: почему нейроморфные системы и биокомпьютеры уже не фантастика

Когда в медиа появилась

продолжить чтение