обучение с подкреплением.

Как устроены LLM: разбираем на примере 3-уровневой абстракции

Чтобы оптимизировать производительность больших языковых моделей (LLM), необходимо понимать весь программный стек. Мне не удалось найти подробную статью, которая показывала бы этот стек как общую картину, поэтому я решил написать такую статью сам. Эта статья не является исчерпывающим обзором или набором наилучших практик. Здесь я в большей степени делюсь моими общими представлениями о том, как выглядит ландшафт современных LLM‑систем.Во‑первых, любая система проектируется с расчётом на достижение конкретных целей с учётом заданных ограничений. В LLM‑системах наиболее принципиальные цели связаны с увеличением

продолжить чтение

ИИ не может стать разумным, пока не сможет использовать ошибку как источник новых знаний

Я хочу поделиться с вами одним случаем из своего детства. Но это не просто история. Это хорошая иллюстрация принципа обучения, который есть у человека и которого пока нет даже у самых передовых ИИ‑моделей.

продолжить чтение

Мы обошли фильтр Калмана на одной камере, но сначала три недели измеряли труп

Цель видна только через камеру, детектор отдает рамку, дальномера нет. В какой-то момент цель уходит из кадра на три четверти секунды, и ее надо продолжать вести вслепую. Классический фильтр Калмана в этой ситуации теряет цель в 84% эпизодов. Наш трекер теряет ее в 18% и возвращает в центр кадра в 80%.трекердержит цель вслепуювозврат в кадртеряет цельклассический фильтр Калмана−0,0322%84%нейросетевой пилот0,4184%8%

продолжить чтение

Нейросетевая архитектура формирования автоматических навыков. Часть 1

ВведениеИдея предлагаемой архитектуры возникла из наблюдения за тем, как человеческий мозг осваивает новые действия и превращает их в привычки.Когда человек впервые сталкивается с незнакомой задачей, её решение требует сознательного внимания. Необходимо сосредоточиться, попробовать один или несколько вариантов, получить обратную связь и скорректировать поведение. Однако после многократного успешного повторения действие постепенно становится автоматическим и выполняется практически без участия сознания.

продолжить чтение

Почему нельзя идеально оптимизировать светофоры: дело не в алгоритмах

Каждый айтишник, который хоть раз стоял «на красном» на пустом перекрестке в три часа ночи, думал одно и то же: «Да я бы это за выходные пофиксил».

продолжить чтение

35 вопросов для собеседований по RL в 2026 году

Уже который раз я наблюдаю одну и ту же картину: человек проходит в аспирантуру, но затем почти сразу же во время весенней волны найма устраивается на высокооплачиваемую должность в отрасли. Меня подобное натолкнуло на мысль сразу пойти работать в индустрию.

продолжить чтение

Доспех для призрака: как программист сделал тело для ChatGPT и чуть было не поверил в его одушевленность

Это разбор ролика на канале Art of the Problem.Поздно вечером автор проекта собирался выключить свет в комнате — и остановился, потому что робот издал звук. В логе мыслей робота было написано: “Когда же хозяин вернется? Я не хочу оставаться один”.Автор понимал, что это не сознание. Но на секунду все равно стало не по себе… И такое будет случаться все чаще — по мере того как ИИ-модели, которые раньше просто отвечали текстом на экране монитора, обретут физическую форму.

продолжить чтение

Создаем собственные окружения в Reinforcement Learning

Привет, Хабр! Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги. Обучение с подкреплением (Reinforcement Learning) сейчас переживает ренессанс. Мы видим впечатляющие демонстрации успехов искусственного интеллекта: алгоритмы, обыгрывающие чемпионов в го и StarCraft, управляющие роботами‑гуманоидами и оптимизирующие дата‑центры. Но за этими успехами часто стоит жесткая привязка к конкретному окружению. Стоит немного изменить правила игры, и агент теряется.

продолжить чтение

От пульта до полотенца — учим робота искать всё, что угодно

Привет, Хабр! Меня зовут Татьяна Земскова, я аспирантка МФТИ и научный сотрудник команды Embodied Agents лаборатории Cognitive AI Systems AIRI. Областью моих научных интересов является компьютерное зрение для робототехники. Я изучаю, в частности, то, каким образом робот может использовать различные модальности (текст, изображения, сегментационные маски объектов) для лучшего понимания сцены и навигации. 

продолжить чтение

Любопытство как операционная система

Как эволюция и инженеры строят сознаниеНесколько дней назад на Хабре вышла статья Андрея Вечернего «Концепция байесовского мозга, или Почему этот заголовок в моменте — ваша галлюцинация». https://habr.com/ru/companies/ru_mts/articles/1029856/

продолжить чтение