RLVR.

Как управлять reasoning effort в LLM

Прошло почти два года с тех пор, как OpenAI выпустила o1, модель, которая популяризировала reasoning в LLM. Примерно через четыре месяца появился DeepSeek-R1. Вместе с ним авторы подробно описали, как обучать reasoning-модели с помощью reinforcement learning with verifiable rewards (RLVR), то есть RL на проверяемых наградах.На прошлой неделе OpenAI представила семейство моделей GPT-5.6. В него входят модели трех размеров, и для каждой предусмотрено пять или шесть настроек reasoning effort.

продолжить чтение

Данные, которые нельзя выдумать: как мы собираем трейсы для тренировки агентских навыков Cotype

продолжить чтение

Внутри Claude нашли сознание у моделей. J-пространство в LLM

Привет, Хабр. 6 июля 2026 года Anthropic опубликовала исследование Verbalizable Representations Form a Global Workspace in Language Models. Разбираю технические детали и практические следствия.

продолжить чтение

Обучение с подкреплением и верифицируемые вознаграждения: анализ эффективности RLVR для языковых моделей

В новом исследовании, проведённом в Университете Цинхуа и Шанхайском университете Цзяо Тун, рассматривается вопрос о том, помогает ли обучение с подкреплением и верифицируемыми вознаграждениями (RLVR) крупным языковым моделям лучше рассуждать или просто делает их более эффективными при повторении известных решений.

продолжить чтение