Как управлять reasoning effort в LLM
Прошло почти два года с тех пор, как OpenAI выпустила o1, модель, которая популяризировала reasoning в LLM. Примерно через четыре месяца появился DeepSeek-R1. Вместе с ним авторы подробно описали, как обучать reasoning-модели с помощью reinforcement learning with verifiable rewards (RLVR), то есть RL на проверяемых наградах.На прошлой неделе OpenAI представила семейство моделей GPT-5.6. В него входят модели трех размеров, и для каждой предусмотрено пять или шесть настроек reasoning effort.

