Крестики-нолики. Самообучение с подкреплением
В статье я попробую осветить подход к обучению нейронной сети игре в крестики-нолики с помощью методов обучения с подкреплением (Reinforcement Learning или RL). Мы разберем основные идеи TD Learning и Q-Learning, посмотрим, как сеть постепенно учится принимать все более сильные решения.Статья не претендует на исчерпывающее изложение темы. Цель скорее в том, чтобы дать интуитивное понимание ключевых идей. Тем не менее надеюсь что материал покажется вам интересным и будет полезен.

