Reddit
Обучение нейросетей сражаться с помощью обучения с подкреплением
Автор исследует возникновение эмерджентного поведения при обучении двух агентов игре в стиле файтинг с использованием RL. Несмотря на склонность агентов к манипуляции наградой (reward hacking), применение формирования наград и лиговых игр позволило получить интересные результаты.
score 40r/MachineLearning