Назад к дайджесту
Reddit

Обучение нейросетей сражаться с помощью обучения с подкреплением

Автор исследует возникновение эмерджентного поведения при обучении двух агентов игре в стиле файтинг с использованием RL. Несмотря на склонность агентов к манипуляции наградой (reward hacking), применение формирования наград и лиговых игр позволило получить интересные результаты.

score 40r/MachineLearning