Reddit
Как заставить ИИ играть реактивно: эксперимент с Atari Breakout
Автор провёл 124 эксперимента с PPO на Atari Breakout, пытаясь заставить агента играть реактивно, а не заучивать скрипты. Решение оказалось в шейпинге вознаграждения: небольшая награда за близость ракетки к мячу во время снижения изменила оптимальную стратегию с заученной на реактивную.
score 40r/MachineLearning