Reddit
Почему RLCD (jev) считается обучением с подкреплением?
Пользователь сомневается, что метод RLCD (связанный с моделью jev) действительно использует RL, поскольку выходы модели (Choice, Score, Noul) дифференцируемы и могут обучаться через обычные функции потерь (cross entropy или MSE). Он предполагает, что упоминание RL может быть маркетинговым ходом, и спрашивает, как в таком случае выглядит среда RL.
score 40r/MachineLearning