Назад к дайджесту
Reddit

Почему RLCD (jev) считается обучением с подкреплением?

Пользователь сомневается, что метод RLCD (связанный с моделью jev) действительно использует RL, поскольку выходы модели (Choice, Score, Noul) дифференцируемы и могут обучаться через обычные функции потерь (cross entropy или MSE). Он предполагает, что упоминание RL может быть маркетинговым ходом, и спрашивает, как в таком случае выглядит среда RL.

score 40r/MachineLearning