Reddit
Воспроизведение OpenAI: «персистентно полезные модели». GRPO почти не меняет черты. Есть идеи?
Автор пытается воспроизвести исследование OpenAI о персистентных полезных чертах на модели Qwen2.5-7B с помощью GRPO, но обучение показывает слабый прогресс (+2.4 балла вместо ожидаемых +15). Исследователь исключил переобучение, хакерство награды и проблемы с градиентами, ищет советы по настройке RLHF на малом масштабе.
score 55r/MachineLearning