Назад к дайджесту
Reddit

Воспроизведение OpenAI: «персистентно полезные модели». GRPO почти не меняет черты. Есть идеи?

Автор пытается воспроизвести исследование OpenAI о персистентных полезных чертах на модели Qwen2.5-7B с помощью GRPO, но обучение показывает слабый прогресс (+2.4 балла вместо ожидаемых +15). Исследователь исключил переобучение, хакерство награды и проблемы с градиентами, ищет советы по настройке RLHF на малом масштабе.

score 55r/MachineLearning