Reddit
Подробный разбор RL и дистилляции для обучения языковых моделей
Автор предлагает глубокое погружение в математику и код алгоритмов RL и on-policy distillation (OPD), которые лежат в основе обучения современных LLM вроде Kimi, DeepSeek, Qwen и GLM. Материал объясняет связь GRPO-стиль алгоритмов с предобучением и supervised fine-tuning, включая видео-разбор.
score 40r/MachineLearning