Назад к дайджесту
Reddit

Подробный разбор RL и дистилляции для обучения языковых моделей

Автор предлагает глубокое погружение в математику и код алгоритмов RL и on-policy distillation (OPD), которые лежат в основе обучения современных LLM вроде Kimi, DeepSeek, Qwen и GLM. Материал объясняет связь GRPO-стиль алгоритмов с предобучением и supervised fine-tuning, включая видео-разбор.

score 40r/MachineLearning