Назад к дайджесту
Reddit

Дистилляция 8B-учителя в 0.6B-студента на Mac (MLX): от 36% до 100% точности и проблемы few-shot

Инженер дистиллировал узкоспециализированный навык 8B-модели в 0.6B Qwen с помощью MLX на Mac для локальной обработки финансовых документов. Обученная модель достигла 100% точности против 36% у базовой версии, но эксперимент выявил, что few-shot промптинг ухудшает качество из-за неспособности малой модели разделять примеры и входные данные.

score 40r/LocalLLaMA