Reddit
Дообучение модели Qwen на 1.5B для генерации bash-команд на уровне GPT-4o с использованием 400k синтетических примеров
Разработчик представил проект по дообучению небольшой модели Qwen (1.5B параметров) для генерации bash-команд, достигая производительности, сопоставимой с GPT-4o. В основе подхода лежит использование полностью синтетического датасета объемом 400 тысяч примеров и автоматизированных пайплайнов обучения. Все компоненты проекта, включая модель и датасет, являются полностью открытыми.
score 55r/LocalLLaMA