Назад к дайджесту
Reddit

Дообучение модели Qwen на 1.5B для генерации bash-команд на уровне GPT-4o с использованием 400k синтетических примеров

Разработчик представил проект по дообучению небольшой модели Qwen (1.5B параметров) для генерации bash-команд, достигая производительности, сопоставимой с GPT-4o. В основе подхода лежит использование полностью синтетического датасета объемом 400 тысяч примеров и автоматизированных пайплайнов обучения. Все компоненты проекта, включая модель и датасет, являются полностью открытыми.

score 55r/LocalLLaMA