Назад к дайджесту
Reddit

Модель в стиле Jev на базе Qwen3.5 4B

Автор провёл эксперимент: LoRA-дообучение Qwen3.5 4B на смеси публичных датасетов и синтетических данных от DeepSeek V4.1 Flash (около 25 млн токенов). Обучение заняло примерно 2 часа на арендованной RTX 3090. Модель показала улучшение с 0.596 до 0.709 на задаче typed-decisions; исходный код, синтетический датасет и API-эндпоинт открыты.

score 40r/LocalLLaMA