Назад к дайджесту
Reddit

Штрафные баллы за слова-заполнители повышают точность моделей Qwen

Исследование показывает, что применение логит-штрафов к словам-маркерам «размышлений» (таким как «возможно», «подождите», «хм») в моделях Qwen улучшает их точность. Эксперименты на наборе данных MATH-500 подтверждают, что подавление этих маркеров помогает моделям избегать излишнего усложнения ответов и повышает качество решения задач.

score 40r/LocalLLaMA