Reddit
Штрафные баллы за слова-заполнители повышают точность моделей Qwen
Исследование показывает, что применение логит-штрафов к словам-маркерам «размышлений» (таким как «возможно», «подождите», «хм») в моделях Qwen улучшает их точность. Эксперименты на наборе данных MATH-500 подтверждают, что подавление этих маркеров помогает моделям избегать излишнего усложнения ответов и повышает качество решения задач.
score 40r/LocalLLaMA