Назад к дайджесту
Reddit

«Нецензурируемые» LLM становятся заметно более оптимистичными, чем базовые модели

Автор провёл эксперимент с удалением цензуры (abliteration) на моделях Gemma и Qwen для предсказания рынка акций. Выяснилось, что после отключения фильтров модели становятся увереннее и оптимистичнее, но не точнее — точность осталась на уровне случайного угадывания. При этом направление сдвига уверенности различалось: у Gemma она упала, у Qwen выросла.

score 40r/LocalLLaMA