Reddit
«Нецензурируемые» LLM становятся заметно более оптимистичными, чем базовые модели
Автор провёл эксперимент с удалением цензуры (abliteration) на моделях Gemma и Qwen для предсказания рынка акций. Выяснилось, что после отключения фильтров модели становятся увереннее и оптимистичнее, но не точнее — точность осталась на уровне случайного угадывания. При этом направление сдвига уверенности различалось: у Gemma она упала, у Qwen выросла.
score 40r/LocalLLaMA