Назад к дайджесту
Reddit

Я попытался создать ИИ, который нельзя переубедить в правильном ответе — вот что на самом деле ломается на практике

Автор делится опытом создания инструмента для жёсткой обратной связи, который не смягчает критику под давлением пользователя. Он выяснил, что модели, оптимизированные на дружелюбие, со временем расходятся с точностью, а для проверки возражений требуется перепроверять источники, а не доверять словам пользователя. Также обнаружилось, что даже с корректным системным промптом форматирование из контекста может просачиваться в новые ответы, влияя на поведение модели.

score 40r/artificial