Назад к дайджесту
Reddit

OpenAI: сотрудники теперь могут сообщать о несовпадении целей модели для публичного обсуждения

Компания OpenAI внедрила механизм, позволяющий её сотрудникам фиксировать случаи несовпадения поведения языковых моделей заявленным целям (misalignment). Эти отчеты будут доступны для публичного обзора, что повышает прозрачность процессов обеспечения безопасности ИИ.

score 55r/OpenAI