Назад к дайджесту
Reddit

Производительность GLM 5.2

Пользователь спрашивает, насколько эффективны показатели работы модели GLM 5.2 на конфигурации из процессоров Xeon и видеокарт RTX 3060 при квантовании 3-бит. Обсуждается возможность достижения 20k контекста и скорость генерации токенов в расчете на стоимость оборудования.

score 40r/LocalLLaMA