Назад к дайджесту
Reddit

Какой минимально комфортный показатель токенов в секунду вы считаете для локального запуска моделей, как для обработки промпта, так и для генерации?

Пользователь спрашивает сообщество о минимально комфортной скорости работы локальных языковых моделей, разделяя обработку промпта и генерацию текста. Он приводит свои пороги в 300-350 токенов в секунду для ввода и 9 токенов в секунду для вывода.

score 40r/LocalLLaMA