Reddit
Скорость prefill локальных моделей против Opus и Astra
Пользователь отмечает, что при обсуждении производительности локальных моделей основное внимание уделяется скорости генерации (decode), тогда как скорость обработки входных данных (prefill) часто игнорируется. Он спрашивает, существуют ли бенчмарки, сравнивающие скорость prefill локальных моделей с API-провайдерами, такими как Opus и Astra.
score 40r/LocalLLaMA