Назад к дайджесту
Reddit

Сравнение производительности FreeToken и llama.cpp на RTX 3090: влияние объема VRAM и параллельных запросов

Бенчмарк показал, что llama.cpp превосходит FreeToken по пропускной способности и времени до первого токена (TTFT), когда модель помещается в видеопамять. Однако при работе с моделями, не помещающимися в VRAM (например, gpt-oss-120b), FreeToken обеспечивает значительно более быструю генерацию первого токена при высокой конкурентности, хотя общая пропускная способность остается сопоставимой.

score 55r/LocalLLaMA