Назад к дайджесту
Reddit

Почему ik_llama.cpp быстрее mainline? Мой опыт на гибридной системе с несколькими GPU

Автор сравнивает производительность форка ik_llama.cpp и основной версии llama.cpp на конфигурации из четырех асимметричных GPU и CPU с поддержкой AVX-512. Несмотря на популярные рекомендации, основной репозиторий показал значительно более высокую скорость генерации токенов (10.86 против 8.43 t/s), тогда как форк страдал от задержек и отсутствия поддержки CUDA Graphs. Обсуждение касается оптимизации распределения слоев модели Qwen 177B между разнородным оборудованием.

score 55r/LocalLLaMA