Reddit
Сколько агентов реально запустить на 2×4090? Три недели данных о конкурентности llama.cpp — мягкий предел 5 при 64k, жесткий 9, и почему
CTO некоммерческой организации три недели бенчмаркал четыре модели и три квантизации на двух RTX 4090, чтобы выяснить, сколько агентов можно запускать одновременно с полезной производительностью. Выяснилось, что 122B MoE модель проигрывает 27B из-за медленных вызовов инструментов (11.91 с против 3.40 с), а добавление агентов сверх определенного числа не дает выигрыша. Автор делится полными данными и ошибками, включая влияние конфигурации памяти на производительность.
score 55r/LocalLLaMA