Назад к дайджесту
Reddit

Сколько агентов реально запустить на 2×4090? Три недели данных о конкурентности llama.cpp — мягкий предел 5 при 64k, жесткий 9, и почему

CTO некоммерческой организации три недели бенчмаркал четыре модели и три квантизации на двух RTX 4090, чтобы выяснить, сколько агентов можно запускать одновременно с полезной производительностью. Выяснилось, что 122B MoE модель проигрывает 27B из-за медленных вызовов инструментов (11.91 с против 3.40 с), а добавление агентов сверх определенного числа не дает выигрыша. Автор делится полными данными и ошибками, включая влияние конфигурации памяти на производительность.

score 55r/LocalLLaMA