Reddit
Медведь умеет танцевать: Qwen 3.8 27B на одной RTX 3090 в течение трёх недель
Автономный агент на базе квантованной Qwen 3.8 27B в течение ~21 дня на одной RTX 3090 пытался создать CUDA-инференс-движок под эту архитектуру. Были получены рабочие ядра и бенчмарки, но производительность оказалась примерно вдвое ниже llama.cpp. Эксперимент включал 180 субагентов, ~230 млн токенов и 699 компакций, при этом агент следовал протоколу и не сходил с курса.
score 40r/LocalLLaMA