Reddit
Локальное рабочее пространство агента на ноутбуке с 4 ГБ видеопамяти (RTX 3050 Ti): скорость генерации и пределы малых моделей при работе с инструментами, артефактами и RAG
Автор тестирует локальное развертывание AI-агента на ноутбуке с 4 ГБ видеопамяти, используя модели Qwen через Ollama. Приведены замеры скорости генерации токенов для разных квантованных версий (от 0.8b до 9b) и описаны ограничения при работе с RAG и инструментами. Оптимальным вариантом для 4 ГБ VRAM признана модель Qwen 2b, которая позволяет запускать агента без выгрузки весов в CPU.
score 40r/LocalLLaMA