Reddit
Готовы к Le Chaton FAT или всё ещё сливаете бюджет на GPU?
Автор делится конфигурацией для локального запуска ИИ-моделей, делая ставку на скоростные NVMe-диски и ZFS вместо дорогих видеокарт. Обсуждается оптимизация KV-кэша и хранение данных Hugging Face на высокопроизводительном хранилище. Это практический подход к снижению затрат на инфраструктуру для инференса.
score 40r/LocalLLaMA