Назад к дайджесту
Новость

Сайзинг RAM и vCPU для локальной языковой модели: расчёт стартовой конфигурации VM

Статья описывает подход к определению стартовых требований к памяти и CPU для self-hosted LLM, начиная с весов модели и профиля запросов. Автор учитывает длину входа и ответа, конкурентность, рантайм и схему offload, а также использует формулу KV-кэша для расчёта. Прогретый тест показывает реальное потребление памяти и предел, после которого увеличение CPU не даёт эффекта.