Новость
Анатомия AI-инфраструктуры 2026: почему LLM тормозит даже на одной видеокарте
Статья разбирает архитектуру инфраструктуры для запуска больших языковых моделей в 2026 году. Рассматриваются ключевые компоненты производительности: HBM, KV-кеш, механизмы параллелизма (tensor/pipeline) и связь между узлами (NVLink, InfiniBand). Автор объясняет, где именно возникают узкие места в GPU-кластерах при работе с моделями типа 70B.