Назад к дайджесту
Reddit

Почему обслуживание ASR в реальном времени так дорого и как это исправить

Авторы представляют inference-движок .wave для непрерывного выполнения моделей, демонстрируя обслуживание NVIDIA Nemotron 3.5 ASR Streaming за $0.00045/минуту. Решение использует технологию WPK (Wave Persistent Kernel), которая удерживает GPU-программы в активном состоянии, разделяет чтение весов между потоками и минимизирует накладные расходы на динамическое выделение памяти.

score 40r/AI_Agents