Reddit
Визуализация агентной оптимизации вычислительных ядер
Автономные агенты GPT оптимизировали модель, аналогичную Kimi K3, ускорив генерацию с 65 до 406 токенов в секунду. Решение включает слияние операторов, трансформацию графа выполнения и разработку кастомных WebGPU-ядер для механизмов внимания и MoE. Ожидается публичный релиз этого фреймворка оптимизации.
score 40r/LocalLLaMA