Назад к дайджесту
Reddit

Визуализация агентной оптимизации вычислительных ядер

Автономные агенты GPT оптимизировали модель, аналогичную Kimi K3, ускорив генерацию с 65 до 406 токенов в секунду. Решение включает слияние операторов, трансформацию графа выполнения и разработку кастомных WebGPU-ядер для механизмов внимания и MoE. Ожидается публичный релиз этого фреймворка оптимизации.

score 40r/LocalLLaMA