Reddit
Исследование оптимизаций FlashAttention-3/4 на видеокартах RTX
Автор протестировал перенос оптимизаций FlashAttention-3 и 4 на потребительские видеокарты RTX 5090. Результаты показали, что для consumer-сегмента пределом остаётся FlashAttention-2, так как ключевые улучшения требуют специфических инструкций тензорных ядер, доступных только в дата-центрах. Попытки внедрить альтернативные методы ускорения не дали значимого прироста производительности.
score 40r/LocalLLaMA