Reddit
Тестирование Qwen3.8-Flash-Next на одной R9700: 863 токенов/с на префилле и 35 токенов/с на декодировании при контексте 230k
Пользователь тестирует модель Qwen3.8-Flash-Next (экспертная архитектура, квантование exl3) на видеокарте AMD Radeon RX 9700 с использованием бэкенда exllamav3. При работе с контекстом 230k токенов и частичным вынесением экспертов на CPU достигнуты скорости префилла 863 t/s и декодирования 34.7 t/s, что вызывает вопросы о корректности настройки и потенциале оптимизации.
score 40r/LocalLLaMA