Reddit
Конвейер литературного перевода на двух моделях: gemma-4-26B + Qwen3.6-35B на 2x Tesla P40 со специулятивным декодированием MTP
Автор описывает локальный пайплайн перевода художественных книг EN→RU, использующий две MoE-модели на паре Tesla P40. Gemma-4-26B отвечает за перевод (~40 ток/с), Qwen3.6-35B — за вычитку (50-70 ток/с), обе работают со специулятивным декодированием MTP и 64K контекстом. В посте приведены полные команды запуска llama-server с оптимизированными флагами для максимальной производительности.
score 55r/LocalLLaMA