Ускорение локального Qwen3.8-flash-next
Если вы интересуетесь запуском локальных LLM, и пробовали запускать Qwen3.8-flash-next, и вас не устраивала скорость - то в мире появилось кое-что интересное.
https://github.com/Niko1221/Strata
У меня на компе 3090 24gb + 128 DDR4 на оригинальной модели было 15-17 токенов/сек
Увидел видео
Да-да, на ютубе. но кому интересно - найдет как поглядеть.
Скачал, развернул. 80! токенов/сек
Взял квант побольше. 70!
Просто пушка. Coder, который там предлагается как быстрый и типа сбалансированный у меня ну очень сильно галлюционирует. А вот обычный - прям кайф.
Короче пока восторг.

есть ещё калибри какая-то, тоже чудеса обещают