Tensor banana chat
webpage
нажмите — покажем
нажмите — покажем
Qwen3.6-35b со скоростью 270t/s на 5090 и RTX 6000 Pro
pp 13400 t/s
Tg 270 t/s без MTP
Tg 320 t/s с MTP
Другие модели и видюхи не поддерживает
Оптимизированный форк llama.cpp:
https://github.com/ambud/q36
https://www.reddit.com/r/unsloth/s/g1Up9Ctb6P