Replymessage unavailable
Dipende anche dall'uso che devi fare, la maggioranza di questi modelli come qwen3.6 ottengono ottimi risultati nei benchmark tramite "overthinking", cioè sono addestrati per generare >4-8k token a richiesta. Il che diventa insostenibile insieme ad un throughput (tokens/s) di per se basso localmente