Ответсообщение недоступно
Можно попробовать отпрофилировать.
1) Не видел пока (не значит, что их нет в природе) профилировщиков заточенных под ML Workload’ы, но можно попробовать General Purpose, например Intel VTune
2) Не все ворклоады выигрывают от квантизации. С одной стороны - это действительно уменьшает прогоны памяти (и улучшает кэширование), увеличивает возможности для использования SIMD. Двойной выигрыш в плане Roofline Projection. С другой - на современных процессорах это работает намного сложнее. К примеру могут получаться последовательности инструкций, не поддающиеся конвейеризации, могут получаться незаалайненные чтения и много что еще.
3) Если речь про i9 начиная с 12900 - посмотрел бы на параллелизацию. Если используется что-то в духе OpenMP под капотом - могут быть точки синхронизации между тредами на разных по мощности ядрах. Тогда P ядра могут простаивать.