30 июня 2024
AnimatronicПростите, скорость падает..., исправил опечатку
Я предполагаю, что проблема в onnx. Возможно, он не оптимизирует под квантованную модельку вычисления, а падает скорость, потому что после квантизации сам граф модельки побольше становится обычно. Я бы попробовал в OV все квантизовать и там посмотреть на скорость, но в первую очередь проверить VNNI на наличие
AnimatronicПростите, скорость падает..., исправил опечатку
Можно попробовать отпрофилировать.
1) Не видел пока (не значит, что их нет в природе) профилировщиков заточенных под ML Workload’ы, но можно попробовать General Purpose, например Intel VTune
2) Не все ворклоады выигрывают от квантизации. С одной стороны - это действительно уменьшает прогоны памяти (и улучшает кэширование), увеличивает возможности для использования SIMD. Двойной выигрыш в плане Roofline Projection. С другой - на современных процессорах это работает намного сложнее. К примеру могут получаться последовательности инструкций, не поддающиеся конвейеризации, могут получаться незаалайненные чтения и много что еще.
3) Если речь про i9 начиная с 12900 - посмотрел бы на параллелизацию. Если используется что-то в духе OpenMP под капотом - могут быть точки синхронизации между тредами на разных по мощности ядрах. Тогда P ядра могут простаивать.