Ответсообщение недоступно
Я предполагаю, что проблема в onnx. Возможно, он не оптимизирует под квантованную модельку вычисления, а падает скорость, потому что после квантизации сам граф модельки побольше становится обычно. Я бы попробовал в OV все квантизовать и там посмотреть на скорость, но в первую очередь проверить VNNI на наличие