ChatCrawlerпоиск по публичному Telegram Открыть приложение
M

Machine learning chat

снимок за июнь 2024
июнь 2024 ×
30 июня 2024
A
Всем привет. Кто-нибудь квантовал CV модели через ONNX? Не сталкивались с падением скорости инференса? Проблема: Квантую модель в onnx, а скорость инференса не растёт.
С
железяку бы ещё по-хорошему говорить сверху
ха, инт8)) конечно скорость увеличилась))
М
размер меньше + целочисленные вычисления
М
а писал "Квантую модель в onnx, а скорость инференса растёт"
A
Простите, скорость падает..., исправил опечатку
AnimatronicПростите, скорость падает..., исправил опечатку
Я предполагаю, что проблема в onnx. Возможно, он не оптимизирует под квантованную модельку вычисления, а падает скорость, потому что после квантизации сам граф модельки побольше становится обычно. Я бы попробовал в OV все квантизовать и там посмотреть на скорость, но в первую очередь проверить VNNI на наличие
можно ещё здесь почитать, мб что-то в кассу будет
С
но проблема интересная
N
AnimatronicПростите, скорость падает..., исправил опечатку
Можно попробовать отпрофилировать. 1) Не видел пока (не значит, что их нет в природе) профилировщиков заточенных под ML Workload’ы, но можно попробовать General Purpose, например Intel VTune 2) Не все ворклоады выигрывают от квантизации. С одной стороны - это действительно уменьшает прогоны памяти (и улучшает кэширование), увеличивает возможности для использования SIMD. Двойной выигрыш в плане Roofline Projection. С другой - на современных процессорах это работает намного сложнее. К примеру могут получаться последовательности инструкций, не поддающиеся конвейеризации, могут получаться незаалайненные чтения и много что еще. 3) Если речь про i9 начиная с 12900 - посмотрел бы на параллелизацию. Если используется что-то в духе OpenMP под капотом - могут быть точки синхронизации между тредами на разных по мощности ядрах. Тогда P ядра могут простаивать.
Открыть в Telegram Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог