Фотография
нажмите — покажем
нажмите — покажем
⚡️ Это очень интересные практические тесты на DeepSeek V4 Flash с DSpark на двух штуках DGX Spark. Это оборудование около $10 000 в сумме, что для запуска фронтирной LLM вообще ни о чём. Отмечу, что тут речь идёт о запуске оригинальной, а не квантованной модели с деградацией.
Инженер на деле делал много тестов DSpark в разных конфигурациях с preview и релизом, а также моделирование нескольких соединений. Сам по себе DSpark действительно ускоряет до 60%, т.к. без него скорость была 60 токенов/сек, с ним стало 96 токенов/сек.
Но тут сильно влияет ещё вариант, сколько соединений, т.к. DSpark на деле устроен хитро для использования простаивающих мощностей GPU за счёт Hardware Scheduler. Если нагрузить сервер сильнее, то выигрыш снизится до 20% примерно.
💡 Однако то, что можно всего за $10K запускать фронтирную модель и даже на 4-х пользователях с более-менее приемлемой скоростью инференса — это невероятная экономика.
https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
2.9K ·