24 серпня 2026
• ВадимНа чому запускали? У мене досвід негативний
LM Studio, чи ви про що? Залізо вказано - 5090, це карта Nvidia, квантизація Q6, контекст 36к
Sergiiтекст ще не в індексі
як думаєте, наскільки реально витиснути подібний результат на 16ГБ VRAM, чи таких варіацій цієї моделі ще не існує?
SergiiLM Studio, чи ви про що? Залізо вказано - 5090, це карта Nvidia, квантизація Q6, контекст 36к
Так я про studio, запускав через ollama то геть погано, вже не пам'ятаю метрик, але н сподобалось
Benми про якість (результат), не тільки можливість подальшого стиснення
так робіть офлоад бажаної моделі, просто швидкість менше буде. Але dflash2 реально непоганий
• ВадимТак я про studio, запускав через ollama то геть погано, вже не пам'ятаю метрик, але н сподобалось
офлоадінг у звичайну рам був? який квант/контекст? коли офлоадінг переходить у звичайний рам то він стає серйозним ботлнеком
Benяк думаєте, наскільки реально витиснути подібний результат на 16ГБ VRAM, чи таких варіацій цієї моделі ще не існує?
погратись можна але 16 це дуже мало. Навіть 32 це часто в притик і з квантизацією Q4-Q6 в залежності від моделі.
Tritiumтак робіть офлоад бажаної моделі, просто швидкість менше буде. Але dflash2 реально непоганий
ollama теж так вміє, але падіння швидкодії катастрофічне як правило
Benollama теж так вміє, але падіння швидкодії катастрофічне як правило
от як раз офлоадінг це треба двічі прдумати, бо генерація токенів падає в рази і може і на порядок, згаданий мною квен 3.8 27млр параметрів без офлоадінгу генерую близько 70 токенів на секунду на карті 5090, це дуже шустро
Sergiiофлоадінг у звичайну рам був? який квант/контекст? коли офлоадінг переходить у звичайний рам то він стає серйозним ботлнеком
RTX5090, ~100к контексту ліміт. Потом може ще спробую але не на олламі/
GLM5.2 запускав через colibri, швидкіть ~1.5 токена/с
• ВадимМоже просто до платних флагманів привик
ну локальні моделі не конкурент клаудним флагманам, це геть різні речі.
Sergiiну локальні моделі не конкурент клаудним флагманам, це геть різні речі.
Та, а от кімі та glm доволі близькі
• ВадимТам ділиться щей між RAM/SSD (на два SSD)
на ссд, ну то вже таке...поексперементувати ок але я пробував запускати середні моделі на рам, фігня, генерація 1-3 токена в секунду то настільки довго що не бачу сенса
Benollama теж так вміє, але падіння швидкодії катастрофічне як правило
Dflash2 мав би витягувати, звісно що без нього швидкість фігова була б