ChatCrawlersearch across public Telegram Open the app
E

ESC Hardware - PCs e Overclock

сообщение · 2026-07-28 15:03 UTC
E
ESC Hardware - PCs e Overclock
Replywebpage
Esse novo Gemini 3.6 gratuito dá uma surra no ChatGPT gratuito, que só libera 3 passagens no modelo mais ou menos deles e depois coloca um modelo muito burro para responder, acaba não servindo de nada. Até eu notei esse erro ai porque na página do Qwen tem um resumo dos parâmetros usados e tinha o --group-size -1 para INT8 lá. A resposta do ChatGPT contém uma equívoco matemático e de arquitetura sobre o funcionamento do group-size, enquanto o raciocínio do Gemini e o uso do --sym estão alinhados com a arquitetura nativa do OpenVINO. Aqui está a avaliação técnica detalhada sobre por que a recomendação do DeepSeek/ChatGPT com --group-size 128 não faz sentido para INT8 na CPU e qual é a combinação ideal para o seu hardware: --- ### 1. O erro de lógica sobre o --group-size 128 em INT8 O ChatGPT afirmou que *"group-size 128 reduz a quantidade de escalas carregadas da memória"*. Isso é matematicamente o oposto do que acontece na prática: * No `--group-size -1` (Por Canal / Per-Channel): O algoritmo cria 1 única escala por linha inteira da matriz (exemplo: para uma linha de 4096 números, existe apenas 1 fator de escala). * No `--group-size 128` (Por Grupo): O algoritmo cria 1 escala a cada 128 números. Em uma linha de 4096 números, ele criará 32 escalas distintas ($4096 / 128 = 32$). > Conclusão Matemática: O --group-size 128 gera 32 vezes MAIS dados de escala na memória RAM do que o --group-size -1. Ele aumenta o consumo de metadados na RAM, em vez de reduzir. --- ### 2. Por que o --group-size 128 existe e por que ele só serve para INT4? Dividir a matriz em grupos menores (group-size 64 ou 128) foi uma técnica inventada exclusivamente para o INT4 (4-bit): * Em 4-bit, a perda de precisão é tão violenta que, se você usar uma escala por linha inteira, a IA "emburra" e perde a capacidade de raciocínio. Os grupinhos de 128 servem para recuperar a acurácia do 4-bit. * Em INT8 (8-bit), a perda de precisão é imperceptível (~0.1%). Dividir em grupos de 128 em INT8 é um peso desnecessário que só serve para: 1. Multiplicar a quantidade de escalas na RAM por 32x. 2. Forçar o compilador C++ do OpenVINO (oneDNN) a fazer interrupções no registrador AVX-512 a cada 128 números para recarregar escalas. --- #Guia Intel LLM Weight Compression INT8 Asymmetric | Symmetric | --group-size -1 https://docs.openvino.ai/2025/openvino-workflow/model-optimization-guide/weight-compression.html

Вся лента · оригинал в Telegram

Open in Telegram Каталог площадок Искать в ChatCrawler

A snapshot of an open public feed from the search index ChatCrawler — “Google for public Telegram”; refreshed as the venue is crawled. Times are UTC.

Public content only, official Telegram API. About · FAQ · What we do not do · Remove a page · Catalog