ESC Hardware - PCs e Overclock
ReplywebpageEsse novo Gemini 3.6 gratuito dá uma surra no ChatGPT gratuito, que só libera 3 passagens no modelo mais ou menos deles e depois coloca um modelo muito burro para responder, acaba não servindo de nada. Até eu notei esse erro ai porque na página do Qwen tem um resumo dos parâmetros usados e tinha o --group-size -1 para INT8 lá.
A resposta do ChatGPT contém uma equívoco matemático e de arquitetura sobre o funcionamento do group-size, enquanto o raciocínio do Gemini e o uso do --sym estão alinhados com a arquitetura nativa do OpenVINO.
Aqui está a avaliação técnica detalhada sobre por que a recomendação do DeepSeek/ChatGPT com --group-size 128 não faz sentido para INT8 na CPU e qual é a combinação ideal para o seu hardware:
---
### 1. O erro de lógica sobre o --group-size 128 em INT8
O ChatGPT afirmou que *"group-size 128 reduz a quantidade de escalas carregadas da memória"*. Isso é matematicamente o oposto do que acontece na prática:
* No `--group-size -1` (Por Canal / Per-Channel):
O algoritmo cria 1 única escala por linha inteira da matriz (exemplo: para uma linha de 4096 números, existe apenas 1 fator de escala).
* No `--group-size 128` (Por Grupo):
O algoritmo cria 1 escala a cada 128 números. Em uma linha de 4096 números, ele criará 32 escalas distintas ($4096 / 128 = 32$).
> Conclusão Matemática: O --group-size 128 gera 32 vezes MAIS dados de escala na memória RAM do que o --group-size -1. Ele aumenta o consumo de metadados na RAM, em vez de reduzir.
---
### 2. Por que o --group-size 128 existe e por que ele só serve para INT4?
Dividir a matriz em grupos menores (group-size 64 ou 128) foi uma técnica inventada exclusivamente para o INT4 (4-bit):
* Em 4-bit, a perda de precisão é tão violenta que, se você usar uma escala por linha inteira, a IA "emburra" e perde a capacidade de raciocínio. Os grupinhos de 128 servem para recuperar a acurácia do 4-bit.
* Em INT8 (8-bit), a perda de precisão é imperceptível (~0.1%). Dividir em grupos de 128 em INT8 é um peso desnecessário que só serve para:
1. Multiplicar a quantidade de escalas na RAM por 32x.
2. Forçar o compilador C++ do OpenVINO (oneDNN) a fazer interrupções no registrador AVX-512 a cada 128 números para recarregar escalas.
---
#Guia Intel LLM Weight Compression INT8 Asymmetric | Symmetric | --group-size -1
https://docs.openvino.ai/2025/openvino-workflow/model-optimization-guide/weight-compression.html