Erik CoelhoФотография
Фотография
click to show
click to show
Fiz a migração do Optimum para OpenVINO GenAI, que é hibrido de Python e C++ onde o Python não é tão eficiente igual a parte de tokenização de arquivos grandes.
E tem muito algoritmos de otimização impressionantes como esse:
https://openvinotoolkit.github.io/openvino.genai/docs/concepts/optimization-techniques/sparse-attention-prefill/
E esse onde você usa a versão de menor peso do seu modelo principal e integra as duas no mesmo script, para usar no mesmo prompt.
Esse é o maior problema quando vai usar um modelo grande para coisas simples tem que ler uma parte enorme na memória e cache gigante para responder algo básico:
https://openvinotoolkit.github.io/openvino.genai/docs/concepts/optimization-techniques/speculative-decoding#speculative-decoding-fast-draft
Esse ainda não implementei tem que estar na exata quantização.