Видео
Qwen-3.0-30B-Agantic.mp4 · 1005 KB · click to show
Qwen-3.0-30B-Agantic.mp4 · 1005 KB · click to show
Modelo de LLM Local Qwen de 30 bilhões de parâmetros, via CLI (sem Open WebUI) totalmente funcional, com agentes e várias ferramentas.
URL do modelo otimizado pela Intel:
https://huggingface.co/OpenVINO/Qwen3-30B-A3B-Instruct-2507-int8-ov
│ ⚡️ Motor de Inferência: OpenVINO C++ Engine (Intel CPU AVX-512 VNNI) │
│ 💎 Modelo & Precisão: Qwen3-30B (INT8 Weight-Only Quantization) │
│ 🎯 Extração de Erros: Busca Web focada em Logs/Tracebacks do arquivo │
│ 📄 Suporte a Arquivos: Markdown (.md), Textos (.txt) + Docling (PDFs) (Ativo) │
│ 🔍 Busca Web Automática: DuckDuckGo API
#Guia Inferência com Intel Optimum
https://docs.openvino.ai/nightly/openvino-workflow-generative/inference-with-optimum-intel.html
OpenVINO Tokenizers
https://docs.openvino.ai/2026/openvino-workflow-generative/ov-tokenizers.html
Intel Optimum tem integração com Hugging Face para converter ou executar os modelos
https://huggingface.co/docs/optimum-intel/index
Com tantas ferramentas para o agente num único prompt com modelo muito grande fica pesado. mesmo sendo int8 mais ou menos a metade dos tokens por segundo em relação a correr sem agente/tools.
Mas tem outros modelos mais leves de 27B como o Qwen 3.5 e 3.6, mas infelizmente a função de cache crucial para rodar em RAM, não está disponível em int8 nem pela conversão via Optimum-CLI.
111 ·