Вчора заради цікавості трохи поганяв локальний Qwen3.8-27B на RTX 5090 32 GB і вирішив перевірити не стільки «наскільки він розумний», скільки наскільки йому взагалі можна довіряти як research/agent-моделі.
Підключив йому web-search + fetch сторінок і дав задачу підібрати/порівняти локальні LLM/VLM під 5090: agentic flows, coding, vision тощо. Потім зберіг увесь його trace з reasoning, tool calls, знайденими джерелами та фінальними висновками й окремо віддав ChatGPT на fact-check.
Загалом Qwen виступив несподівано добре. Він нормально будував multi-step search: якщо пошук нічого не знаходив, змінював запити, пробував прямі URL, доходив до офіційних HuggingFace README/config.json і arXiv, а не просто переказував SEO-статті. Наприклад, по Qwen3.6-35B-A3B сам витягнув офіційні параметри: 35B total / 3B active, 256 experts, 8 routed + 1 shared, 262K native context, і реальні benchmark’и: SWE-bench Verified 73.4, Terminal-Bench 51.5, Claw-Eval 68.7. Ще знайшов і сам виправив свою помилку, коли спочатку назвав модель text-only — офіційний config показав vision encoder.
По InternVL3.5 взагалі вийшло цікаво: Qwen поліз прямо в config.json і з’ясував, що InternVL3.5-38B = Qwen3-32B + приблизно 5.5–6B vision encoder, а в 14B і 30B-A3B vision-частина всього близько 0.3B. Причому він не повірив лише назві intern_vit_6b, а подивився hidden size/layers і зрозумів, що в 30B-A3B це насправді маленький ViT. Це вже цілком нормальна інженерна перевірка джерела, а не просто autocomplete.
Але слабке місце теж дуже добре проявилося. Факти з первинних джерел він витягує добре, а от інженерні висновки з них інколи починає додумувати. Наприклад, видавав оцінки на кшталт 75–90 tok/s, 64–128K context буде комфортно, приблизно у 2 рази швидше, хоча конкретних benchmark’ів саме під цей runtime не було. Один раз узагалі написав, що Qwen3.8 використовує звичайне quadratic attention і 32K+ context, хоча раніше сам же знайшов офіційний config: там hybrid linear/full attention і 262K native context.
Ще характерний косяк: складав розміри моделей і казав, що дві моделі «влізуть у 32 GB», але забував про KV cache, CUDA/runtime buffers і multimodal projector. Тобто вагу моделі рахує, а реальний VRAM budget — уже гірше.
У сухому залишку після перевірки я б дав йому приблизно:
tool use 9/10,
пошук первинних джерел 9/10,
витяг фактів 9/10,
самокорекція 8/10,
оцінка performance/VRAM 4–5/10,
загальна надійність research-answer ~7–8/10.
Тобто як локальний research-agent на одній 5090 — уже реально цікава штука. Але цифри й висновки типу «отже буде X tok/s / Y GB / ця модель точно краща» я б поки що обов’язково переперевіряв. Невеликий вечірній тест, але доволі показовий.