Фотография
нажмите — покажем
нажмите — покажем
🔬 Alibaba наконец опубликовала тесты Qwen3.8-Max. В целом модель класса Claude Opus, поэтому по ценам вендор не демпингует. Я тестировал Qwen3.8-Max в научных исследованиях. В плане анализа научных работ с сильным математическим аппаратом вероятно это сейчас сильнейшая модель на рынке. Если Qwen3.8-Max нормально подумает своим длинным CoT, то там даже не кандидат, а скорее доктор наук по компетенции. Это видно и по лидерству в PaperBench. Иногда бывает перекос в критическую точку зрения, но уровень научно-технического разбора намного сильнее Claude, Gemini или DeepSeek. Если у вас у агентов научный блок, то Qwen3.8-Max очень хорошее решение.
В части разработки я бы больше обратил внимание не на SWE Bench, сейчас все фронтирные ИИ хорошо фиксят баги, а на более сложный Terminal Bench, где код для агента black box. Qwen пишет, что добился уровня автономной разработки в 10+ дней. Это тоже тренд, траектории разработки быстро удлиняются и более серьезной проблемой становится как корректно поставить задачу агентам на такой большой объем работ, т.к. коррекции по ходу их работы уже не вносятся. Это не Agile, а фактически AI Waterfall 2.0, где вы должны загружать в фабрику производства кода очень четкие задания. Мастерство управления агентами сдвигается в создание спеков и прототипов с демонстрацией агентам что требуется.
Модель как и Kimi K3 имеет нативное мультимодальное обучение, т.е. модель в pretraining сразу же училась на смеси текстов и графиков. Alibaba публикует множество бенчмарков на Vision с топовыми результатами, где можно выделить CharXiv, где от модели требуется умение читать сложные диаграммы и схемы не уровня графиков «купи-продай», а уровня научных исследований.
Qwen3.8-Max и Qwen3.8-27B будут open-weights. Очень интересная модель на 27B весов, т.к. даже предыдущая версия на стеке Python и React показывала способность программировать на уровне LLM. Для тех кто в «закрытом контуре» это важная модель, т.к. можно как минимум на ней писать тесты.
Цены:
Ввод: $2.0 / M токенов
Вывод: $6.0 / M токенов
Кэширование: $0.25 / M токенов
Alibaba уверен в качестве модели, раз ставит такие цены.
2.2K ·