ChatCrawlerпоиск по публичному Telegram Открыть приложение
A

AI Projects

сообщение · 2026-08-03 03:20 UTC
V
Фотография
нажмите — покажем
🔬 Alibaba наконец опубликовала тесты Qwen3.8-Max. В целом модель класса Claude Opus, поэтому по ценам вендор не демпингует. Я тестировал Qwen3.8-Max в научных исследованиях. В плане анализа научных работ с сильным математическим аппаратом вероятно это сейчас сильнейшая модель на рынке. Если Qwen3.8-Max нормально подумает своим длинным CoT, то там даже не кандидат, а скорее доктор наук по компетенции. Это видно и по лидерству в PaperBench. Иногда бывает перекос в критическую точку зрения, но уровень научно-технического разбора намного сильнее Claude, Gemini или DeepSeek. Если у вас у агентов научный блок, то Qwen3.8-Max очень хорошее решение. В части разработки я бы больше обратил внимание не на SWE Bench, сейчас все фронтирные ИИ хорошо фиксят баги, а на более сложный Terminal Bench, где код для агента black box. Qwen пишет, что добился уровня автономной разработки в 10+ дней. Это тоже тренд, траектории разработки быстро удлиняются и более серьезной проблемой становится как корректно поставить задачу агентам на такой большой объем работ, т.к. коррекции по ходу их работы уже не вносятся. Это не Agile, а фактически AI Waterfall 2.0, где вы должны загружать в фабрику производства кода очень четкие задания. Мастерство управления агентами сдвигается в создание спеков и прототипов с демонстрацией агентам что требуется. Модель как и Kimi K3 имеет нативное мультимодальное обучение, т.е. модель в pretraining сразу же училась на смеси текстов и графиков. Alibaba публикует множество бенчмарков на Vision с топовыми результатами, где можно выделить CharXiv, где от модели требуется умение читать сложные диаграммы и схемы не уровня графиков «купи-продай», а уровня научных исследований. Qwen3.8-Max и Qwen3.8-27B будут open-weights. Очень интересная модель на 27B весов, т.к. даже предыдущая версия на стеке Python и React показывала способность программировать на уровне LLM. Для тех кто в «закрытом контуре» это важная модель, т.к. можно как минимум на ней писать тесты. Цены: Ввод: $2.0 / M токенов Вывод: $6.0 / M токенов Кэширование: $0.25 / M токенов Alibaba уверен в качестве модели, раз ставит такие цены.
2.2K ·

Вся лента · оригинал в Telegram

Открыть в Telegram Лента t.me/s Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог