Источник: Z.ai.
<!-- /wp:image -->
<!-- wp:paragraph -->
В компании заявили, что прирост мощностей по сравнению с GLM-5.2 (https://forklog.com/news/ai/zhipu-ai-otkryla-glm-5-2-s-kontekstom-v-1-mln-tokenov) получен исключительно за счет посттренировки, без смены базовой модели.
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
Открытые веса опубликуют через две недели после оценки безопасности и дополнительного харденинга.
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
На внутреннем бенчмарке Code Bench для оценки кодинга GLM-5.3 улучшила результат предшественника на 50%.
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
В релизной таблице Z.ai привела сравнение по ряду тестов:
<!-- /wp:paragraph -->
<!-- wp:list -->
<!-- wp:list-item -->
Terminal Bench 3.0 — 28,3 балла против 4,6 у GLM-5.2;
<!-- /wp:list-item -->
<!-- wp:list-item -->
DeepSWE v1.1 — 66,9 против 46,2;
<!-- /wp:list-item -->
<!-- wp:list-item -->
Agents' Last Exam — 28,5 против 23,8;
<!-- /wp:list-item -->
<!-- wp:list-item -->
CyberGym — 84,5% против 77,2%;
<!-- /wp:list-item -->
<!-- wp:list-item -->
ExploitBench — 54,4% против 24,4%.
<!-- /wp:list-item -->
<!-- /wp:list -->
<!-- wp:paragraph -->
Отдельно выделен ExploitGym. Модель закрыла 105 задач за двухчасовой бюджет против 29 у GLM-5.2. В шестичасовом бюджете показатель вырос до 130 задач вместо 39 у предыдущей версии.
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
Еще один блок релиза — тестирование на реальных кодовых базах вместе с несколькими командами по безопасности в Китае. Z.ai сообщила, что после проверки и дедупликации система выявила 2436 уязвимостей в 269 проектах, включая 1097 проблем средней и высокой критичности.
<!-- /wp:paragraph -->
<!-- wp:image {"id":286331,"sizeSlug":"full","linkDestination":"none"} -->