Фотография
нажмите — покажем
нажмите — покажем
Только что обновился DeepSeek V4 Flash. Хотя они и не фанаты бенчмарков, но улучшения по тестам просто драматические. Флешка сильнее старой Pro-версии и по тестам сильнее GLM-5.2. Скорее всего, между Opus и Sonnet по силе.
Особенно я бы отметил Terminal Bench. Я разбирал внимательно этот тест для DeepSeek, и он намного сложнее для ИИ, чем фикс багов. Просто при фиксе багов LLM видит код, поэтому ей легко делать гипотезы, что фиксить. А вот терминальный тест — это black box, там ИИ приходится вслепую делать гипотезы. Раньше Flash и Pro различались тут особенно сильно у DeepSeek.
На мой взгляд, для бэкенда DeepSeek — вполне хороший выбор. Фронтенды он делать может, но дизайн «не вау». Скорее просто формочки для ввода данных. Поэтому я бы UI делал в GLM или Opus сначала эскизно, а потом отдавал DeepSeek.
https://api-docs.deepseek.com/updates/
4.3K ·