Ответсообщение недоступно
Фотография
нажмите — покажем
нажмите — покажем
С добавлением воркфлоу в Claude Code я заметил, что там зачастую работают модели Sonnet и Haiku для рутинных задач. Они дешевле, но по производительности особо не отличаются от Opus.
В целом время работы в облачных моделях стало ужасным. Во многих задачах складывается впечатление, что модель просто ждёт, а не делает задачу.
Начал тестировать локальные модели не только по качеству реализации, но и по времени работы. На моей пекарне чуть больше ресурсов, чем нужно, и значит, можно их задействовать в полезной нагрузке. А значит, реально заменить модели Sonnet и Haiku на локальную.
Провёл тесты, результаты оказались отличными на MoE-моделях. Мой фаворит, Gemma-4-26B-A4B, оказалась сверхбыстрой и при этом достаточно качественной. Прирост производительности — в 5 раз.
А чтобы она работала вместо этих двух моделек, буду использовать CCR.
MoE-модели в целом очень приятны в домашнем использовании: там немного активных параметров, но при этом качество ответов практически такое же. Это видно, например, по Qwen Coder Next: модель имеет размер 51 GB, но 3B активных параметров. Она не влезает полностью на две мои видюхи, но ей это не мешает. А у Gemma 4 31B все 31B активные, и она полностью помещается на две видюхи, но производительность у неё низкая из-за того, что на каждый токен ей нужно пересчитать все активные веса. На скрине — таблица с отчётом.
380 ·