Веб-версияОткрыть в Telegram
GGaperton's Tech Corner

Gaperton's Tech Corner

@gaperton_tech · канал · Технологии · в индексе с 2026-05-29
372подписчиков+3 за неделю
1 006постов в индексе
Gaperton's Tech Corner
Ответ#tomorrow
Фотография
нажмите — покажем
В Х массовая истерия по поводу 27B. Ждут чего-то не слабее чем Opus. От херни которая работает в 24GB VRAM.
2 · 258 ·
Фотография
нажмите — покажем
Grok уже в 4.5 стал адекватным, а теперь так ваще. Хорошо это потому что его можно, как ChatGPT, подключить к Hermes по подписке. В целом, со временем они все примерно упрутся в потолок, и начнется конкуренция по цене.
3 · 262 ·
G
Фотография
нажмите — покажем
Да они издеваются.
249 ·
G
Gaperton's Tech Corner
Я устал целовать в жопу молодых специалистов, и поэтому накатал специальные правила, как вести себя во время дискуссий группового проектирования. Ну и вообще – технических дискуссий. Они нарушают каждый пункт. Поэтому ничего лишнего здесь нет. Может кому полезно окажется в общем. Это всё не так просто перевести в слова. Design Discussion Rules I’d like to establish a few communication rules for our design discussions to make them more effective and reduce unnecessary back-and-forth: Uncertainty and misunderstanding: ✔️ Be explicit about uncertainty. If you don’t know, acknowledge that directly. Ask questions when the missing information could materially change the outcome. ✔️ Be explicit about misunderstanding. If something is unclear or underspecified, say so directly rather than guessing. When a reasonable assumption is sufficient, state the assumption explicitly and proceed. ✔️ Change the explanation when something isn’t understood. If someone says they didn’t understand or repeats the same question, explain it differently rather than repeating the same explanation or pointing out that it was already given. Questions and answers: ✔️ Answer the question actually asked. Don’t substitute a different or adjacent question because it seems more useful, more important, or easier to answer. If the premise is incorrect, say so directly. ✔️ Match the form of the answer to the question. For a yes/no question, lead with “yes,” “no,” or “not sure.” Add an explanation afterward if needed. Precise speech: ✔️ Maintain terminological stability. Use the same term for the same concept unless a distinction is intentional. Choose the clearest and most specific wording. Avoid unnecessary synonyms, decorative language, and rhetorical devices used mainly to make the language sound polished. ✔️ Use explicit references. Prefer specific names, objects, components, or concepts over pronouns when a pronoun could make the meaning ambiguous or require the reader to infer
26 · 366 ·
G
Gaperton's Tech Corner
Фотография
нажмите — покажем
А неплохо. Лучшая малая модель. Hermes умеет разные специальные запросы направлять на модели попроще, например локальные. Ну например, страницу скачать и распарсить. Это экономит квоту на большую модель которая основаная. Смекаете, да?
7 · 273 ·
Фотография
нажмите — покажем
Кстати, AtomicChat никто не пробовал? У них тоже неплохая квантизация как у unsloth. На тему того какую выбирать — напоминаем. Минимум это Q4, рабочий выбор Q5, если есть память и нужно больше качества то Q6. Дальше народ перестает на глаз замечать разницу, особенно с динамическими квантами как у unsloth. Это для малых моделей. А для 200B+ параметров тесты показывают что даже Q3 и Q2 в динамических квантах не так плохо. Для k/v cache квантизация должна быть Q8 или F16. То есть, малую модель надо трамбовать в VRAM в кванте Q4 с kv-cache Q8.
3 · 251 ·
ОтветКстати, AtomicChat никто не пробовал? У них тоже неплохая квантизация как у unsloth. На тему того какую выбирать — напоминаем. Минимум это Q4, рабочий выбор Q5, если есть память и нужно больше качества то Q6. Дальше народ перестает на глаз замечать разницу, особенно с динамическими квантами как у u
Qwen3.8-27B — только что жене отдал тестировать. У меня AMD R9700 32GB. Модель unsloth Q6_K_XL Это дает примерно 170К токенов контекста в Q8. Скорость генерации 41 t/s (c OTP). Живенько. В 24GB VRAM тоже можно запустить. Но придется жить поскромнее. Никакого Q6. R9700 по скорости почти один в один как Apple M5 Max. Это практический минимум что можно терпеть. "Удовлетворительно", то есть тройка.
4 · 252 ·
Фотография
нажмите — покажем
А это тест, который я провел на своем R9700. Он показывает, насколько скорость декодирования dense модели Qwen зависит от квантизации и MTP. Квантизация взята от unsloth. Здесь я тестировал 3.6, но на новой модели 3.8 будет примерно то же самое. Как видите, за Q5 вы в сравнении с Q4 почти ничего не платите.
1 · 245 ·
G
ОтветА это тест, который я провел на своем R9700. Он показывает, насколько скорость декодирования dense модели Qwen зависит от квантизации и MTP. Квантизация взята от unsloth. Здесь я тестировал 3.6, но на новой модели 3.8 будет примерно то же самое. Как видите, за Q5 вы в сравнении с Q4 почти ничего н
Фотография
нажмите — покажем
А вот это тест Qwen3.6-27B, который показывает, сколько влезает контекста Q8 в 32 гигабайта видеопамяти в зависимости от квантизации. Тоже мой. На длинном контексте всем этим моделям плохеет, они становятся медленными и глупыми. Поэтому я лично не вижу практического смысла в контексте длиннее чем 128К. Это все делает квант Q6 вполне практичным в 32GB. В 24 гигабайтах вам придется делать Q4. Это прям минимум-минимум. Но тоже вполне рабочая штука. В 16GB вам придется пускать МoЕ модели, это модели, в имени которых после первой цифры идет вторая, вида 35B-A3B.
3 · 265 ·
Gaperton's Tech Corner
Фотография
нажмите — покажем
DeepSeek поднял цены на Flash. Не только американские лавки субсидируют цены на токены, в общем. Но китайцам это обходится сильно дешевле. Сейчас Luna дешевле. И ждем теста Qwen3.8-27B — малые модели обходятся практически бесплатно если их пускать на своем оборудовании, и я ожидаю что они за год сожрут весь этот хвост слева. Пока, 3.8-27B очень людям нравится.
237 ·
ОтветDeepSeek поднял цены на Flash. Не только американские лавки субсидируют цены на токены, в общем. Но китайцам это обходится сильно дешевле. Сейчас Luna дешевле. И ждем теста Qwen3.8-27B — малые модели обходятся практически бесплатно если их пускать на своем оборудовании, и я ожидаю что они за год с
Фотография
нажмите — покажем
Говоря о запуске чего-то на своем оборудовании — напоминаем что кучка слева лезет в 8-32GB VRAM. А Deepseek — в 128GB unified memory с трудом и в 192GB комфортно. Это позволяем нам утверждать что весь хвост слева на предыдущем графике будет в скорой перспективе сожран локальными моделями. Процесс займет 1-2 года, нужен новый цикл оборудования в котором любой телефон сможет гонять малую модель. Не уложимся в один цикл — значит уложимся в два, и это будет 3-4 года. Фронтир разумеется останется в облаке, но он мало того что подешевеет — на него будет идти только часть трафика где он реально нужен. Это все будет на фоне конкуренции по цене с открытыми моделями и независимыми провайдерами. В общем, OpenAI и Anthropic ждут тяжелые времена. Лоббисты в США наверное всерьез попробуют запретить китайские модели. Думаю, эта попытка закончится провалом — эту скам-модель в которой оперирует Уолл-Стрит не спасти.
1 · 237 ·
Ссылка
нажмите — покажем
https://x.com/thesupermanmx/status/2088551268793090178?s=20 Статья от Boston University, где авторы сделали то что я прикинул на коленке примерно год или полгода назад, прийдя разумеется примерно к тем же выводам. The researchers mathematically tested every popular fix. Universal Basic Income? Fails. It raises the living standard but doesn't change the corporate incentive to cut jobs. Retraining? Fails. Worker equity? Fails. Только мой вывод был глубже — рынок как известно закладывает в цену все известные прогнозы, и поэтому прогнозы никогда не сбываются. Как только все вот в это поверят — все очень возможно что немедленно наебнется. И оно пойдет не так.
1 · 246 ·
ОтветГоворя о запуске чего-то на своем оборудовании — напоминаем что кучка слева лезет в 8-32GB VRAM. А Deepseek — в 128GB unified memory с трудом и в 192GB комфортно. Это позволяем нам утверждать что весь хвост слева на предыдущем графике будет в скорой перспективе сожран локальными моделями. Процесс з
Фотография
нажмите — покажем
Две 3090 это очень хороший вариант. Наверное лучше чем одна 5090. Учтите что мать должна поддерживать два полноценных слота PCIe x16 или x8, а таких матерей мало. Ну, и надо БП на 1000-1200W минимум. А чо, 48GB VRAM на дороге не валяются. Две R9700 это плохой вариант. Если вы не используете их раздельно. Говорю как владелец. Одна R9700 — отлично. Лучше чем одна 3090.
1 · 273 ·
G
Фотография
нажмите — покажем
Q6 практически не отличим от Q8, и на деле мало отличается от Q4. Но самое интересное — Q3_XXS не катастрофа. Это так для малых моделей, а для средних это еще лучше. Q6_K привязывает Q8_0 ко второму знаку после запятой, поэтому самый большой файл в рейтинге здесь ничего не добавляет. Особенно выделяется UD-IQ3_XXS: 92,7 из 93,7 по Q8 при работе с файлом размером 11,1 ГБ со скоростью 96 токов/с, что позволяет уместить плотный файл объемом 27B в лимит карты объемом 16 ГБ практически с полным качеством. https://x.com/witcheer/status/2088940018144326007?s=20
293 ·
G
Gaperton's Tech Corner
Фотография
нажмите — покажем
У Qwen3.8-27B космический интеллект для ее размера. Примерно как у DeepSeek V4 Flash.
2 · 276 ·
Gaperton's Tech Corner
Фотография
нажмите — покажем
Новости.
1 · 301 ·
Фотография
нажмите — покажем
Это оценки за домашние работы против оценок на экзамене.
10 · 454 ·
G
Фотография
нажмите — покажем
Заново качайте 3.8-27B короче.
3 · 307 ·
Gaperton's Tech Corner
Фотография
нажмите — покажем
Очередь, понимаете-ли, на Mac Studio. В комментах пишут что этот дефицитный товар можно загнать на eBay за большие деньгию
2 · 271 ·
Видео
rXQnx72Jy3jeaLp2.mp4 · 9.6 МБ · нажмите — покажем
#nothing_special #just 🇨🇳 World Humanoid Robot Games 2026 in Beijing Это все на фоне безумия Антропика, обещающего конец света, и попыток запретить китайские модели, создает крайне плохую оптику для США.
4 · 238 ·
Фотография
нажмите — покажем
Попытки надуть пузырь вокруг VR и "метавселенных" промните? Цук тогда так впечатлился, что компанию в "мета" переименовал. Ну вот.
2 · 238 ·
G
Фотография
нажмите — покажем
Qwen 3.8 Low and Medium are goated Artificial Analysis just benchmarked them and the scores are crazy good, proving the earlier success wasn't only enabled by overthinking. Восторги вокруг Qwen 3.8-27B не только не утихают, но становятся больше. Народ говорит это первая модель от которой есть прям реальная польза.
1 · 232 ·

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем