1 августа 2026
Anton OutkineКстати, мне тут Fable в режиме планировщика предложил запустить тяжёлую сессию со сложными правками в Opus 5, но не в high по умолчанию, а в xhigh.
То, что я вижу по прогону — получился такой мини-Fable, очень внимательный, вдумчивый и аккуратный, но куда более экономный по ток
Фотография
нажмите — покажем
нажмите — покажем
Внезапно!
Иван Валерьевичкодекс, кстати, предпочитает создавать чаты-исполнители на английском, и задания давать на английском (сам я, конечно, пишу на родном молдавском всегда при этом)
У многих сеток такое. Некоторые думают на английском независимо от языка запроса, а выдают уже как положено. Thinking сейчас скрывается по умолчанию и не всегда это заметно
webpage
нажмите — покажем
нажмите — покажем
Говорят, кими 3 (прям который 3т недавно выложили) можно локально через цпу даже с 32/64 гб озу запустить через новый движок, на маке про 64гб выдавал треть токена/сек
А кими 48b на 10 токенов в сек у них заработал, то есть мелкие до 100b тоже можно ускорить
https://open.substack.com/pub/marcobambini/p/the-waste-inference-engine?utm_source=share&utm_medium=android&r=8ti2b7
Сам не щупал, все лишние озу обменял на золото, кто пощупает отпишитесь
Yuriy Zolotovда я тоже видел как чувак на mac studio запустил и получил 30 t/s ))
прям 30 токенов в секунду:? мне клод говорит о 0,3 ток/с для триллионников
- Kimi K3 (2,78T): «The capital of Italy is Rome. [16 tokens, 49.31 s, 0.32 tok/s]» — и автор прямо пишет «approximately one third of a token per second». Причём его первоначальный прогноз был 1–1,5 ток/с, а по факту вышло ~0,3.
- Kimi-Linear 48B: «approximately 8.9 tokens per second» с бюджетом памяти 8 ГБ (после оптимизации с 2,15 с/токен до 0,12 с/токен).
Chaos Messпрям 30 токенов в секунду:? мне клод говорит о 0,3 ток/с для триллионников
- Kimi K3 (2,78T): «The capital of Italy is Rome. [16 tokens, 49.31 s, 0.32 tok/s]» — и автор прямо пишет «approximately one third of a token per second». Причём его первоначальный прогноз был 1–1,5 ток
Надо поисквать какая квантоака там была
Chaos Messпрям 30 токенов в секунду:? мне клод говорит о 0,3 ток/с для триллионников
- Kimi K3 (2,78T): «The capital of Italy is Rome. [16 tokens, 49.31 s, 0.32 tok/s]» — и автор прямо пишет «approximately one third of a token per second». Причём его первоначальный прогноз был 1–1,5 ток
дая перепутал, там у него на m1 mac с 64GB RAM выдавал 0.3 токена в секунду ))
2 августа 2026
ВикторИнглиш лангуаге меньше токенов кушает
Польский меньше кушает, про английский таких исследований вроде нет
Yuriy Zolotovдая перепутал, там у него на m1 mac с 64GB RAM выдавал 0.3 токена в секунду ))
webpage
нажмите — покажем
нажмите — покажем
сегодня читал как чел запустил на 64 гигах /m1 https://www.reddit.com/r/SelfHostedAI/comments/1v8jhtg/got_kimi_k3_running_on_my_macbook_its_painfully/ со скоростью 1 токен за 16 секунд)
Chaos Messсегодня читал как чел запустил на 64 гигах /m1 https://www.reddit.com/r/SelfHostedAI/comments/1v8jhtg/got_kimi_k3_running_on_my_macbook_its_painfully/ со скоростью 1 токен за 16 секунд)
да этого тоже видел, но там тоже m1 мак и там он реально что-то крутил вертел, я так понял в начале вся проблема была в том, что MoE не скачивал на локальный диск, а стримил с удаленного сервера))))
Yuriy Zolotovда этого тоже видел, но там тоже m1 мак и там он реально что-то крутил вертел, я так понял в начале вся проблема была в том, что MoE не скачивал на локальный диск, а стримил с удаленного сервера))))
Фотография
нажмите — покажем
нажмите — покажем
уху) и так было минуты на токен)
сразу вспомнился этот аппарат
Yuriy Zolotovинтересно когда-нибудь кто-нибудь придумает Cloud AI Compute P2P
чтобы все у кого видяхи есть могли донатить мощности свои XD
уже есть такое. и там Дуров замешан
webpage
нажмите — покажем
нажмите — покажем
Вспомнил, https://cocoon.org/
Cocoon (Confidential Compute Open Network) - проект Дурова, децентрализованная платформа для работы с искусственным интеллектом, объединяющая AI и блокчейн-сеть TON
Chaos MessВспомнил, https://cocoon.org/
Cocoon (Confidential Compute Open Network) - проект Дурова, децентрализованная платформа для работы с искусственным интеллектом, объединяющая AI и блокчейн-сеть TON
да, точно вспомнил, но это больше на майнинг децентрализованный похоже ))
Что это за сервис
Cocoon — децентрализованная сеть «конфиденциального AI-инференса»: владельцы GPU запускают LLM-воркеры, приложения (в первую очередь экосистема Telegram) платят за приватный инференс, оплата автоматически идёт смарт-контрактами в TON. Запустился в ноябре 2025. Ключевая фишка — приватность через TEE (Trusted Execution Environment): и клиент, и сеть не видят содержимое запросов, что подтверждается аппаратной аттестацией.
Почему наше железо не подходит
Требования из их документации для GPU-owner жёсткие, потому что вся модель построена на confidential computing:
- Intel CPU с поддержкой TDX — у нас GB10 это ARM-чип NVIDIA Grace (aarch64), TDX нет в принципе.
- NVIDIA GPU уровня H100+ с поддержкой Confidential Computing — режим CC есть только у датацентровых Hopper/Blackwell (H100/H200/B200) с обновлённым VBIOS. У GB10 (Spark) этого режима нет.
- Плюс Linux 6.16+ с TDX, QEMU 10.1+, аттестация всего стека.
То есть это не «народный майнинг на любой видеокарте», а сеть для владельцев серверов с H100 — вход от ~$25–30k за карту. Наши Spark'и не пройдут аттестацию ни по CPU, ни по GPU.
Roman IlyinПольский меньше кушает, про английский таких исследований вроде нет
Фотография
нажмите — покажем
нажмите — покажем
У опенаи на сайте есть интерактивный токенайзер
https://platform.openai.com/tokenizer