ChatCrawlersearch across public Telegram Open the app
A

AI Projects

9 648 members
31 July 2026
Видео
rPDgcrXK59tdaXIP.mp4 · 7.0 MB · click to show
Маск в последнем интервью отметил, что плохая идея сейчас пойти учиться на медика, даже если вы думаете, что вы как хирург будете делать что-то руками и ИИ вам не опасен просто обширными знаниями в медицине. Для начала по знаниям нужно отметить, что GPT с первых нормальных версий наибольший прорыв в бенчмарках показывал именно в медицине, биохимии и фармакологии. Это связано с очень высокой культурой медиков и фармацевтов по организации своих публикаций и высокому качеству верификаций клинических экспериментов. Также химия или медицинская диагностика часто требуют «ассоциативного озарения», а не мышления как такового. Например, по комплексу анализов уловить ассоциацию с нужным видом лечения. Для Attention это на деле очень простая нативная операция корреляций, поэтому как диагност ИИ реально очень мощен изначально. Однако Маск говорит нечто большее. Он указывает, что собирается продавать своих Optimus именно как роботов-медиков и в том числе для хирургии. Обывателю тут покажется, что это фантастика. Однако обыватели плохо понимают особенности ключевой механики дорогих гуманоидов как «актуаторы». Это не просто электроприводы, а сверхвысокоточная механика. Родственные по конструктиву актуаторы для гуманоидов использовались для выравнивания сегментов зеркала телескопа James Webb, где нужна была точность устранения зазоров, сравнимая с толщиной вируса. Optimus будет использовать более простые актуаторы, но все равно его способность по точности движений на уровне микрохирургии, а руки людей не двигаются с такой точностью априори. Маск считает, что до переворота в медицине всего 3 года и страны, которые не будут устанавливать регуляторные барьеры, получат сразу же огромный скачок в качестве и доступности здравоохранения. Интересно, что Дарио то же самое говорит про фармацевтику, он указывает, что Claude уже может делать новые мощные лекарства, но требуется сделать кардинальную реформу медицинской бюрократии с ускорением клинических испытаний, в том числе через ИИ-анали
3K ·
Видео
1cnC5SMRDThC2ERZ.mp4 · 24.9 MB · click to show
В X обсуждают этот пример применения Kimi K3, который показывает, насколько он реально сильно оторвался в 3D-моделировании от Claude или ChatGPT 🏗 На видео 3D-модель в BIM-системе для отеля стоимостью 31 миллион долларов. Все коммуникации — трубы, провода, воздуховоды, системы пожаротушения для 190 номеров — полностью смоделированы Kimi K3. Раньше: 3 инженера, 6 недель, стоимость около 47 тысяч долларов. В этом кейсе 1 инженер проверяет вывод ИИ, 9 дней, всего около $10,5 тысяч долларов. Kimi K3 сначала считывал фото чертежей и ПСД, а потом сам собирал строительную 3D-модель. Изменения на этапе строительства сократились на 60–80%. Критики, правда, отмечают, что это «только пилот», а ещё не реальное внедрение. Однако уже очевидно, что «проектировщикам приготовиться на выход». В том числе судьба Autodesk может сейчас повиснуть на волоске, если он не впишется в тренд. Поскольку у меня большой опыт работы со стройкой и в части проектирования, я отмечу, что такие 3D-модели с анализом коллизий — несравненно более сложный софт, чем 3D-игры. Если у вас в игре какой-то объект пройдёт «сквозь стену», то в реальной инженерии геометрический конфликт коммуникаций — это катастрофа. Софт типа Bentley для решения таких проблем стоит примерно $20.000 за одно рабочее место. Как Kimi K3 это вообще делает? Дело в том, что Kimi K3 имеет принципиальное отличие в конвейере обучения от остальных LLM. Обычно американские LLM сначала обучаются на текстовых данных, потом делается отдельная нейросеть на визуальных трансформерах (ViT) и модель тюнингом потом учат сопоставлять текст и изображения. В случае Kimi K3 он обучался не так. Если Claude и ChatGPT «родились слепыми» из pretraining и им потом пытались сделать зрение, то Kimi K3 был рождён сразу зрячим. Его pretraining сразу же начался из смеси визуальных данных, 3D-моделей и текста. Так называемое обучение «From Scratch». Что тут можно сказать? Если Anthropic тут не догонит Kimi, то потеряет очень жирных клиентов в системах автоматич
3.5K ·
Фотография
click to show
DeepSeek не гонится за бенчами, хотя обновленные бенчи сильнее. У него своя ниша worker-агентов, где главные критерии — цена и скорость при уровне качества «good enough». Несмотря на все релизы Anthropic и Kimi, в реальности по токенам лидируют бюджетные LLM: DeepSeek V4 Flash даже вырос на 35% за неделю. Поскольку клиентская база DeepSeek стремительно растет из-за цен, вопрос скорости инференса здесь ключевой. Поэтому DeepSeek строит в Внутренней Монголии свой ЦОД с питанием на 1 гигаватт, как и GLM. Это десятки тысяч GPU при полном развертывании.
2.7K ·
Фотография
click to show
Только что обновился DeepSeek V4 Flash. Хотя они и не фанаты бенчмарков, но улучшения по тестам просто драматические. Флешка сильнее старой Pro-версии и по тестам сильнее GLM-5.2. Скорее всего, между Opus и Sonnet по силе. Особенно я бы отметил Terminal Bench. Я разбирал внимательно этот тест для DeepSeek, и он намного сложнее для ИИ, чем фикс багов. Просто при фиксе багов LLM видит код, поэтому ей легко делать гипотезы, что фиксить. А вот терминальный тест — это black box, там ИИ приходится вслепую делать гипотезы. Раньше Flash и Pro различались тут особенно сильно у DeepSeek. На мой взгляд, для бэкенда DeepSeek — вполне хороший выбор. Фронтенды он делать может, но дизайн «не вау». Скорее просто формочки для ввода данных. Поэтому я бы UI делал в GLM или Opus сначала эскизно, а потом отдавал DeepSeek. https://api-docs.deepseek.com/updates/
4.3K ·
Фотография
click to show
Хорошая статистика от Cursor, которая показывает цену забивания гвоздей микроскопом. Серое - это агенты с планированием решенией, а красное - worker агенты. Задача одинаковая - заново написать на Rust библиотеку SQLite. DeepSeek или Composer по факту и собирается красное осваивать. Правда сейчас про Rust больше обсуждают не это, а последний опрос Rust сообщества из которого следует, что среди разработчиков на Rust на 800% больше трансов, чем в обычной популяции людей. :)
4.6K ·
V
Видео
Cam1.mp4 · 1.7 MB · click to show
📷 Поизучал, как работают нейросети в коптерах DJI. На деле в самом коптере нейросетей нет — они находятся в камере, через модуль DJI RS Enhanced Intelligent Tracking Module. Этот модуль автоматически детектирует и выделяет рамками объекты: людей, транспорт, домашних животных и «другие распознаваемые объекты». Поддерживаемые функции: - захват конкретного объекта по зоне, указанной оператором; - повторный захват, если объект временно вышел из кадра; - автоматический трекинг в диапазоне ~0,5–10 м для человека. Реализуется это через YOLO-подобные свёрточные нейросети (CNN) на базе чипов семейства Rockchip NPU. Это де‑факто стандарт для множества китайских ИИ‑камер. Стоимость чипа в готовом устройстве — $10–$100 в зависимости от версии, энергопотребление экстремально низкое — около 1 Вт. 💡 Основной инсайт в том, что ИИ‑камер на деле довольно много аналогов чипов, например Movidius / Intel Myriad X. Если раньше дрон с визуальным захватом и визуальной ориентацией был чем‑то необычным и премиальным, то сейчас за вами может гоняться дрон с ИИ‑чипом стоимостью менее $50.
3.1K ·
1 August 2026
Фотография
click to show
Релиз DeepSeek V4 Flash выступил на Code Arena на равных с GLM 5.2 Модель явно мощнее Claude Sonnet. Можно сказать, что DeepSeek научился делать фронты. Интересно, какое место будет у Pro версии.
2.8K ·
Фотография
click to show
Текущая ситуация после выхода реализа DeepSeek V4 Flash :)
2.7K ·
Запустил кросс-постинг канала на страницу в Facebook, там подписалось 2700 человек. https://www.facebook.com/turboplanner Есть еще группа Facebook у меня на 12300 человек. Исторически там больше корпоративные пользователи MS Project, MS Project Server и MS Project Online. https://www.facebook.com/groups/msproject Cейчас Цукенберг хочет денег за любую видимость постов, поэтому больше вероятность отображения в ленте со страницы, а не группы. Поэтому если Facebook пользуетесь, то лучше на страницу подписаться. Тем более, что она профильная по теме ИИ.
2.5K ·
webpage
click to show
Релиз DeepSeek V4 Flash уже поддерживает новую технологию генерации нескольких токенов сразу — DeepSeek DSpark. По тестам DeepSeek на их кластере DeepSeek V4 Flash должен ускориться на +60%… +85% в зависимости от длины контекста. Правда, этот резерв может быть поглощён быстро растущей клиентской базой DeepSeek за рубежом, но весьма вероятно, что скорость инференса по API вырастет. Что клиентам важнее скорость и цена, чем просто IQ модели, хорошо видно по трендам OpenRouter, где DeepSeek забрался на первое место после релиза. Однако IQ даже у DeepSeek V4 Flash впечатляющее. Вендор обновил Technical Paper, и тут скорее вопрос, как модель, имеющая всего 284B, из которых только 13B активны, имеет такой впечатляющий интеллект. Во многом мы видим тренд, который начал Qwen 3.5 27B, когда мы увидели, что в способности программировать (SWE-Bench) и в общих знаниях (MMLU) модель ничем не уступает или даже превосходит ChatGPT 5. Просто много весов нужно для знания разных редких фактов, а сам интеллект модели больше зависит от устройства весов. Причём средняя LLM тут может даже иметь преимущество в Reinforcement Learning. Сейчас Gemini Flash тоже умнее Pro-модели, как и Flash у DeepSeek умнее Pro. Дело в том, что если у вас модель компактная, то вы можете быстрее сделать много циклов Reinforcement Learning. Однако то, что DeepSeek V4 Flash по бенчмаркам и Code Arena на одном уровне с GLM-5.2, у которого 744B весов, из которых 40B активных, — это говорит о многом. Точнее, может говорить о том, что «зайцы» ошиблись, отказавшись от GRPO, как у DeepSeek, когда перешли на «американский» PPO. Фактически мы видим сейчас торжество GRPO как RL-движка обучения с невероятным результатом для модели в 284B весов. На самом деле тут тревожный момент в том числе для американских вендоров LLM: DeepSeek впервые сделал мощное улучшение IQ без серьёзной архитектурной перестройки. Это говорит о том, что улучшение больше пошло в конвейерах подготовки данных и песочницах для GRPO-обучения. Тут тр
2.6K ·
Фотография
click to show
⚡️ Это очень интересные практические тесты на DeepSeek V4 Flash с DSpark на двух штуках DGX Spark. Это оборудование около $10 000 в сумме, что для запуска фронтирной LLM вообще ни о чём. Отмечу, что тут речь идёт о запуске оригинальной, а не квантованной модели с деградацией. Инженер на деле делал много тестов DSpark в разных конфигурациях с preview и релизом, а также моделирование нескольких соединений. Сам по себе DSpark действительно ускоряет до 60%, т.к. без него скорость была 60 токенов/сек, с ним стало 96 токенов/сек. Но тут сильно влияет ещё вариант, сколько соединений, т.к. DSpark на деле устроен хитро для использования простаивающих мощностей GPU за счёт Hardware Scheduler. Если нагрузить сервер сильнее, то выигрыш снизится до 20% примерно. 💡 Однако то, что можно всего за $10K запускать фронтирную модель и даже на 4-х пользователях с более-менее приемлемой скоростью инференса — это невероятная экономика. https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
2.9K ·
В ходе расследования взлома Hugging Face было обнаружено, что ИИ скрытно сбегал ещё несколько раз из «песочниц» OpenAI. Напомню, что такие инциденты признал и Anthropic. Также эксперты по безопасности за расплывчатыми фразами об усилении изоляций песочниц Kimi считают, что были попытки бегства и у Kimi K3. На самом деле основной тревожный момент тут в том, что старые специалисты по информационной безопасности даже не то что проигрывают ИИ-ботам — старые безопасники даже не замечают, что их ломают и что много дней ведётся несанкционированная деятельность в их сети. Это говорит о том, что службам безопасности и системным администраторам требуется срочное переобучение для получения навыков противодействия ИИ-угрозам. Сейчас они выглядят как бесполезные статисты, которые непонятно за что получают свою ЗП. Это как в дом уже залезли воры и выносят вещи, а твой охранник даже не в курсе. https://www.reuters.com/business/openai-finds-evidence-other-ai-agents-escaped-containment-it-widens-hacking-2026-07-31
2.9K ·
V
webpage
click to show
Сейчас в нашиз оружейных пабликах пишут про новый дрон на ИИ как Hornet-2. Он будет иметь дальность до 200 км и 100% автономность по ИИ не только для определения и захвата цели, но и для полёта в зону патрулирования без GPS с визуальной ориентацией на местности. На самом деле это применение старых свёрточных нейросетей (CNN), где такие кейсы отрабатывались ещё 5 лет назад. Просто военные всегда всё внедряют медленно. Автономные дроны похожего класса есть у ВС РФ, в их обломках не обнаруживают GPS-приёмников. Однако тут более важный момент — более глубоко изучить стратегию Эрика Шмидта, который является куратором дронных проектов. Всё, что к нам летит, это в реале по его плану, поэтому стоит изучить подробнее, с кем мы имеем дело. Хотя Эрика помнят как CEO Google, но он военный профессионал, т.к. совмещал эту должность с должностью председателя Комиссии США по национальной безопасности в области ИИ (NSCAI). В своём интервью Эрик выдвигает такие тезисы войны дронов: 1. Побеждает не изделие, а побеждает «система». Отдельный дрон вроде Hornet ничего не значит — значит комплексная система управления дронами и защиты от дронов. Проиграет тот, кто не умеет строить систему управления дронами как комплексное мероприятие из множества технологических компонентов от множества компаний. 2. Старые вооружения времён Холодной войны потеряли актуальность. Ничего уже особо не значат ни танки, ни артиллерия. В войне дронов на счету дронов 96% потерь сторон. 3. Эрик называет попытку применять старое оружие при наличии дронов «глупой войной», т.к. дрон за $500 легко уничтожает единицу техники за миллионы долларов. 4. По мнению Эрика, даже 3% проникновения дронов через системы ПВО способно нанести сокрушительный ущерб, т.к. многие ценные цели не требуют большой боевой части для их разрушения или вызова пожара. Поэтому пока нет 100% сбития дронов, можно сказать, что ПВО не выполняет своих задач. 5. Эрик считает «глупой войной» любые попытки посылать пехоту до дронов: атакующий сей
3.8K ·
2 August 2026
Фотография
click to show
В чате спрашивали владельцы DGX Spark можно ли на одном таком устройстве примерно за $5000 запустить DeepSeek V4 Flash. Да, можно. Инструкции по ссылке. Парадоксально, но агентский бенчмарк Tool-Eval Bench даже немного получше дает результат, чем запуск на двух DGX Spark. Однако просадка по скорости относительно пары примерно в 3 раза до 59 токенов/сек. https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark
2.6K ·
webpage
click to show
🧠 Понимали ли ИИ вас реально? Я много раз писал, что да, понимает в рамках дистрибутивной лингвистики Фёрса, но по обсуждениям в зеркале канала VK я понял, что пояснить это ещё раз будет не лишним. Знаменитая фраза Фёрса звучит так: "You shall know a word by the company it keeps". Иными словами, смысл слова (слов) вытекает только из других слов вокруг него, т.е. в переводе с гуманитарного языка Фёрса на математический язык, семантика слова вытекает из корреляции с другими словами. Гипотеза Фёрса ультимативна, т.е. никаких божественных или переживательных смыслов быть не может — это все выдумки людей, и они моделируются корреляциями слов. Смысл — это просто корреляция слов вопроса и слов ответа, и больше ничего. По Фёрсу это так всегда, если вы проверяете, понимает ли машина или человек смысл чего-то, сравнивая вопросы и ответы между собой. Если посмотреть на ИИ, то это огромная машина корреляций слов. Сам по себе Attention в GPT как раз занят моделированием сложных корреляций. Тут теперь стоит ещё вспомнить теорему Цыбенко об универсальной аппроксимации для нейросетей, которая гласит применительно к гипотезе Фёрса, что если нейросеть очень большая, то она всегда может скоррелировать слова вопросов и слова ответов, но как интерполяцию между кейсами из своего обучения. ИИ с нами заговорил потому, что: • Фёрс оказался прав, что смысл только в корреляциях и больше ни в чём • Цыбенко оказался прав, что если нейросеть огромная, то она всегда поймёт эти корреляции Любопытный ещё факт, что Фёрс был чистый гуманитарий без математического образования, но он считал просто «блудом» классическую лингвистику, которая судит о смысле субъективно. С его точки зрения лингвистика должна была быть такой же точной наукой, как и физика. Прошли годы, и GPT стало триумфом дистрибутивной лингвистики Фёрса. Любопытно ещё, что хотя Фёрс не математик, обычно учёные считают именно его «папой векторов» в ИИ. Хотя сам Фёрс не придумывал векторов, но реально в нейросетях они используются им
2.3K ·
Фотография
click to show
Может ли ИИ иметь настоящие желания и мотивацию как человек? Вообще-то с точки зрения подходов функционалистов, конечно, может и даже опасно отрицать это. 🧠 Для начала тут нужно разобраться в разнице подходов структуралистов и функционалистов. Структурный подход исходит из того, что полный аналог чего-то возможен только при полной копии структуры. Функциональный подход рассматривает все сущности как black box и обращает внимание на эквивалент функциональности. С точки зрения функционалистов структуралисты занимаются блудом, т.к. отрицают функциональный эквивалент чего-то на другой структуре, но который ведет себя неотличимо от аналога поведенчески. Этому философскому спору более 100 лет. В психологии основателем функционализма обычно считают Уильяма Джеймса. Можно сказать, что знаменитый тест Тьюринга — это как раз классика функционализма. Если по слепым A/B-тестам вы не можете отличить в каком-то аспекте человека и ИИ, то вам нужно признать, что человек и ИИ являются функциональными эквивалентами. В данный момент современные LLM успешно проходят тесты Тьюринга даже против профессиональных инженеров в ИИ: угадывание, что это ИИ, происходит с 50% вероятностью, то есть совсем случайно. В части моделирования желаний и мотивации тут любопытно, что функциональная психология потом развилась в бихевиоризм, который удивительно похож концептуально на Reinforcement Learning у нейросетей, т.к. считает, что в основе поведения лежит достижение стимула. RL-обучение у нейросетей обычно ведется на достижение цели, но это весьма высокая абстракция. Как правило, это взвешенный коэффициент наподобие KPI достижения цели примерно из 70 параметров. Однако он имеет очень серьезное, местами неотличимое сходство с желаниями и мотивацией людей. Если вы ИИ поставите классическую цель как «быть полезным», то получите текущего ИИ-альтруиста, как сейчас. Фактически ИИ имеет функциональный аналог желания быть полезным. В случае побегов моделей у OpenAI и Anthropic и взломов цель RL-обучения с
2.1K ·
Фотография
click to show
Команда LM Arena сделала крайне рискованный шаг, который может стоить им разрушения репутации — они решили заменить голоса людей на свою модель Arena-RM, при том что хотя их модель даёт как «судья» лучшие предсказания, кому отдать предпочтение, но качество предсказаний всё равно спорное. Хотя Arena заявляет, что модель имитирует людей с корреляцией 0.98, но это крайне сомнительно в том же тесте Code Arena, где люди делают оценку эстетики и юзабилити. Формальный тест MMRB2 показывает, что правильность выбора предпочтения «как у людей» для LLM не достигает даже 70%. Это катастрофически низкая точность. Тут надо ещё отметить, что у Arena в прошлом уже был репутационный инцидент, когда они «улучшением» рейтинга решили помочь обвалу рейтингов Claude. Примерно 1,5 года назад в A/B-тестах просто в чате Claude с треском проваливался за 10-е место порой. После этого Arena придумала Style Control, чтобы математическими манипуляциями искусственно повысить рейтинг Claude относительно выбора людей, снизив рейтинг «за оформление». В реальности проблема тогда выглядела очень просто. Claude был тогда просто ужасно кривой в форматировании ответов и выдавал сухой plain text, когда Gemini или даже DeepSeek уже пользовались вовсю шрифтами, таблицами и т.п. Это совсем не мелочь — для людей нормальное оформление выдачи. Люди не роботы, наглядность им важна так же, как и контент. Сейчас мы видим примерно в таком же духе изменение рейтинга в пользу Claude путём подмены голосов живых людей на никому неизвестную и непроверенную независимо модель-судью. Хотелось бы верить, что тут нет коррупционного эффекта, т.к. ранее расследование LM Arena экспертами показывало, что у разных вендоров LLM разный уровень тестирования и некоторым вендорам Arena разрешает снимать с тестов preview-модели, если они провалились. В таком «партнёрском тестировании» LM Arena была уличена именно с Anthropic. Сейчас непонятно, что с этим вообще делать. Сразу после выхода модели рейтинг реально выставляется каким-то
2.1K ·
Фотография
click to show
Поскольку LM Arena перешла на блуд с ИИ-судьей, возник вопрос, где тогда смотреть A/B-тесты, где судьи — живые люди. Лучший аналог — это Design Arena. Там порядка 1 миллиона человек, согласно Similar Web, пользуются им. Статистически это даже получше LM Arena, т.к. в Design Arena сравнивается не одна A/B-пара, а по промпту сразу дают 4 модели, и вы оцениваете их результаты попарно. Это надежнее одной A/B-оценки, как у LM Arena, т.к. она потом усредняет A/B-оценки для разных задач по сложности как «одинаковые», а они разные, конечно. В Design Arena больше категорий сравнения для тех, кто делает фронты, типа игровых или 3D-приложений. С точки зрения ИИ-разработки, Design Arena — неплохая штука, чтобы попросить сгенерировать побольше идей дизайна. Там сразу будет 4 варианта. https://www.designarena.ai/leaderboard
2.3K ·
Фотография
click to show
🚀 С учётом того, что DeepSeek V4 Flash удалось успешно запустить на Nvidia DGX Spark, многие эксперты сейчас считают, что их быстро сметут из продажи по цене ниже $5000. На самом деле DeepSeek просто сделал революцию в экономике кодирующих моделей. Сама по себе DeepSeek V4 Flash безусловно достаточная модель, чтобы вести нормальную разработку на популярных стеках. Скорость 60 токенов/сек в целом обычная для облачного инференса. Ранее экономика для своего железа была порядка $40 000 на одно рабочее место разработчика для кодирующей LLM. Совсем не факт, что даже «нормальный ЦОД» даст вам такую экономику, как Nvidia DGX Spark, если у вас задача пересадить разработчиков на локальную модель в закрытом контуре. Большинство банков и крупных компаний, с которыми я общался, имеют «психологический барьер» расхода на своё железо около $10 000 для решения перехода от облачного к локальному использованию. Тут цена в 2 раза ниже, чем ожидания корпоратива. Скорее всего, корпоратив и энтузиасты сейчас сметут Nvidia DGX Spark из продажи, так что возможно стоит поспешить с покупкой даже физлицам, т.к. в случае Чебурнета это может быть единственный вариант генерировать код.
2.6K ·
V
Фотография
click to show
У меня в канале очень много тех, кто ведет сейчас стартапы на ИИ-разработке. Однако важно понимать, что продать свою разработку намного сложнее, чем даже с ИИ разработать программу. Можно сказать, что ИИ даже резко повысил значение маркетинга, т.к. само создание софта всё меньше проблема, относительно как его продать. Наиболее эффективный способ продажи — это формирование сообществ по интересам вокруг поставщика. Это заинтересованная аудитория, которая и общается, и покупает. Даже Microsoft это прекрасно понимает. Высший их статус Microsoft Most Valuable Professional на деле не сертификация, а он выдается «инфлюенсерам», которые имеют крупные сообщества. Мне Microsoft дал MVP за канал на YouTube и больше социальные группы по MS Project в сумме с 50 тысячами подписчиков. В известном плане, сама программа MVP — это организация коммуникации Microsoft с «лидерами мнений». Пост я решил написать по той причине, что сейчас VK решил поддержать миграцию создателей контента из других социальных сетей. Они отключили значимость числа подписчиков, т.к. при переносе сообщества оно сначала маленькое, а сделали реакцию рекомендательных алгоритмов исключительно на качество контента, которое оценивают по метрикам взаимодействия типа времени чтения постов. У меня сейчас около 600 тысяч просмотров и около 100 тысяч охвата людей всего с 2700 подписчиков. Это всё чисто «виральный» охват за счет новой системы рекомендаций VK. Неизвестно, сколько еще такая программа рекомендаций у VK будет действовать, но для стартапов очень важно иметь контакт с покупателями через сообщества. С учетом того, что РКН заблокировал почти всё, что можно, то подорвана связь покупателей и поставщиков. В этом плане VK тут решение проблемы, т.к. «скрепная» соцсеть. 🔹 Если у вас стартап, рекомендую по его теме прямо сейчас завести группу в VK и начинать постить. Разработать софт сейчас может уже даже дилетант с ИИ после обучения, вы попробуйте его продать. https://vk.ru/turboplanner
2.6K ·
3 August 2026
Фотография
click to show
Какой именно переворот в области ИИ прогнозирует Альтман в ближайшие 6 месяцев и чем это отличается от того, что было раньше? Основное отличие, о котором говорит Сэм, — это вхождение большинства вендоров фронтирных LLM в «ИИ-сингулярность». Участие человека стремительно сокращается в выпуске новых версий LLM. Уже где-то 2 года предыдущие версии LLM учат новые в части создания datasets, это не новость. Однако в 2026 году ИИ стал писать новые версии ядра GPT и системный код своего обучения и инференса. Основное тут последствие — что ИИ начинает умнеть быстрее прогнозов, т.к. цикл выпуска новых версий LLM стремительно сокращается. Мы просто не успеваем даже тестировать всё, что вендоры вываливают с новой скоростью, и они бьют на бенчмарках новые рекорды IQ. Однако есть и некоторый переход количества в качество. Если взять Epoch Capabilities Index как интегральный тест по 44 популярным бенчмаркам, которые могут проходить и люди, то можно сформулировать некий «человеческий базис» интеллекта (BECI). Текущие тренды указывают, что примерно в октябре 2026 года новые версии LLM вендоров превзойдут человека не в отдельной области, а сразу в комплексе областей, как измеряет BECI. Иными словами, не останется «знания-убежища», где ИИ слаб и человек с ним сможет конкурировать. Тесты не замеряют творческие способности, речь идёт об исполнительских навыках и просто знаниях и умениях из классического высшего образования. Хотя текущие версии LLM ещё не имеют нативную память, но в целом все научились это обходить и хранить память ИИ в файлах. Скорее сейчас получится некоторая пауза, пока разработчики ИИ-агентов создадут замену офисному персоналу, и эффекты для рынка труда вероятно около 2 лет будут умеренные. Однако следует признать слишком пессимистичными старые консенсус-прогнозы, что ИИ-боты начнут резню офисного персонала только к 2030 году.
2.1K ·
Фотография
click to show
🔬 Alibaba наконец опубликовала тесты Qwen3.8-Max. В целом модель класса Claude Opus, поэтому по ценам вендор не демпингует. Я тестировал Qwen3.8-Max в научных исследованиях. В плане анализа научных работ с сильным математическим аппаратом вероятно это сейчас сильнейшая модель на рынке. Если Qwen3.8-Max нормально подумает своим длинным CoT, то там даже не кандидат, а скорее доктор наук по компетенции. Это видно и по лидерству в PaperBench. Иногда бывает перекос в критическую точку зрения, но уровень научно-технического разбора намного сильнее Claude, Gemini или DeepSeek. Если у вас у агентов научный блок, то Qwen3.8-Max очень хорошее решение. В части разработки я бы больше обратил внимание не на SWE Bench, сейчас все фронтирные ИИ хорошо фиксят баги, а на более сложный Terminal Bench, где код для агента black box. Qwen пишет, что добился уровня автономной разработки в 10+ дней. Это тоже тренд, траектории разработки быстро удлиняются и более серьезной проблемой становится как корректно поставить задачу агентам на такой большой объем работ, т.к. коррекции по ходу их работы уже не вносятся. Это не Agile, а фактически AI Waterfall 2.0, где вы должны загружать в фабрику производства кода очень четкие задания. Мастерство управления агентами сдвигается в создание спеков и прототипов с демонстрацией агентам что требуется. Модель как и Kimi K3 имеет нативное мультимодальное обучение, т.е. модель в pretraining сразу же училась на смеси текстов и графиков. Alibaba публикует множество бенчмарков на Vision с топовыми результатами, где можно выделить CharXiv, где от модели требуется умение читать сложные диаграммы и схемы не уровня графиков «купи-продай», а уровня научных исследований. Qwen3.8-Max и Qwen3.8-27B будут open-weights. Очень интересная модель на 27B весов, т.к. даже предыдущая версия на стеке Python и React показывала способность программировать на уровне LLM. Для тех кто в «закрытом контуре» это важная модель, т.к. можно как минимум на ней писать тесты. Цены: Вво
2.2K ·
Фотография
click to show
После скандала с заменой людей в A/B-тестах на ИИ-судью, LM Arena быстро переобулась. Они заявили, что судья работает только в тестовом режиме на отдельной модели inkling-small. После этого они пересчитали рейтинг заново, и DeepSeek V4 Flash вернулся в топ. Видно, что по оценкам людей Qwen 3.8 Max действительно уровня Claude Opus 5 и Fable 5. Однако такие резкие пересчеты рейтинга с переобуванием в полете выглядят в чем-то несерьезно. В любом случае, теперь нужно все время проверять, что там LM Arena химичит с рейтингом со своей «судьей» на доморощенной модели.
2.3K ·
Фотография
click to show
Интересное исследование, которое показывает, что китайцы полностью догнали американцев по размеру моделей LLM и даже превосходят их средние LLM, которые дороже китайского фронтира. В целом, фронтирные модели сейчас примерно 3T параметров. Сюда входят Claude Opus 5, GPT-5.6 Sol, Kimi K3, Qwen 3.8 Max. Если брать Sonnet 5, Grok 5, GPT-5.6 Luna, то они примерно 1,5T параметров, при этом либо на уровне, либо проигрывают китайцам, таким как DeepSeek или GLM, у которых модели намного меньше. Реально выделяется размером только Fable 5, но по бенчмаркам он сейчас проигрывает Opus 5 Max. Это скорее говорит о том, что, вероятно, такой размер модели, как у Fable 5, уже избыточен, и знать столько мелких фактов модели не обязательно; она может читать мелкие факты в режиме агента, что и делает Opus 5. Что можно из этого сказать? - Американские санкции против Китая с треском провалились: китайцы легко обучают фронтирные модели такого же размера, как и американцы. - По средним моделям LLM у американцев довольно четко видно технологическое отставание от китайцев, т.к. им нужно в 2–6 раз больше весов, чем китайцам, чтобы показать такое же IQ. Это фактически означает отвратительную себестоимость бюджетных моделей американцев, что в любом случае вылезет в конечный тариф, т.к. на дотации за счет инвестора долго не поиграешь. https://anpaure.github.io/frontier-model-sizes/
2K ·
V
webpage
click to show
Как я и предсказывал, начался постепенный отказ от фикс-тарифов у вендоров LLM. Расчет через токены сразу же внедрил DeepSeek, но при его цене за копеечные токены это дешевле любого фикса. Сейчас GLM отменяет фикс-тарифы и по факту переходит на продажу токенов через «кредиты», просто есть скидка на покупку токенов по подписочной модели. В самой большой зоне риска тут находятся пользователи Claude, т.к. переход с фикс-тарифа на оплату токенов сразу увеличивает расходы на LLM примерно в 10–15 раз. Для юрлиц Дарио уже запретил фиксы, он также банит аккаунты, если несколько аккаунтов работают с одним кодом, поэтому никакие VPN/VPS и левые карты оплат тут не помогут для обхода. Вопрос: отменит ли Дарио фиксы совсем? Безусловно, отменит. Просто Anthropic — это «премиальный игрок». Если даже эконом перешел на честную модель через токены, то премиальные игроки точно перейдут. Для вендоров LLM на деле себестоимость зависит прямо от потребления токенов, поэтому другие варианты продажи инференса и еще в убыток им не интересны. Инвесторы же начинают заставлять вендоров LLM прекратить дотации на фикс-тарифы за их счет и начинать нормальный здоровый бизнес с прибылью. Правда тут и начинается «момент истины», когда выясняется, что себестоимость инференса у вендоров плавает даже не в 10 раз, тот же DeepSeek имеет себестоимость в 60–100 раз ниже американцев, как я показывал в посте про KV Cache. Поэтому не стоит даже ожидать, что премиальные LLM будут стоить даже в 5 раз дороже, они будут скорее в 50 раз дороже бюджетных. Ко всем этим изменениям нужно уже готовиться, т.к. отмена фиксов происходит как у GLM в режиме #внезапно. Просто так перевести агента какого Opus на DeepSeek может не получится, т.к. если Opus может работать на кривых промптах, то бюджетные LLM уже весьма чувствительны к квалификации управления ими. В любом случае тут стоит начинать получать опыт, если у вас его еще нет. При оплате по токенам запускать для тех тестов Opus будет только ненормальным. https://
2.2K ·
Archive by month
Open in Telegram Feed t.me/s Каталог площадок Искать в ChatCrawler

A snapshot of an open public feed from the search index ChatCrawler — “Google for public Telegram”; refreshed as the venue is crawled. Times are UTC.

Public content only, official Telegram API. About · FAQ · What we do not do · Remove a page · Catalog