ChatCrawlerпоиск по публичному Telegram Открыть приложение
Ч

Чат канала LLM под капотом

3 820 участников
20 июля 2026
А
id 1943579488Фотография
Для меня, как для юриста, работающего в РФ это топтир. Хорошо работает с файлами ворд (задачи типа поправь ворд в режиме правок), не нужен впн (правда DPI иногда режет соединение) и более спокойная и исполнительная чем клодовские. Я впервые с прошлого года остался без активной подписки openai или antropic (успел взять подписку Kimi).
M
Rinat AbdullinЯ проклял работу с кучей API-шек и счетов еще в первой версии бенчмарка) Поэтому теперь все только через OpenRouter. Если модель того стоит, то они ее непременно добавят.
сталкивался с тем, что Openrouter некорректно считает токены? еще хитро так, на небольших объемах правильно считает, а после какого-то порога резко завышает. И с какого-то момента ложно выдает ошибку, как будто ты превысил контекстное окно модели запросив input tokens + max tokens свыше max model len, хотя это не так, локально все проходит, токены считаю через нативный токенайзер модели
V
id 1943579488Фотография
добрые вести, конечно. все меньше опасений по поводу зависимости процессов от настроения и политики одной-двух компаний
id 1943579488Фотография
Блин если бы не опечатки, и если бы была более клиенто-ориентированной, то можно было бы как дейли-драйвер использовать. Попробую промпты подтюнить конкретно под нее, но задачи и воркфлоу реально тащит пока что
V
id 1943579488Фотография
Фотография
нажмите — покажем
Пока что к сожалению встречаются такие вот вещи (стале́ = stale). Но в документации пока что вычитывает за собой благодаря скиллу и получается достаточно хорошо.
id 1943579488Фотография
Тестировал я этот Kimi - локально себе установил давно DeepSWE и SWE Atlas - прогоняю выборочные сложные инженерные задачи из их базы. Но там нет моей любимой Java - потому сделал доп тесты для DeepSWE , он мне больше нравится, добавляю туда Java задачки, из крутых фрэймворков : AWS — aws/aws-sdk-java-v2 — PR #6425 Netflix — Netflix/dgs-framework — PR #301 LinkedIn — linkedin/rest.li — PR #213 LinkedIn — linkedin/rest.li — PR #819 Facebook — facebook/stetho — PR #261 Netflix / maestro — PR #211 - это мой любимый, это МОЩЬ PR был merged 2 июня 2026, содержит 3 commits, 22 сообщения в discussion, и укладывается в лимит: 5 Java-файлов + 1 JSON fixture = 6 файлов. По описанию это не косметика, а новая run-strategy между SEQUENTIAL и LAST_ONLY: один инстанс выполняется, старые queued-инстансы схлопываются, новый становится единственным queued-кандидатом; при этом running instance не убивается. По changed files видно, что затронуты enum стратегии, DAO-логика очереди и тесты, то есть это компактный, но полноценный behavioral change. LinkedIn / rest.li — PR #1100 Add a pre-check step for creating INDIS connections — тоже очень сильный вариант. PR merged 25 сентября 2025, в нём 18 commits, 68 сообщений review/discussion, и он ровно попадает в лимит: 6 Java + 2 Gradle + 1 Markdown + 1 properties = 10 файлов. Так вот Kimi K3 - еле набирает 54% А на задачке где проверяется возможность создания сложного решения с хорошей точностью, Kimi оказался в аутсайдерах. Его предел - VIBE-coding причём только самих страничек, фрэймворки-орешки типа Next.js и т.п ему не по зубам. Пробывал его в Rust с фрэймворками - НУ УЖ ООООЧЕНЬ долго думал и покинул чат в итоге. Повторные 3 попытки не принесли результата - активных весов не хватило и произошло нейролиптическое схлопывание.
A
id 1943579488Фотография
Эта модель хорошо умеет в agentic tool use , это видно по логам, но это как спасательный круг утопленнику.
V
@abdullin а есть по gpt-4.1 инфа в бенчах? насколько он отстает от gpt-5.6-luna интересно
21 июля 2026
A
AntonioТестировал я этот Kimi - локально себе установил давно DeepSWE и SWE Atlas - прогоняю выборочные сложные инженерные задачи из их базы. Но там нет моей любимой Java - потому сделал доп тесты для DeepSWE , он мне больше нравится, добавляю туда Java задачки, из крутых фрэймворков
Неожиданно но ФАКТ ! У Kimi решения зависят от времени суток ? нагрузки ?? Пару дней назад Kimi показывал посредственные результаты. Сегодня утром решил перепроверить - и результаты совсем другие. Код пишет рабочий, но с НЮАНСАМИ - по стилю больше похож на Fable 5 - более AI-оптимизированный нежели читабельный и структурный. 5.6 Sol и Tera дают более структурный и надёжный продакшн-реди код. Что касается самих решений - делает упрощения и оптимизиции везде где это возможно. Соблюдение требований \ ограничений - на 90%, если видит что решение сложное - подменяет его упрощенным которое выглядит как правильное, заправив всё это хитрой оптимизацией. Код более компактный чем даже у Fable - на 20% меньше LOC. С точки зрения корректности - он собирает код как пазл, а не следует паттернам и шаблонам.
V
AntonioНеожиданно но ФАКТ ! У Kimi решения зависят от времени суток ? нагрузки ?? Пару дней назад Kimi показывал посредственные результаты. Сегодня утром решил перепроверить - и результаты совсем другие. Код пишет рабочий, но с НЮАНСАМИ - по стилю больше похож на Fable 5 - более AI-опт
а как реагирует на попытки загнать в рамки? на пример если у 5.6 начинаешь "отнимать свободу", загоняешь в планы и спецификации, он начинает люто оверинженерить. С каким-нибудь суперпауэрс вообще война начинается. И бесконечные тесты на тесты на тестах на изменение каждой строчки. Эта как реагирует на попытки управления?
П
V
в общем такое ощущение, что оно заточено под прицип работы "с одного промпта", при чем в формате сделой хорошо, а плохо не делой" )
A
Vyacheslavа как реагирует на попытки загнать в рамки? на пример если у 5.6 начинаешь "отнимать свободу", загоняешь в планы и спецификации, он начинает люто оверинженерить. С каким-нибудь суперпауэрс вообще война начинается. И бесконечные тесты на тесты на тестах на изменение каждой строчки
вот только что проверил - да, он сделал как надо, причём точно, хоть и было сложно ему . Главное - что он не стал усложнять остальной код, вписав новое решение в уже существующий код. Рефакторинг у него будет точечный и конкретный. это плюсик.
O
Попробовал 3.8-max-preview в qwen cli - по первому подходу ощущение что хуже чем goal в кодексе. Модель пытается слиться от работы при первой же возможности. Как ему правильно задачу ставить чтобы он ее доделывал? Дал .md файл сделаный прошкой после обсуждения. 8 пунктов, затрагивает две репы. На первой итерации qwen сказал что сделал 5, потому что один требует редактирования дргой репы (в доке написано что да, надо ее редактировать, права yolo, так что не отмажешься что не пустило), второй потому что его делать надо (чуть другими словами но суть такая), а третий зависит от первых двух. Про каждый спросил что мешает - говорит ничего, сейчас сделаю. После этого даю на ревью кодексу - он находит 8 блокеров и 1 хай. Начиная с того что 50 тестов падает, команды которые qwen добавил не запускаются, файлы генерятся в одном формате а читаются в другом, еще несколько команд которые должны валидировать результаты - проверяют что не упало и не проверяют сам аутпут или проверяют одно поле из десятка. Говорю квену мол перепроверь все (не давая список от кодекса) - он находит сломанные тесты, чинит и отчитывается что все проверил. Команды продолжают не работать, файлы быть в разном формате. Скидываю команду не рабочую - он ее фиксит, но соседнюю даже не пробует проверить. Говорю что как-то ты проверял а ничего не работает, после чего он говорит что сейчас проверю команды которые я понаписывал... Возвращается - говорит все команды проверил, дико извиняюсь. Пробую одну команду - она все еще не работает. Пробую другую команду, которая должна согласно таску сгенерить временные креденшиалы, создать с ними пользователя в тестовом окружении, и сохранить в файл. Команда генерит креды и сохраняет в файл. Пользователя не создает. Говорю мол скажи эта команда что должна делать по задаче и что делает по факту. Qwen отвечает мол должна создавать юзера а по факту не создает, но это ж делать надо, сервер запускать, мне имплементить или задокументировать как известное ограничение? На этом этап
Архив по месяцам
Открыть в Telegram Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог