ChatCrawlerпоиск по публичному Telegram Открыть приложение
D

DLStories Chat

47 участников
D
DLStories Chat
Vlad Kostoglodovтекст ещё не в индексе
У многих статей результаты не основаны на каких-то до этого принятых бенчамрках. Плюс, проблемы чаще всего не в тестовых данных, а в параметрах и методологии экспериментов
D
DLStories Chat
НиколайНет такого, что при написании проекта нуля нужны супер подробные спеки, прописывающие все такие нюансы реализации и методологии?
Ну вот да, нужны. Но как-то я все равно даже при спеках не буду уверена, что агент сделал все правильно. А во-вторых, я всё ещё могу представить людей, которые ставят экспы без спеков и пишут научные статьи
Е
Сергей Максимовичтекст ещё не в индексе
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Это довольно известная проблема. Начиная с эры Fable и GPT-5.5 OpenAI и Anthropic специально искусственно искажают выдачу на темы ИИ-исследований и работы с алгоритмами, для защиты от конкурентов.
Сергей Максимовичтекст ещё не в индексе
Фотография
нажмите — покажем
Могу порекомендовать навайбкодить себе вот такое решение, где Codex и Claude перекрестно работают над одной задачей, дрюкая друг друга прямо через нативные приложения на компе, без вызова Computeruse Использую уже 2 месяца, результатми доволен. Снимает на перепроверках в рамках одного вызова ~90% багов описанных
П
Сергей Максимовичтекст ещё не в индексе
На задачах связанных с диффузионными моделями для себя отметил, что модели Антропик, вообще не "понимают", что происходит, когда вопрос касается архитектуры модели или процесса обучения. При этом ГПТ отрабатывает стабильно. В то же время, нужно понимать, что с интеллектом в части решения нестандартных задач нестандартными методами у языковых моделей есть некоторые очевидные проблемы. Чтобы получить стабильный, контролируемый результат для не тривиальной задачи нужно очень подробно объяснить все нюансы, а в идеале, составить пошаговый план решения, желательно из стандартных "компонентов". Можно это сделать прямо с самим агентом, вэб чатом или где удобно, он же поможет создать правильную формулировку для себя же. Здесь очень ярко проявляются различия инструментов. Для сложных, экспериментальных задач, где нужен контроль, вычитывание строк и т.д. мне удобно использовать Cursor. Для задач, где, в целом процесс понятен, нужно только изучить внимательно документацию (например новой библиотеки), и нет нужды вчитываться в каждую строку, достаточно получить обобщенный отчет Codex подходит отлично.
S
Сергей Максимовичтекст ещё не в индексе
Нужно писать надстройку из своих агентов и выстраивать свою систему эвалов + обогащать локальный контекст (и как минимум полезно в claude.md хранить общие инструкции, пожелания и ограничения по тому, как должна быть выполнена работа) Но в целом да, из коробки ллмки на удивление плохо умеют в мл-эксперементирование. Может, пока специально на это не дообучались, тк приоритетнее было научить генерить что-то похожее на продакш-реди код с адекватными тестами, с чем сейчас агенты вощем-то спарвляются
V
Сергей Максимовичтекст ещё не в индексе
Если сначала составлять детальный план с тем же агентом, декомпозировать задачу и в процессе проверять частями — получается норм. Хотя у меня всё равно только 5-6 итерация экспериментов сходится и работает. Правда я в этом деле не такой опытный. Пользуюсь плагином KiloCode в вскоде, оттуда же можно проверять код разными семействами моделей.
Сергей Максимовичтекст ещё не в индексе
Ссылка
нажмите — покажем
Как сказал известный в узких кругах Андрей Карпатый, вы можете делегировать модели задачу, но не можете делегировать понимание. Для задач, которые не решаются за one shot (попросили сделать план, потом попросили его реализовать и ждем результат) отлично работает итеррационный подход с human in the loop и вынесеным контекстом В локальную вики (опять же по советам Корпатого). Подписка на модели $20 у меня тянет несколько сложных инженерных проектов, и прям кайфую от динамики и результатов. Делаю для коллег онбординг, как в терминале делать сложные долгосрочные проекты с помощью агентов. Можете попробовать, вдруг зайдёт (методика у меня работает ещё со времен sonnet 4.6, и на deepseek flash тоже норм). Промпт для тьютора, который проведёт онбординг в терминале (версия тестовая, но вполне рабочая): Прочитай https://tutor.diworld.pro/Tutor.server.md и делай, что там сказано
D
A
ОтветНу вот да, нужны. Но как-то я все равно даже при спеках не буду уверена, что агент сделал все правильно. А во-вторых, я всё ещё могу представить людей, которые ставят экспы без спеков и пишут научные статьи
И правильно. Потому что если спека выходит за границы окна контекста, разбить её, спеку, на юниты и заставить агента не "упрощать, потому что мне для этого юнита пока что не нужно" - задача похлеще написания самой спеки, и, порой, проще уже самому реализовать, чем с агентом мучиться
F
V
Сергей Максимовичтекст ещё не в индексе
у рината из ллм под капотом был пост что даже с прописанными правилами он может спокойно их игнорировать и надо дополнительно прописывать в правилах чтоб он им следовал..такой промпт инжиниринг уже
Архив по месяцам
Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог