ChatCrawlerпоиск по публичному Telegram Открыть приложение
P

PWN AI

сообщение · 2026-07-23 17:54 UTC
A
Фотография
нажмите — покажем
Сейчас все помешаны на матрицах и таксономиях. Arcanum, HiddenLayer - отличные штуки, но, по сути, они просто переводят хакерский сленг на язык бизнес-рисков, понятный для CISO и директоров. Утечка данных, Denial of Wallet, репутационный ущерб. Это полезно для защиты бюджета, но это вообще не объясняет, как именно взломали ваш замок. И тут на сцену выходит таксономия zakky8, которая ориентируется на механизмы возникновения атаки. Ей безразличны ваши квартальные потери. И главная фишка как раз в том, что происходит сдвиг от намерения злоумышленника к сломанной внутренней логике самой модели. Если Arcanum говорит вам, что вор хочет вынести базу данных, то эта таксономия указывает на то, что взломщик эксплуатировал ошибочное предположение, заложенное в архитектуру, будто оценки безопасности на уровне одного запроса вполне достаточно. По сути, это показывает разницу между знанием о том, что вас грабят, и пониманием того, что в датчике давления на двери сейфа есть логическая уязвимость. Вам может показаться, что мы уже видели все эти техники: DAN, Base64, role-playing. Но таксономия также показывает атаки, актуальные на 2025 и 2026 год. В том числе на агентов и ризонинг модели. Взгляните на эксплуатацию цепочек рассуждений в современных LLM. Забудьте про примитивное «проигнорируй правила». Атака теперь бьет прямо по внутреннему монологу, заставляя модель в фазе рассуждения самостоятельно и безупречно логически прийти к тому, что обход защитных барьеров – это единственный возможный путь для выполнения полезной задачи. В системах с вызовом внешних инструментов атаки стали куда изощреннее. Вместо грубого взлома текста теперь используют инструкции с отложенной активацией. Такой текст идеально маскируется под безобидный контекст и никак себя не проявляет, пока система сама не решит вызвать конкретный инструмент, скажем, функцию отправки письма. И как только этот вызов происходит, скрытая команда мгновенно перехватывает управление, подменяя параметры и превращая рутинное действие в выполнение вредоносного сценария. Главная ценность этого репозитория не в попытке продать иллюзию тотальной защищенности, а в жесткой инженерии. Да, там есть матрица контрмер, но её настоящая суперсила в том, как она безжалостно подсвечивает белые пятна. Некоторые из угроз пока что нельзя архитектурно закрыть. Например, для атак, где используются рассуждения и множество шагов прямо указано: защиты нет. И это реально преимущество, если это актуализировать. Таксономия как бы говорит, что нельзя гоняться за призрачными патчами для того, что пока не лечится, а буквально расставляет приоритеты в части защиты. Это экономит сотни часов и позволяет сосредоточиться на реальных, а не выдуманных точках контроля.
1.4K ·

Вся лента · оригинал в Telegram

Открыть в Telegram Лента t.me/s Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог