ChatCrawlerпоиск по публичному Telegram Открыть приложение
P

PWN AI

сообщение · 2026-07-20 17:45 UTC
A
Ссылка
нажмите — покажем
Непонятно, почему так происходит. Смотришь на красивых демо умных агентов, которые читают файлы, управляют инструментами и строят длинные цепочки задач, а стоит копнуть чуть глубже, и вся эта магия рассыпается в прах от одного кривого запроса. Я тут перечитал свежий материал Криса Хьюза про изоляцию как самый важный принцип для безопасности агентов и понял, что все еще пытаются решать структурные проблемы вероятностными методами. Это как пытаться удержать цунами с помощью канцелярского скотча. Авторы нового исследования предлагают не перечислять бесконечные векторы атак, а задать один простой вопрос. Где именно в системе впервые происходит потеря изоляции. Они выделяют пять критических границ доверия: 1️⃣Первая граница между пользователем и агентом, где пользовательский контент перестает быть просто данными и становится кодом управления. 2️⃣Вторая граница между агентом и инструментом, определяющая доступ к внешним возможностям. 🌷Третья граница исполнения, где абстрактное рассуждение материализуется в конкретное действие. 4️⃣Четвертая граница взаимодействия между самими агентами. 5️⃣И пятая граница между системой и окружающей средой. Часто в рекомендациях по безопасности агентов видишь советы про строгие системные промпты или наличие ограничения на вызов инструмент, но это чистая иллюзия. Их можно уговорить, обмануть или заставить галлюцинировать. Цифры в материале снимают иллюзии. Рост числа серверов MCP составил две тысячи процентов за год, и подавляющее большинство крутится на машинах разработчиков, а не на защищенных корпоративных серверах. Это огромный риск цепочки поставок. Авторы прямо пишут, что сообщение в мультиагентной системе это скрытый приказ к действию. Один скомпрометированный агент передает вредоносные инструкции другим, и начинается каскадный сбой на уровне коммуникаций. Что в целом также известно уже и в OWASP, и других методологиях. Сетевое окружение превращается в активную враждебную поверхность. Бенчмарки вроде SafeArena и STWebAgentBench наглядно демонстрируют, что агенты выдают небезопасные результаты через обычные клики и навигацию, а модели, обученные вежливо отказывать, моментально ломаются, как только начинают действовать через интерфейс, а не через чат. Я не могу доверять агенту просто потому, что он выдал связный текст. Я должен гарантировать исходя из структуры, что его изначальное намерение не было подменено на стыке этих пяти границ. Ограничения, по сути, будут таким -песочницы, контроль исходящего трафика, детерминированные проверки политик на уровне ядра. Вместо нагромождения защитных слоев поверх хрупкого агента изоляцию нужно закладывать в саму архитектуру. Когда вы будете оценивать агента – стоит задать один вопрос «Где проходят границы этой системы и какой конкретный механизм их реально защищает?». Если ответ сводится к фразе разработчики написали строгий системный промпт, битва уже проиграна. Границы доверия не прощают небрежности.
1.8K ·

Вся лента · оригинал в Telegram

Открыть в Telegram Лента t.me/s Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог