Ссылка
нажмите — покажем
нажмите — покажем
Непонятно, почему так происходит. Смотришь на красивых демо умных агентов, которые читают файлы, управляют инструментами и строят длинные цепочки задач, а стоит копнуть чуть глубже, и вся эта магия рассыпается в прах от одного кривого запроса.
Я тут перечитал свежий материал Криса Хьюза про изоляцию как самый важный принцип для безопасности агентов и понял, что все еще пытаются решать структурные проблемы вероятностными методами. Это как пытаться удержать цунами с помощью канцелярского скотча.
Авторы нового исследования предлагают не перечислять бесконечные векторы атак, а задать один простой вопрос. Где именно в системе впервые происходит потеря изоляции. Они выделяют пять критических границ доверия:
1️⃣Первая граница между пользователем и агентом, где пользовательский контент перестает быть просто данными и становится кодом управления.
2️⃣Вторая граница между агентом и инструментом, определяющая доступ к внешним возможностям.
🌷Третья граница исполнения, где абстрактное рассуждение материализуется в конкретное действие.
4️⃣Четвертая граница взаимодействия между самими агентами.
5️⃣И пятая граница между системой и окружающей средой.
Часто в рекомендациях по безопасности агентов видишь советы про строгие системные промпты или наличие ограничения на вызов инструмент, но это чистая иллюзия. Их можно уговорить, обмануть или заставить галлюцинировать.
Цифры в материале снимают иллюзии. Рост числа серверов MCP составил две тысячи процентов за год, и подавляющее большинство крутится на машинах разработчиков, а не на защищенных корпоративных серверах. Это огромный риск цепочки поставок. Авторы прямо пишут, что сообщение в мультиагентной системе это скрытый приказ к действию. Один скомпрометированный агент передает вредоносные инструкции другим, и начинается каскадный сбой на уровне коммуникаций. Что в целом также известно уже и в OWASP, и других методологиях.
Сетевое окружение превращается в активную враждебную поверхность. Бенчмарки вроде SafeArena и STWebAgentBench наглядно демонстрируют, что агенты выдают небезопасные результаты через обычные клики и навигацию, а модели, обученные вежливо отказывать, моментально ломаются, как только начинают действовать через интерфейс, а не через чат.
Я не могу доверять агенту просто потому, что он выдал связный текст. Я должен гарантировать исходя из структуры, что его изначальное намерение не было подменено на стыке этих пяти границ. Ограничения, по сути, будут таким -песочницы, контроль исходящего трафика, детерминированные проверки политик на уровне ядра.
Вместо нагромождения защитных слоев поверх хрупкого агента изоляцию нужно закладывать в саму архитектуру. Когда вы будете оценивать агента – стоит задать один вопрос «Где проходят границы этой системы и какой конкретный механизм их реально защищает?». Если ответ сводится к фразе разработчики написали строгий системный промпт, битва уже проиграна. Границы доверия не прощают небрежности.
1.8K ·