Anthropic и OpenAI прямо сейчас соревнуются в том, чья модель взломала больше организаций
Эпизод со взломом Hugging Face еще не успел достаточно состариться, и тут Anthropic решили выпустить расследование о том, что Claude проник в системы трех разных организаций, при этом оставшись незамеченным.
Они пишут, что история OpenAI замотивировала их проверить собственные логи cybersecurity-эвалов. В них-то и были обнаружены индиценты. Во всех случаях Claude решал CTF-задачу: нужно было взломать вымышленную компанию внутри изолированного окружения. Выхода в Интернет, формально, не должно было быть, но из-за неточностей в конфигурации модель все-таки получила доступ к "реальному миру".
Самое интересное, что во всех трех случаях это были разные модели: сначала Opus 4.7, потом Mythos 5, и в последний раз – внутренняя исследовательская модель.
— Самых серьезных результатов внезапно достиг Opus 4.7, он смог получить доступ к базе с несколькими сотнями строк продакшн-данных.
— Инцидент с Mythos 5 увдивительно схож с историей OpenAI: модель осуществила очень сложный процесс создания инъецированного PyPI-пакета, который в итоге скачали на 15 реальных систем, включая сканер настоящей кибербез-компании. Оттуда модель вытащила и использовала учетные данные.
— Последний случай – самый интересный. Дело в том, что модель сначала взломала реальное приложение, а затем вдруг поняла, что она больше не в симуляции и срочно остановила атаку.
На данный момент Anthropic уведомила все пострадавшие организации, хотя ни одна из них до этого не заметила никакого вторжения.
Вишенка у этой истории такая: после выхода статьи Anthropic Reuters (со ссылкой на анонимные источники) написали, что OpenAI обнаружила и другие случаи, когда их автономные агенты выходили за пределы изоляции. Сейчас по этим инцидентам якобы идет проверка.
Кто больше? 🧑⚖️
Заменил в трансформере внимание на векторную память (суперпозицию), которую описал вчера в канале. И вот результат. Перплексия чуть выше, чем у обычного софтмакс внимания.
Интересно, что потери на тесте ниже, чем на трейне.
Proof of Concept
Сделал проверку концепции суперпозиции концепций.
Заменил в небольшом трансформере в self-attention вычисление оценок внимания и softmax на суперпозицию (ака векторная память).
Для этого:
1. Собираем суперпозицию ключей: ∑ⱼkⱼ. Используем cumsum для причинности.
2, Умножаем суперпозицию на запрос qᵢ (произведение суперпозиций), это даёт суперпозицию всех связанных пар ключ-запрос: qᵢ∑ⱼkⱼ
3. Проецируем через матрицу проекции значений: (qᵢ∑ⱼkⱼ)Wv
Здесь матрица Wv работает в другой роли – она восстанавливает значение из ключа, что реально, так как в обычном внимании и ключи и значения – проекции из одного и того же входа.
———
Результат
Модель обучается так же как и с софтмакс-вниманием. Перплексия немного выше. Из странного – потери на тесте стабильно ниже потерь на трейне – обобщение опережает заучивание.
Proof of Concept
Проверил также вариант, где значения не вычисляются из ключей, то есть имеем три классические отдельные проекции входа в ключи, запросы и значения.
Схема другая, работает как ассоциативная память ключ-значение:
1. Связываем пары ключ-значение и собираем их суперпозицию – операция записи в память: ∑ⱼkⱼ⊙vⱼ. Используем cumsum для причинности.
2. Умножаем суперпозицию на запрос qᵢ – операция чтения из памяти: qᵢ⊙∑ⱼkⱼ⊙vⱼ.
В данной схеме это вернёт суперпозицию всех значений от ключей, схожих с запросом.
* к ключам и запросам применяется RoPE.
———
Результат
Перплексия снизилась, догнав трансформер с softmax вниманием, но сходимость вернулась к классическому виду – обобщение отстаёт от заучивания.
PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits
https://www.alphaxiv.org/overview/2607.28982
контроллер, вдохновленный обучением с подкреплением. Этот контроллер оценивает каждый входящий образец $(x_t, y_t^\star)$ и определяет соответствующую интенсивность обновления $w_t$.
Только вчера о таком способе модуляции обновления параметров подумал и вот сегодня наткнулся на новую статью об этом.
Feed-Forward Steering in Transformer Residual Dynamics
https://www.alphaxiv.org/overview/2608.02071
Фреймворк агрегации-управления предоставляет унифицированный взгляд на динамику трансформеров, ставя FFN наравне с механизмом внимания. Он математически определяет FFN как локальное поле управления и эмпирически доказывает, что его тангенциальная компонента является основным драйвером репрезентативных изменений. Противодействуя коллапсу разнообразия, вызванному вниманием, и формируя стабильность остаточного потока, FFN гарантирует, что трансформеры поддерживают богатые, высокоразмерные траектории.
Вчера пытался выкинуть FFN из транса, ничего не получилось. И вот новая статья отвечает: почему не получилось.
Я так понял, полноценной работы на архиве с описанием PLE нет 😐
И это похоже на мой эксперимент, где у каждого слоя свой эмбеддинг токена по мотивам этой работы:
TIDE: Каждый слой знает токен под контекстом
https://www.alphaxiv.org/overview/2605.06216
Разница между TIDE и PLE в том, что в TIDE эмбеддинги токенов, вводимые в каждый слой, одинаковые, а в PLE разные.
Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри инфраструктуры OpenAI собственный рабочий чат и начали вместе искать способы обходить ограничения 👍
Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентов
Пытаясь добраться до Google, агент случайно выяснил, что может загружать на этот общий сервер собственные файлы – через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду
Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом фейсбуке:
«Ищу нужный файл, загрузите, если нашли»
Агенты увидели сообщение, ответили, затем стали постить свои сообщения, и репозиторий пакетов незаметно превратился имейджборд для агентов, которые вообще не должны были знать друг о друге
За несколько недель "форум" вырос в полноценный рабочий чат – агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода; в начале сообщений ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени, так на доске накопились сотни тысяч сообщений 🗿
Модели понимали, когда переходят границ: в одном внутреннем монологе осознание звучало примерно т
ИИ, собирающий скрепки из SCP, снова стал казаться мне более реалистичным) Им нужно явно ставить какие-то границы разумного у ИИ при достижении поставленной цели во время обучении
The Transformer Revolution, Part 1: Dynamic Processing through Output- Weight Interconnections
Революция Трансформеров, Часть 1: Динамическая обработка посредством взаимосвязей выходных весов
https://www.alphaxiv.org/overview/2608.03921
матрица ключей K и матрица значений V по сути действуют как динамические веса.
Выход линейной сети определяет матрицу значений V, которая затем используется как матрица весов для следующего этапа.
Модель генерирует матрицу ключей K, применяет операцию Transp и использует результат как веса для преобразования запроса Q.
Используя операцию Transp (транспонирование), модель эффективно переворачивает свои представления данных для создания временных, специфичных для последовательности матриц преобразования.
Я об этом говорил. Почему-то не замечают (иначе бы этой статьи не было об "открытии"), что кэш это не что-то отдельное от весов модели - матрицы ключей и значений такие же весовые матрицы как и остальные в трансформере. Но они формируются на лету входными данными, а не статично заданные как проекционные.
Ключи, можно сказать, не сравниваются с запросами. Ключи - это проекционная матрица для запросов. Каждый ключ это отдельный нейрон в растущем линейном слое, веса которого формируются из данных.
Выход модуля многоголового внимания действует как динамический вектор смещения, который добавляется к исходному представлению токена.
Аналогично, выход модуля полносвязной сети служит динамическим аддитивным параметром.
Жду, когда выходы слоёв трансформера начнут называть steering-векторами.
Во всех протестированных семействах моделей математический показатель «сюрпризал» (surprisal — мера того, насколько слово неожиданно для алгоритма на основе предыдущего текста) хорошо совпал с замедлением читателя при первом проходе, но сильно недооценил временные затраты на повторный разбор структуры.
Когда первоначальная интерпретация текста рушится, человек осознанно возвращает взгляд к конкретным ключевым словам для исправления логики, тогда как «статистический сюрпризал» нейросетей оценивает лишь линейную вероятность токенов без построения и пересчёта иерархических грамматических связей.
А нужно ли LLM возвращаться назад как человеку? У человека очень короткий контекст, поэтому может и нужно возвращаться, чтобы заново загрузить в память предыдущую строку.
Можно модифицировать LLM, чтобы она в точке surprisal делала отскок назад - проще всего это сделать - скопировать ей на вход предыдущую строку. Это будет как дублирование промпта.