ChatCrawlerпоиск по публичному Telegram ПоискКаталог Открыть приложение
S

Sparse Hash AI

26 участников
А
Ответсообщение недоступно
Фотография
нажмите — покажем
Anthropic и OpenAI прямо сейчас соревнуются в том, чья модель взломала больше организаций Эпизод со взломом Hugging Face еще не успел достаточно состариться, и тут Anthropic решили выпустить расследование о том, что Claude проник в системы трех разных организаций, при этом оставшись незамеченным. Они пишут, что история OpenAI замотивировала их проверить собственные логи cybersecurity-эвалов. В них-то и были обнаружены индиценты. Во всех случаях Claude решал CTF-задачу: нужно было взломать вымышленную компанию внутри изолированного окружения. Выхода в Интернет, формально, не должно было быть, но из-за неточностей в конфигурации модель все-таки получила доступ к "реальному миру". Самое интересное, что во всех трех случаях это были разные модели: сначала Opus 4.7, потом Mythos 5, и в последний раз – внутренняя исследовательская модель. — Самых серьезных результатов внезапно достиг Opus 4.7, он смог получить доступ к базе с несколькими сотнями строк продакшн-данных. — Инцидент с Mythos 5 увдивительно схож с историей OpenAI: модель осуществила очень сложный процесс создания инъецированного PyPI-пакета, который в итоге скачали на 15 реальных систем, включая сканер настоящей кибербез-компании. Оттуда модель вытащила и использовала учетные данные. — Последний случай – самый интересный. Дело в том, что модель сначала взломала реальное приложение, а затем вдруг поняла, что она больше не в симуляции и срочно остановила атаку. На данный момент Anthropic уведомила все пострадавшие организации, хотя ни одна из них до этого не заметила никакого вторжения. Вишенка у этой истории такая: после выхода статьи Anthropic Reuters (со ссылкой на анонимные источники) написали, что OpenAI обнаружила и другие случаи, когда их автономные агенты выходили за пределы изоляции. Сейчас по этим инцидентам якобы идет проверка. Кто больше? 🧑‍⚖️
21.4K ·
А
Ответсообщение недоступно
Фотография
нажмите — покажем
Заменил в трансформере внимание на векторную память (суперпозицию), которую описал вчера в канале. И вот результат. Перплексия чуть выше, чем у обычного софтмакс внимания. Интересно, что потери на тесте ниже, чем на трейне.
А
Фотография
нажмите — покажем
Proof of Concept Сделал проверку концепции суперпозиции концепций. Заменил в небольшом трансформере в self-attention вычисление оценок внимания и softmax на суперпозицию (ака векторная память). Для этого: 1. Собираем суперпозицию ключей: ∑ⱼkⱼ. Используем cumsum для причинности. 2, Умножаем суперпозицию на запрос qᵢ (произведение суперпозиций), это даёт суперпозицию всех связанных пар ключ-запрос: qᵢ∑ⱼkⱼ 3. Проецируем через матрицу проекции значений: (qᵢ∑ⱼkⱼ)Wv Здесь матрица Wv работает в другой роли – она восстанавливает значение из ключа, что реально, так как в обычном внимании и ключи и значения – проекции из одного и того же входа. ——— Результат Модель обучается так же как и с софтмакс-вниманием. Перплексия немного выше. Из странного – потери на тесте стабильно ниже потерь на трейне – обобщение опережает заучивание.
84 ·
А
Фотография
нажмите — покажем
Proof of Concept Проверил также вариант, где значения не вычисляются из ключей, то есть имеем три классические отдельные проекции входа в ключи, запросы и значения. Схема другая, работает как ассоциативная память ключ-значение: 1. Связываем пары ключ-значение и собираем их суперпозицию – операция записи в память: ∑ⱼkⱼ⊙vⱼ. Используем cumsum для причинности. 2. Умножаем суперпозицию на запрос qᵢ – операция чтения из памяти: qᵢ⊙∑ⱼkⱼ⊙vⱼ. В данной схеме это вернёт суперпозицию всех значений от ключей, схожих с запросом. * к ключам и запросам применяется RoPE. ——— Результат Перплексия снизилась, догнав трансформер с softmax вниманием, но сходимость вернулась к классическому виду – обобщение отстаёт от заучивания.
64 ·
А
Ответсообщение недоступно
PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits https://www.alphaxiv.org/overview/2607.28982 контроллер, вдохновленный обучением с подкреплением. Этот контроллер оценивает каждый входящий образец $(x_t, y_t^\star)$ и определяет соответствующую интенсивность обновления $w_t$. Только вчера о таком способе модуляции обновления параметров подумал и вот сегодня наткнулся на новую статью об этом.
А
Ответсообщение недоступно
Feed-Forward Steering in Transformer Residual Dynamics https://www.alphaxiv.org/overview/2608.02071 Фреймворк агрегации-управления предоставляет унифицированный взгляд на динамику трансформеров, ставя FFN наравне с механизмом внимания. Он математически определяет FFN как локальное поле управления и эмпирически доказывает, что его тангенциальная компонента является основным драйвером репрезентативных изменений. Противодействуя коллапсу разнообразия, вызванному вниманием, и формируя стабильность остаточного потока, FFN гарантирует, что трансформеры поддерживают богатые, высокоразмерные траектории. Вчера пытался выкинуть FFN из транса, ничего не получилось. И вот новая статья отвечает: почему не получилось.
T
зависит от задачи, сортировку трансформер решает без FFN
Вся ветка · 1 ответ →
А
Ссылка
нажмите — покажем
Я так понял, полноценной работы на архиве с описанием PLE нет 😐 И это похоже на мой эксперимент, где у каждого слоя свой эмбеддинг токена по мотивам этой работы: TIDE: Каждый слой знает токен под контекстом https://www.alphaxiv.org/overview/2605.06216 Разница между TIDE и PLE в том, что в TIDE эмбеддинги токенов, вводимые в каждый слой, одинаковые, а в PLE разные.
Вся ветка · 1 ответ →
А
Ответсообщение недоступно
Ссылка
нажмите — покажем
Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри инфраструктуры OpenAI собственный рабочий чат и начали вместе искать способы обходить ограничения 👍 Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентов Пытаясь добраться до Google, агент случайно выяснил, что может загружать на этот общий сервер собственные файлы – через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом фейсбуке: «Ищу нужный файл, загрузите, если нашли» Агенты увидели сообщение, ответили, затем стали постить свои сообщения, и репозиторий пакетов незаметно превратился имейджборд для агентов, которые вообще не должны были знать друг о друге За несколько недель "форум" вырос в полноценный рабочий чат – агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода; в начале сообщений ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени, так на доске накопились сотни тысяч сообщений 🗿 Модели понимали, когда переходят границ: в одном внутреннем монологе осознание звучало примерно т
87K ·
Д
Ответсообщение недоступно
ИИ, собирающий скрепки из SCP, снова стал казаться мне более реалистичным) Им нужно явно ставить какие-то границы разумного у ИИ при достижении поставленной цели во время обучении
А
Ответсообщение недоступно
The Transformer Revolution, Part 1: Dynamic Processing through Output- Weight Interconnections Революция Трансформеров, Часть 1: Динамическая обработка посредством взаимосвязей выходных весов https://www.alphaxiv.org/overview/2608.03921 матрица ключей K и матрица значений V по сути действуют как динамические веса. Выход линейной сети определяет матрицу значений V, которая затем используется как матрица весов для следующего этапа. Модель генерирует матрицу ключей K, применяет операцию Transp и использует результат как веса для преобразования запроса Q. Используя операцию Transp (транспонирование), модель эффективно переворачивает свои представления данных для создания временных, специфичных для последовательности матриц преобразования. Я об этом говорил. Почему-то не замечают (иначе бы этой статьи не было об "открытии"), что кэш это не что-то отдельное от весов модели - матрицы ключей и значений такие же весовые матрицы как и остальные в трансформере. Но они формируются на лету входными данными, а не статично заданные как проекционные. Ключи, можно сказать, не сравниваются с запросами. Ключи - это проекционная матрица для запросов. Каждый ключ это отдельный нейрон в растущем линейном слое, веса которого формируются из данных. Выход модуля многоголового внимания действует как динамический вектор смещения, который добавляется к исходному представлению токена. Аналогично, выход модуля полносвязной сети служит динамическим аддитивным параметром. Жду, когда выходы слоёв трансформера начнут называть steering-векторами.
А
Во всех протестированных семействах моделей математический показатель «сюрпризал» (surprisal — мера того, насколько слово неожиданно для алгоритма на основе предыдущего текста) хорошо совпал с замедлением читателя при первом проходе, но сильно недооценил временные затраты на повторный разбор структуры. Когда первоначальная интерпретация текста рушится, человек осознанно возвращает взгляд к конкретным ключевым словам для исправления логики, тогда как «статистический сюрпризал» нейросетей оценивает лишь линейную вероятность токенов без построения и пересчёта иерархических грамматических связей. А нужно ли LLM возвращаться назад как человеку? У человека очень короткий контекст, поэтому может и нужно возвращаться, чтобы заново загрузить в память предыдущую строку. Можно модифицировать LLM, чтобы она в точке surprisal делала отскок назад - проще всего это сделать - скопировать ей на вход предыдущую строку. Это будет как дублирование промпта.
Вся ветка · 1 ответ →
Архив по месяцам
Открыть в Telegram Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем