Веб-версияОткрыть в Telegram

ПостЕщё свежая математическая статья про динамику оптимизации и важность факторизации матриц внимания.

1 октября 2026
Ч
Частные заметки одного лица
Ссылка
нажмите — покажем
Ещё свежая математическая статья про динамику оптимизации и важность факторизации матриц внимания. High-Dimensional Learning Dynamics of Attention-Indexed Models Yizhou Xu, Margarita Sagitova, Lenka Zdeborová, and Florent Krzakala Paper: https://arxiv.org/abs/2609.03858 Review: https://arxiviq.substack.com/p/high-dimensional-learning-dynamics Code: N/A Model: N/A ЧТО сделали: Авторы построили макроскопическую теорию динамики обучения для моделей с механизмом внимания в пределе высокой размерности, где матрицы внимания обладают экстенсивным рангом, растущим прямо пропорционально размерности эмбеддингов d. В то время как асимптотический популяционный лосс полностью определяется компактным конечномерным набором следовых параметров порядка, онлайн-SGD индуцирует бесконечномерную иерархию зацепленных матричных моментов. Эту иерархию строго описывает система детерминированных ОДУ, а усечения конечного порядка аппроксимируют её с экспоненциальной точностью. Опираясь на полученный аппарат, авторы доказали, что параметризация внимания работает как архитектурный implicit bias: связывание весов (S = WW^T) запускает автоматическое нарушение симметрии и обеспечивает слабое восстановление учителя за Θ(d^2 log d) шагов по выборке, тогда как раздельное внимание (S = UV^T) демонстрирует двухмасштабную релаксацию, где успех восстановления всецело зависит от того, сможет ли быстрый дрейф средних разрушить неинформативную симметрию студента. ПОЧЕМУ это важно: Классический теоретический анализ механизмов внимания обычно скатывается в одно из двух упрощений: либо игнорирует термодинамический предел высокой размерности, либо искусственно ограничивает ранг матриц внимания константой Θ(1). В современных же моделях эффективный ранг растёт вместе с пространством представлений. Настоящая работа переносит методы математической физики на современные архитектуры трансформеров и доказывает: факторизация матриц внимания — это не просто удобная перепараметризация общего ландшафта функции потерь, а фундаментальная смена траекторий градиентного спуска. Она превращает узкие горлышки оптимизации в проходимые сценарии обучения признаков за счёт архитектурного нарушения симметрии. Для практиков: Теория долго не могла строго объяснить, как трансформеры на этапе предобучения выбираются из неинформативных начальных состояний, поскольку исследовала игрушечные низкоранговые матрицы. Если ранг реалистичен и растёт вместе с размерностью, статический ландшафт функции потерь выглядит просто, но реальная траектория оптимизатора бесконечномерна. Выбранный способ факторизации проекций выступает скрытым регуляризатором: связывание весов (S = WW^T) принуждает оптимизатор автоматически разрушать непродуктивные симметрии и быстро выучивать фичи, тогда как раздельные проекции (S = UV^T) расщепляют динамику на сверхбыстрое выравнивание средних и медленное обучение признаков, гарантированно срабатывающее лишь при удачной конфигурации пограничного слоя. Погружаться тут: https://t.me/gonzo_ML_podcasts/4815
3 · 97 ·

Рядом в ленте

ЧЧастные заметки одного лицаБольшие языковые модели - это настоящий интеллект? В IT-сообществе не утихают горячие споры: есть ли в современных LLM (таких как Claude, ChatGPT или DeepSeek) ЧЧастные заметки одного лицаСнова про теорию генерализации и гроккинга. Много математики для желающих :) A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient
это сообщение
ЧЧастные заметки одного лицаИсследователи из Meta* предложили дать моделям полный контроль над собственным контекстом Обычно контекст агента устроен довольно просто: старый контекст + новыЧЧастные заметки одного лицаКарпаты рассказал, как теперь правильно общаться с LLM Совсем недавно переживали, что Андрей Карпаты уже два месяца ничего не пишет. Все хорошо, сегодня вернулс

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем