Веб-версияОткрыть в Telegram

ПостСнова про теорию генерализации и гроккинга. Много математики для желающих :)

30 сентября 2026
Ч
Частные заметки одного лица
Ссылка
нажмите — покажем
Снова про теорию генерализации и гроккинга. Много математики для желающих :) A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay Yuqing Wang, Ioannis G. Kevrekidis, Mikhail Belkin Paper: https://arxiv.org/abs/2609.07755 Review: https://arxiviq.substack.com/p/a-theoretical-analysis-of-generalization ЧТО сделали: Авторы построили строгий теоретический фреймворк для анализа динамики обобщения глубоких нейросетей при оптимизации градиентным спуском с weight decay на квадратичном лоссе. Разбив входное пространство на ячейки вокруг обучающих точек, исследователи разложили популяционный риск на три слагаемых: ошибку данных, ошибку оптимизации и ошибку вариации предсказаний. В предположениях диссипативности и локальной приближённой однородности доказано, что weight decay сжимает внутренние представления, гарантируя эмпирическую сходимость и задавая необходимые и достаточные условия для послойной сходимости и эффекта гроккинга (grokking). ПОЧЕМУ это важно: Классическая теория статистического обучения опирается на статические границы равномерной сходимости, которые бессильны перед перепараметризованными сетями, интерполирующими шум или демонстрирующими отложенное обобщение. Предложенный подход выходит далеко за рамки линеаризованного режима нейро-касательного ядра (NTK) и игрушечных постановок. Он объединяет геометрию данных, глубину сети и алгоритмическую регуляризацию в общую динамическую теорию, объясняя, почему глубокие слои обобщают позже и как weight decay управляет временным зазором между запоминанием и генерализацией. Для практиков: На практике глубокие сети часто ведут себя контринтуитивно: тренировочный лосс падает практически в ноль почти мгновенно, но тестовая точность выходит на плато и лишь спустя тысячи дополнительных шагов резко взлетает — это и есть гроккинг. Работа математически объясняет этот феномен: подгонка под обучающую выборку и генерализация управляются двумя разными физическими процессами, идущими на разных временных масштабах. Запоминание обучающих точек происходит быстро вдоль координат данных, тогда как для истинного обобщения требуется время, чтобы weight decay успел подавить неконтролируемые осцилляции функции во всём остальном объёме входного пространства. Описав, как это сжатие послойно распространяется по сети, теория даёт конкретные критерии баланса между покрытием датасета, силой weight decay и длительностью обучения. Подводить базу здесь: https://t.me/gonzo_ML_podcasts/4814
95 ·

Рядом в ленте

ЧЧастные заметки одного лицаЭто не я, это модель! Есть такой “зеркальный” тест, которым проверяют, осознает ли живое существо себя. Берут, например, шимпанзе, незаметно ставят метку на лбуЧЧастные заметки одного лицаБольшие языковые модели - это настоящий интеллект? В IT-сообществе не утихают горячие споры: есть ли в современных LLM (таких как Claude, ChatGPT или DeepSeek)
это сообщение
ЧЧастные заметки одного лицаЕщё свежая математическая статья про динамику оптимизации и важность факторизации матриц внимания. High-Dimensional Learning Dynamics of Attention-Indexed ModelЧЧастные заметки одного лицаИсследователи из Meta* предложили дать моделям полный контроль над собственным контекстом Обычно контекст агента устроен довольно просто: старый контекст + новы

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем