ChatCrawlerпоиск по публичному Telegram ПоискКаталог Открыть приложение
B

Big Data Science :: AI / Big Data / Machine Learning / MLOps

5 576 участников
A
Astral Zanderда, ток в реальности почти все пиксели лежат в очень взаимозависимых кластерах
Это кстати подтверждается собственно, модельками диффузии, которые генерят все разом из некоторого общего распределения, а не независимо. Кмк, тут стоит смотреть не на уровне пикселей и фич, а на уровне распределений и вероятностей.
Astral ZanderЭто кстати подтверждается собственно, модельками диффузии, которые генерят все разом из некоторого общего распределения, а не независимо. Кмк, тут стоит смотреть не на уровне пикселей и фич, а на уровне распределений и вероятностей.
даже если взять эмбеддинг размера 512, то это всё равно очень большое пространство у которого 2^512 (=10^154) углов. На базе теории пустых пространств признаков я успешно делал очень нетривиальные штуки, так что эта теория определённо верна В учебниках обычно рисуют двумерные картинки с границами классов очень сложной формы. Но в реальности такого никогда не будет. В реальности будет пространство огромной размерности с кучей пустых углов, и границы классов простейшей формы. На основе этого и надо строить всю дальнейшую логику
А
A
А
Astral Zanderда, ток в реальности почти все пиксели лежат в очень взаимозависимых кластерах
Обучающие выборки тоже не содержат абсолютно независимые данные . Они обычно сильно скоррелированы между собой (то есть не покрывают равномерно всё пространство, от чего оно становится ещё более пустым). А часто вообще выборки формируются из ограниченного набора источников, когда например куча картинок сняты в одной и той же локации
А
Расскажу вам ещё один прикол. Есть ещё такое понятие как "искривление пространства признаков". Это когда в некоторой подобласти пространства признаков распределение классов/целевой переменной в обучающей выборке сильно отличается от того распределения, которое должно быть на самом деле. И естественно, что такое искривление будет выучено моделью как неправильный предикт. И такое явление встречается на практике очень часто. Искривление пространства признаков может возникать: - из-за того, что в определённой подобласти пространства признаков в выборке просто нет данных определённого класса - при добавлении в обучение новых данных, были добавлены данные только одного класса (и это вообще очень опасная штука, потому что на валидации такое может не обнаружиться, а в проде это будет стабильный неправильный предикт). - при добавлении в обучение кучи дублирующихся или очень похожих данных - из-за недосемплирования/избыточного сэмплирования определённых данных - если распределение классов в некоторой подобласти неправильное - в задаче регрессии, если распределение целевой переменной в природе неравномерное (но для справедливого обучения оно должно быть равномерным, иначе будет искривление ответов) На практике всё это встречается очень часто, и негативно влияет на качество обучения. Поэтому считаю эту концепцию крайне полезной.
V
VeronicaА почему для справедливого обучения распределение таргета должно быть равномерным? Если модель учит среднее y для каждого x, разве она не должна выучить неравномерность как есть (это же часть задачи)?
Если распределение Y - колоколобразное, то модель заучит это искривление (что средний Y всегда более вероятен, чем крайние Y), из-за чего распределение ответов модели будет ещё более колоколообразным, то есть ещё более смещённым к центру
А
А
Astral Zanderтекст ещё не в индексе
даже если распределение данных действительно низкоразмерное, то распределение обучающей выборки обычно ещё более низкоразмерное. То есть если учимся отличать собак от кошек, то например нет кошек и собак в темноте. Или есть только собаки, мы добавили кошек, но тут выяснилось, что мы добавили много лежащих кошек в темноте, но у нас нет лежащих собак в темноте. Это всё искривления пустых пространств , о которых я писал после сообщения о пустых пространствах признаков
Ваш тейк про пустые пространства наверное можно немного по другому перефразировать: агрегаторы типа пулинга являются оконными, и отображение между входом и выходом оного не является биекцией, одному пуллингу соответствует множество разных окон. Но это не совсем про "пустоту", кмк.
Короче весь тейк сводится к тому, что свертки не pixel-wise. Что как бы очевидно.
A
А
Astral ZanderЭто тривиальный факт. Переводя на человеческий: Обучающая выборка конечна и не покрывает все распределение.
речь про искривления распределений на конкретном участке пространства признаков. Выборка может быть бесконечной и покрывать всё разнообразие данных. Но лежащих в темноте кошек может быть в 100 раз больше, чем лежащих в темноте собак. Это будет искривление пространства признаков, которое будет заучено как ложная закономерность. И эта система абстракций более эффективна, чем тривиально говорить, что данных мало, потому что предлагает более конкретные шаги по решению возникающих проблем.
A
Ссылка
нажмите — покажем
Обожаю вспоминать всякие древние статьи. https://arxiv.org/abs/2008.02217 Саммари: Авторы смотрят на модель Хопфилда. Модель Хопфилда это такой "прародитель нейросетей" для распознавания образов. А еще по совместительству известная статфизическая модель: Модель Изинга (с бонусом в виде правила Хэбба из биологии). Авторы обобщили ее на непрерывные спины, получили фактически "модель Хопфилда" для высших порядков (учли парные, тройные, четверные, etc взаимодействия) и непрерывных спинов. А потом оказалось, что это ваш самый обычный self-attention из трансформера. tldr: self-attention = статфизическая спиновая модель
610 ·
B
Big Data Science :: AI / Big Data / Machine Learning / MLOps
Фотография
нажмите — покажем
Только для своих: Робо Драйв Пати от команды робототехники Сбера! 🤫 10 июля в новом пространстве Сбер.Среда, настоящем доме для ИТ-сообществ, состоится закрытая вечеринка для ML, RL, DL, Robotics Software и Embedded-инженеров. ✔️ Расскажем, как строится программная архитектура роботов ✔️ Презентуем продуктовую стратегию и разработку Green-VLA ✔️ Обсудим, как создаётся физическая платформа роботов ✔️ И, конечно же, познакомим с первым антропоморфным роботом Сбера — Грином Если ты хочешь создавать реальных роботов — приходи знакомиться с командой (или будущими коллегами 😉), обсуждать проекты и, вполне возможно, получить оффер мечты. Твой билет на закрытую Робо Драйв Пати здесь! 🎟
B
Big Data Science :: AI / Big Data / Machine Learning / MLOps
Фотография
нажмите — покажем
RecSys, NLP, антифрод и агентные системы — все за один день Если интересуетесь современными ML-подходами, обратите внимание на «Урбан ML». 2 августа в Москве эксперты MTS Web Services, ВТБ, Wildberries, «Звук», Альфа-Банка и других компаний представят 18 докладов по ключевым направлениям Data Science. После технической части — спортивныеи активности (баскетбол, настольный теннис, ИИ-шахматы) , общение и афтепати. Вход бесплатный (на площадку необходимо взять с собой паспорт или права), регистрация по ссылке: [ссылка] 📅 2 августа, 11:00–21:00 (первый доклад в 12:00) 📍 Москва, офлайн
B
Big Data Science :: AI / Big Data / Machine Learning / MLOps
Фотография
нажмите — покажем
Как сегодня строят рекомендательные системы — и что будет с ними завтра? 30 сентября собираем RecSys-сообщество — разработчиков, ML/DS-специалистов и всех, кто делает персонализацию и рекомендации в реальных продуктах. В программе — доклады от экспертов Сбера. Поговорим о свежих подходах и нестандартных решениях на реальных кейсах. А после докладов переключаемся на неформальный режим: знакомимся, спорим про RecSys, обсуждаем идеи, находим единомышленников и просто хорошо проводим вечер среди своих. 📍г. Нижний Новгород, пространство «Гараж» Количество мест ограничено — успей забрать своё по ссылке!
B
Big Data Science :: AI / Big Data / Machine Learning / MLOps
Фотография
нажмите — покажем
Не отставайте от рынка — учитесь со скидкой 16% Если чувствуете, что стоите на месте, и хотите освоить востребованную профессию, — сейчас хороший момент начать. Потому что до 30 сентября на все курсы Практикума действует скидка 16%.  Выбрать курс Вы сможете: — получить актуальные навыки; — освоить ИИ-инструменты для работы; — перенять опыт экспертов, которые двигают индустрию; — попасть в сообщество выпускников, где можно попросить совета и, возможно, найти будущих коллег. Просто выберите курс, начните учиться бесплатно и получите скидку 16% — она автоматически появится в личном кабинете.  Учиться! Erid: 2SDnjee4GJo Название: ООО "ЯНДЕКС" ИНН: 7736207543
B
Big Data Science :: AI / Big Data / Machine Learning / MLOps
Фотография
нажмите — покажем
Что под капотом у рекомендаций Авито на главной Они решают две задачи: 1️⃣ Показывают пользователю максимально релевантные товары. 2️⃣ Разбавляют выдачу объявлениями, которые могут быть интересны. Качественные товары с адекватной ценой часто разбирают в первые часы. Поэтому важно, чтобы они быстро попадали на главную. Недавно мы поменяли архитектуру рекомендаций — и ускорили их в 18 раз. После этого контакты продавцов с покупателями выросли на 1%, а расход памяти упал в три раза. Но получилось всё это не с первого раза: пришлось пройти несколько итераций. Подробности в статье ↖️
Архив по месяцам
сентябрь 2026июль 2026июнь 2026май 2026апрель 2026март 2026январь 2026декабрь 2025ноябрь 2025октябрь 2025сентябрь 2025август 2025июль 2025июнь 2025май 2025апрель 2025март 2025февраль 2025январь 2025декабрь 2024ноябрь 2024октябрь 2024сентябрь 2024август 2024июль 2024июнь 2024май 2024апрель 2024март 2024февраль 2024январь 2024декабрь 2023ноябрь 2023октябрь 2023сентябрь 2023август 2023июль 2023июнь 2023май 2023апрель 2023март 2023февраль 2023январь 2023декабрь 2022ноябрь 2022октябрь 2022сентябрь 2022август 2022июль 2022июнь 2022май 2022апрель 2022март 2022февраль 2022январь 2022декабрь 2021ноябрь 2021октябрь 2021сентябрь 2021август 2021июль 2021июнь 2021май 2021апрель 2021март 2021февраль 2021январь 2021декабрь 2020ноябрь 2020октябрь 2020сентябрь 2020август 2020июль 2020июнь 2020май 2020апрель 2020март 2020февраль 2020январь 2020декабрь 2019ноябрь 2019октябрь 2019сентябрь 2019август 2019июль 2019июнь 2019май 2019апрель 2019март 2019февраль 2019январь 2019декабрь 2018ноябрь 2018октябрь 2018сентябрь 2018август 2018июль 2018июнь 2018май 2018апрель 2018март 2018февраль 2018январь 2018декабрь 2017ноябрь 2017октябрь 2017сентябрь 2017август 2017июль 2017июнь 2017май 2017апрель 2017март 2017февраль 2017январь 2017декабрь 2016ноябрь 2016октябрь 2016сентябрь 2016август 2016
Открыть в Telegram Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем