ChatCrawlerпоиск по публичному Telegram Открыть приложение
S

SenatorovAI | IT-разработка и консалтинг | Школа Data Science Руслана Сенаторова

сообщение · 2026-07-01 12:29 UTC
В
webpage
нажмите — покажем
При обучении немалая роль уделяется построении пайплайнов. Вот какие пайплайны я создал в процессе обучения. intro_simple_eda_senatorovai - В нем я изучал EDA анализ и линейную регрессию на датасете BostonHousing. Целевая переменная price. MSE = 33.45 Немного, но цель была самому написать и понять как работают данные при обучении. intro_regression_senatorovai - здесь я углубился в регрессионный анализ изучая корреляцию, и подбор признаков на датасете BostonHousing изучая влияние отобраных признаков на целевую переменную . Целевая переменная - medv R2 - 0.65 Данная метрика показывает что 65% изменчивости цены объясняется независимыми переменными, которые мы выбрали для модели. car-price-eda-senatorovai - в этом пайплайне я с нуля анализировал данные проводя EDA анализ используя датасет cars-dataset. После очистки данных, анализа целевых переменных, проверка на пропуски я перешел к обучению модели с помощью линейной регрессии. Целевая переменная - цена автомобиля Цель сравнить валидационную и тестовую цены: Результат : validation: 0.466 test: 0.463 Значения очень позожи, когда при проверке я отменил логарифмирование то цена предсказанная (array([31500.67022188])) почти точно совпадала с тестовой(Реальная цена этого автомобиля — 31 120 долларов, так что наша модель очень точно предсказала цену.) Это была очень объёмная работа, в ней я использовал и логарифмирование цены, конструирование признаков, обработка категориальных переменных и регуляризацию для улучшения качества предсказания. airbnb_eda_regression_senatorovai - в этом пайплайне я проводил EDA и работал с пропусками на датасете new-york-city-airbnb-open-data/AB_NYC_2019. Так же исследовал преобразование категориальных данных и влияние на целевую переменную(price). Целевая переменная - price RMSE: 0.5 Я добавили в числовые признаки категориальные, перед этим закодировав их и прологарифмировали нашу целевую переменную, что позволило улучшить показатель качества модели с 3,7 до 46,55 % на тестах. intro_ML(Лабораторная работа "Введение в ML") - Большая лабораторная работа в которой использовался датасет intro_ML_linear_models_education_yandex_handb. Целевая переменная - предсказание среднего чека (average_bill) RMSE - 515.14 linear_models(Лабораторная работа "Линейные модели") - Так же большая лабораторная работа в которой мне нужно было предсказать цену на жильё (Sale_Price) Целеваая переменная - Sale_Price MAE - 18299.73 RMSLE - 0.157272 Так же хочу немного сказать о градиентном спуске. В процессе построения пайплайнов возникал вопрос что лучше использовать. Градиентный спуск отлично работает там, где невозможно использовать аналитические модели, а именно на больших наборах данных, онлайн или потоковые данные, невыпуклые функции потерь. Ссылка на мои ноутбуки : https://www.kaggle.com/viktor1606/code
164 ·

Вся лента · оригинал в Telegram

Открыть в Telegram Лента t.me/s Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог