webpage
нажмите — покажем
нажмите — покажем
При обучении немалая роль уделяется построении пайплайнов. Вот какие пайплайны я создал в процессе обучения.
intro_simple_eda_senatorovai - В нем я изучал EDA анализ и линейную регрессию на датасете BostonHousing.
Целевая переменная price.
MSE = 33.45
Немного, но цель была самому написать и понять как работают данные при обучении.
intro_regression_senatorovai - здесь я углубился в регрессионный анализ изучая корреляцию, и подбор признаков на датасете BostonHousing изучая влияние отобраных признаков на целевую переменную .
Целевая переменная - medv
R2 - 0.65
Данная метрика показывает что 65% изменчивости цены объясняется независимыми переменными, которые мы выбрали для модели.
car-price-eda-senatorovai - в этом пайплайне я с нуля анализировал данные проводя EDA анализ используя датасет cars-dataset. После очистки данных, анализа целевых переменных, проверка на пропуски я перешел к обучению модели с помощью линейной регрессии.
Целевая переменная - цена автомобиля
Цель сравнить валидационную и тестовую цены:
Результат :
validation: 0.466
test: 0.463
Значения очень позожи, когда при проверке я отменил логарифмирование то цена предсказанная (array([31500.67022188])) почти точно совпадала с тестовой(Реальная цена этого автомобиля — 31 120 долларов, так что наша модель очень точно предсказала цену.)
Это была очень объёмная работа, в ней я использовал и логарифмирование цены, конструирование признаков, обработка категориальных переменных и регуляризацию для улучшения качества предсказания.
airbnb_eda_regression_senatorovai - в этом пайплайне я проводил EDA и работал с пропусками на датасете new-york-city-airbnb-open-data/AB_NYC_2019. Так же исследовал преобразование категориальных данных и влияние на целевую переменную(price).
Целевая переменная - price
RMSE: 0.5
Я добавили в числовые признаки категориальные, перед этим закодировав их и прологарифмировали нашу целевую переменную, что позволило улучшить показатель качества модели с 3,7 до 46,55 % на тестах.
intro_ML(Лабораторная работа "Введение в ML") - Большая лабораторная работа в которой использовался датасет intro_ML_linear_models_education_yandex_handb.
Целевая переменная - предсказание среднего чека (average_bill)
RMSE - 515.14
linear_models(Лабораторная работа "Линейные модели") - Так же большая лабораторная работа в которой мне нужно было предсказать цену на жильё (Sale_Price)
Целеваая переменная - Sale_Price
MAE - 18299.73
RMSLE - 0.157272
Так же хочу немного сказать о градиентном спуске. В процессе построения пайплайнов возникал вопрос что лучше использовать. Градиентный спуск отлично работает там, где невозможно использовать аналитические модели, а именно на больших наборах данных, онлайн или потоковые данные, невыпуклые функции потерь.
Ссылка на мои ноутбуки : https://www.kaggle.com/viktor1606/code
164 ·