30 июля 2024
Фотография
нажмите — покажем
нажмите — покажем
🛢 В мире, где данные — новая нефть, растёт спрос на дата-инженеров. Ведь именно они знают, как такую нефть добывать, обрабатывать и хранить. И пока компании осознают потребность в этих специалистах, конкуренция на рынке низкая, а зарплаты — высокие.
Освоить ключевые компетенции дата-инженера поможет онлайн-магистратура Нетологии и НИУ ВШЭ «Инженерия данных». За 2 года вы на практике изучите Python, Java, Scala, Kotlin и SQL, научитесь проектировать пайплайны и обрабатывать данные, работать с системами хранения данных и базами данных в облаке. Программа даёт широкий простор для переквалификации, поэтому после учёбы сможете перейти в MLOps, DevOps или менеджмент.
Онлайн-формат позволяет учиться без отрыва от привычной жизни и совмещать занятия с работой. При этом у вас будет отсрочка от армии, льготы на проезд и все остальные бонусы очного обучения.
Станьте магистром программной инженерии с дипломом одного из лучших вузов страны и получите веское преимущество при приёме на работу: https://netolo.gy/dlaL
Реклама. ООО "Нетология". Erid 2VSb5wpkBUL
Фотография
нажмите — покажем
нажмите — покажем
Фотография
нажмите — покажем
нажмите — покажем
🌟 Voyager — это библиотека Python (и Java) для быстрого приближенного поиска ближайших соседей
— pip install voyager
Voyager может использоваться как из Python, так и из Java;
библиотека опирается на алгоритм HNSW, основанный на пакете hnswlib, плюс использует много дополнительных функций.
Voyager активно используется в продакшене в Spotify
🖥 GitHub
🟡 Доки
🟡 Видео про Voyager
@data_analysis_ml
7.3K · 31 июля 2024
id 1966927727Hello, I am requesting if any one has a machine learning project that has been done using Jupyter notebook
I do, but just beginner kinds with regression/classification/clustering models of traditional type, have not tried deep learning yet. DM if you have questions.
Фотография
нажмите — покажем
нажмите — покажем
Знакомьтесь! Сетка — новая социальная сеть для нетворкинга от hh ru, которая помогает ИТ-коммьюнити расширять сеть полезных знакомств и общаться с коллегами по рынку
В приложении есть простой и удобный функционал Q&A, где можно задать свой вопрос сообществу и получить на него развёрнутый ответ от экспертов. Ещё здесь можно профессионально расти и развиваться, следить за актуальным контентом в своей сфере, делиться кейсами и искать партнёров для новых коллаб или side-проектов.
Благодаря big data hh ru Сетка подгружает информацию о вашем опыте работы и помогает точно пересечься с теми, кто повлияет на ваш профессиональный путь. Теперь не нужно ломать голову над тем, где искать полезные контакты.
Скачать приложение. Пересечёмся в Сетке ✌🏻
Я понимаю, что мимо, но попытка не пытка. Подскажите модельку для прогнозирования энергопотребления регионов относительно даты. То есть есть табличка с 75 регионами, есть их потребление электроэнергии. Шаг временного ряда 1 час. Нужно спрогнозировать энергопотребление на будущие относительно региона. То есть нужна моделька, которая от нескольких фичей (регион, дня, и т. д.) прогнозирует одно число - электропотребление.
Deniz ErdoganЯ понимаю, что мимо, но попытка не пытка. Подскажите модельку для прогнозирования энергопотребления регионов относительно даты. То есть есть табличка с 75 регионами, есть их потребление электроэнергии. Шаг временного ряда 1 час. Нужно спрогнозировать энергопотребление на будущие относительно региона
Лучше строить зависимость не от даты, а от ряда предыдущих значений, чтобы выявлять сезонность, цикличность и тренд. Для этого есть целый класс моделей - авторегрессионные. Эконометрические (такие как ARIMA) и нейросетевые (такие как LSTM). Для лучшего качества советую LSTM, но нужно много данных (10к - 50к наблюдений)
Михаил АникутинЛучше строить зависимость не от даты, а от ряда предыдущих значений, чтобы выявлять сезонность, цикличность и тренд. Для этого есть целый класс моделей - авторегрессионные. Эконометрические (такие как ARIMA) и нейросетевые (такие как LSTM). Для лучшего качества советую LSTM, но нужно много данных (1
это самые популярные решения, для такой стандартной задачи их должно хватать
Фотография
нажмите — покажем
нажмите — покажем
Видео
нажмите — покажем
нажмите — покажем
🌟 Click-Gaussian — интерактивная сегментация любых 3D-гауссианов
Интерактивная сегментация 3D-гауссианов открывает широкие возможности для работы с 3D-сценами в реальном времени, однако текущие методы имеют массу недостатков.
Чтобы улучшить ситуацию, Seokhun Choi и его коллеги из Сеула и они предлагают метод Click-Gaussian, который позволяет обрабатывать каждый клик 10 мс, что в 15-130 раз быстрее, чем предыдущие методы; при этом Click-Gaussian имеет ещё и большую точность сегментации.
🟡 Страничка Click-Gaussian
🟡 Arxiv
@data_analysis_ml
7.4K · Machine learning chat
Фотография
нажмите — покажем
нажмите — покажем
Фотография
нажмите — покажем
нажмите — покажем
⚡️ Gemma 2 2B: Релиз набора моделей и открытый набор автоэнкодеров к семейству Gemma
Спустя месяц после выхода Gemma 2 компания Google расширила набор моделей Gemma, добавив в него следующие новинки:
🟢Gemma-2-2B;
🟢Gemma-2-2b-it;
🟢Gemma-2-2b-pytorch;
🟢Gemma-2-2b-it-pytorch;
🟢Gemma-2-2b-GGUF;
🟢Gemma-2-2b-it-GGUF;
🟢ShieldGemma-2b;
🟢Shieldgemma-9b;
🟢Shieldgemma-27b;
🟠Gemma Scope для всех плотностей семейства Gemma.
✔️Gemma - это семейство легких современных открытых моделей от Google, созданных на основе тех же исследований и технологий, которые использовались при создании моделей Gemini. Это большие языковые модели, работающие только с декодером, доступные на английском языке, с открытыми весами как для предварительно обученных вариантов, так и для вариантов, настроенных по инструкции.
В этом релизе представлена версия Gemma 2 с параметрами 2.6B (базовая и instruct, версии GGUF и pytorch), как дополнение к вариантам 9B и 27B.
Gemma 2 2B имеет ту же архитектуру, что и другие модели семейства Gemma 2, и использует такие технические возможности, как sliding attention и logit soft-capping.
*️⃣Модели Gemma-2-2B можно запускать с помощью библиотеки Transformers и llama.cpp. GGUF-версии совместимы с llama.cpp, Ollama и LM Studio.
Gemma 2 2B была оценена на ряде тестов: BBH, IFEval, MATH Hard, GPQA, MuSR и MMLU-Pro. Результаты показали, что Gemma 2 2B превосходит другие модели того же размера в задачах, связанных с знаниями и инструкциями.
Кроме того, модель Gemma 2 2B может быть использована для ассистировании генерации текста, что позволит ускорить генерацию текста в 3 раза без потери качества.
✔️ ShieldGemma - это серия моделей модерации безопасного контента, построенных на основе Gemma 2, которые нацелены на несколько категорий цензурирования (включая откровенно сексуальный, опасный контент, ненависть или преследование).
Это крупные модели, работающие по принципу "текст в текст", только с декодером, доступные на английском языке, с открытыми весами и в 3 вар
8.5K · Михаил АникутинЛучше строить зависимость не от даты, а от ряда предыдущих значений, чтобы выявлять сезонность, цикличность и тренд. Для этого есть целый класс моделей - авторегрессионные. Эконометрические (такие как ARIMA) и нейросетевые (такие как LSTM). Для лучшего качества советую LSTM, но нужно много данных (1
Есть около 6 миллионов строк. Насчёт ARIMA, не сочтите совсем за дурачка, но многие модели (и как мне помнится ARIMA, хотя могу ошибаться) работают в паре целевая переменная - время, то есть регион и т. д. не учесть. А LSTM смотрел, вариант хороший, суть я понял, но только вопрос. LTSM может прогнозировать конкретно одно значение (то есть только целевую переменную)? Просто, когда я смотрел multi variance forecasting time series, там были примеры LTSM, но как я понял они сразу несколько значений прогнозировали, то есть и регион и т. д. МБ я прям всё попутал в голове, но пока все дни сёрфил, уже подустал. Нашёл на kaggle похожие по тематике соревнования, там был пример сравнения ltsm и xgboost. В том соревновании Xgboost показал себе лучше, а с ним я довольно таки неплохо работал, вот и решил остановиться пока что на нём. Но сегодня прочитал, что град. бустинг не ловит тенденций, как я понял тот же тренд. А это точно мне не подойдёт, хотя по метрикам всё очень даже. Извините за не точности, или если что-то перепутал. Пока что изучаю вопрос, пытаюсь внедриться в данную тематику, поэтому и написал сюда.
Всем привет. Есть задача где нужно по фотке косметического продукта (всякие баночки, тоналки, тюбики кремов) нужно искать этот продукт в бд. В бд лежат условно фотки от производителя. Подскажите в какую сторону лучше копать, после небольшого рисеча кажется что SIFT самое подходящее. Но работает относительно долго, и объект кейпоинтов огромный получается. Может я не туда копаю и лучше вообще что-то другое заюзать вместо сифта?
Я нуб в мл, так что любой совет к месту, спасибо 🙏
Deniz ErdoganЕсть около 6 миллионов строк. Насчёт ARIMA, не сочтите совсем за дурачка, но многие модели (и как мне помнится ARIMA, хотя могу ошибаться) работают в паре целевая переменная - время, то есть регион и т. д. не учесть. А LSTM смотрел, вариант хороший, суть я понял, но только вопрос. LTSM может прогноз
ты задаешь свой X и y, подаешь на вход Х, а на игрек что хочешь предсказывать. Что подаешь и что хочешь предсказывать сам выбираешь
по регрессорам это правда, CatBoost или XGBoost подходят, вы можете искусственно сделать модель авторегрессионной, если сделаете признаки равными переменной с лаггом
Для прогнозирования временных рядов подходят все решения для seq2seq (тот же NLP например), поэтому можете всех их рассматривать. Советую посмотреть на NHiTS или архитектуру трансформеров (Informer например), на вашем датасете должны обучиться. Они часто лучше рекуррентных нейросетей справляются.
Также есть шуточные решения, например построить диффузионную модель)
Михаил Аникутинты задаешь свой X и y, подаешь на вход Х, а на игрек что хочешь предсказывать. Что подаешь и что хочешь предсказывать сам выбираешь
по регрессорам это правда, CatBoost или XGBoost подходят, вы можете искусственно сделать модель авторегрессионной, если сделаете признаки равными переменной с лаггом
Спасибо большое.