Веб-версияОткрыть в Telegram
MML for Value / Ваня Максимов

ML for Value / Ваня Максимов

@ml4value · канал · Технологии · в индексе с 2026-05-24
5 690подписчиков−6 за неделю
1 353средний охват поста
23.8%ER — охват к подписчикам
3постов за 30 дней
M
ML for Value / Ваня Максимов
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
17 · 4K ·
M
ML for Value / Ваня Максимов
[3/3] Тщетные надежды и мечты Очень надеялся, что в рексис или поиске будет прорыв в этих темах в 2025, но он пока не случился 1. Economic recsys research А именно, внятное объединение recsys + pricing/promo в единую систему Даже в самом простом виде: продавец дал скидку 30%, но в кандидаты товар чаще попадать не стал, тк обычные двубашенный кандген ничего про скидку не знает В более сложном: мы можем сами давать скидку + наливать трафик на товар рекомендациями. Как правило, просто скидка на не самый популярный товар не работает, тк никто о ней не знает. А наливание трафика без скидок - непонятно, в чем доп вэлью (и прирост конверсий) пользователя 2. Крутые решения по сбору наборов/образов В сопутствующих товарах все еще рулят статистические методы. А в визуальной сопутке (одежда) дальше статьи 2017 года от ASOS на базе сближения векторов товаров от картиночного энкодера, мир особо не продвинулся 3. Long-term eval - Почти все текущие датасеты имеют feedback loop: надо предсказать позитивы, смещенные на то, что показывала прод модель рекомендаций - Все же мы эвалим точность next action или в лучшем случае actions за последующие 1-2 недели. А вот long-term эффект на LTV считает мало кто и особо про это не рассказывают (тут конечно nda, все дела) - RL в recsys, который мог бы все это решить, все же пока скорее мертв в нашей сфере 💀 А на какие прорывы в 2026г надеетесь вы?
11 · 2.9K ·
M
ML for Value / Ваня Максимов
Ссылка
нажмите — покажем
Middle+ ML engineers ко мне в команду рекомендаций Я.Маркета (3 вакансии) 300-400к руб на руки Москва, Спб или remote *если вы senior - тоже пишите, договоримся) Наша команда рекомендаций Яндекс.Маркета делает персональные рекомендации товаров на главной странице, подбирает похожие и сопутствующие товары, персонализирует поиск, crm-коммуникации и другие поверхности. Мы - бизнесовая команда, которая приносит прямой прирост выручки/прибыли компании в АВ-тестах. Баланс бизнес-рисерч у нас 80-20 Сейчас мы ищем уверенных ML инженеров на 3 трека: нейросетевые рекомендации, более классический recsys + discovery, СRM-персонализация. Внутри команды со временем трек можно менять, это скорее фокус на ближайшие полгода 1. Нейросетевые рекомендации Предстоит работать в первую очередь над трансформерной моделью ARGUS-8k, глубоко погружаться в архитектуру - Добавление новых входных данных для нейросетей: поисковые запросы, новые типы действий (шеринг ссылки на товар), фичи пользователей и тп - Эксперименты с эмбеддингом товара: что из текстового описания и характеристик использовать, как учесть картинки товаров, semantic id и дп - Эксперименты с архитектурой: добавление отдельной головы под новый таргет, изменение лосса и тп - Адаптация моделей под сценарии: рекомендации на главной странице, товары-аналоги (учет контекста основного товара), поиск (учет контекста поискового запроса) - Анализ наших данных и поиск точек роста в ML-моделях через новые таргеты, входные данные или фичи 2. RecSys и Discovery Нужно оптимизировать не только количество действий пользователя в моменте (заказы, корзины и тп), но и учитывать юнит экономику товара + оптимизировать долгосрочный LTV пользователя. С нейронками работать тоже нужно, но без настолько глубокого погружения как в выкансии выше: и BERT-ы для похожих товаров учить, и LLM-ки применять, и многое другое. Основы нашей архитектуры рекомендаций можно посмотреть в докладе на highload - Эксперименты с таргетом ранжирующих моделей: как учес
101 · 4.1K ·
M
ML for Value / Ваня Максимов
Фотография
нажмите — покажем
Не проводи АВ-тест, пока не прочитаешь этот пост Да-да, это кликбейтный заголовок) Остановись на минутку. Вероятно, прямо сейчас у тебя идет какой-то АВ-тест. Вот скажи, зачем ты его проводишь? Вроде понятно, что это нужно для честного замера метрик. Но зачем их честно замерять? Попробуй ответить на несколько подряд идущих "Зачем?" Не только же для аналитического удовольствия мы АВ-тесты крутим 😅 А зачем нужны АВ-тесты на мой взгляд, можно почитать ниже: 1. Не катить в прод красные фичи с падением бизнес-мерик + находить баги Все хотят новой фичей нанести благо компании (все же, да?). Но по ходу написания фич периодически вылезают проблемы: забыли корнер кейс, не рассчитали нагрузку, отсортировали реком ленту в обратном порядке (тут и я грешен) - все это не всегда можно отловить на ручном/авто-тестировании. АВ как финальный босс покажет явные слабости и баги 2. Не катить в прод серые фичи без изменения метрик = сильно снижаем тех долг и упрощаем систему Это нас частично избавляет от напиливания фич ради фичей, а не реальной пользы. Плюс, меньше кода в проде - проще система, быстрее внедрять изменения и меньше времени на тех долг. По сути, экономия на часах разработки ну или на токенах ai-агентов, если вы уже в будущем, где они пишут подакшен код) 3. Понимать, что работает, а что нет = выявлять направления развития Если просто делать тикеты без оценки эффекта, то не получится узнать, что реально дает доп метрики и на чем стоит фокусироваться. Можно год оптимизировать UI и гордо говорить, что мы молодцы. А можно посмотреть на результаты пары АВ и увидеть, что конверсия от этого прекрасного UI не меняется - гораздо раньше переключиться на что-то другое 4. Оценивать команды по реальному вкладу Я сторонник того, что практически любую метрику можно свести к итоговому эффекту на выручку/прибыль компании. Соответственно, работу любой команды над ее метрикой можно свести к влиянию на выручку/прибыль = легко оценить их вклад и сравнить между собой Я знаю единственный
28 · 3.8K ·
ML for Value / Ваня Максимов
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
LLM долгосрочные интересы пользователя Понемногу LLM-ки находят полезное применение в рекомендациях! Обычная реком система упрощенно устроена так: - Модель на короткой realtime истории пользователя (SLIM, SASRec, …) вытаскивает товары текущего интереса - Модель на очень длинной offline истории пользователя (часто ALS, LightFM) вытаскивает некие долгосрочные интересы - Их результаты смешиваются и переранжируются Есть гипотеза, что кусочек с длинной историей можно обрабатывать LLM-кой и вытаскивать оттуда доп профит! Отчасти такой подход сработал в Taobao (их модель RecGPT v2). Ну и мы в Я.Маркете тоже внедрили свою адаптацию - Влад из моей команды недавно рассказал об этом на ML Party Подход относительно простой, но с кучей подводных камней: о них как раз в нашем докладе 😎
66 · 3.7K ·
M
Фотография
нажмите — покажем
Фотография
нажмите — покажем
65 · 3.7K ·
M
ML for Value / Ваня Максимов
Фотография
нажмите — покажем
LLM - велосипед в новой обертке Холиварный пост выходного дня) Доля правды в этом есть - и это наоборот круто! LLM научились довольно неплохо решать в zero shot режиме (без обучения на доп данных) классические задачи: - Классификация текста - Named entity recognition (NER) - Суммаризация текста - Question answering по тексту (хотя тут еще есть куда расти) Куча бизнес-задач = комбинация нескольких таких простых классических задач 🆘 Автоматизация поддержки пользователей = Классифицировать запрос пользователя + достать нужный кусок документации / инфы о юзере из базы данных (RAG) + ответить на вопрос по вытащенным данным (question answering) И если раньше на каждый кусочек задачи нужно было учить свои модели, что долго/дорого, то сейчас это решает LLM…не всегда дешево, но заметно быстрее! Подобных примеров в бизнесе еще довольно много: автоматизация пушей, генерация простого контента по шаблону, … P.S. Настоящий reasoning я пока вижу только на очень «строгих» и задачах с понятными критериями успеха: написание отдельных кусков кода и решение не оч сложных математических задач В общем, решать много простых задач = решать и сложные задачи, которые можно разделить на несколько простых. И тогда хорошо решать простые задачи = успех 🚀
12 · 4.2K ·
ML for Value / Ваня Максимов
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Начинать писать после перерыва всегда непросто, поэтому пока легкий пост про мои новости) Официально стал частью Transactional AI в Яндексе 🤖 Помимо персонализации всего в Я.Маркете буду делать ИИ-агентов для покупок товаров Съездил на теннисный турнир Barcelona Open 🎾 Мой первый турнир в качестве зрителя - это конечно топ! В полуфинале Рублев был крут, но и восходящие звезды Фис и Ходар впечатлили. Теперь еще больше мотивации все же сыграть и самому pro турнир уровня сильно пониже: ATP 15/25 Отметил 4ую годовщину с моей женой ❤️ Лучшее решение, всем советую) Бодро иду к своим 30 годам: записался на все чекапы и операции на год вперед 🔴 Собираю базу данных анализов для терапевта gpt :) Возобновил регулярный спорт: бег, качалка, теннис и улучшил питание Вот такие новости: а дальше пойдут посты про фейлы в ml — stay tuned, будет интересно!
10 · 3.8K ·
M
Фотография
нажмите — покажем
Фотография
нажмите — покажем
10 · 3.8K ·
M
ML for Value / Ваня Максимов
The art of a strong baseline За последнее время все чаще понимаю, что создать сильный бейзлайн - это не просто база, с которой нужно начинать любой ml/ai продукт, а прям полноценная часть системы. Даже когда в проде уже давно есть трансформеры и агенты, бейзлайн дает прям много метрик Вот учите вы трансформер для персональных рекомендаций (sasrec, argus, pinnerformer, hstu - неважно).  И если в лоб его применить, то вероятно получите рекомендации из истории кликов. Потому что простой бейзлайн "уже изучал товар - покажи еще раз" чаще всего почти по любым метрикам релевантности будет лучше Окей, пофильтровали историю кликов / занизили таким позитивам вес в лоссе / сделали еще что-то - получили очень-очень похожие товары на последние 30-50 действий. Вот буквально товар того же бренда-категории, но чуть другого цвета условно. А это уже похоже на другой сильный бейзлайн - realtime slim/als/ease на последних 30-50 действиях На самом деле можно еще и дальше продолжать с бейзлайнами в этом кейсе или в других. Частые бейзлайны: - Персональные рекомендации - популярное, история, уже купленное для повторных покупок - item2item рекомендациях (похожие товары) - популярные товары того же бренда в той же категории  - Поиск - tfidf/bm25. Да, даже в эру dense retrieval и search agents если аккурфтно подтюнить bm25, то можно выбить sota. Есть даже подходы на основе Sparse autoencoderse , которые позволяют генерить не эмбеды запросов/документов, а их токены - и дальше применять обычный bm25 - Прогноз временных рядов - среднее значение в тот же день недели  ↔️ Я всегда стараюсь строить сильные бейзлайны, а потом учить более сильные модели для улучшения поверх них, а не для замены. Потому что какой толк учить условный sasrec/argus для запоминания истории кликов пользователя? Пустая трата компьюта + модель тратит свою капасити на тривиальные зависимости = что-то нетривиальное (и самое полезное + ожидаемое от нее) не учит Интересно, как не только я сам, но и другие люди в в индустр
36 · 3.5K ·
M
ML for Value / Ваня Максимов
ML вообще работает? (эпизод 1) Давно не писал в канал. Понял, что сейчас сфокусирован на довольно больших историях, которые в формат одного поста не умещаются - ну что ж, готовьтесь к серии постов:) Заголовок конечно чуть кликбейтный для привлечения внимания "А персональные ленты товаров вообще работают? А для какого % пользователей - скорее нет?" -- Вот один из вопросов, который донимает меня последнее время. Подобное есть в любом ML-продукте от банковского скоринга до LLM-чатов, но ответить на этот вопрос не так-то просто На первый взгляд, элементерно: есть бизнес-метрики (продажи, CR и тп) и оффлайн-метрики (ndcg, recall@k). Если они достаточно хороши (vs бейзлайн и vs прод неделю назад), то все круто же? А вот и нет. Эти метрики (как и почти все другие классические в ML и продукте) показывают качество в среднем. В среднем, у нас может быть хороший продукт, но условно для 10% пользователей - плохим. Проблема чаще всего в том, что это важные 10%: новички, пред-отточники, пока еще малоактивные пользователи. Если не сделать для них качественный ML-продукт, то со временем они просто уйдут = долгосрочно это падение всех основных метрик, хотя в моменте может быть и особо не заметно. Ну и бонусом у вас постоянный поток негативного фидбека 😢 Поэтому хорошо бы мерить не только качество в среднем, но и долю плохих кейсов (дефектов) = defect rate. Пусть дефект - случай, когда пользователь сталкивается с чем-то очевидно стремным, что может привести к мгновенному окончании сессии в приложении или даже оттоку Посмотрите на свои ML-продукты. Особенно если они b2c - на экраны приложений с ними. Как часто вы видите дефекты и какие? Покидайте в комменты скрины с дефектами (ладно, можно и из яндекс.маркета 💀) - что-то из них разберу И поставьте лайк что ли, если эта тема интересна -- у меня там на очереди уже есть несколько эпизодов с деталями, как этот defect rate можно считать и снижать:)
11 · 1.7K ·
M
ML for Value / Ваня Максимов
текст ещё не в индексе
14 · 1.3K ·
M
ML for Value / Ваня Максимов
ML вообще работает? ч3 Начинается мое любимое: как померить ощущение «персональности» рекомендаций? Про учет пола, возраста и размера все и так в курсе, поэтому поговорим о чем-то более интересном Чаще всего смотрят на вау-метрики типа serendipity ~ высокий скор релевантности товара для юзера, но не популярный товар Но, если честно, я ни разу не видел, чтобы эта метрика кого-то убедила, что лента персональная. Имхо потому что: - метрика завязана на скор модели (модель оценивает сама себя) - метрика не очень интерпретируема Поэтому я бы заходил с другой стороны Учет базовых интересов из истории взаимодействий В широком смысле персонализация — учет истории взаимодействий пользователя с сервисом. Очевидно, но так давайте явно проверять, учитывает ли это наша система! Я бы мерил в терминах Defect rate долю показанных товаров, для которых есть взаимодействия в истории пользователя с - Широкими категориями из истории (покупал спальник — рекомендуем ли товары для туризма?) - Любимыми брендами (купил футболку muted — показываем ли шорты/носки этого бренда?) Через такую метрику «у нас 60% рекомендаций из широких категорий юзера и 25% из любимых брендов» вполне можно убеждать бизнес (и себя!), что персонализация работает. Плюс, легко проверить для отдельно взятого юзера, работает ли персонализация конкретно для него Stay tuned
9 · 817 ·

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем