Веб-версияОткрыть в Telegram
MMLечный путь

MLечный путь

@mlpathway · группа · Технологии · в индексе с 2026-05-28
4 392участников
5 896сообщений в индексе
G
Админ. Мои извинения-понимаю что не в тему,  но нет выхода. У меня небольшой проект. Надо сделать pipeline с RAG всего по двум документам. Подскажите сайты где можно найти специалиста. Работа удаленная. Спасибо!!!
  1. Э
    Можешь самостоятельно ассистента сделать в ChatGPT или в Яндексе (Assistant AI).
  2. Т
    В ChatGPT есть Playground, где можно сделать Assistant с RAG по документам
  3. E
    Ссылка
    нажмите — покажем
    https://youtu.be/F_0PoGUtpU4?si=QgfsRig96bQ4HBEb Всё там при желании конфижится в докере и работает локально. Вместо Pinecone работает Qdrant, вместо OpenAI что душе угодно
Вся ветка · 3 ответа →
E
Если доки небольшие то будет прям хорошо Я у себя делал на 10 документах, единственное, что пришлось дописывать скрипт для предобработки, чтобы удалить все лишнее и переделать таблицы.
А
🤖🎓🧠#MLечный_путь Остался месяц до конца года - время согласования бюджетов. Напоминаю, что Selectel может помочь вам с любой инфраструктурой: от готовых серверов и серверов собственной разработки до S3, K8s и ML платформ. Приходите знакомиться 🖖🏼 1️⃣ ROCm 6.3 adds several new features including a Fortran compiler, and SGLang Несмотря на заголовок, главная, на мой взгляд, фишка этого релиза - FlashAttention-2. “FlashAttention-2 purportedly features up to 3x speedup improvements over version one for backward and forward passes, accelerating AI model training time.” AMD делает ещё один шаг, чтобы убедить рынок в своей состоятельности. 🔗Ссылка 2️⃣ Compare MLOps vs DataOps: Top 5 similarities & differences Наше сообщество, если вы не знали, и про DataOps, и про MLOps. Давеча, наткнулся на хорошую статью сравнение. Если коротко, то версия авторов такая: 🔸MLOps focuses on ML model lifecycle management for better management and deployment; 🔸DataOps focuses on data management cycles and data quality. Ну и понятно, что MLOps без DataOps, мягко говоря, будет не так уж и эффективен. 🔗Ссылка 3️⃣ Как мы провели ИИ-трансформацию стратегических процессов Сбера Статья от C-level, вроде как тоже для C-level. В любом случае, я всякие maturity models люблю и организационные трансформации тоже, поэтому с интересом почитал. 🔗Ссылка 🌌 Группа про MLOps/DataOps: MLечный путь 📅 Бесплатный двухнедельный доступ к GPU при тестировании ML-платформы Selectel. 🔸научим основам работы; 🔸поможем с переносом одного проекта. Для старта теста пишите @anton_chunaev
А
Всем привет! Антон собрал в одном месте базовые источники, из которых мы брали информацию для изучения различных аспектов Inference. Может кому-то ещё будет полезно.
А
Как мы строили Inference платформу - источники По следам моего доклада на HighLoad выкладываю источники, которые вам встречались в ходе рассказа. Так сказать все в одном месте в одном сообщении🐹 1. Istio + Canary deploy Как работает Istio Как реализовать basic auth Canary deploy в Istio 2. Autoscaling Что это такое? Автоскейлинг в k8s с GPU нодами Node autoscaler в k8s Как работает GPU оператор Ускоряем автоскейлинг Выносим кеш моделей в PVC S3 Lazy loading образов - как помогает ускорить пуллинг контейнеров eStargz, SOCI, Nydus - снепшоттеры для ленивой загрузки образов ZSTD формат образов - быстрее чем gzip Шерим GPU MIG, MPS, Timeslicing - технологии шеринга GPU и их сравнение Бенчмарк для замера производительности GPU на основе YOLOv5 3. Inference Graph Ray Serve, Ray Cluster - граф на нескольких нодах Triton ансамбль моделей - граф на одной ноде 4. Оптимизация Triton Как работает оптимизация Triton Perf_client - делает нагруженные тесты трайтона Model Analyzer - подберет конфиг тритона Model Navigator - подберет формат модели 5. UI интерфейс без разработчиков Istio дашборд DCGM дашборд Triton дашборд Kiali для визуализации трафика На этом список источников я закончу, надеюсь вы найдете что то для себя полезное! Те, кто не смог посетить мой доклад - скоро я выложу статьи на хабр с перессказом, где дополню его небольшими уточнениями, так что следите за новостями) Если у вас остались вопросы после моего доклада - вы можете задать их под этим постом в комментариях или выцепить меня на конференции) Спасибо что послушали доклад, вы классные!😊
77 · 2.1K ·
A
По мотивам выступления в декабре выйдут две статьи на хабре! Так что все ссылочки также будут доступны там, следите за обновлениями☺️
S
🎙📅🤖#Analytics_feed #49_week_24 1️⃣How top data teams are structured Небольшой очерк о том, как устроены современные аналитические команды. Прикольно, что все многообразие ролей и должностей "упаковали" в 3 группы: 🔹 Insight; 🔹 Data Engineering; 🔹 Machine Learning. Есть еще вот такое интересное распределение специалистов в разных мировых компаниях. 🔗Ссылка 2️⃣Как приготовить DataVault и не испортить Greenplum История от коллег из X5 про миграцию с Postgres на Greenplum, да еще и с реализацией DataVault-архитектуры. Стек вокруг СУБД довольно общепринятый: Kafka, NiFI, Airflow, DBT. 🔗Ссылка 3️⃣Оптимизация Arenadata DB: как избежать критических ошибок и повысить производительность кластера Мощная техническая статья от коллег из Arenadata про аудит кластеров ADB (подойдет и для Greenplum) для повышения производительности и отказоустойчивости. Основные направления: - анализ утилизации ресурсов кластера; - анализ настроек квотирования; - анализ модели данных. 🔗Ссылка 🌌 Группа про MLOps/DataOps: MLечный путь
I
Всем привет! Подскажите, для собственного ресеча, кто каким AB тест тулом пользуется у себя в проектах, какой фитбек?
О
Всем привет! Если можете, подскажите мне нужно сделать проект по распознованию рукописного текста, формул и графиков.... Первая задача это сегментировать все это безобразие, далее подать текст на модель, которое это распознает, формулы и графики планирую пока оставить в виде картинок... Кто-то подобное решал... Завис на сегментации...
V
Только почему-то ссылку сюда не могу на Гитхаб прикрепить(
V
Там короче нужно сначала детектор обучить Faster R-Cnn например. Который на картинке будет находить поля, где у тебя текст, где формулы, где графики. Для этого данные нужно разметить
V
Потом обучаешь Transformer, который будет распозновать текст и формулы. для этого тоже нужен размекеченный датасет. Для текста можно найти для русского языка HKR, на пример.
  1. Г
    а разве тот же EasyOCR не справится с рукописным текстом? Уже готовая модель, можно выбирать языки, в общем маст хэв, если нет датасета
Вся ветка · 1 ответ →

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем