Веб-версияОткрыть в Telegram
DData Portal | DS & ML

Data Portal | DS & ML

@LLMScience · канал · Технологии · в индексе с 2026-06-16
10 462подписчиков+99 за неделю
1 834средний охват поста
17.5%ER — охват к подписчикам
137постов за 30 дней
D
Data Portal | DS & ML
Видео
ssstwitter.com_1790353566754.mp4 · 10.6 МБ · нажмите — покажем
77 · 1.2K ·
Data Portal | DS & ML
Фотография
нажмите — покажем
DeepSeek выложила в открытый доступ библиотеку, которая ускоряет вычисления на GPU, лежащие в основе ИИ-моделей. Она называется DeepGEMM. Библиотека оптимизирует матричные операции, на которых работают большие языковые модели, и позволяет эффективнее использовать NVIDIA Hopper и Blackwell. Поддерживаются FP8, FP4 и BF16. Есть оптимизации для моделей с архитектурой Mixture-of-Experts, совмещение обмена данными между GPU с вычислениями и компиляция ядер прямо во время выполнения, без отдельной сборки CUDA при установке. По данным DeepSeek, DeepGEMM на ряде размеров матриц показывает производительность на уровне или выше специализированных библиотек, вручную оптимизированных экспертами. https://github.com/deepseek-ai/DeepGEMM#interfaces
50 · 1.1K ·
Фотография
нажмите — покажем
Гайд по RL от Unsloth. В нём разбирается обучение с подкреплением и то, как обучить собственную reasoning-модель в стиле DeepSeek-R1 с помощью Unsloth и GRPO. Полный материал — от базового уровня до продвинутого. Ссылка: https://unsloth.ai/docs/get-started/reinforcement-learning-rl-guide
35 · 922 ·
D
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Лекция 8 курса по машинному обучению на графах посвящена графовым свёрточным сетям. В лекции разбираются свёртки на сетках и графах, сопоставление с общим шаблоном, спектральная свёртка, преобразование Фурье, полиномы Чебышёва, изотропная и анизотропная агрегация, а также архитектуры ChebNet, GCN, GAT и GatedGCN. https://storage.googleapis.com/xavierbresson/lectures/GML/lecture08_graph_convolutional_networks.pdf
43 · 932 ·
Data Portal | DS & ML
Фотография
нажмите — покажем
Фотография
нажмите — покажем
«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024 год. Он посвящён одному из фундаментальных вопросов нейросетей — как модель обучает свои веса. В конспекте процесс обучения рассматривается с математической точки зрения. Разбираются прямой проход, функции потерь, градиенты, обратное распространение ошибки и градиентные методы оптимизации. Думаю, это интересный материал для тех, кто хочет выйти за рамки общего интуитивного представления о нейросетях и начать разбираться в математике, на которой основано их обучение. https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/mit6_7960_f24_lec2.pdf
3 · 58 ·
Ссылка
нажмите — покажем
«Изучение математики. Почему память, практика и техника важнее таланта» Чтобы освоить математику, необходимо запомнить большой объём информации, правил, способов упрощения и приёмов решения задач. Другого пути нет. Теория полезна, но в меру. Это как изучение языка. Если слишком сосредоточиться на грамматике, никогда не научишься свободно на нём говорить. https://algebrica.org/learning-mathematics/
38 · 1.2K ·
Фотография
нажмите — покажем
Modern Robotics: Mechanics, Planning, and Control. Сохраните на потом. Это полноценный учебник по робототехнике уровня магистратуры от Кевина Линча и Фрэнка Парка, изданный Cambridge University Press. Внутри: - конфигурационные пространства - кинематика - динамика - генерация траекторий - планирование движения - управление роботами По сути, это современная математическая база того, как роботы двигаются и взаимодействуют с окружающим миром. https://hades.mech.northwestern.edu/images/7/7f/MR.pdf
54 · 1.3K ·
D
GIF
TWMate.com-33d4c3138972a8528755f23fba183688.mp4 · 6.0 МБ · нажмите — покажем
Нашёл хороший ресурс для интерактивного изучения машинного обучения и ИИ — VizLearn. Можно поэкспериментировать с градиентным спуском, SVM, PCA, методом Байеса, токенизацией BPE, Q/K/V, KV-кэшем, квантизацией и многим другим. Меняешь входные данные и видишь, как меняются сами вычисления. Бесплатно, без регистрации. https://vizlearn.in
107 · 1.2K ·
Data Portal | DS & ML
Ссылка
нажмите — покажем
Reasoning from Scratch, шестой выпуск. Себастьян Рашка Введение и практическая реализация обучения с подкреплением с проверяемыми наградами RLVR и Group Relative Policy Optimization GRPO. 00:00 — Введение 01:54 — Чем reasoning-модель отличается от обычной 04:25 — Цепочки рассуждений и возможности модели 08:29 — Награды за точность и формат ответа 11:34 — «Aha-моменты» и обучение DeepSeek-R1 14:41 — Глубина рассуждений и длина ответа 18:38 — RLHF и RLVR 23:04 — GRPO против PPO 26:40 — Объяснение GRPO на аналогии с готовкой 31:43 — KL-компонент и упрощённый GRPO 35:04 — Загрузка предобученной модели 36:07 — Загрузка обучающих данных MATH 39:26 — Генерация ответов модели 46:30 — Расчёт проверяемых наград 49:55 — Расчёт преимуществ 51:54 — Логарифмические вероятности токенов и последовательностей 55:29 — Реализация логарифмических вероятностей последовательностей 57:37 — Исправление ошибки режима инференса 1:02:24 — Расчёт функции потерь GRPO 1:04:37 — Собираем один шаг GRPO целиком 1:09:19 — Цикл обучения GRPO 1:12:57 — Настройки обучения, логирование и чекпоинты 1:17:24 — Запуск обучения и разбор результатов 1:19:28 — Загрузка и оценка чекпоинтов 1:22:33 — Результаты MATH-500 и стабильность обучения 1:24:05 — Требования к памяти и следующие шаги https://www.youtube.com/watch?v=237Hf7Q3lgg
62 · 1.2K ·
D
Фотография
нажмите — покажем
«Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям. Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны. Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций. Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP. Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование. Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник. web.stanford.edu/~jurafsky/slp3/
73 · 1.2K ·
Data Portal | DS & ML
Ссылка
нажмите — покажем
Harvard бесплатно выложил один из лучших курсов по системам для ИИ, которые я видел. CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание. И это не просто учебник. Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса. В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию. Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers. Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень. Всё здесь: mlsysbook.ai GitHub: https://github.com/harvard-edge/cs249r_book
97 · 1.2K ·
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике. Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0. Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba. Хорошие небольшие модели могут создавать не только в США и Китае. 😋
13 · 1.1K ·
Фотография
нажмите — покажем
«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное зрение с точки зрения обработки изображений и машинного обучения. В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое. Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях. https://visionbook.mit.edu
63 · 908 ·
D
GIF
TWMate.com-915ea015431f1540b7b80a1a873f6740.mp4 · 98 КБ · нажмите — покажем
Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программировании GPU с Triton. Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа. Ты каждый день пишешь c = a + b в PyTorch. Эта лекция показывает, что GPU на самом деле делает с этим выражением. В лекции разбираются: — Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры. — Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память. — Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент. — Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность. — Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер. — Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков. — Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline. — Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему. Знание CUDA и устройства железа не требуется. Что дальше: — Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней. — Новые лекции о программировании GPU и оптимизации инференса. — Запланированная серия о глубоком обучении для аудио. Полная лекция: https://youtu.be/dEZP1qUNTOk
50 · 612 ·
Data Portal | DS & ML
Фотография
нажмите — покажем
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых идей современных языковых моделей. Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer. Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание. https://arxiv.org/pdf/2604.00965
35 · 806 ·
D
Видеолекции от Раджа Дандекаря: — Создаём LLM с нуля — Создаём DeepSeek с нуля — Принципы диффузионных моделей — Создаём диффузионную языковую модель с нуля
32 · 519 ·
Data Portal | DS & ML
Фотография
нажмите — покажем
Google выпустила EmbeddingGemma 2. Это первая открытая мультимодальная модель для эмбеддингов, изначально работающая с текстом, кодом, изображениями, видео и аудио. 740 млн параметров. Модульная архитектура. Модель создана для запуска прямо на устройстве, а не в дата-центре. При этом она обходит некоторые специализированные модели, которые более чем вдвое крупнее. В паре с Gemma 4 можно собрать полностью локальный RAG с упором на приватность. https://huggingface.co/google/embeddinggemma-2 https://huggingface.co/unsloth/embeddinggemma-2-GGUF
34 · 994 ·

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем