Веб-версияОткрыть в Telegram

ПостDistillation with time

22 мая 2026
4
404 Driver Not Found
Distillation with time Сегодня разберём сразу две статьи о дистилляции с учётом временного контекста. RCTDistill: Cross-Modal Knowledge Distillation Framework for Radar-Camera 3D Object Detection with Temporal Fusion Учитель — LiDAR-детектор, ученик — camera-radar-детектор с time fuse. У обоих BEVFusion-архитектура. Авторы рассматривают, как решить три проблемы дистилляции: 1. Специфика данных. Камеры плохо оценивают расстояние до объектов, а у радаров — низкое угловое разрешение. Для решения предлагают использовать модуль Range-Azimuth KD (RAKD), который подобно BEVDistill взвешивает L2-лосс между BEV-фичами. Только здесь маска использует размеры объектов, расстояние до эго-машины и угол, формируя эллипсы. 2. Временное смещение динамических объектов. Простой time fuse (concat + conv) не моделирует пространственное смещение объектов между кадрами. С этой проблемой борется Temporal KD (TKD), который также формирует эллипсоидную маску на BEV. Таким образом учитывают скорость и историю траектории объекта. 3. Неэффективное объединение модальностей. При наивном слиянии модальностей фичи переднего плана и фона смешиваются. С этим помогает модуль Region-Decoupled KD (RDKD). В качестве лосса он использует матрицы косинусных расстояний векторов BEV'а по выбранным позициям, где у ученика больше heatmap score. Distilling Future Temporal Knowledge with Masked Feature Reconstruction for 3D Object Detection В этой работе учитель — SparseBEV с фреймами из прошлого и будущего. Ученик такой же, только без информации о будущем. Авторы разбираются, как грамотно передавать ученику информацию о будущем. Две основные идеи: 1. Future-Aware Feature Reconstruction. Сначала вводят Temporal Self-Attention (TSA) — чтобы учитель мог агрегировать информацию с фреймов будущего. Потом для выхода ученика маскируют некоторую долю токенов, восстанавливают её генератором и считают лосс. Так ученик тренируется строить фичи, обогащённые знанием о будущем, не имея к нему прямого доступа. Подобный генератор есть на уровне картиночных фичей (после FPN), а также на уровне BEV queries. 2. Future-guided Logit Distillation. Лоссы классификации и регрессии минимизируют через венгерский алгоритм. Когда у учителя есть знания о будущем, он выдаёт больше true negative. Авторы обеих статей утверждают, что их подходы помогают улучшить перфоманс, одновременно сэкономив вычислительные мощности и решив ключевые проблемы дистилляции для задачи мультимодальной 3D-детекции. Разбор подготовила ❣️ Елизавета Мирова 404 driver not found
❤10👍4🔥2
9 · 1.2K ·

Рядом в ленте

4404 Driver Not FoundFastPillars: A Deployment-friendly Pillar-based 3D Detector В BEV-based-детекторах часто используют sparse-свёртки. Но их не так-то просто перевести в формат, о4404 Driver Not FoundUniMotion: A Unified Motion Framework for Simulation, Prediction and Planning Сегодня разберём статью о UniMotion — едином фреймворке на основе decoder-only-тра
это сообщение
4404 Driver Not FoundVision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model Беспилотный транспорт в свой работе полагается на данные различных с4404 Driver Not FoundЧем запомнился первый день ICRA 2026 С 1 по 5 июня в Вене идёт International Conference on Robotics & Automation. Хайлайтами первого дня поделился Максим Спорыш
4404 Driver Not Found404 Driver Not Found@DriverNotFound · канал · Технологии
1 549подписчиков87постов в индексе
Лента площадки Открыть в Telegram

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем