Веб-версияОткрыть в Telegram
4404 Driver Not Found

404 Driver Not Found

@DriverNotFound · канал · Технологии · в индексе с 2026-05-24
1 553подписчиков
87постов в индексе
404 Driver Not Found
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Residual RL, генерация сложных сценариев поведения и безопасность движения: что обсуждали в третий день ICRA 2026 Продолжаем трансляцию с главной международной конференции о робототехнике и автоматизации. Сегодня в подборку самого интересного вошёл один доклад и пять постеров. Residual Off-Policy RL for Finetuning Behavior Cloning Policies Работа от Amazon Frontier AI & Robotics, посвящённая планированию движения. Проблематика рассматривается на роботах, но те же подходы можно применить к автономному транспорту. Для больших VLA хорошо работает behaviour-cloning-претрейн, но RL пока масштабируется плохо: недостаточно данных, сложно учиться на success rate длинных горизонтов, а пространства экшнов слишком большие (в статье упоминаются 29 DOF), чтобы покрывать их в RL. Авторы предлагают учить Residual RL — политику, которая даёт небольшую добавку к экшну от BC. А ещё делятся рецептом реализации: 🔴Off-policy RL — показывают, что Residual PPO в 200 (!!!) раз менее эффективен, чем Residual off-policy. 🔴Много апдейтов на один роллаут. 🔴N-steps returns. Learning to Annotate Delayed and False AEB events: a Practical System for Extreme Class Imbalance and Asymmetric Label Noise Постер о том, как работает AEB в Lixiang. Говорят, что в проде используют и rule-based, и модель. Чаще срабатывает rule-based, модель тюнят для более сложных сценариев. Данные собирают по экстренным торможениям всех пользователей Lixiang. Датасетами, конечно же, не делятся. Search3D: Hierarchical Open-Vocabulary 3D Segmentation Второй постер о новом подходе к open vocabulary от ETH, Google и Stanford. Застать авторов, к сожалению, не получилось. VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving Третий постер — от Waymo. Взяли VLM, собрали преференсы, обучили DPO. Но не для end2end-, а для motion-LM-модели. На метриках open-loop стало лучше, на closed-loop не проверяли. COMPASS: Cross-embOdiment Mobility Policy via ResiduAI RL and Skill Synthesis Ещё оди
🔥11👍4⚡4❤1🙏1
10 · 1.1K ·
4
Фотография
нажмите — покажем
Фотография
нажмите — покажем
10 · 1.2K ·
4
404 Driver Not Found
Видео
видео.mp4 · 4.0 МБ · нажмите — покажем
POV: ведём вас читать обзоры и лучшие статьи ICRA 2026 Сегодня заключительный день конференции. И вот что рассказали о ней наши коллеги: ➡️ Чем запомнился первый день ICRA 2026 ➡️ И ещё одно мнение о первом дне в канале ML Underhood ➡️ Земной автомобиль, луноход или марсианский ровер — на ICRA 2026 припаркуются все ➡️ Заметки о втором дне в канале ML Underhood ➡️ Residual RL, генерация сложных сценариев поведения и безопасность движения: что обсуждали в третий день ICRA 2026 А вот работы, которые отметил оргкомитет ICRA 2026. Награду Best Conference Paper Award получили две статьи: 🔴 SymSkill: Symbol and Skill Co-Invention for Data-Efficient and Reactive Long-Horizon Manipulation Интересный не-ML-подход к манипуляционным задачам. 🔴 OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction Обучение гуманоидов на человеческих демонстрациях — новый способ ретаргетинга, который сохраняет расстояния до объектов, точки контактов, связи с окружением. В категорию Best paper in Robotic Learning попала одна работа: Do You Know Where Your Camera Is? View-Invariant Policy Learning with Camera Conditioning Необычный кондишенинг положения камер в VLA-моделях. В качестве Best Perception paper отметили ещё одну интересную статью: FindAnything: Open-Vocabulary and Object-Centric Mapping for Robot Exploration in Any Environment Exploration и mapping над пространством объектов. Робот ищет произвольный объект в неизвестной локации и по пути строит карту всего, что нашёл. Про каждый объект запоминает языковое описание, положение в пространстве, геометрию и визуальные признаки. #YaICRA26 Говорили и показывали ❣️ Максим Спорышев и Егор Волков 404 driver not found
❤12🔥6❤‍🔥5🏆2👍1🙏1
24 · 3.2K ·
4
404 Driver Not Found
Фотография
нажмите — покажем
VoxelNeXt: Fully Sparse VoxelNet for 3D Object Detection and Tracking Классические dense-подходы, применяемые поверх воксельных featuremap’ов требуют большого количества вычислений и пост-процессинга (например, NMS). Сегодня разберём статью о попытках оптимизировать это. Авторы предлагают решать задачу 3D-детекции на лидарных точках в fully-sparse режиме. Для построения такого детектора используют классический spconv-based лидарный бэкбон. Но с улучшениями: 🔴 В изначальный FPN добавили больше featuremap’ов в низком разрешении с последующим апсэмплом. Это значительно увеличило размер эффективного рецептивного поля. 🔴 В конец лидарного бэкбона добавили пуллинг по высоте. Вычислений стало меньше, но метрики не изменились. 🔴 Добавили spatially voxel pruning, «размазывающий» только воксели с достаточно большими магнитудами. 🔴 Кандидатов в боксы отбирали не NMS, а sparse-max-пуллингом. С точки зрения метрик это оказалось почти эквивалентной заменой. В статье много ablation’ов по всем предложенным изменениям. По результатам замеров на nuScenes, подход позволяет получить сравнимое с лидерами качество 3D-детекции при значительно лучшем latency. Разбор подготовил ❣️ Владимир Филипенко 404 driver not found
❤10🔥8👍7
21 · 4.4K ·
4
404 Driver Not Found
Occupancy Grid Prediction [1/2] Сегодня начнём серию постов о 3D occupancy perception. В первой части обсудим особенности подхода и общие тренды, а в следующей — разберём несколько актуальных работ. Для этого подхода сцену представляют плотной 3D-решёткой (вокселями) с семантикой и метками «занято» или «пусто». В отличие от BEV, в 3D occupancy perception явно моделируют высоту, что критично для сложных городских сцен. Например, для случаев, когда 3D occupancy справляется лучше, чем 2D: небольшие камни или куски мусора на дороге, которые проще пропустить между колёс, а не объезжать. Или края досок, вылезающие за пределы грузовика: если они достаточно высоко, легковой автономный автомобиль без проблем под ними проедет. В общих чертах стек охватывает технологии: 🔴 от 2D→3D-преобразований (проекция из 3D на камеру и обратно с предсказанием глубины, кросс-аттеншн); 🔴 до пространственно-временного фьюжна признаков с нескольких камер и мультимодальной интеграции камеры, лидара и радара. Среди популярных методов обучения — self-supervised, weak, strong. Среди метрик — IoU, MIoU и ray-MIoU (это IoU вдоль каждого луча камеры). Ключевыми датасетами считаются nuScenes, Waymo и SemanticKITTY. Тренд последних лет — стремительный рост vision-centric-методов. Камеры дешевеют, текстуры улучшаются, а за счёт продвинутого 2D→3D и temporal fusion разница в качестве предсказаний на основе данных камер и лидаров стремительно сокращается. Но лидар по-прежнему обеспечивает наилучшую геометрию, а мультимодальные схемы ещё не всегда стабильно опережают одномодальные — потенциал фьюжна до сих пор не раскрыт. При грамотной оптимизации (облегчённые головы, разреженные представления, ускорение инференса) можно получить ~10–13 FPS на Occ3D-nuScenes при MIoU около 40%. Это уже близко к практическим требованиям. Главные вызовы подхода: реальное время на бортовом железе, робастность к погодным условиям, окклюзиям и отказам сенсоров, а также обобщение без дорогой плотной 3D-разметки. На
❤‍🔥15✍8🔥8❤2⚡2
23 · 4.6K ·
4
404 Driver Not Found
Occupancy Grid Prediction [2/2] Продолжаем серию постов о 3D occupancy perception. В первой части обсудили особенности подхода и общие тренды, а сегодня разберём три актуальные работы. Одна из особенностей Agent Occupancy Grid — воксели агентов движутся и в системе координат мира, и в системе эго-агента. Это значит, что можно предсказывать Occupancy Grid Flow — то есть, направление и скорость перемещения каждого вокселя. Let Occ Flow: Self-Supervised 3D Occupancy Flow Prediction Авторы предлагают решать задачи Occupancy Grid (OG) и Occupancy Grid Flow (OG Flow) prediction, не используя 3D-аннотации. Для этого они обращаются к данным изображений и Optical Flow, полученным из внешней модели. В общих чертах это работает так: 🔴 2D→3D-энкодер извлекает признаки изображений и строит из них трёхмерный тензор благодаря проекциям на 3D-плоскости. 🔴 Temporal Fusion выравнивает признаки с учетом движения эго-агента, и с помощью deformable attention извлекает временные признаки для разных уровней высоты. 🔴 Rendering-Based Optimization — две разные головы предсказывают Semantic Occupancy Grid и Occupancy Grid Flow. Полученные результаты рендерят на плоскости камер с помощью NeuS и сравнивают с уже существующими изображениями Optical Flow и картами глубин. 🔴 Flow-Oriented Optimization разделяет оптимизацию динамических и статических областей для улучшения сходимости. ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions Архитектура для предсказания Occupancy Grid и Occupancy Grid Flow. Её главные элементы: 🔴 Adaptive Lifting. Это аналог LSS, но с учётом внутриобъектной и межобъектной окклюзий. 🔴 Semantic Prototype-Based Occupancy Head. В голове предсказания OG используют обучаемые векторы (прототипы), которые инвариантны к BEV- и 3D-представлениям. 🔴 Cost Volume-Based Flow Prediction Head. Для головы предсказания OG Flow вводят тензор, который содержит скалярные произведения всех сдвигов 3D-признаков относительно соседних таймстемп
❤11👍4💯3🔥2
10 · 1.8K ·
4
404 Driver Not Found
Фотография
нажмите — покажем
Умеют ли трансформеры водить машину? Трансформеры уже умеют писать код, генерировать тексты и рисовать картины. Сегодня разберём нашу статью о том, как в Яндексе используют архитектуры на основе трансформеров для планирования движения и почему это сильно отличается от привычных задач генеративных моделей. Любая система автономного движения опирается на модуль Motion Planner — алгоритм, который несколько раз в секунду решает, куда должен переместиться робот или автономный автомобиль. То есть превращает их восприятие мира в конкретные действия: руление, торможение, ускорение. В индустрии популярны два подхода к построению Motion Planner: классический, с разделением на perception и planning, и end-to-end, когда модель получает на вход сырые данные сенсоров и сразу выдаёт управляющие действия, без промежуточной стадии perception. Мы в Яндексе используем классический подход. Формально перед нами задача sequence-to-sequence: на вход приходят временные последовательности стейтов, и нам нужно предсказать будущие стейты. Для решения используем трансформеры. 🔴 Энкодер временного контекста. Для каждого агента и эго у нас есть последовательность стейтов за последние несколько секунд. Мы пропускаем её через энкодер с attention по временной оси — чтобы модель учитывала динамику движения. 🔴 Энкодер карты. Карта — статическая структура, которую также нужно преобразовать в эмбеддинги. Обычно её разбивают на фрагменты с фиксированным числом точек и кодируют каждый фрагмент отдельным энкодером. Мы используем PointNet, но это лишь один из возможных вариантов. 🔴 Взаимодействие всех объектов. Движение любого участника зависит не только от его собственной истории, но и от поведения остальных агентов и структуры дороги. Поэтому результаты всех энкодеров объединяются трансформером с attention между всеми сущностями сцены, чтобы модель могла учитывать все взаимодействия при планировании. На выходе этого блока получается три вида эмбеддингов: агентов, карты и эго. 🔴 Декодеры будущих
❤13🔥8👍6⚡1
25 · 1.4K ·
404 Driver Not Found
Фотография
нажмите — покажем
Генерация реального города Seoul World Model, memory bias в RL, совместное обучение VLA и WM: что обсуждают на ICML 2026 [1/2] 6 июля в Южной Корее стартовала одна из крупнейших конференций о машинном обучении — ICML. Участников очень много, работы охватывают самые разные тематики. Личным топом выступлений и постеров, полезных для автономного транспорта, делится наш коллега Иван Дубровин. Seoul World Model На Expo Talk авторы из Naver рассказали, как используют RAG поверх фотографий street view, чтобы генерировать настоящий Сеул, а не вооображать что-то похожее. Это позволяет эффективно обучаться, не запоминая весь мир, а также использовать постоянно обновляющиеся данные из карт без полного переобучения. Основной фокус — неперывная генерация на километровых масштабах. На вход инференс получает глобальные координаты и текстовый промпт с описанием. В презентации приводили примеры генераций с разной погодой и временем суток, которые выглядели весьма правдоподобно, а также с наводнением, НЛО и Годзиллой, которые, ожидаемо, выглядели как кринж. Во время инференса модель обращается к геобазе с картинками: проецирует виды на нужное положение камеры и использует их как основу для генерации. Чтобы бороться с окклюзиями, используют наборы фотографий, разнесённых во времени. Окружающие машины пока что просто бэкграунд, их ни на что не кондишнят. Из зала спрашивали про SWM для обучения self-driving VLA моделей, но авторы подчеркнули, что пока сосредоточены на реалистичности и бесшовной генерации для больших расстояний. Красиво, но хотелось бы больше деталей реализации. Investigating Memory in RL with POPGym Arcade Исследование моделей с памятью в MDP- и POMDP-сетапах. Для экспериментов авторы воссоздали на JAX популярные игрушечные среды с возможностью переключаться между полной и частичной наблюдаемостью. Основной вывод — в полностью наблюдаемых средах, где вся информация содержится в последнем кадре, модели с памятью тратят капасити на историю и теряют из-за этого
10 · 783 ·
4
Фотография
нажмите — покажем
Фотография
нажмите — покажем
10 · 1.2K ·
404 Driver Not Found
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Генерация реального города Seoul World Model, memory bias в RL, совместное обучение VLA и WM: что обсуждают на ICML 2026 [2/2] Продолжаем всё ближе подбираться к автономному транспорту в продолжении обзора работ с ICML, которая прямо сейчас продолжается в Сеуле. DriveWorld-VLA: Unified Latent-Space World Modeling with Vision–Language–Action for Autonomous Driving К сожалению, не получилось пообщаться с авторами. В статье они предлагают совместно обучать VLA- и WM-модели, чтобы у них был общий latent state. То есть, чтобы можно было генерировать потенциальные развития событий без вычислительно тяжелых пиксельных симуляций. Обучают в три этапа. 1. Совместно VLA и VM: с маппингом картинок c камер, текстовых инструкций и BEV в общее пространство фичей, из которого параллельно предсказывают будущие BEV и действия эго. 2. Энкодер и action-голова замораживаются, обучается генерация будущих стейтов, обусловленная на действие. 3. Размораживается action-голова, и добавляется reward-модель, которая учится скорить будущие стейты по предложенным действиям. В итоге получается попытка сделать модель, которая «представляет» потенциальные развития событий и выбирает наиболее подходящее действие. Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy Интересная position-статья с весьма очевидным названием, в котором авторы напоминают RL-щикам про разницу между «решением симулятора» и «использованием симулятора как прокси». Иными словами: политики, хакнувшие реворд, плохо ведут себя в реальном мире. Кажется, статья больше нацелена на ресёрчеров, которым нужно бить бенчмарки, чтобы их статьи принимались в журналы. С практической точки зрения, когда модели уже ездят в реальном городе, пользы в этих советах немного. По сути, единственный прикладной совет, — хорошие аугментации, которые позволяют политике быстрее найти нужные стейты, ускоряют сходимость. Весьма очевидная мысль, но всё равно было интересно пообщаться с автор
9 · 984 ·
4
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Три статьи об автономном транспорте с ICML 2026 Продолжаем рассказ о тематических работах на крупнейшей международной конференции по машинному обучению. Впечателниями делится наш коллега из команды автономного транспорта Иван Дубровин. CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving Авторы пытаются решить главную проблему imitation learning — выход модели в out of distribution под накапливающимся влиянием расхождений предсказанных и GT-траекторий. Предлагают решать это через объединение IL и RL, чтобы добавить в обучение exploration и расширить распределение, которое модель видела на обучении, что само по себе не новая идея. Реализуют с помощью collaborative-competitive-сетапа. IL и RL политики — это две разные модели, которые обучаются параллельно и раз в какое-то количество шагов «соревнуются» на валидационном сете. Веса проигравшего заменяются на линейную комбинацию с весами победителя, и обучение продолжается. Выходы обеих моделей также используются для обучения latent world model, которая нужна для скоринга действий RL-агента. RL при этом не совсем настоящий, потому что использует GT. В качестве реворда — произведение L2-отклонения от GT-траектории, умноженное на collision score. Это же произведение используют как главную метрику. Замеры, судя по всему, только в OL. Motion Planning in Compressed Representation Spaces Авторы сводят задачу guided-планирования к жадному поиску по квантизированным латентным токенам: • Обучают токенизатор траекторий, обусловленный на окружение, с reconstruction-лоссом. • Поверх выходов энкодера делают софт-квантизацию, из чего получают набор латентных токенов. • К латетным токенам применяют nested dropout — случайно отбрасывают хвосты случайной длины, чтобы форсить coarse-to-fine иерархическую структуру. В таком случае каждый префикс декодируется в полную траекторию, и можно делать жадный поиск. На постере — пример получения траектории левого поворота
4 · 1.2K ·
4
404 Driver Not Found
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Безопасность, ускорение end-to-end, prediction в частотной области: чем запомнился ещё один день ICML 2026 В этом году конференция продолжает бить собственные рекорды по количеству участников. В основной программе — 168 устных докладов и почти 5900 постеров. Рассказываем о трёх классных постерах про АТ. CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving Авторы предлагают архитектуру планера, которая умеет корректировать траекторию во время декодинга. Если голова-критик утверждает, что предложенный токен небезопасен, то он добавляется в список невалидных. Авторы называют его correction trace. На этот список обуславливается следующая, исправляющая генерация. Перегенерация продолжается до тех пор, пока не найдётся валидный токен или не достигнется заданное максимальное количество коррекций. В последнем случае дефолтный токен — «продожать делать то, что делаем сейчас». Претрейн делают через imitation learning, а потом замораживают его и используют для интерактивности агентов. В то же время саму модель дообучают реагировать на небезопасные роллауты через RL с положительным ревордом за прогресс и отрицательным — за столкновения. AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture -of-Transformers for End-to-End Autonomous Driving Работа об архитектуре для ускорения end-to-end за счёт разделения и асинхронного инференса медленного VLM reasoner и быстрого action expert. Большую предобученную VLM-модель замораживают: инференсят независимо и асинхронно от action-модели, с которой их объединяет общий attention. Между тяжёлыми пересчётами латентов используют KV-кеш. Авторы по сути показали, что необязательно дообучать VLM на специфику задачи автономного вождения — достаточно улучшить action-часть. И за счёт независимого асинхронного инференса action-эксперта значительно снизили latency. TF-FACE: Time-Frequency Fusion Learning via Frequency-Domain Adaptive and Controllable Enhancement for Trajectory P
8 · 1.4K ·
4
404 Driver Not Found
Видео
IMG_3463.mp4 · 3.6 МБ · нажмите — покажем
Вас посетил маленький, но очень громкий робот-рекламщик Время сделать перерыв. Например, перечитать один из наших обзоров ICML 2026: ➡️ Генерация реального города Seoul World Model, memory bias в RL, совместное обучение VLA и WM: что обсуждают на ICML 2026 [1/2] ➡️ Генерация реального города Seoul World Model, memory bias в RL, совместное обучение VLA и WM: что обсуждают на ICML 2026 [2/2] ➡️ Три статьи об автономном транспорте с ICML 2026 ➡️ Безопасность, ускорение end-to-end, prediction в частотной области: чем запомнился ещё один день ICML 2026 #YaICML2026 Поймал в объектив робота-рекламщика и лучшие моменты ICML 2026 ❣️ Иван Дубровин 404 driver not found
3 · 1.3K ·
4
404 Driver Not Found
Фотография
нажмите — покажем
RadarDistill: Boosting Radar-based Object Detection Performance via Knowledge Distillation from LiDAR Features Lidar-only детекторы работают заметно лучше, чем radar-only. Причиной тому — разница в качестве данных. Лидар фиксирует более точные и многочисленные точки, в то время как радар склонен выдавать false-positive и false-negative результаты из-за переотражений и других физических тонкостей. Улучшить работу radar-only детекторов можно благодаря дистилляции. Сегодня разберём статью о том, как получить мощный radar-only детектор с помощью lidar-only детектора. Авторы предложили несколько способов продвинутой дистилляции, учитывающих разную природу лидарных и радарных данных. Наивная дистилляция путём матчинга фичей лидарного энкодера в фичи радарного работает плохо. Это происходит из-за особенностей радарных и лидарных данных: разной плотности точек, зашумлённости, рассинхронизации сенсоров. Авторы предлагают три способа улучшения дистилляции: 1. Cross-Modality Alignment. Использование небольшой FPN-like сетки поверх радарной фичамапы, чтобы сделать радарные фичи такими же плотными, как лидарные. 2. Activation-based Feature Distillation. Перевзвешивание лосса в областях фичамапы с ранней стадии энкодера, где есть амплитудные лидарные фичи, помогает акцентировать внимание нейросети на релевантных областях BEV-а. 3. Proposal-based Feature Distillation. Перевзвешивание лосса в областях фичамапы с поздней стадии энкодера позволяет сфокусировать внимание нейросети на областях с GT. Полная архитектура RadarDistill — на схеме выше. Обратите внимание, что лидары используются только на этапе обучения и не требуются для инференса. Использование всех трёх улучшений одновременно позволяет увеличить mAP в 2 раза и NDS в 1,25 раз на nuScenes относительно radar-only from scratch. Разбор подготовил ❣️ Владимир Филипенко 404 driver not found
10 · 1.2K ·
4
404 Driver Not Found
Фотография
нажмите — покажем
FutrTrack: A Camera-LiDAR Fusion Transformer for 3D Multiple Object Tracking Сегодня разберём работу о модульном фреймворке для трёхмерного трекинга множества объектов. Подход основан на совместном использовании трёх типов информации: 📌BEV-фичей, извлечённых из данных камер и LiDAR; 📌detection queries, полученных при уточнении 3D-детекций; 📌track queries, перенесённых с предыдущего кадра. BEV-фичи вычисляют с помощью стандартного пайплайна BEVFusion. Detection queries получают из отдельного блока smoother. Это энкодер-декодерная архитектура, обученная на вспомогательной задаче временного уточнения исходных 3D-детекций. Энкодер собирает для каждой детекции контекст по нескольким кадрам. Декодер уточняет положение, размеры и класс объекта. При этом в основной трекер передаются не сами итоговые детекции, а извлечённые из промежуточного слоя object-query-представления, сформированные в процессе решения задачи уточнения. Они и становятся detection queries текущего кадра. Track queries — промежуточные query-представления, сформированные основным трекинговым декодером на предыдущем кадре. Для подтверждённых активных треков модель сохраняет связанные с ними скрытые представления и передаёт их на следующий кадр. Таким образом, между кадрами переносятся не сами предсказанные боксы, а признаки, аккумулирующие информацию о положении, классе и идентичности каждого отслеживаемого объекта. После независимого кодирования все три типа информации объединяются с помощью трансформера с multi-head attention. Track queries предыдущего кадра выступают в роли queries, detection queries текущего кадра — keys, а BEV-фичи — values. Благодаря этому модель сопоставляет активные треки с новыми детекциями и извлекает из BEV-представления необходимый пространственный и семантический контекст. Декодер предсказывает обновлённые координаты, размеры, классы, идентификаторы и значения уверенности объектов. Промежуточные query-представления подтверждённых треков рекуррентно передаются на следу
7 · 1.1K ·
4
404 Driver Not Found
Long-Range 3D Perception — датасет и методы детекции отдалённых объектов Сегодня вас ждёт подборка статей на тему детекции отдалённых объектов. Это важная задача, поскольку на скорости 100 км/ч автомобиль проезжает ~28 м/с, поэтому для безопасного торможения и перестроения нужно видеть препятствия на расстоянии 150–200 метров, а классические бенчмарки такую дальность обрезают. NuScenes размечен до 50–80 м, KITTI — до 70 м. Дальние объекты — это отдельная боль: у лидара на 150 метрах на объект остаются единицы точек, на камере он занимает десятки пикселей, и в датасетах таких объектов на порядки меньше ближних, из-за чего модели переобучаются на ближнюю зону. Поэтому начнём с датасета — здесь лучше всего подходит Argoverse 2. Он содержит 1000 размеченных картиночных сцен с семью камерами, объекты размечены на удалении до 200 метров. Каждая сцена длится 30 секунд, частота — 20 fps. Датасет размечен по 30 категориям, причём почти все категории имеют более 10 000 боксов. Лидар работает на 10 Гц. Основные методы для детекции отдалённых объектов: LiDAR-only FSD, FSDv2 — полностью sparse lidar-only модели. Основная идея: собрать точки в группы (соответствующие объектам) и процессить эти группы отдельно. Внутри каждой группы точки предсказывают центры объектов, которые далее используются для предсказания бокса. В v2 кластеризация в группы заменена на работу с виртуальными вокселями (локальное объединение точек). Основные результаты представлены на Argoverse 2 до 200 метров. FSDv2 показывает результаты, близкие к SoTA c latency < 100ms. Camera-only (Far3D) Far3Det — чтобы построить модель для отдалённых объектов, авторы решили «почистить» датасет NuScenes от сцен с неполной разметкой, оставив только те, в которых размечены все объекты вплоть до 80 метров. Также предложили вариант адаптивного NMS (AdaNMS) для изменения IoU threshold в зависимости от расстояния. Far3D — SoTA на NuScenes в сетапе camera-only на момент публикации. Результаты на Argoverse 2 похуже, чем у
11 · 1.2K ·

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем