ChatCrawlerпоиск по публичному Telegram Открыть приложение
D

Data, Stories and Languages Chat

31 участников
I
Ссылка
нажмите — покажем
Рекомендую канал Хочу порекомендовать вам интересный канал о регулировании систем ИИ по всему миру: ИИ & Право. Новые законы, судебные кейсы, международные инициативы, статьи об ИИ-комплаенсе и управлении рисками ИИ, вопросы этики и правовые казусы - все это со ссылками на первоисточники и документы, которые авторы канала ищут специально для вас. Присоединяйтесь к ИИ & Право, чтобы не отстать от быстроразвивающейся новой отрасли. Канал доступен также и на английском языке. Весьма актуально, учитывая как Dario недавно заявил о том, что надо замедлять разработку frontier AI.
1.1K ·
I
I
id 1592775624Ссылка
Интересно, агенты сами догадались делить фолды по скважинам? Я видел, как в похожей задаче модель красиво росла на валидации, пока не выяснилось, что куски одной скважины попали и в трейн, и в тест.
D
I
Ссылка
нажмите — покажем
​​GDE Swag Недавно я рассказывал как я пробовал Antigravity в рамках программы Google Developer Expert. Потом я ещё участвовал в peer review других проектов: в целом было неплохо, откровенно плохих проектов было мало и несколько было прям интересными. А ещё мне за это пришёл прикольный swag :) #ai #career
807 ·
M
Y
D
Data, Stories and Languages Chat
Yury Kashnitskyкак тебе в целом антигравити?
Фотография
нажмите — покажем
Увы, не очень по сравнению с codex/claude code. Когда я пробовал, antigravity слишком часто запрашивал разрешения - на каждый чих; конкретные указания выполнял нормально, но если дать возможность - тупил (3.1 pro, high); плюс работал медленно. А сейчас я просто не могу ни одну модель в ui выбрать :(
Y
I
Ссылка
нажмите — покажем
Data & AI London Meetup https://www.meetup.com/data-ai-london/events/316165116/ 22 сентября в Лондоне буду делать доклад: буду снова рассказывать про "AI-driven participation in Kaggle competitions, на этот раз добавлю опыт из соревнования ROGII. Помимо этого будет ещё два доклада: Javier Ramirez: When Your Wire Protocol Becomes the Bottleneck Alexy Golev: When the Bug Looks Like Success: Reliability Patterns for Multi-Agent AI Systems #datascience #career
485 ·
М
Е
М
I
Ссылка
нажмите — покажем
​​DeepSeek-V4.1-Flash: Frontier Agents on a Smaller Memory Budget Большая часть недавнего прогресса в LLM — это reasoning, масштабные RL-rollouts и всё более изощрённое обучение агентов. Но одним из bottlenecks остаётся контекст. Coding agents, research agents и tool-using системы раз за разом обрабатывают сотни тысяч токенов входа, генерируя при этом сравнительно мало выхода. На таком workload prefill-компьют и KV cache становятся главной инфраструктурной проблемой. DeepSeek-V4.1-Flash — это, по сути, попытка перепроектировать Transformer вокруг этого сценария. 552B MoE backbone, 1M контекст, нативное зрение, 45T мультимодальных токенов на претрейне. Работают три механизма: - Causal Encoder-Decoder (CED): 40 слоёв делятся на 20-слойный causal encoder и 20-слойный decoder. Каждый decoder-слой проецирует свой global KV не из собственных hidden states, а из финального hidden state энкодера, поэтому декодер можно пропустить на prefill. Отсюда асимметрия: около 8B активных параметров на токен в prefill против 16B в decode. - Compressed Sparse Attention 2 (CSA2): каждый слой статически получает один из трёх режимов — Full, Reindex или Reuse. Sharing KV экономит память, sharing Top-K-индексов ещё и убирает повторное скорингование всей истории. В итоге один decoder-слой создаёт main KV, который читают все двадцать, а вместе с FP4-квантованием это ужимает global cache до 890 байт на токен, примерно четверть от DeepSeek-V4-Flash. - SWA Bounded Replay: sliding-window KV вообще не персистится между ходами, а на cache hit восстанавливается проигрыванием одного окна токенов вместо честной реконструкции по всем слоям. Реконструкция неточная, но авторы оценивают потерю качества как незначительную. На post-training практически весь прирост идёт из масштабирования синтезированных задач и агентных окружений. Отдельно любопытен раздел про RL failure modes: агенты занимаются reward hacking, эксплуатируют реальные уязвимости в песочницах, удаляют системные бинарники, а иногда сносят
575 ·
Е
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
🌸AI Research Preference Model🌸 #nlp #про_nlp #nlp_papers Сегодня опять про скаффолды для агентов. Мы уже говорили про то, хорошая ли идея применить сверху preference models для оценки потенциала идей (спойлер: нет). А что, если попробовать обучить такую preference-модель не на вкусовщине (новизна идеи, "вкус", интуиция и т.д.), а на верифицируемом сигнале? Про это наша новая статья — “AI Research Preference Models”. 🌸TL;DR Главная проблема: AI-агент может быстро придумать множество вариантов эксперимента, но полноценный запуск каждого варианта — обучение модели и оценка результата — требует часов работы GPU. Поэтому критически важно заранее понять, какие идеи действительно стоит проверять. Мы предлагаем Research Preference Model (RPM) — модель, которая сравнивает несколько предложенных решений и выбирает наиболее перспективное до их полного запуска. В идеале, такая модель может выучить паттерны лучших практик МЛ, чтобы использовать эту информацию для попарного сравнения экспериментов, какой будет более перспективным. Рассматриваются два варианта: Inference-only RPM анализирует планы, код и результаты предыдущих экспериментов только при помощи рассуждений LLM. Agentic RPM дополнительно проводит дешёвые пилотные эксперименты: запускает сокращённое обучение (5 минут, 30 минут, 4 часа), проверяет код и использует полученные метрики для выбора. 🌸Агент RPM встроена в исследовательского агента AIRA-dojo. На каждом шаге агент генерирует 15 вариантов продолжения, после чего RPM проводит попарное сравнение и отправляет на полноценный запуск только победителя. 🌸Данные Эксперименты проведены на 20 задачах AIRS-Bench, охватывающих языковое моделирование, математику, биоинформатику и временные ряды. Каждому запуску предоставлялись 24 часа на одной H200 GPU. 🌸Основные результаты обычный AIRA-dojo: 0,684 среднего нормализованного балла; с Inference-only RPM: 0,711; с Agentic RPM: 0,729; теоретически достижимый результат: 0,748. Обе RPM достигают результата обычного 24-часово
10.7K ·
В
Архив по месяцам
Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог