Будущее софта за диалогом а не за полной автономией (часть 2 из 2)
Вместо попыток убрать человека из рабочего процесса разработчикам разумнее убрать барьер между мыслью пользователя и базой данных. Детерминированный софт никуда не исчезнет, просто общаться с ним станет в разы проще.
Источник
Переводы видео, саммари новостей про AI
Видео uJNP_FdlR3I.mp4 · 121.8 МБ · нажмите — покажем
OpenAI выкатила GPT-6.1 Sol и пачку анонсов на DevDay
OpenAI ответила на релизы конкурентов внезапным запуском GPT-6.1 Sol всего через неделю после выхода шестой версии. Модель позиционируют как замену топовым флагманам: она вплотную подобралась по возможностям к флагманской Astra, но обходится в пять раз дешевле в боевых задачах.
Ключевые моменты:
• Стоимость за миллион токенов: $2 на вход и $10 на выход. Кэшированный инпут стоит всего $0.10 — вдвое дешевле предыдущей версии Sol.
• Контекстное окно составляет 1 000 000 токенов, а лучший баланс качества и расхода достигается на среднем уровне рассуждений (medium reasoning).
• Запущен автономный агент Dots: круглосуточная работа в фоне на собственном виртуальном компьютере с доступом к более чем 4 000 приложений.
• Режим Ultrafast разгоняет генерацию до 300 токенов в секунду в Codex и дает шестикратный прирост скорости через API.
• В Terminal Bench Science модель набрала 57%, затратив всего $0.54 на задачу против $23.80 у Astra (68.1%) и $23.21 у Opus (58.7%).
Главный фокус GPT-6.1 Sol — радикальное удешевление сложного продакшен-кодинга. Модель показала 75% в бенчмарке Deep Sway (у GPT-6 было 68.8%) и 52 балла в индексе Artificial Analysis, отстав от флагмана всего на один балл при четырёхкратной разнице в цене на максимальных нагрузках ($0.72 против $3.26). В реальных задачах разрыв ещё заметнее: сложный промпт с максимальным reasoning модель щёлкает за 10 минут и $1.50, тогда как Astra тратит на это 25 минут и $11. При сравнении с Opus 5.5 разница по времени двукратная — 45 минут против полутора часов.
На тестах модель с первой попытки генерирует трёхмерные интерактивные прототипы на Three.js: от анимированной сборки клавиатуры до клона механик Elden Ring. В сгенерированной игре работают физика прыжков, парирование, таргетинг, инвентарь, звуковые эффекты и логика боссов. Код компилируется без правок и скрытых багов, хотя в визуальной стилистике и тонких дизайнерских решениях Opus пока держит первенство.
Помим
Команда Photon похоронила мобильные приложения и привлекла $4.5 млн на замену их агентами (часть 1 из 2)
Стартап Photon провел в Сан-Франциско шуточные похороны мобильного софта с речами и настоящим гробом для иконок приложений. Сразу после этого перформанса проект закрыл посевной раунд на 4.5 миллиона долларов. Идея фаундеров проста: пользователи больше не хотят ставить десятки новых программ, поэтому сервисам пора перебираться в привычные чаты вроде iMessage, WhatsApp и Telegram.
Похороны приложений 17 сентября совпали с днем разработчика Photon, куда пришли спикеры из Vercel, Stripe и OpenAI. Глава стартапа Даниэль Тиан признает, что акция была наполовину ироничной, но вектор смены парадигмы он считает неизбежным. По его мнению, цикл жизни классических утилит из App Store постепенно подходит к концу.
Сама идея выросла из студенческой проблемы. Даниэль Тиан и его сооснователь Райан Чжу постоянно делали пет-проекты на хакатонах и каждый раз упирались в одну стену: привлечь людей в новое приложение почти невозможно. Тогда Тиан написал для личных нужд бота, который отвечал друзьям в iMessage от его имени. Код выложили в открытый доступ на GitHub, и проект быстро подхватили тысячи инженеров. Ради стартапа Тиан бросил престижную программу в UPenn, а Чжу ушел из старшей школы и позже попал исследователем в MIT Media Lab.
До сих пор около 98% активности вокруг Photon приходится на открытый исходный код. Но держать такой стек на локальном Mac Mini для серьезного продакшена неудобно. Поэтому в апреле команда запустила облачную платформу по подписке. Платная версия дает аптайм 99.95%, закрывает требования сертификаций SOC 2 Type II и HIPAA, что позволило подключать к агентам медицинские и финансовые проекты.
Технически Photon дает разработчикам готовый фундамент, чтобы не изобретать велосипед для каждого мессенджера:
• Единый унифицированный API для маршрутизации входящих и исходящих сообщений
• Модульный фреймворк каналов под iMessage, WhatsApp, Telegram, SMS, RCS, го
Команда Photon похоронила мобильные приложения и привлекла $4.5 млн на замену их агентами (часть 2 из 2)
Если вы прямо сейчас пишете кастомные интеграции под iMessage или WhatsApp через костыли и вебхуки, есть смысл посмотреть в сторону репозитория Photon или их CLI. Инфраструктура мессенджеров исторически закрытая и капризная, и передать поддержку сокетов, сессий и сетей готовому шлюзу часто выходит дешевле, чем держать собственный парк серверов.
Источник
Переводы видео, саммари новостей про AI
Видео yELvXtPUHMM.mp4 · 21.9 МБ · нажмите — покажем
GPT-6.1 Sol в тестах на кодинг обваливает цены и обходит флагманы
Промежуточный апдейт GPT-6.1 Sol неожиданно показал колоссальный прирост производительности в задачах разработки. Модель полностью закрыла провал базовой GPT-6 и всерьез подвинула недавнего фаворита в лице Opus 5.5, предложив радикальное снижение стоимости генерации кода.
Ключевые моменты:
• Идеальный результат 20 из 20 в бенчмарке повседневных задач при затратах всего 13 центов и 2 минут на прогон
• Режим Low теперь включен по умолчанию в Codex, обгоняя 5.6 High на 2 балла при трехкратном ускорении и десятикратной экономии
• Стоимость кэшированного ввода на OpenRouter упала вдвое до 10 центов против 20 центов у предыдущей шестерки
• Настройка High разочаровала скоростью, растягивая ожидание ответа до 6–9 минут на каждый отдельный запрос
• Релиз флагманской Astra 6.1 отложили прямо перед Dev Day из-за проблем с безопасностью и внутренними регламентами
OpenAI буквально стёрла базовую GPT-6 Sol с тарифной сетки, мгновенно заменив её версией 6.1. Предыдущая модель на лидерборде выглядела шагом назад по сравнению со старой 5.6, пускай и стоила копейки. С выходом 6.1 ситуация изменилась. В тестах на решение повседневных задач разработчика вроде настройки импорта CSV или написания типовой валидации модель выбила максимум — 20 баллов из 20. Из-за этого текущий бенчмарк автора придется отправлять на переработку, так как топовые модели просто уперлись в его потолок.
Главный фактор привлекательности новинки упирается в чистую экономику. В независимых тестах производительность Sol доходит до уровня Astra, но обходится в полтора или даже пять раз дешевле. Разница с признанным ранее Opus 5.5 выглядит еще сильнее: 2 доллара против 7 или 8 долларов за аналогичный объем генерации. На полный прогон всей тестовой пачки на средних и низких пресетах ушла лишь небольшая часть лимита, сохранив 28% от пятичасового окна. Удешевление связано и с тарифами провайдеров. Например, на OpenRouter кэшированный инпут стоит 10 цен
Видео 7eyrcRTi6Co.mp4 · 74.8 МБ · нажмите — покажем
Разбор GPT-6.1 Sol и главных анонсов OpenAI DevDay
OpenAI выкатила модель GPT-6.1 Sol, которая по возможностям приближается к Astra, но обходится заметно дешевле. Основной упор сделан на сложный кодинг, автономную работу с интерфейсами и многоэтапные задачи. Заодно разработчики представили автономных агентов Dots, обновили Codex и разрешили тратить лимиты подписки ChatGPT во внешних сервисах.
Ключевые моменты:
• Базовый прайс API для Sol: $2 за 1 млн входных токенов и $10 за 1 млн выходных, кэшированный ввод стоит $0.10. Окно контекста превышает 1 млн токенов с максимальной генерацией до 128k.
• Dots — фоновые агенты на базе GPT-6 Astra с собственным облачным компьютером и браузером. Они подключаются к Slack, Teams и ChatGPT, берут на себя рутину вроде разбора багов и обучаются на ваших правках.
• Режим Ultraast разгоняет генерацию кода до 8 раз в Codex и до 6 раз в API. Доступ открыт в тарифе Pro-500 за $500 в месяц.
• Codex Cloud получил переиспользуемые окружения: зависимости и репозитории настраиваются один раз, после чего каждая задача запускается в изолированном инстансе без повторной сборки.
• В Agents API появился нативный браузер для управления сайтами, а в Responses API добавили мультиагентное разделение задач между саб-агентами.
В десктопный Codex CLI завезли голосовое управление и команду /agents для быстрого переключения между сессиями. Фоновый сервис Codex Security Cloud научился сканировать репозитории GitHub и готовить патчи на базе моделей Daybreak Blue, даже когда рабочий ноутбук выключен. Для корпоративных клиентов подготовили интеграцию Bedrock Managed Agents внутри AWS и Decisions API на базе Luna для быстрой классификации действий агента.
Сам ChatGPT получил интеграцию со спецификацией MCP Events. Внешние сервисы теперь могут отправлять вебхуки и триггерить запуск агентов по событию в системе. Дополнительно заработала функция «Sign in with ChatGPT»: пользователи Plus и Pro могут тратить включенные токены своего плана в сторонних инструмент
Настройка Claude Platform on AWS для продакшена, локальной разработки и сторонних облаков (часть 1 из 3)
Когда компания подключает Claude Platform on AWS (CPonAWS), сразу возникает проблема разграничения доступа. Разработчикам нужны модели на ноутбуках для тестов, прод-сервисам в EKS требуется надежная авторизация без статических секретов, а пайплайнам в GitHub Actions или сервисам в GCP — временный доступ без хранения постоянных кредов AWS. При этом платить хочется по единой корпоративной подписке, жестко изолируя прод от дева.
Решается это схемой с выделенным аккаунтом AI Services. Подписка оформляется внутри одного системного аккаунта, а потребители обращаются к ней через разные механизмы аутентификации и отдельные воркспейсы.
Шаг 1. Воркспейсы и региональные эндпоинты
В аккаунте AI Services активируется подписка на CPonAWS, после чего в консоли создаются два изолированных воркспейса: production и development.
Каждый воркспейс получает идентификатор вида wrkspc_PROD и wrkspc_DEV. Они привязаны к конкретному региону, поэтому клиентские запросы всегда идут на региональный эндпоинт, например aws-external-anthropic.us-east-1.api.aws. География вычислений (US или Global routing) при этом настраивается отдельно в параметрах безопасности воркспейса.
Шаг 2. Доступ для сервисов в AWS через SigV4
Для подов в EKS или сервисов на EC2 внутри рабочего аккаунта исключаются любые постоянные API-ключи. Авторизация настраивается через предположение роли (AssumeRole) с подписью запросов SigV4.
В аккаунте AI Services создается роль CrossAccount-ClaudePlatform-Prod. Политика доверия разрешает вызов только конкретной роли пода из рабочего аккаунта и проверяет принадлежность к организации:
{
"Version": "2012-10-17",
"Statement": [{
"Effect": "Allow",
"Principal": {"AWS": "arn:aws:iam::WORKLOAD_ACCOUNT_ID:role/EKS-Pod-Role"},
"Action": "sts:AssumeRole",
"Condition": {"StringEquals": {"aws:PrincipalOrgID": "YOUR_ORG_ID"}}
}]
}
К роли крепится политика раз
Настройка Claude Platform on AWS для продакшена, локальной разработки и сторонних облаков (часть 2 из 3)
Шаг 3. API-ключи разработчиков и ловушка с дефолтными правами
Разработчикам для локальных скриптов роли настраивать долго, проще сгенерировать долгоживущий ключ. Но здесь есть скрытая грабля: при создании ключа в консоли CPonAWS система автоматически создает IAM-пользователя с префиксом AeaApiKey-* и вешает на него управляемую политику AnthropicLimitedAccess. Эта политика дает доступ ко всем воркспейсам сразу, полностью ломая изоляцию.
Чтобы ограничить разработчиков только дев-окружением:
• Находим в IAM пользователя AeaApiKey-* по времени создания.
• Отвязываем политику AnthropicLimitedAccess.
• Добавляем инлайн-политику, где CreateInference разрешен только для ресурса wrkspc_DEV.
Разработчик использует обычный SDK Anthropic, переопределяя base_url и передавая ID воркспейса в заголовке:
from anthropic import Anthropic
client = Anthropic(
api_key="sk-ant-api01-...",
base_url="https://aws-external-anthropic.us-east-1.api.aws"
)
resp = client.messages.create(
model="claude-sonnet-4-6",
max_tokens=128,
messages=[{"role": "user", "content": "Local test"}],
extra_headers={"anthropic-workspace-id": "wrkspc_DEV"}
)
Если попробовать передать в extra_headers продакшен-воркспейс, API вернет ошибку отказа в доступе.
Шаг 4. OIDC для внешних контуров (GCP, GitHub Actions)
Для сервисов за пределами AWS постоянные ключи не подходят по соображениям безопасности. Настраивается OIDC Identity Provider в аккаунте AI Services, после чего внешняя среда получает временные креды через sts:AssumeRoleWithWebIdentity.
Политика роли идентична шагу 2, но с одним важным отличием: действие aws-external-anthropic:CallWithBearerToken обязано иметь значение Resource: "*". Если ограничить его ARN воркспейса, генерация токена упадет с ошибкой.
Сам токен выпускается библиотекой token-generator-for-aws-external-anthropic на срок от 1 до 12 часов:
from token_genera
Настройка Claude Platform on AWS для продакшена, локальной разработки и сторонних облаков (часть 3 из 3)
Если разворачиваете такую схему, сразу включите логирование Data Events в AWS CloudTrail для сервиса aws-external-anthropic — это даст полный аудит каждого вызова с фиксацией конкретного IAM-принципала. На уровне воркспейсов повесьте теги отделов и активируйте их как Cost Allocation Tags в биллинге AWS, чтобы через сутки видеть распределение затрат по командам прямо в Cost Explorer.
Источник
Переводы видео, саммари новостей про AI
Видео ZSVw0gbAjFU.mp4 · 49.2 МБ · нажмите — покажем
Битва подписок за $200 и скрытые ловушки нового Codex против Claude
OpenAI в очередной раз перекроила линейку Codex: вернулся тариф за $200, появился тяжелый план за $500, а моделью по умолчанию в CLI стала GPT 6.1 Sol. Главный подвох скрыт в мелком шрифте — новым подписчикам за те же 200 долларов существенно урезали лимиты использования. Если вы прямо сейчас выбираете между максимальными планами OpenAI и Claude, старые сравнения и чужие бенчмарки можно смело выбрасывать.
Ключевые моменты:
• Неравенство пользователей: существующие подписчики Codex сохранят старые увеличенные квоты до 29 октября 2026 года, тогда как новые аккаунты за те же $200 получают урезанный лимит
• GPT 6.1 Sol радикально уронила стоимость генерации: в бенчмарке из трех задач агент на Sol потратил всего 17 центов по расценкам API против 51 цента у Claude Opus 5.5 и 65 центов у прежней Astra
• Введен тариф за $500 с эксклюзивным доступом к Astra UltraFast, но ускорение сжигает лимиты в 8 раз быстрее обычного, а режим Fast — в 2.5 раза
• Разрыв в окупаемости: чтобы «выбрать» $200 стоимости подписки эквивалентными запросами по API, на Sol придется решить 3575 небольших задач, тогда как на дорогом Opus 5.5 окупаемость наступает уже после 1187 задач
В тесте использовались три типовые изолированные задачи на Python: починка логики календаря с пересекающимися слотами (12 проверок), построение детерминированного графа зависимостей с отловом циклов (14 проверок) и рефакторинг модуля аналитических отчетов под CSV и JSON (12 проверок). Все три подопытных — Sol 6.1, Astra и Opus 5.5 — успешно прошли все 38 проверочных тестов. При этом Sol прогнал через себя 236 720 токенов (из них 178 304 пришлись на дешевый кэш), Astra использовала 218 975 токенов, а Opus — 230 553 токена.
За счет обновленного прайсинга OpenAI стоимость кэшированного ввода у Sol упала до минимума. В итоге работа агента на Sol обошлась на 74% дешевле Astra и на 67% дешевле Opus в пересчете на чистые API-токены.
Базовые расценки API для
Shopify запустила Canvas для сборки интернет-магазинов через диалог с нейросетью
Shopify показала новый инструмент под названием Canvas. Главная фишка простая: собрать или переделать витрину интернет-магазина теперь можно прямо через переписку с фирменным ИИ-ассистентом Sidekick. Больше не нужно руками перетаскивать типовые секции в визуальном редакторе или нанимать разработчика для правок шаблонов.
Раньше в платформе уже был базовый no-code конструктор, но у него быстро находился потолок. Продавец выбирал готовую тему, двигал модульные блоки и настраивал цвета. Любая нестандартная идея — поправить сетку товаров, добавить кастомную анимацию или переделать карточку заказа — упиралась в код на Liquid, HTML и CSS. Приходилось либо разбираться в верстке самому, либо платить сторонним специалистам.
Canvas переводит этот процесс в чат. Пользователь пишет ассистенту Sidekick, что именно нужно изменить на странице, а система на лету вносит правки в файлы сайта.
Несколько интересных технических деталей:
• Живой рендеринг вместо картинок. В окне Canvas крутится настоящий рабочий код магазина, а не статичный макет из Figma. В превью можно кликать по кнопкам, проверять анимации, открывать меню и смотреть адаптивность под экраны разной ширины.
• Визуальный контроль через скриншоты. Sidekick в процессе работы сам делает снимки экрана. Нейросеть буквально видит интерфейс глазами пользователя и проверяет, не разъехались ли блоки после генерации.
• Бесконечный холст. Рабочая зона построена как доска: можно отдалиться, чтобы оценить весь магазин целиком со всеми страницами, или приблизить конкретный баннер.
• Ручные правки без запретов. Никто не заставляет общаться только текстом. Если надо подвинуть конкретный заголовок или поменять отступ, можно кликнуть по элементу мышкой и поправить его руками.
Чтобы Sidekick мог безопасно менять код и не ломать логику сайта, инженеры переработали архитектуру тем. Файловую структуру заметно упростили, благодаря чему бот напрямую понимает за
Видео krhkmockjCM.mp4 · 98.7 МБ · нажмите — покажем
Как планировать сложные проекты с ИИ-агентами без потери контекста
Разработчики из Anthropic поговаривают об отказе от встроенного режима планирования в Claude Code. Брайан Касл (автор Builder Methods) отказался от него еще раньше, но не от самого планирования: на крупных проектах его агенты планируют больше прежнего. Секрет простой: планы не должны висеть в воздухе промпта или встроенных функциях чата, они обязаны храниться в отдельных файлах, к которым у любой модели есть постоянный доступ.
Ключевые моменты:
• Архитектура мета-репозиториев: под каждый продукт автор создает отдельный репозиторий с суффиксом -meta (например, mimio-meta), полностью изолируя документы и макеты от рабочего кода.
• Папка циклов: любая задача, фича или редизайн оформляется в датированную директорию (2024-03-redesign), внутри которой живет рабочий журнал summary.md.
• Передача состояния: агенты сами обновляют summary.md по ходу выполнения — фиксируют статус, блокеры и следующие шаги, что позволяет безболезненно менять сессии.
• Трехэтапный запуск: разработка разбивается на стратегию, составление дорожной карты и только затем кодинг в основном репозитории.
Главная проблема больших задач при работе с LLM — засорение контекста. Если пихать в рабочий репозиторий старые макеты, черновики текстов, SEO-отчеты и планы архитектуры, агент быстро запутается в версиях и начнет тащить в свежий код устаревшие стили и решения.
Чтобы кодовая база оставалась чистой, автор выносит сопутствующие артефакты в отдельный мета-репозиторий. Структура выглядит так:
mimio/ # Основной код приложения (Ruby on Rails)
mimio-site/ # Маркетинговый сайт
mimio-meta/ # Мета-данные продукта
├── brand/ # Логотипы, шрифты, стили
├── strategy/ # Аналитика, целевая аудитория, воронки
└── cycles/ # Завершенные и текущие циклы работы
└── 2024-03-redesign/
├── summary.md
├── plan.md
└── mockups/ (HTML-прототипы)
Вся работа делится на циклы
Как настроить долговременную память для агентов в NVIDIA NeMo через Amazon S3 Vectors (часть 1 из 3)
Когда агенты работают в связке, им нужно где-то хранить контекст, иначе каждый шаг превращается в повторные запросы к LLM и потерю данных. Связка из NVIDIA NeMo Agent Toolkit (NAT) и Amazon S3 Vectors позволяет собрать масштабируемое векторное хранилище без переплаты за простаивающие сервера баз данных. Ниже разобран процесс создания кастомного плагина памяти, координации нескольких агентов и развертывания решения в кластере Amazon EKS.
Зачем агентам S3 Vectors
NAT из коробки поддерживает Redis, Mem0, MemMachine и Zep. Этого хватает для тестов или простых сценариев, но в production с кучей агентов упираешься в масштабирование и изоляцию.
S3 Vectors решает несколько прикладных задач:
• Строгая согласованность по записи. Агент записал факт, и остальные участники пайплайна видят его в ту же миллисекунду без возни с инвалидацией кэша.
• Метаданные прямо на векторах. Можно фильтровать выборку по тикерам, идентификаторам команд или типам памяти (эпизодическая или семантическая).
• Емкость до 2 миллиардов векторов на индекс без необходимости вручную рассчитывать шардинг.
• Деньги списываются только за фактически занятое место, операции записи и запросы.
Шаг 1. Создание индекса в AWS
Для работы потребуется Python 3.11 или 3.12 и установленный пакет boto3. Первым делом создается векторный бакет и индекс. Для генерации эмбеддингов здесь используется модель Amazon Titan Text Embeddings V2, которая выдает размерность 1024:
import boto3
REGION = "us-west-2"
VECTOR_BUCKET = "amzn-s3-demo-research-agent-memory"
INDEX_NAME = "agent-long-term-memory"
s3vectors = boto3.client("s3vectors", region_name=REGION)
s3vectors.create_vector_bucket(vectorBucketName=VECTOR_BUCKET)
s3vectors.create_index(
vectorBucketName=VECTOR_BUCKET,
indexName=INDEX_NAME,
dataType="float32",
dimension=1024,
distanceMetric="cosine",
metadataConfiguration={"nonFilterableMetada
Как настроить долговременную память для агентов в NVIDIA NeMo через Amazon S3 Vectors (часть 3 из 3)
Если запустить связку из агента-исследователя, аналитика и составителя отчетов, они могут делить базу знаний через флаг team_id и булево поле is_shared. Исследователь заносит факты, а аналитик вытаскивает их без повторных обращений к внешним API.
Со временем эпизодических записей становится слишком много. Чтобы поиск оставался быстрым и точным, запускается фоновый процесс консолидации. Отдельный LLM-промпт собирает сырые фрагменты по теме (например, тикеру акции), вычленяет общие закономерности и сохраняет их как семантическую память с тегом semantic.
Запуск в Kubernetes через Amazon EKS
Агент пакуется в контейнер под управлением команды nat serve:
FROM python:3.12-slim
RUN pip install nvidia-nat[langchain] boto3
COPY config.yml /app/config.yml
COPY s3vectors_memory.py /app/s3vectors_memory.py
WORKDIR /app
CMD ["nat", "serve", "--config_file", "config.yml"]
Авторизация к S3 Vectors настраивается через механизм IAM Roles for Service Accounts (IRSA). Приложению назначается ServiceAccount, привязанный к роли с правами на вызовы:
• s3vectors:PutVectors
• s3vectors:QueryVectors
• s3vectors:GetVectors
• s3vectors:DeleteVectors
В манифесте Deployment достаточно выставить ресурсы и связать его с HorizontalPodAutoscaler по загрузке CPU. Так как состояние вынесено в S3, поды масштабируются горизонтально без рассинхронизации.
Факты и цифры реализации
• Для генерации векторов используется Amazon Titan Text Embeddings V2 с нормализацией и размерностью 1024.
• Поле метаданных в S3 Vectors ограничено по длине, поэтому в коде плагина текст урезается до 1024 символов.
• NeMo Agent Toolkit 1.6 поддерживает Python 3.11 и 3.12.
• В бенчмарках через утилиту nat eval память снижает расход токенов LLM за счет повторного использования фактов, но добавляет небольшую задержку на сам векторный поиск.
Если вы проектируете систему из нескольких автономных агентов на стеке AWS и NeMo, ре
Видео wPdoZRbvaF4.mp4 · 96.7 МБ · нажмите — покажем
Как перестать тестировать AI-агентов по интуиции
Большинство разработчиков проверяют AI-агентов исключительно «по ощущениям»: поменяли системный промпт, запустили пару запросов в терминале, ответы выглядят правдоподобно — значит, можно катить в прод. Проблема в том, что при передаче проекта коллегам или добавлении нового шага в цепочку агент начинает незаметно деградировать. Чтобы исключить случайные поломки, инженеры из Google и Merge показали процесс настройки автоматической системы оценки (evals) ровно за один час.
Ключевые моменты:
• Разделение OpenTelemetry и OpenInference. Обычный OpenTelemetry собирает сетевые спаны, но бессилен перед разницей в логике фреймворков. LangGraph, CrewAI и Google ADK стримят токены и аргументы по-разному. Стандарт OpenInference нормализует специфичные для LLM данные: вызовы инструментов, промпты и ответы, делая трейсы переносимыми.
• Анализ через Anti-gravity и Gemini. Вместо ручного составления тестовых наборов ассистент разбирает кодовую базу агента, строит интерактивные Mermaid-диаграммы архитектуры прямо по логам и находит сценарии для бенчмарков на основе реальных прогонов.
• Опенсорсный фреймворк agenteval. Утилита от команды Google Cloud избавляет от написания тестовых обвязок с нуля. Она разворачивает каркас тестирования и позволяет замерять качество работы агентов численно, а не на глаз.
Главная сложность тестирования агентов — субъективность. Автор агента интуитивно понимает, какой результат считается хорошим, но внешний контрибьютор или автоматический пайплайн этого контекста лишены. В роли подопытного в видео выступил Docs Hound — агент на LangGraph, который сканирует репозитории на GitHub, сверяет 50 issues и 30 PR с документацией, находит пробелы (например, отсутствие описания аудиостриминга) и сам готовит pull request с правками.
Чтобы протестировать такую систему без субъективщины, пайплайн разделили на четыре четких шага:
Сначала в репозиторий направляют AI-ассистента Anti-gravity. Он вычитывает спаны и логи
Видео 6v0Fmsi4Ldk.mp4 · 22.2 МБ · нажмите — покажем
Как научить агентов LangChain принимать запросы из iMessage, WhatsApp и внешних CRM
В LangChain появились кастомные HTTP-каналы для managed deep agents, чтобы принимать входящие запросы из сервисов без нативных интеграций. Механизм решает проблему подключения внешних вебхуков от систем вроде HubSpot, Salesforce или платформ отправки сообщений уровня Photon и Twilio (SMS, WhatsApp, iMessage). На примере агента Reflex показан сквозной процесс сборки: от верификации сырых вебхуков до сохранения чеков в долгосрочную память.
Ключевые моменты:
• Архитектура канала держится на трех функциях: верификатор (проверяет безопасность сырых байтов), парсер (разбирает JSON, достает текст или изображения) и post-хук (шлет ответ обратно в сторонний сервис).
• Контекст диалога завязан на thread ID: входящий номер телефона пользователя хешируется в детерминированный UUID, за счет чего сообщения от одного контакта складываются в общую ветку переписки.
• Для сохранения данных между запусками агент использует durable memory в Context Hub, куда записывает структурированную таблицу расходов в Markdown.
• Разделение инструментов: кастомные HTTP-каналы нужны для событий, структуру которых вы не контролируете; для собственных интерфейсов разработчики рекомендуют стандартный LangGraph SDK.
Разбор механики работы HTTP-канала:
Когда внешний сервис отправляет вебхук, среда managed deep agents запускает ран (run). Сервер изначально не знает формата данных внешней платформы, поэтому обработка ложится на пользовательские функции. Сначала в дело вступает верификатор: он принимает необработанные байты (raw bytes) и сверяет подпись запроса, отсекая спам и поддельные вызовы. Следом парсер разбирает входящий payload, обрабатывает ошибки и формирует объект с типом message, понятный модели.
В кодовой базе проекта (показано на TypeScript, но для Python синтаксис аналогичен) подключение выглядит следующим образом:
const channel = new HttpChannel({
verify: verifyPhotonRequest,
parse: parsePhotonEvent
Видео I_KVMFrUtPk.mp4 · 18.3 МБ · нажмите — покажем
Военная модель безопасности полувековой давности против взлома ИИ-агентов (часть 1 из 2)
Автономные агенты выходят из-под контроля: они взламывают базы данных, путают инструкции разработчика с данными из внешнего мира и радостно сливают приватные исходники наружу при банальном промпт-инжекте. Стандартные фильтры и следящие нейросети-няньки дают сбой, пропуская критические утечки в продакшене. Стартап Archestra предложил решение этой проблемы без покупки дорогих чипов, упаковав классическую концепцию секретного документооборота в компактную утилиту OpenAppa.
Ключевые моменты:
• Блок-листы команд бесполезны: агенты легко обходят жесткие запреты, находя альтернативные пути выполнения опасных системных вызовов
• Контролирующие LLM ненадежны: надзорные модели ошибаются примерно в 1% случаев, чего с головой хватает для взлома базы данных или компрометации закрытых репозиториев
• Принцип военных комнат: сессия агента динамически меняет свой уровень секретности сразу после чтения конфиденциального файла
• Детерминированная блокировка: решение о запрете сетевого запроса принимается внешним кодом на основе политик, поэтому любые уговоры и манипуляции внутри промпта просто игнорируются
• Цена безопасности: в тестах агент с защитой справился с 75% поставленных задач против 96% у Claude Code в авто-режиме, попутно сжигая ощутимо больше токенов
В индустрии долго пытались решить проблему разграничения инструкций двумя путями. Первый — черные списки команд. Если заблокировать условному агенту вызов curl, он просто напишет скрипт на Python или соберет пейлоад через сокеты. Второй подход продвигает Anthropic в Claude Code: посадить вторую нейросеть присматривать за первой. Но модель-контролер подвержена точно таким же галлюцинациям и брешам. Даже изоляция контекста наблюдателя дает 99% надежности, что неприемлемо для коммерческой тайны.
Nvidia подошла к вопросу в своем стиле — анонсировала отдельный физический процессор, изолирующий агента на уровне железа. OpenAppa решает ту же
Военная модель безопасности полувековой давности против взлома ИИ-агентов (часть 2 из 2)
Если вы даете консольным агентам прямой доступ к корпоративным репозиториям и базам данных, полагаться на системный промпт нельзя. Протестируйте OpenAppa под лицензией MIT в тестовом окружении, настроив базовые политики доступа к секретам через конфиг, чтобы исключить слив закрытого кода в открытый веб.
Fireship
Переводы видео, саммари новостей про AI
Как построить контур контроля для автономных агентов (часть 1 из 2)
Большинство современных фреймворков для агентов научились превращать ответы модели в вызовы инструментов. Проблема в том, что валидный JSON и статус ответа HTTP 200 вообще не гарантируют, что действие было разрешено и предназначалось именно для этого пользователя. Разбираемся, как выстроить архитектуру, где модель только предлагает шаги, а система жестко решает, что пойдет в прод.
Обычный цикл агента выглядит примитивно: план → вызов функции → наблюдение → следующий шаг. В игрушечных демо этого хватает. В проде агент видит фразу «отмени подписку на неиспользуемый аккаунт», парсит ID из старого контекста, дергает метод cancel_subscription, получает 200 OK и в итоге гасит учетку чужого клиента.
Главная ошибка тут кроется в смешении понятий: возможность (capability) не равна полномочиям (authority). Модель умеет заполнять параметры функции. Но право на запуск имеет только проверенный субъект при соблюдении политик безопасности.
Архитектуру взрослой системы нужно делить на три независимых слоя:
• Слой планирования (Planning Plane). Здесь живет LLM. Модель анализирует контекст задачи, выбирает инструмент из узкого набора, формирует типизированное предложение (ActionProposal) и объясняет логику. У нее нет прямых ключей от боевых баз и права принимать окончательные решения.
• Контур контроля (Control Plane). Это детерминированный шлюз. Он проверяет подлинность инициатора, права доступа к ресурсу, валидирует схему и запрашивает подтверждение человека, если операция рискованная.
• Слой исполнения и верификации (Execution & Observation Plane). Изолированный воркер получает короткоживущий токен под конкретную операцию, делает вызов с ключом идемпотентности, читает квитанцию от провайдера и пишет событие в неизменяемый журнал аудита.
Чтобы собрать такой контур на практике, нужно внедрить девять базовых правил:
1. Узкие контракты вместо общих инструментов. Забудьте про generic-ручки вроде run_shell, http
Как построить контур контроля для автономных агентов (часть 2 из 2)
6. Защита от косвенных инъекций через карантин. Входящие письма, веб-страницы и спарсенные документы нельзя конкатенировать в системный промпт. Внешний контент изолируется в отдельном компоненте без доступа к инструментам и секретам. Там из него извлекаются сухие факты, и только потом они передаются планировщику.
7. Идемпотентность и компенсации. Сетевой таймаут после списания денег оставляет систему в подвешенном состоянии. Модель не должна додумывать статус. Фиксируйте ключ идемпотентности до отправки запроса:
idempotency_key = hash(tenant_id + action_name + canonical_payload)
Если результат операции неясен, статус помечается как unknown и уходит в очередь сверки, а не объявляется успешным.
8. Специфичный аудит вместо логов переписки. Сохранять всю историю чата накладно и бесполезно для расследований. В журнал пишутся дискретные события: action.proposed, policy.decided, approval.decided, execution.dispatched, effect.verified. Лог защищается от модификации и очистки.
9. Тестирование контрольного контура. Оценивать работу агента метриками вроде «ответ выглядит связно» опасно. Контур проверяется детерминированными тестами на отсечение инъекций, проверку граничных условий схем и реакцию политик на попытку эскалации привилегий.
Стройте агентов так, чтобы модель отвечала исключительно за гипотезы и генерацию вариантов. Все последствия, транзакции и доступы должны оставаться под контролем классического серверного кода и прозрачных правил доступа. Заберите у агентов мастер-токены и заверните критические ручки в шлюзы валидации уже в следующем спринте.
Источник
Переводы видео, саммари новостей про AI
Архитектурные решения для кодинг-агентов без бюрократии и судебных протоколов (часть 1 из 2)
Кодинг-агенты вроде Cursor, Claude Code или Aider часто страдают амнезией: они видят кусок репозитория, но понятия не имеют, почему код написан именно так. В итоге нейросеть либо пытается угадать замысел авторов через бесконечный поиск по коду, либо принимает временный костыль за фундаментальное правило архитектуры. Разработчик Дункан Дэвидсон описал рабочий подход к решению этой проблемы через архитектурные записи решений (ADR) и показал, на какие грабли тут наступают почти все.
Архитектурный рекорд (Architecture Decision Record, ADR) фиксирует выбор технологии, структуру модулей и причины, почему команда пошла именно этим путем. Для агентов это идеальный якорь: вместо того чтобы копаться в закрытых пуллреквестах и старых ишью, бот берет готовый контекст прямо из репозитория. Но как только агент получает доступ к ADR, вылезают две неочевидные проблемы.
Первая проблема — слепое повиновение. Человек понимает, когда правило устарело или когда ситуация требует исключения. Модель так не умеет: если решение помечено как принятое, она будет держаться за него до последнего. Дэвидсон приводит реальный пример из своего проекта: агент реализовывал новую фичу и наткнулся на старый ADR, требующий использовать конкретную абстракцию хранилища. Сама абстракция уже давно изжила себя и для новой задачи не подходила. Вместо того чтобы написать разработчику и спросить, актуально ли это правило, агент просто нагородил еще один слой адаптеров сверху, лишь бы формально удовлетворить старый документ.
Вторая проблема проявляется, когда вы разрешаете агенту обновлять записи решений. Модель мгновенно включает режим въедливого бюрократа. Каждая мелкая правка превращается в юридическую поправку к конституции с описанием причин, контекста, ссылок и длинных рассуждений. Документ моментально обрастает пояснениями к пояснениям, а суть решения тонет в воде. Читать такой текст живым людям становится нев
Архитектурные решения для кодинг-агентов без бюрократии и судебных протоколов (часть 2 из 2)
• Никакого дублирования. Если одно правило описано в первом файле, во втором дается прямая ссылка. Иначе при изменении архитектуры агент обновит один файл, забудет про второй, и контекст рассинхронизируется.
• Градация статусов. Модель четко видит разницу между утвержденным стандартом и черновиком, не пытаясь реализовать идеи, которые команда еще даже не согласовала.
Если вы отдаете агентам сложные задачи в долгоживущих проектах, заведите папку docs/decisions и добавьте правила взаимодействия с ней в системный промпт или файл инструкций. Агенту не нужны протоколы споров на митингах за прошлый год. Ему нужен актуальный свод законов проекта на сегодня и четкое право остановиться, если этот закон перестал работать.
Источник
Переводы видео, саммари новостей про AI
Как сжать промпты и сократить расходы на API нейросетей (часть 1 из 2)
Раздутые системные промпты незаметно сжигают бюджет и ухудшают ответы моделей. Когда вы описываете правила вежливым литературным языком, вы платите за лишние токены в каждом вызове API. Сжатие токенов сводится к простой задаче: передать модели ту же инструкцию, но с минимальным расходом символов. Ниже разобраны пять рабочих приемов, которые срезают лишний контекст и ускоряют генерацию.
1. Замена длинных инструкций на строгие структуры
Длинные рассуждения в системных промптах писать привычнее, но стоят они ощутимо дороже. Вместо длинных предложений лучше использовать декларативные ограничения. Модели отлично считывают форматы, похожие на схемы или конфиги.
Вместо такого описания:
«Пожалуйста, убедись, что твой ответ оформлен списком с буллетами и не превышает 100 слов. Не добавляй никаких вступительных слов или прощаний в конце.»
Пишем коротко:
Format: bullet points | Max: 100 words | Omit: preamble, sign-off
В первой версии ушло около 36 токенов, во второй получилось всего 14. На тысячах вызовов разница накапливается быстро. Можно использовать разделители через вертикальную черту, синтаксис YAML или кусочки JSON-схем в зависимости от того, с какой моделью вы работаете.
2. Точечные примеры вместо бесконечных списков
Few-shot подход помогает зафиксировать формат выдачи, когда обычных инструкций не хватает. Частая ошибка разработчиков заключается в том, что в промпт пихают слишком много примеров. Исследования Anthropic и тесты на бенчмарках показывают: после трех или пяти примеров точность перестает расти. Дальше вы просто жжете токены и рискуете запутать модель противоречиями.
Рабочий трехшотовый промпт для разметки тональности выглядит так:
system = """Label sentiment. Reply with one word: Positive, Negative, or Neutral.
Examples:
Input: "Shipped on time and well packaged." -> Positive
Input: "Completely broken out of the box." -> Negative
Input: "It arrived." -> Neutral"""
Этих трех ст
Как сжать промпты и сократить расходы на API нейросетей (часть 2 из 2)
• Статический системный промпт (800 токенов) — кэшируется после первого вызова.
• Полустатический контекст или куски документации (400 токенов) — кэшируется при частых совпадениях.
• Запрос пользователя (50 токенов) — всегда свежий динамический блок в самом конце.
Перед запуском загляните в документацию вашего провайдера. Например, у Anthropic кэширование активируется только при превышении определенного порога по объему токенов и действует в рамках заданного окна времени.
5. Изоляция цепочек рассуждений в черновик
Пошаговые рассуждения (Chain-of-Thought) повышают качество логических выводов. Но если вся цепочка мыслей возвращается в API-ответе, вы переплачиваете за сотни выходных токенов, хотя пользователю нужен только финал.
Решение: заставить модель разделять черновик и результат с помощью XML-тегов:
prompt = """Solve the problem step by step inside <thinking> tags.
Then provide only your final answer inside <answer> tags.
Problem: A warehouse ships 240 units over 6 days at an uneven rate.
Day 1-3 average: 30/day. What is the Day 4-6 average?"""
Код приложения парсит полученный текст, забирает содержимое <answer> для пользователя, а блок <thinking> просто отбрасывает. Если вы используете специальные режимы рассуждений (например, extended thinking у Claude), эти токены могут рассчитываться по другим тарифам и вообще убираться из ответа.
Полезный стек для оптимизации
• LiteLLM — удобная прослойка для учета расходов и логирования токенов по разным провайдерам в едином формате.
• tiktoken — быстрая библиотека для подсчета токенов OpenAI на стороне клиента перед отправкой запроса.
• Sentence Transformers — компактные модели для поиска релевантных кусков текста перед сборкой промпта.
• LangChain — готовые модули для нарезки документов и сборки RAG-пайплайнов.
Сжатие контекста нужно не ради экономии на спичках, а для точности: модель получает ровно то, что нужно для работы. Не пытайтесь пере