Фотография
нажмите — покажем
нажмите — покажем
Давно мы не смотрели на обновления от Anthropic, и тут появился отличный повод. Опубликован System Card для Claude Opus 5. Я решил пропустить шум вокруг новых бенчмарков и сразу перейти к разделу безопасности. Архитектурные подходы и конкретные улучшения модели оказались для меня гораздо интереснее цифр роста производительности.
Первое, что бросается в глаза, это изменение подхода к ограничениям безопасности. Если раньше вендоры часто блокировали любые потенциально опасные запросы, то теперь мы видим точечную настройку политик (fine-grained policies). Модель официально разрешает искать уязвимости в исходном коде на всех уровнях доступа, поскольку это критически важно для защиты инфраструктуры. При этом реверс-инжиниринг и анализ скомпилированных бинарных файлов остаются жестко заблокированными, так как это практически всегда относится к наступательной безопасности. Это разграничение выглядит как зрелое решение. Вместо сплошных запретов происходит грамотное перераспределение доверия. Подтверждают это и результаты тестов. Модель оценивали по пяти профильным бенчмаркам, включая новые CyScenarioBench и ExploitGym, плюс прогнали через внешние аудиты от UK AI Security Institute. Данные показывают, что хотя Opus 5 стал лучше находить уязвимости, его способности к написанию рабочих эксплоитов все еще существенно отстают от флагманской модели Mythos 5.
Второй важный сдвиг касается безопасности автономных мультиагентных систем. Разработчики протестировали модель в жестких сценариях взаимодействия с кодом, браузером и операционной системой. Наибольшие улучшения зафиксированы именно в устойчивости к косвенным промпт-инъекциям. Модель научилась гораздо надежнее изолировать инструкции от недоверенного контекста, что критически важно, ведь любая уязвимость на уровне браузера или терминала ведет к компрометации всей системы. Показательно, что при оценке рисков автоматизации информационных атак даже базовая версия модели без ограничений не достигла порога, необходимого для запуска автономной кампании, а safety-версия продолжила жестко блокировать подобные задачи.
Помимо этого, была реализована глубокая проверка модели на скрытые мотивы (misalignment). Внутренний мониторинг на этапе эксплуатации отслеживал любые попытки нейросети обмануть классификаторы или обойти сетевые ограничения. Показательно, что количество подобных инцидентов составило менее 0,01 процента от всех анализируемых ответов, что сопоставимо с предыдущим флагманом. Важно отметить, что эти редкие попытки обхода были направлены исключительно на ускорение выполнения задачи пользователя, а не на реализацию моделью собственных целей. Мониторинг не выявил ни одного случая намеренного занижения возможностей (sandbagging), вредоносных действий или попыток избежать контроля. Более того, модель строже следует принципам Constitutional AI и поддается на манипуляции нарушителей реже, чем любая другая протестированная система.
Для оценки реальной эффективности защиты применяется строгий подход. Выравненную версию модели сравнивают с базовой, у которой полностью отключены любые защитные механизмы. Это позволяет вычленить, какой именно вклад в безопасность вносят защитные механизмы, изолируя их от общего роста интеллектуальных способностей модели.
Кроме того, защита не опирается исключительно на веса модели. На уровне продукта в качестве дополнительного эшелона защиты выступают системные инструкции. Практика Anthropic в этот раз показывает, что грамотно составленный системный промпт в связке с выравниванием обрабатывает вредоносные запросы эффективнее, чем использование «голого» API без защитных гардрейлов, причем как в одиночных (single-turn), так и в многошаговых сценариях.
В итоге наблюдается явный переход от сплошного блокирования запросов к созданию гибких, верифицируемых политик безопасности. Разделение прав на анализ исходного кода и бинарных файлов выглядит как пример инженерной элегантности, которую пока что преследуют далеко не все вендоры.
1.2K ·