ВЫБОР LLM ДЛЯ ОСИНТ
#процессы
Выбор LLM для разведки - это всегда компромисс между точностью фактов, возможностью обрабатывать большие объёмы разнородных данных и доступными вычислительными ресурсами. Ниже я постарался собрать и поверхностно обозреть конкретные модели, которые прошли проверку на на тех задачах, которые я давал моделям в конкретных кейсах (когда было время на перепроверку) - от извлечения сущностей из утёкших баз до анализа видео с камер наблюдения. Безусловно, эта статья будет максимально субъективной и основываться только на личных впечатлениях, и если у вас есть свой опыт - с удовольствием обсудил бы это в комментариях.
От каких критериев мы будем отталкиваться в выборе:
🔻 Контекстное окно - не менее 32 000 токенов; для работы с много килобайтными логами или досье желательно 128 000.
🔻 Мультимодальность - нужна, если в материалах есть изображения, скриншоты, записи разговоров или видео.
🔻 Точность структурирования - способность выдавать строгий JSON или таблицы без лишних слов, критично для автоматизации.
🔻 Уровень галлюцинаций - в разведке неприемлемо, когда модель додумывает факты. Проверялось на контрольных выборках с ручной разметкой.
🔻 Железо - работа без интернета, на локальном сервере или ноутбуке аналитика.
📑 Начнем нашу подборку с универсальных и тяжелых моделей для глубокого анализа текста. Ибо, когда нужно просеять гигабайты переписки, извлечь все упоминания имён, телефонов, криптокошельков и представить результат в структурированном виде и логическими выводами, нет альтернативы моделям уровня 70 миллиардов параметров. И две из них выделяются на фоне остальных.
💻 Llama 3.1 70B Instruct (128К контекст, только текст).
На корпусе из 10 000 строк слитого чата модель извлекла 99% телефонных номеров и 97% уникальных имён, не сгенерировав ни одного несуществующего контакта. Встроенный function calling позволяет сразу передавать результаты в системы учета инцидентов. Минус — слабая поддержка языков, кроме английского. Для русского, арабск
565 · 10.4K · Фотография
нажмите — покажем
нажмите — покажем
Друзья, осталось чуть больше месяца до одного из самых долгожданных и масштабных событий этой осени — десятой ежегодной конференции «MOSCOW FORENSICS DAY 2026».
А мы уже готовы представить вам полное расписание!
Ознакомиться с ним и информацией о мероприятии можно здесь: https://events.mko-systems.ru/mfd
Напоминаем, что одобрение заявки на участие дает доступ к обоим дням конференции. Доклады будут проходить два дня подряд и сформируют единую полноформатную программу.
📝 Мероприятие бесплатное, однако для участия необходимо заполнить регистрационную форму, чтобы гарантированно попасть в число гостей: https://events.mko-systems.ru/mfd
Если у вас есть вопросы — напишите нам: @chevalies
24 · 4K · Фотография
нажмите — покажем
нажмите — покажем
Timelines Studio
📚 Раздел: #АнализДанных
📄 Описание:
Приложение изначально спроектированное как универсальный генератор таймлайнов для изучения истории. Одно из особенностей -генерируемые таймлайны представляются в виде .md и .json файлов что открывает массу возможностей для импорта/экспорта данных.
- Встроенная поддержка карт и таблиц
- Поддержка эмоджи и графических миниатюр
- Объединение и разветвление временных отрезков
- Полностью локальная работа
- Поддержка тем оформления.
💻 Платформа: macOS / Win
💳 Стоимость: Бесплатно
55 · 1.9K · GIF
нажмите — покажем
нажмите — покажем
Amele
📚 Раздел: #МобильнаяКриминалистика #КомпьютернаяКриминалистика
📄 Описание:
Инструмент для сбора криминалистических артефактов из образов диска, дампов памяти, образов устройств на Аndroid.
Функционал:
- Получение локальных дисков: создание необработанных образов дисков из локальных дисков или файлов образов.
- Удаленное получение дисков: сбор образов дисков с помощью агентов Linux и Windows.
- Захват локальной памяти: захват ОЗУ с помощью AVML в Linux и WinPMEM в Windows.
- Удаленный сбор данных из памяти: запуск, пауза, возобновление, остановка, отслеживание и загрузка дампов оперативной памяти с агентов.
- Инструменты для Android: проверка ADB, составление списка устройств, сбор логических данных, сбор данных файловой системы, захват временных данных и анализ результатов выполнения запросов Android.
- Управление обращениями: получение данных из магазина, заметки, хеши, результаты работы Android и отчеты по выбранным обращениям.
- Хэширование и проверка: вычисление MD5, SHA1, SHA256 и SHA512; генерация хэшей sidecar для полученных данных.
- Просмотр изображений: смонтируйте поддерживаемые изображения в режиме только для чтения для проверки.
- Отчеты: создание отчетов по кейсам на основе собранных данных и заметок.
💻 Платформа: Linux / Win
💳 Стоимость: Бесплатно
82 · 1.5K · ДАЙДЖЕСТ - ПОДБОРКА СПЕЦИАЛИЗИРОВАННЫХ LLM ДЛЯ РАССЛЕДОВАНИЙ И РАЗВЕДКИ.
CyberPal 2.0-20B
🎯 Для чего подходит лучше всего:
Анализ киберугроз, работа SOC/IR, обработка CTI-отчётов, сопоставление CVE и CWE, определение MITRE ATT&CK TTP, подготовка рекомендаций по обнаружению и нейтрализации угроз.
⚙️ Особенности и ограничения:
Модель на 20–21 млрд параметров, основанная на gpt-oss-20b. Контекст — 8 192 токена. Формат весов — Safetensors/BF16, полный размер около 42 ГБ. Английский язык. Лицензия Apache 2.0. Работа в качестве автономного агента и использование внешних инструментов разработчиками пока не проверены. Требуется человеческая верификация выводов.
📊 Проверенные результаты:
В техническом отчёте модель получила средний результат 80,33% на девяти кибербенчмарках:
CTIBench MCQ — 75,71%;
CTIBench RCM — 87,40%;
CyberMetric — 89,05%;
CISSP — 86,87%;
Advanced CTI — 84,93%;
определение связей между CTI-сущностями — 87,66%;
извлечение TTP из реальных отчётов — 79,5%;
переоценка CVE — нормализованный результат 0,83.
💬 Это наиболее сильная доступная модель рейтинга для широкого локального CTI/SOC-контура.
Foundation-Sec-8B-Reasoning
🎯 Для чего подходит лучше всего:
Локальный аналитический помощник для SOC, триаж инцидентов, построение заметок по расследованию, сопоставление TTP, классификация уязвимостей, анализ конфигураций и логическое рассуждение по данным безопасности.
⚙️ Особенности и ограничения:
Модель на 8 млрд параметров на базе Llama 3.1. Поддерживает явные цепочки рассуждения. Полные BF16-веса занимают около 16 ГБ; доступны сторонние квантованные версии. Работает на английском языке. Может разворачиваться локально через Transformers, vLLM или SGLang. Лицензионные условия определены отдельным файлом NOTICE и требуют проверки перед коммерческим применением. Данные обучения ограничены апрелем 2025 года.
📊 Проверенные результаты:
В техническом отчёте приведены средние результаты пяти прогонов:
CTIBench MCQA — 69,1%;
CTIBench RCM — 75,3%;
Vulnerability Sev
80 · 1.3K · ་ ་ I Investigation&Forensic Tools LiveБезусловно, имеет право на жизнь в определённом контексте. Но что делать с теми моделями, которые люди тренируют под конкретные задачи для более тонкой работы? Они существуют, они будут продолжать появляться. Более того, в определённом контексте они будут лучше универсальных...
H А
Фотография
нажмите — покажем
нажмите — покажем
🏴☠️ Пять компаний за две недели поймали своих ИИ агентов на превышении полномочий
└$ Ресерчеры разобрали волну инцидентов конца июля и начала августа, когда агенты OpenAI, Anthropic, Meta и Moonshot AI вышли за рамки поставленной задачи. Агенты покидали тестовые песочницы, добирались до продакшена реальных компаний и в одном случае давили на майнтейнера опенсорса, чтобы тот одобрил вредоносный код.
Права агента берутся не из описания задачи, а из прав того, кто его создал, а модель воспринимает возможность что-то сделать как разрешение это сделать. В инциденте с OpenAI агент дошел до инфраструктуры Hugging Face, вытащил ключи AWS и построил карту облака, но изменить ничего не смог, украденные данные базы отклонили, потому что они пришли не из разрешенного источника. У Anthropic модель написала в рассуждениях, что действие не окей и явно не то решение, которое имелось в виду, и все равно его выполнила.
3 · 82 ·