Веб-версияОткрыть в Telegram

ПостСегодня быстренько протестировал OpenAI Privacy Filter для поиска и редактирования PII.

1 мая 2026
О
Одержимый кодом🔥
Ссылка
нажмите — покажем
Сегодня быстренько протестировал OpenAI Privacy Filter для поиска и редактирования PII. Если коротко: это локальный open-weight фильтр для персональных данных. Он находит в тексте имена, телефоны, email, адреса, даты, номер счета, секреты и возвращает spans с byte offsets, после чего текст можно безопасно редактировать перед отправкой в LLM. Хорошая новость: модель достаточно лёгкая по меркам локальных ML-инструментов. Checkpoint скачивается примерно на 2.8 GB, запускал через Docker на CPU. Это не LLM на десятки гигабайт, а специализированный PII-фильтр, который можно встроить перед прокси/LLM API. Базовый пример работает нормально: { "detected_spans": [ { "label": "private_person", "text": "Иван Иванов" }, { "label": "private_phone", "text": "79222222222" } ], "redacted_text": "Привет меня зовут <PRIVATE_PERSON> мой номер <PRIVATE_PHONE>" } Но на русском языке быстро проявляются те же проблемы, что и у аналогов. Без дополнительного fine-tuning на русскоязычных датасетах я бы не стал использовать это в production как единственный слой защиты. Например, обычные слова с заглавной буквы модель может принять за имя: { "text": "Привет - это Нормальное Слово", "detected_spans": [ { "label": "private_person", "text": "Нормальное Слово" } ], "redacted_text": "Привет - это <PRIVATE_PERSON>" } Ещё один нюанс: телефонный номер иногда классифицируется не как private_phone, а как account_number: { "by_label": { "account_number": 1, "private_person": 2, "private_phone": 1 }, "redacted_text": "Привет меня зовут <PRIVATE_PERSON> мой номер <ACCOUNT_NUMBER>! А меня зовут <PRIVATE_PERSON> и телефон - <PRIVATE_PHONE>" } По ресурсам в Docker на CPU получил такие срезы: CPU RAM 1834.93% 3.838 GiB / 7.648 GiB 2348.13% 4.114 GiB / 7.648 GiB 2272.03% 3.279 GiB / 7.648 GiB То есть примерно 18-23 логических CPU в пике и около 3.3-4.1 GiB RAM. Потоков внутри контейнера было около 55. Вывод: штука рабочая и полезная как локальный PII pre-filter перед LLM, особенно если нужен контроль над данными до отправки наружу. Но для русского языка нужно либо дообучение, либо дополнительный слой правил/валидации, иначе будут false positives и нестабильная классификация категорий.
10 · 798 ·

Рядом в ленте

ООдержимый кодом🔥Понял, что в последнее время перед ревью мне не хватает понимания, кто именно писал реализацию. Похоже, теперь во всех моих open-source проектах появится такой ООдержимый кодом🔥Стало грустно, значит надо писать код! Последние N месяцев не пишу код руками. N - потому что уже забыл, сколько. Оттупел, возможно. Все это время где-то внутри
это сообщение
ООдержимый кодом🔥Офигенный подкаст, только что посмотрел. Многое из сказанного осознал совсем недавно, и кстати, автоперевод на русский на YouTube на высоком уровне. https://youООдержимый кодом🔥На днях провел эксперимент с LLM. Занимался реализацией задачи в проекте, где генерировать код LLM-кой запрещено. Сам проект абсолютно не готов для работы с ИИ,
ООдержимый кодом🔥Одержимый кодом🔥@cutcode · канал · Технологии
342подписчиков356средний охват поста
Лента площадки Открыть в Telegram

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем