Compacting conversation...
Фотография
нажмите — покажем
нажмите — покажем
ru-text 2.0 вышел, и главное в нём — контроль нейрослопа
📝 Промпт для копирования: установи https://github.com/talkstream/ru-text
✍️ Установка для ChatGPT/Codex из каталога ChatGPT: ссылка.
И да. Теперь это скилл. Который работает проще и легче, чем прошлая версия.
В первой версии плагин ловил 9 признаков машинного текста, во второй их 17: объявленная искренность («скажу честно»), обязательная триада, выхолощенность, когда в предложении есть механизм, а на месте действующего звена заполнитель, неопределённая атрибуция вроде «как показывают исследования» без исследования, аддитивная псевдопара «не только X, но и Y», где Y ничего не добавляет к X, и запятая, сомкнутая с тире. По Розенталю такой стык нормативен, но всё равно выдаёт машину: человек перестроил бы фразу раньше, чем упёрся бы в него.
Два признака плагин относит не к фрагменту, а к документу целиком: текст, оставшийся стенограммой диалога с нейросетью, и текст, который писали под поисковый запрос. Такие правкой на месте не лечатся, поэтому документ с ними не получит ярлыков «Эталонный» и «Хороший» ни при каком балле. Плюс грамматика, которой корпусу не хватало: управление закрытым списком, деепричастие с чужим субъектом, контекстные омофоны. Корпус вырос с 1 825 атомов до 2 281.
Второе изменение не видно в списке правил, но чувствуется в работе. Раньше полную вычитку нельзя было доверить агенту: она читала 28 000 слов справочников, и запускать её на каждый абзац было разорительно. Теперь у неё две глубины. Если вы просите вычитку словами, плагин читает весь корпус. Агент проверяет себя сам — идёт быстрый проход по индексу признаков и каталогу стоп-слов, около 1 300 слов, и он разворачивается в полную вычитку, если увидел след машинного текста, набрал пять замечаний или текст идёт к читателю. Быстрый проход не судит признаки: у каждого есть оговорка, где приём законен, а оговорки живут только в полном справочнике.
Заодно версия 2.0 обросла тем, чего у первой не было вовсе: 22 эталонных текста с заранее выписанными находками, 8 автопроверок сборки и 93 случая для самих автопроверок. Одни подсовывают проверке испорченный контент и требуют, чтобы она упала, другие следят, чтобы на честном тексте она молчала.
Всё бесплатно, лицензия MIT. Хотите поддержать — нажмите на спонсорство на GitHub (а то там по нулям), поставьте звёздочку к репозиторию или прямо к этому посту :)
Установить за вас, интегрировать в ваш пайплайн, развернуть на компанию за оплату на российского ИП УСН, проконсультировать, сделать для вас что-то кастомное на любую тему — тоже можно, напишите в личку.
57 · 751 ·