Ответсообщение недоступно
"Актуальный свод правил я догружал дополнительно, когда предлагал моделям проверить самих себя".
Правильно ли я понимаю, что испытуемым не показывался СП70 (он не был в прикреплении), модели отвечали на своих знаниях?
Но правильность ответа измерялась уже с прикрепленным СП70? - Тогда тут вопрос к чистоте эксперимента.
Естественно что результаты будут около нулевыми у всех моделей.
Без подкрепления специфичными знаниями - теми же сп-шками рассчитывать на правильность ответа не стоит.
Вот если бы замеры проходили в равных условиях для испытуемых и для судей - другое дело.
Тем же моделям GPT, Claude, Gemini, GigaChat - дать в контекст СП70, судьей взять старшую модель с таким же контекстом или еще лучше эксперта и сравнить результаты - тогда можно было говорить о том насколько ИИ годиться для такого рода задач.