ChatCrawlerпоиск по публичному Telegram Открыть приложение
С

Стройконтроль_Чат™

сообщение · 2026-08-20 08:42 UTC
A
Ответсообщение недоступно
"Актуальный свод правил я догружал дополнительно, когда предлагал моделям проверить самих себя". Правильно ли я понимаю, что испытуемым не показывался СП70 (он не был в прикреплении), модели отвечали на своих знаниях? Но правильность ответа измерялась уже с прикрепленным СП70? - Тогда тут вопрос к чистоте эксперимента. Естественно что результаты будут около нулевыми у всех моделей. Без подкрепления специфичными знаниями - теми же сп-шками рассчитывать на правильность ответа не стоит. Вот если бы замеры проходили в равных условиях для испытуемых и для судей - другое дело. Тем же моделям GPT, Claude, Gemini, GigaChat - дать в контекст СП70, судьей взять старшую модель с таким же контекстом или еще лучше эксперта и сравнить результаты - тогда можно было говорить о том насколько ИИ годиться для такого рода задач.

Вся лента · оригинал в Telegram

Открыть в Telegram Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог