Фотография
нажмите — покажем
нажмите — покажем
Команда LM Arena сделала крайне рискованный шаг, который может стоить им разрушения репутации — они решили заменить голоса людей на свою модель Arena-RM, при том что хотя их модель даёт как «судья» лучшие предсказания, кому отдать предпочтение, но качество предсказаний всё равно спорное. Хотя Arena заявляет, что модель имитирует людей с корреляцией 0.98, но это крайне сомнительно в том же тесте Code Arena, где люди делают оценку эстетики и юзабилити. Формальный тест MMRB2 показывает, что правильность выбора предпочтения «как у людей» для LLM не достигает даже 70%. Это катастрофически низкая точность.
Тут надо ещё отметить, что у Arena в прошлом уже был репутационный инцидент, когда они «улучшением» рейтинга решили помочь обвалу рейтингов Claude. Примерно 1,5 года назад в A/B-тестах просто в чате Claude с треском проваливался за 10-е место порой. После этого Arena придумала Style Control, чтобы математическими манипуляциями искусственно повысить рейтинг Claude относительно выбора людей, снизив рейтинг «за оформление». В реальности проблема тогда выглядела очень просто. Claude был тогда просто ужасно кривой в форматировании ответов и выдавал сухой plain text, когда Gemini или даже DeepSeek уже пользовались вовсю шрифтами, таблицами и т.п. Это совсем не мелочь — для людей нормальное оформление выдачи. Люди не роботы, наглядность им важна так же, как и контент.
Сейчас мы видим примерно в таком же духе изменение рейтинга в пользу Claude путём подмены голосов живых людей на никому неизвестную и непроверенную независимо модель-судью. Хотелось бы верить, что тут нет коррупционного эффекта, т.к. ранее расследование LM Arena экспертами показывало, что у разных вендоров LLM разный уровень тестирования и некоторым вендорам Arena разрешает снимать с тестов preview-модели, если они провалились. В таком «партнёрском тестировании» LM Arena была уличена именно с Anthropic.
Сейчас непонятно, что с этим вообще делать. Сразу после выхода модели рейтинг реально выставляется каким-то непонятным ИИ-судьёй, где не факт, что он может даже «прощёлкать прототип» в Code Arena, лишь через некоторое время голоса людей будут выше этой судьи.
Как понимаю, тут ещё есть коммерческая задумка LM Arena торговать вендорам LLM своим судьёй, но к чему это приведёт — очевидно. Они просто сделают целевое обучение под судью и мы получим вообще полный бред.
Кажется, эта Арена сломалась, несите другую. Благо, что аналоги типа Design Arena есть.
https://arena.ai/blog/autoeval-scores
2.1K ·