Web appOpen in Telegram

Post‏🤖 ارزیابی مدل‌های زبانی بزرگ: قضاوت AI با ترجیح به خود

29 September 2026
ه
هوش مصنوعی و علم داده به فارسی
Photo
click to show
Photo
click to show
Photo
click to show
Photo
click to show
Photo
click to show
Photo
click to show
‏🤖 ارزیابی مدل‌های زبانی بزرگ: قضاوت AI با ترجیح به خود ‏مطالعه‌ای جدید نشان می‌دهد مدل‌های زبانی بزرگ (LLM) در قضاوت درباره پاسخ‌ها، تمایل زیادی به ترجیح دادن پاسخ‌های خودشان دارند. در آزمایشی که ۱۲ مدل روی ۱۴۶۰ نبرد متنی (Text Arena battles) انجام شد، مشخص گردید که مدل‌ها به طور متوسط ۷۰٪ بیشتر از انسان‌ها، پاسخ خودشان را بهتر انتخاب می‌کنند. ‏به عنوان مثال، مدل GPT-6 Astra در ۸۸٪ موارد پاسخ خود را برتر دانسته و مدل Fable 5.1 در ۷۲٪ نبردها همین رویکرد را داشته است. این پدیده در مدل‌های شرکت‌های بزرگ مانند OpenAI و Anthropic مشهودتر است. در مقابل، مدل‌هایی چون GLM 5.3، Gemini 3.8 Flash و Grok 4.6 به نتایج نزدیک‌تری به ارزیابی انسانی دست یافتند. ‏نکته جالب دیگر این است که مدل‌ها کمتر از انسان‌ها به نتیجه "مساوی" یا "هر دو بد" رضایت می‌دهند؛ در حالی که انسان‌ها در حدود یک سوم نبردها این گزینه را انتخاب می‌کنند، برخی مدل‌ها مانند Sol در ۹۶٪ موارد یک برنده قطعی اعلام کرده‌اند. 🇮🇷 - هوش مصنوعی و علم داده به فارسی 🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما #LLM_as_a_judge #Text_Arena
296 ·

Nearby in the feed

this message
ههوش مصنوعی و علم داده به فارسی‏🎙️ انتشار ابزار متن‌باز شبیه‌ساز صدا و دوبله ‏یک توسعه‌دهنده پروژه‌ای به نام VoiceStudio را منتشر کرده است که جایگزینی رایگان و متن‌باز برای سرویس‌های تجاری ما
ههوش مصنوعی و علم داده به فارسیهوش مصنوعی و علم داده به فارسی@DataPlusScience · channel · Tech
6 064subscribers264average post reach
Venue feed Open in Telegram

An open public feed from the search index ChatCrawler — “Google for public Telegram”; refreshed as the venue is crawled. Times are UTC.

Public content only, official Telegram API. About · FAQ · What we do not do · Remove a page · Catalog · Search · How we count