ChatCrawlersearch across public Telegram Open the app
P

python خانه پایتون گروه آموزشی برنامه نویسی

сообщение · 2026-08-05 03:25 UTC
N
🧪 چطور هوش مصنوعی‌ها رو تست می‌کنیم؟ معرفی بنچمارک‌های مدرن برای سنجش IQ مدل‌ها! تا همین چند سال پیش برای تست هوش یک مدل زبانی، چندتا مسئله ریاضی مدرسه یا کد ساده پایتون بهش می‌دادن (مثل بنچمارک‌های قدیمی MMLU یا HumanEval). اما امروز تمام مدل‌های قدرتمند توی این تست‌ها نمره‌های بالای ۸۸ تا ۹۵ درصد می‌گیرن و عملاً این بنچمارک‌ها اشباع و بی‌مصرف (Saturated) شدن! پس امروز مهندس‌ها چطوری واقعاً می‌فهمند کدوم AI باهوش‌تره؟ بیایید با ۴ بنچمارک حیاتی که مرز بین مدل‌های معمولی و فوق‌هوشمند رو مشخص می‌کنند آشنا بشیم: 1️⃣ بنچمارک LMSYS Chatbot Arena (میدان نبرد گلادیاتورها با سیستم Elo): ⚙️ چطوری کار می‌کنه؟ این بنچمارک دقیقاً مثل رتبه‌بندی شطرنج (Elo Rating) است. دو مدل هوش مصنوعی به صورت کاملاً ناشناس (Blind A/B Testing) یک جواب به سوال شما میدن و شما به عنوان انسان انتخاب می‌کنید کدوم بهتر بود. بعد از ثبت میلیون‌ها رأی کاربران، اسم مدل‌ها فاش و رتبه‌بندی میشه. 🎯 هدف چیه؟ سنجش میزان «محبوبیت و کاربردی بودن واقعی» در تعامل با انسان‌ها (Human Preference)، به دور از تقلب در تست‌های خشک آکادمیک 2️⃣ بنچمارک SWE-bench (تست واقعی مهندسی نرم‌افزار): ⚙️ چطوری کار می‌کنه؟ دوران اینکه به AI بگیم «یک تابع فاکتوریل بنویس» تموم شد! در این بنچمارک، یک ریپازیتوری واقعی از گیت‌هاب همراه با یک باگ یا Issue واقعی به مدل داده میشه. هوش مصنوعی باید کل کدبیس رو درک کنه، باگ رو پیدا کنه، کد رو ادیت کنه و تست‌های واحد (Unit Tests) رو پاس کنه تا باگ برطرف بشه! 🎯 هدف چیه؟ سنجش قابلیت‌های عامل هوشمند (Agentic Coding) و توانایی حل مسئله و استدلال عمیق روی پروژه‌های بزرگ نرم‌افزاری. 3️⃣ بنچمارک GPQA Diamond (سوالات سطح دکترای «ضد گوگل»!): ⚙️ چطوری کار می‌کنه؟ شامل صدها سوال بسیار سخت در فیزیک، شیمی و زیست‌شناسی است که توسط اساتید برجسته دکترا طراحی شده. نکته جذابش اینه که این سوالات Google-Proof هستند؛ یعنی حتی اگر سوال رو توی گوگل سرچ کنید هم هیچ جوابی براش پیدا نمی‌کنید! 🎯 هدف چیه؟ سنجش توانایی «استدلال علمی خالص» (Scientific Reasoning) و عمق دانش به جای حفظ کردن و تکرار دیتای اینترنت. 4️⃣ بنچمارک ARC-AGI 2 (سنجش هوش عمومی انتزاعی): ⚙️ چطوری کار می‌کنه؟ به جای متن و کد، معماهای تصویری و منطقی بر اساس پیدا کردن الگوها (Pattern Recognition) به مدل داده میشه که بسیار شبیه به تست‌های هوش IQ انسان (مانند ماتریس ریون) است. 🎯 هدف چیه؟ سنجش «هوش سیال» (Fluid Intelligence). یعنی آیا هوش مصنوعی می‌تونه در موقعیت‌های کاملاً جدیدی که هیچ‌وقت توی دیتای آموزشی خودش ندیده، منطق بسازه و الگو رو حل کنه یا نه! 💡 خلاصه ماجرا: بنچمارک‌ها فقط ادعا هستند، نه واقعیت مطلق! هوش مصنوعی‌های امروزی به خاطر پدیده Contamination (لو رفتن سوالات تست توی دیتای آموزشی) خیلی وقت‌ها نمره‌های تقلبی می‌گیرن. برای همین، بنچمارک‌های زنده (Live) و تست‌های ناشناس الان معتبرترین متر و معیار به حساب میان. شما برای انتخاب مدل هوش مصنوعی مورد نظرتون (مثلاً برای کدنویسی)، بیشتر به کدوم یکی از این بنچمارک‌ها اعتماد می‌کنید؟ 👇 ❇️ @razavituts
2.1K ·

Вся лента · оригинал в Telegram

Open in Telegram Каталог площадок Искать в ChatCrawler

A snapshot of an open public feed from the search index ChatCrawler — “Google for public Telegram”; refreshed as the venue is crawled. Times are UTC.

Public content only, official Telegram API. About · FAQ · What we do not do · Remove a page · Catalog