هوش مصنوعی و علم داده به فارسی
Photo
click to show
click to show
📉 چرا هوش مصنوعی در کارهای طولانی شکست میخورد؟
تحقیقات جدید مهندسان مایکروسافت نشان میدهد که مدلهای هوش مصنوعی در بنچمارکهای کوتاه بسیار درخشان ظاهر میشوند، اما در وظایف چندمرحلهای (Multi-step) با افت شدید عملکرد مواجه هستند. با افزایش تعداد مراحل وابسته، نرخ موفقیت مدلها از نزدیک ۱۰۰ درصد به نزدیک صفر سقوط میکند.
مهمترین یافتههای این پژوهش:
* دلیل اصلی شکست، «طولانی بودن مسیر» است و نه محدودیت پنجره متن؛ اتفاقاً محدود کردن متن باعث گمگشتگی بیشتر مدل میشود.
* موفقیت عاملها از یک «قانون هندسی» پیروی میکند؛ یعنی کوچکترین خطا در یک مرحله، کل زنجیره عملیات را دچار فروپاشی میکند.
* ارزیابیهای فعلی بهدلیل تمرکز بر افقهای کوتاه، فریبنده هستند.
برای بهبود عملکرد، تیمهای توسعهدهنده باید از ارزیابیهای آگاه از افق (Horizon-aware) و بررسیهای میانی استفاده کنند. ابزارهای تست این پژوهش در گیتهاب در دسترس است.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
#ToolQA #Long_Horizon
9 · 237 ·