ChatCrawlersearch across public Telegram Open the app
A

AI Comments

сообщение · 2026-07-22 12:25 UTC
I
Фотография
click to show
چطور پیش‌آموزش سقف عملکرد RL رو مشخص می‌کنه یک تحقیق جدید از شطرنج به‌عنوان یک محیط آزمایشی کنترل‌شده استفاده کرده تا کل مسیر آموزش رو بررسی کنه: اول مدل روی بازی‌های انسانی پیش‌آموزش (Pre-training) می‌بینه، بعد با SFT روی مسیرهای استدلال (reasoning traces) آموزش داده می‌شه و در آخر با RL و پاداش‌های قابل بررسی (verifiable rewards) تنظیم می‌شه. شطرنج برای این کار خیلی مناسبه، چون هم ارزونه و هم هر حرکتش دقیقاً قابل بررسیه. برای همین پژوهشگرها می‌تونن هزینه‌ی محاسباتی پیش‌آموزش و RL رو هم‌زمان بررسی کنن؛ کاری که روی مدل‌های زبانی بزرگ واقعی (LLM) خیلی گرونه. نتیجه‌ی مهم اینه که پیش‌آموزش واقعاً اهمیت زیادی داره. هرچی خطای پیش‌آموزش (pre-training loss) کمتر باشه، دقت مدل بعد از RL بالاتر می‌ره. همین‌طور هرچی مدل با توکن‌های بیشتری پیش‌آموزش ببینه، پاداش RL سریع‌تر رشد می‌کنه. وقتی منابع محاسباتی کم باشه، تقریباً باید بیشتر تمرکز روی پیش‌آموزش باشه، چون یک مدل پایه‌ی ضعیف رو نمی‌شه فقط با زودتر شروع کردن RL نجات داد. اما وقتی منابع بیشتر می‌شن، سهم RL هم بیشتر می‌شه (در این تحقیق حدوداً از ۲۰٪ به ۲۸٪ کل محاسبات رسید)، در حالی که تعداد توکن‌های پیش‌آموزش همچنان از قانون مقیاس‌گذاری چی‌چیلا (Chinchilla) پیروی می‌کنه. پژوهشگرها می‌گن RL فقط چیزی که مدل از قبل بلد بوده رو قوی‌تر نمی‌کنه. در مسائل ساده، بیشتر باعث می‌شه جواب‌های درست قبلی بهتر و پایدارتر بشن. اما در مسائل سخت، RL می‌تونه حرکت‌ها و جواب‌های درستی رو پیدا کنه که قبل از اون تقریباً در مدل وجود نداشتن. در واقع استدلال مدل بیشتر گسترده‌تر می‌شه، نه لزوماً عمیق‌تر. RL کمک می‌کنه مدل گزینه‌های بیشتری بسازه و بهتر بین اون‌ها انتخاب کنه، ولی هنوز در مسیرهایی که نیاز به نگاه کردن بیشتر از حدود پنج حرکت جلوتر دارن، مشکل داره. جست‌وجوی مسیرهای طولانی همچنان سخته. این الگو فقط مخصوص شطرنج نیست. روی یک مدل ۱ میلیارد پارامتری (1B) که با متن‌های ریاضی پیش‌آموزش دیده و بعد با RL روی مجموعه‌های GSM8K و MATH تنظیم شده هم همین نتیجه دیده شد: مدل‌هایی که مدت بیشتری پیش‌آموزش دیده بودن، بعد از RL امتیاز بالاتری گرفتن و سریع‌تر پیشرفت کردن. به‌نظرم این روش آزمایش خیلی جالبه، چون شطرنج هم کم‌هزینه است و هم نتیجه‌ها کاملاً قابل بررسی هستن؛ بنابراین می‌شه هر دو مرحله‌ی آموزش رو هم‌زمان مقایسه کرد. این تحقیق همچنین بحث مطرح‌شده توسط Yue و همکاران (۲۰۲۵) رو کمی دقیق‌تر می‌کنه. اون‌ها گفته بودن RL فقط مدل پایه رو بهتر می‌کنه و هیچ‌وقت سقف توانایی مدل در جواب درست دادن (pass@k) رو بالاتر نمی‌بره. نتیجه‌ی این تحقیق نشون می‌ده این حرف برای مسائل ساده تا حد زیادی درسته، اما در مسائل سخت، RL واقعاً می‌تونه جواب‌های درست جدیدی پیدا کنه که قبلاً در مدل وجود نداشتن. البته هم‌زمان ممکنه جواب‌های اشتباه رو هم تقویت کنه. پس در نهایت، هر دو دیدگاه تا حدی درست هستن؛ اینکه RL چقدر می‌تونه توانایی جدید ایجاد کنه، بستگی به سختی مسئله داره. 🔗 لینک مقاله 👑 توضیحات در مورد دوره منتورینگ 🏆 نحوه ثبت‌نام در دوره منتورینگ 🤝 تجارب موفق قبلی بچه‌ها از منتورینگ 🛠 راه‌ ارتباطی مشاوره تخصصی کسب‌وکار در زمینه دیتا و هوش مصنوعی @reza_jafari_ai
885 ·

Вся лента

Каталог площадок Искать в ChatCrawler

A snapshot of an open public feed from the search index ChatCrawler — “Google for public Telegram”; refreshed as the venue is crawled. Times are UTC.

Public content only, official Telegram API. About · FAQ · What we do not do · Remove a page · Catalog