Фотография
click to show
click to show
چرا LLMهایی که Fine-tune شدن، اطلاعاتی رو حفظ میکنن که نمیتونن ازشون استفاده کنن؟
یه مقالهی جدید با Reverse-engineering بررسی کرده که موقع Fine-tuning دقیقاً داخل یه مدل چه اتفاقی میافته و توضیح میده چرا گاهی با یه وضعیت عجیب روبهرو میشیم: یه حقیقت یا اطلاعات جدید رو به مدل یاد میدید، مدل هم بدون مشکل همون رو به خاطر میاره، اما وقتی ازش میخواید با همون اطلاعات استدلال کنه، عملکردش ضعیفه.
باید گفت که Recall کردن یه اطلاعات و Reasoning کردن با اون، دو مهارت کاملاً متفاوت هستن. مدل معمولاً بعد از فقط یکی دو Epoch اطلاعات جدید رو حفظ میکنه، اما توانایی استفاده از اون اطلاعات در Reasoning حدود ۴ تا ۵ Epoch بعد ظاهر میشه و حتی اون موقع هم ضعیفتره. نویسندههای مقاله به این اختلاف میگن Knowing-Using Gap.
دلیلش به محل ذخیره شدن اطلاعات برمیگرده. Fine-tuning اطلاعات جدید رو توی Layerهای ابتدایی و انتهایی مدل ثبت میکنه، بنابراین مدل میتونه اونها رو مستقیماً Recall کنه. اما Multi-step Reasoning عمدتاً در Layerهای میانی انجام میشه و این اطلاعات هیچوقت به اون بخشها نمیرسه.
برای اثبات این موضوع، پژوهشگرها Internal Representation مربوط به اون اطلاعات رو از یکی از Layerهای ابتدایی یا انتهایی برداشتن و به یکی از Layerهای میانی منتقل کردن. نتیجه این بود که Reasoning ناگهان درست عمل کرد. یعنی اطلاعات از اول داخل مدل وجود داشت، فقط جای اشتباهی ذخیره شده بود.
جالبه که فقط با جابهجا کردن اطلاعات بین یه جفت Layer ثابت، بدون اینکه برای هر نمونه بهصورت جداگانه جستوجو انجام بشه، تونستن بین ۵۸ تا ۷۵ درصد از بیشترین بهبودی ممکن رو به دست بیارن. یعنی محدودیت اصلی نه اندازهی مدل هست و نه مدت زمان آموزش؛ بلکه اینه که اطلاعات دقیقاً کجای مدل قرار میگیره.
البته باید توجه داشت که این روش یه Diagnostic هست، نه یه روش آموزشی جدید. در این تکنیک که بهش Self-patching گفته میشه، بعد از پایان آموزش، Representation اطلاعات به یه موقعیت ثابت منتقل میشه. بنابراین اون بهبود ۵۸ تا ۷۵ درصدی فقط یه Upper Bound از چیزی رو نشون میده که احتمالاً با یه مداخلهی تمیز و اصولی قابل دستیابی باشه. ضمن اینکه آزمایشهای این مقاله فقط روی اطلاعات Knowledge Graph در حوزههای Biomedicine و Academia انجام شده.
نتایج این مقاله در کنار مقالهی Allen-Zhu و Li با عنوان "Physics of Language Models" تصویر جالبی میسازه. اون مقاله هم نشون داده بود که LLMها اطلاعات زیادی رو داخل خودشون ذخیره میکنن، اما بدون Chain-of-Thought Reasoning در استفادهی مؤثر از اون اطلاعات با مشکل مواجه میشن.
🔗 لینک مقاله
👑 توضیحات در مورد دوره منتورینگ
🏆 نحوه ثبتنام در دوره منتورینگ
🤝 تجارب موفق قبلی بچهها از منتورینگ
🛠 راه ارتباطی مشاوره تخصصی کسبوکار در زمینه دیتا و هوش مصنوعی
@reza_jafari_ai
2.1K ·