ChatCrawlersearch across public Telegram Open the app
A

AI Comments

сообщение · 2026-07-18 17:12 UTC
I
Фотография
click to show
چرا LLMهایی که Fine-tune شدن، اطلاعاتی رو حفظ می‌کنن که نمی‌تونن ازشون استفاده کنن؟ یه مقاله‌ی جدید با Reverse-engineering بررسی کرده که موقع Fine-tuning دقیقاً داخل یه مدل چه اتفاقی می‌افته و توضیح می‌ده چرا گاهی با یه وضعیت عجیب روبه‌رو می‌شیم: یه حقیقت یا اطلاعات جدید رو به مدل یاد می‌دید، مدل هم بدون مشکل همون رو به خاطر میاره، اما وقتی ازش می‌خواید با همون اطلاعات استدلال کنه، عملکردش ضعیفه. باید گفت که Recall کردن یه اطلاعات و Reasoning کردن با اون، دو مهارت کاملاً متفاوت هستن. مدل معمولاً بعد از فقط یکی دو Epoch اطلاعات جدید رو حفظ می‌کنه، اما توانایی استفاده از اون اطلاعات در Reasoning حدود ۴ تا ۵ Epoch بعد ظاهر می‌شه و حتی اون موقع هم ضعیف‌تره. نویسنده‌های مقاله به این اختلاف می‌گن Knowing-Using Gap. دلیلش به محل ذخیره شدن اطلاعات برمی‌گرده. Fine-tuning اطلاعات جدید رو توی Layerهای ابتدایی و انتهایی مدل ثبت می‌کنه، بنابراین مدل می‌تونه اون‌ها رو مستقیماً Recall کنه. اما Multi-step Reasoning عمدتاً در Layerهای میانی انجام می‌شه و این اطلاعات هیچ‌وقت به اون بخش‌ها نمی‌رسه. برای اثبات این موضوع، پژوهشگرها Internal Representation مربوط به اون اطلاعات رو از یکی از Layerهای ابتدایی یا انتهایی برداشتن و به یکی از Layerهای میانی منتقل کردن. نتیجه این بود که Reasoning ناگهان درست عمل کرد. یعنی اطلاعات از اول داخل مدل وجود داشت، فقط جای اشتباهی ذخیره شده بود. جالبه که فقط با جابه‌جا کردن اطلاعات بین یه جفت Layer ثابت، بدون اینکه برای هر نمونه به‌صورت جداگانه جست‌وجو انجام بشه، تونستن بین ۵۸ تا ۷۵ درصد از بیشترین بهبودی ممکن رو به دست بیارن. یعنی محدودیت اصلی نه اندازه‌ی مدل هست و نه مدت زمان آموزش؛ بلکه اینه که اطلاعات دقیقاً کجای مدل قرار می‌گیره. البته باید توجه داشت که این روش یه Diagnostic هست، نه یه روش آموزشی جدید. در این تکنیک که بهش Self-patching گفته می‌شه، بعد از پایان آموزش، Representation اطلاعات به یه موقعیت ثابت منتقل می‌شه. بنابراین اون بهبود ۵۸ تا ۷۵ درصدی فقط یه Upper Bound از چیزی رو نشون می‌ده که احتمالاً با یه مداخله‌ی تمیز و اصولی قابل دستیابی باشه. ضمن اینکه آزمایش‌های این مقاله فقط روی اطلاعات Knowledge Graph در حوزه‌های Biomedicine و Academia انجام شده. نتایج این مقاله در کنار مقاله‌ی Allen-Zhu و Li با عنوان "Physics of Language Models" تصویر جالبی می‌سازه. اون مقاله هم نشون داده بود که LLMها اطلاعات زیادی رو داخل خودشون ذخیره می‌کنن، اما بدون Chain-of-Thought Reasoning در استفاده‌ی مؤثر از اون اطلاعات با مشکل مواجه می‌شن. 🔗 لینک مقاله 👑 توضیحات در مورد دوره منتورینگ 🏆 نحوه ثبت‌نام در دوره منتورینگ 🤝 تجارب موفق قبلی بچه‌ها از منتورینگ 🛠 راه‌ ارتباطی مشاوره تخصصی کسب‌وکار در زمینه دیتا و هوش مصنوعی @reza_jafari_ai
2.1K ·

Вся лента

Каталог площадок Искать в ChatCrawler

A snapshot of an open public feed from the search index ChatCrawler — “Google for public Telegram”; refreshed as the venue is crawled. Times are UTC.

Public content only, official Telegram API. About · FAQ · What we do not do · Remove a page · Catalog