Algorithm design & data structureچ
Photo
click to show
click to show
Photo
click to show
click to show
𝐑𝐞𝐢𝐧𝐟𝐨𝐫𝐜𝐞𝐦𝐞𝐧𝐭 𝐋𝐞𝐚𝐫𝐧𝐢𝐧𝐠 𝐟𝐫𝐨𝐦 𝐇𝐮𝐦𝐚𝐧 𝐅𝐞𝐞𝐝𝐛𝐚𝐜𝐤 (𝐬𝐡𝐨𝐫𝐭 𝐛𝐨𝐨𝐤)
🚀 مقدمهای کوتاه و کاربردی درباره RLHF و فرایند Post-Training در مدلهای زبانی
اگر میخواید بدانید مدلهای زبانی مثل ChatGPT چطور «رفتار»، «شخصیت» و «قواعد پاسخدهی» پیدا میکنند، این ساختار یکی از بهترین مسیرهای یادگیریه.
https://rlhfbook.com/
#هوش_مصنوعی
📣👨💻 @AlgorithmDesign_DataStructue
43 · 2.3K ·