eitaa logo
آموزش پایتون
63 دنبال‌کننده
244 عکس
106 ویدیو
52 فایل
ارتباط: https://eitaa.com/joinchat/956171922Cb501d5a32f لینک همین کانال: @LearnPythonIcy لینک کانال تلگرام: https://t.me/learnpythonicy
مشاهده در ایتا
دانلود
🧠 GRPO — The Next Step After PPO? همه با PPO آشنا هستیم (Policy Optimization برای RLHF)، اما OpenAI اخیراً از GRPO استفاده کرده – و این می‌تونه آینده آموزش مدل‌های زبان باشه. ✅ چی هست؟ GRPO = Group Relative Policy Optimization به جای مقایسه یک پاسخ با یک پاسخ مرجع، مدل چند پاسخ تولید می‌کنه، همه رو با هم مقایسه می‌کنه، و فقط بهترین‌ها رو تقویت می‌کنه. 🎯 چرا مهمه؟ بهینه‌تر از PPO برای یادگیری از بازخورد انسانی می‌تونه تنوع پاسخ‌ها رو افزایش بده پایدارتر در مقایسه با روش‌های قبلی ⚙️ به زبان ساده: به جای اینکه مدل رو مجبور کنیم فقط یک پاسخ خوب رو تقلید کنه، بهش یاد می‌دیم چند تا پاسخ مختلف بسازه و بعد از مقایسه بین خودش، راه بهینه رو انتخاب کنه. 💭 سوال برای شما: آیا فکر می‌کنید GRPO می‌تونه جایگزین PPO بشه برای RLHF در آینده؟ یا هر دو در کنار هم باقی می‌مونن؟