eitaa logo
آموزش پایتون
62 دنبال‌کننده
244 عکس
106 ویدیو
52 فایل
ارتباط: https://eitaa.com/joinchat/956171922Cb501d5a32f لینک همین کانال: @LearnPythonIcy لینک کانال تلگرام: https://t.me/learnpythonicy
مشاهده در ایتا
دانلود
🔥Five AI articles that you really have to read! پنج مقاله AI که واقعاً در ۲۰۲۵ باید بخوانی! از کشف علمی مستقل تا ژنتیک و الگوریتم‌های مولد پیشرفته ✔️ اگر دنبال پیشرفت‌های واقعی در AI هستی، این اسلایدها رو از دست نده! ✔️ هر مقاله دیدی به مسیر آینده‌ی AI اشاره می‌کنه — از تحقیق تا مهندسی. لینک دانلود مقالات: 1: https://arxiv.org/abs/2503.08979 2: https://arxiv.org/abs/2408.06292 3: https://arxiv.org/abs/2506.13131 4: https://www.biorxiv.org/content/10.1101/2025.06.25.661532v1 5: https://arxiv.org/abs/2506.17298 @learnpythonicy
🧠 GRPO — The Next Step After PPO? همه با PPO آشنا هستیم (Policy Optimization برای RLHF)، اما OpenAI اخیراً از GRPO استفاده کرده – و این می‌تونه آینده آموزش مدل‌های زبان باشه. ✅ چی هست؟ GRPO = Group Relative Policy Optimization به جای مقایسه یک پاسخ با یک پاسخ مرجع، مدل چند پاسخ تولید می‌کنه، همه رو با هم مقایسه می‌کنه، و فقط بهترین‌ها رو تقویت می‌کنه. 🎯 چرا مهمه؟ بهینه‌تر از PPO برای یادگیری از بازخورد انسانی می‌تونه تنوع پاسخ‌ها رو افزایش بده پایدارتر در مقایسه با روش‌های قبلی ⚙️ به زبان ساده: به جای اینکه مدل رو مجبور کنیم فقط یک پاسخ خوب رو تقلید کنه، بهش یاد می‌دیم چند تا پاسخ مختلف بسازه و بعد از مقایسه بین خودش، راه بهینه رو انتخاب کنه. 💭 سوال برای شما: آیا فکر می‌کنید GRPO می‌تونه جایگزین PPO بشه برای RLHF در آینده؟ یا هر دو در کنار هم باقی می‌مونن؟