eitaa logo
آموزش پایتون
63 دنبال‌کننده
244 عکس
106 ویدیو
52 فایل
ارتباط: https://eitaa.com/joinchat/956171922Cb501d5a32f لینک همین کانال: @LearnPythonIcy لینک کانال تلگرام: https://t.me/learnpythonicy
مشاهده در ایتا
دانلود
🧠 GRPO — The Next Step After PPO? همه با PPO آشنا هستیم (Policy Optimization برای RLHF)، اما OpenAI اخیراً از GRPO استفاده کرده – و این می‌تونه آینده آموزش مدل‌های زبان باشه. ✅ چی هست؟ GRPO = Group Relative Policy Optimization به جای مقایسه یک پاسخ با یک پاسخ مرجع، مدل چند پاسخ تولید می‌کنه، همه رو با هم مقایسه می‌کنه، و فقط بهترین‌ها رو تقویت می‌کنه. 🎯 چرا مهمه؟ بهینه‌تر از PPO برای یادگیری از بازخورد انسانی می‌تونه تنوع پاسخ‌ها رو افزایش بده پایدارتر در مقایسه با روش‌های قبلی ⚙️ به زبان ساده: به جای اینکه مدل رو مجبور کنیم فقط یک پاسخ خوب رو تقلید کنه، بهش یاد می‌دیم چند تا پاسخ مختلف بسازه و بعد از مقایسه بین خودش، راه بهینه رو انتخاب کنه. 💭 سوال برای شما: آیا فکر می‌کنید GRPO می‌تونه جایگزین PPO بشه برای RLHF در آینده؟ یا هر دو در کنار هم باقی می‌مونن؟
میدونی باگ‌های امنیتی چیاااااان؟؟ فرض کن خونه‌ات یه سری در و پنجره داره. باگ امنیتی هم همون جاهایی هست که قفلش خرابه یا اصلاً قفل نداره. دزد میتونه از همونجا راحت وارد خونه بشه. ۱. باگ تزریق (Injection) مثال: یه فرم تماس داریم که کاربر اسمش رو تایپ میکنه. یه آدم خرابکار به جای اسم، یه دستور مخرب مینویسه. مثلاً: ;DROP TABLE Users -- سیستم هم چون حرفش رو بدون چک کردن میپذیره، میره کل جدول کاربران رو پاک میکنه! مثل این میمونه که دزد یه کلید جعلی داشته باشه که به همه قفل‌ها میخوره. ۲. احراز هویت نشده (Broken Authentication) مثال: یه سایت، پسورد رو ضعیف ذخیره میکنه (مثلاً بدون رمزنگاری). دزد میاد دیتابیس رو میدزده و همه پسوردها رو میبینه. مثل اینه که کلید خونه رو زیر گلدون بذاری و دزد پیداش کنه. ۳. مدیریت نشدهٔ Session مثال: وقتی لاگین میکنی، یه کوکی میگیری. اگر این کوکی به درستی باطن نشه، حتی بعد از خروج از حساب، دزد میتونه با همون کوکی وارد حساب تو بشه. مثل اینه که تو هتل کارت کلید رو پس ندی و یه نفر دیگه ازش استفاده کنه. ۴. XSS (Cross-Site Scripting) مثال: توی یه سایت نظر میذاری. یه کاربر مخرب توی نظرش یه کد JavaScript مخرب مینویسه. وقتی مدیر سایت نظرات رو میبینه، اون کد اجرا میشه و اطلاعات مدیر دزدیده میشه. مثل اینه که یه نفر یه دستگاه استراق سمع توی اتاق بذاره. ۵. آدرس‌های حساس در دسترس مثال: آدرس site.com/admin برای همه قابل دسترسه. دزد میتونه حدس بزنه و وارد بخش ادمین بشه. مثل اینه که در پشتی خونه قفل نداشته باشه. ⚪️ چیکار کنیم؟ · ورودی کاربر رو چک کن (همه رو فرض کن خرابکارن!). · پسوردها رو قوی رمزنگاری کن. · بعد از خروج، Session رو پاک کن. · دسترسیها رو محدود کن.
📰 اخبار جعلی سریع‌تر از حقیقت پخش می‌شوند — اما هوش مصنوعی می‌تواند جلوی آن را بگیرد. امروز درباره BERT صحبت می‌کنم؛ یکی از قوی‌ترین مدل‌های ترنسفورمر که می‌تواند برای تشخیص خبر جعلی استفاده شود. 🧠 BERT معنی کلمات را در زمینه جمله می‌فهمد. مثال: “The bat flew out of the cave.” → 🦇 (یعنی خفاش، نه چوب بیسبال ⚾️) همین توانایی باعث می‌شود بعد از آموزش روی اخبار واقعی و جعلی بتواند به ما بگوید: ✅ واقعی یا ❌ جعلی. 💡 سوال: شما تا حالا از مدل‌های NLP برای تشخیص اخبار جعلی استفاده کرده‌اید؟ کدام مدل برایتان بهترین نتیجه را داده؟