🔺خروجی کد بالا چیست؟
- گزینهها:
- A) [1] [2]
- B) [1] [1, 2]
- C) [1, 2] [1, 2]
- D) خطا
#تست_تایم
🧠 GRPO — The Next Step After PPO?
همه با PPO آشنا هستیم (Policy Optimization برای RLHF)،
اما OpenAI اخیراً از GRPO استفاده کرده – و این میتونه آینده آموزش مدلهای زبان باشه.
✅ چی هست؟
GRPO = Group Relative Policy Optimization
به جای مقایسه یک پاسخ با یک پاسخ مرجع، مدل چند پاسخ تولید میکنه،
همه رو با هم مقایسه میکنه، و فقط بهترینها رو تقویت میکنه.
🎯 چرا مهمه؟
بهینهتر از PPO برای یادگیری از بازخورد انسانی
میتونه تنوع پاسخها رو افزایش بده
پایدارتر در مقایسه با روشهای قبلی
⚙️ به زبان ساده:
به جای اینکه مدل رو مجبور کنیم فقط یک پاسخ خوب رو تقلید کنه،
بهش یاد میدیم چند تا پاسخ مختلف بسازه و بعد از مقایسه بین خودش،
راه بهینه رو انتخاب کنه.
💭 سوال برای شما:
آیا فکر میکنید GRPO میتونه جایگزین PPO بشه برای RLHF در آینده؟
یا هر دو در کنار هم باقی میمونن؟
#AI #RLHF #ReinforcementLearning #MachineLearning #GRPO #PPO #LLM
میدونی باگهای امنیتی چیاااااان؟؟
فرض کن خونهات یه سری در و پنجره داره. باگ امنیتی هم همون جاهایی هست که قفلش خرابه یا اصلاً قفل نداره. دزد میتونه از همونجا راحت وارد خونه بشه.
۱. باگ تزریق (Injection)
مثال: یه فرم تماس داریم که کاربر اسمش رو تایپ میکنه. یه آدم خرابکار به جای اسم، یه دستور مخرب مینویسه. مثلاً:
;DROP TABLE Users --
سیستم هم چون حرفش رو بدون چک کردن میپذیره، میره کل جدول کاربران رو پاک میکنه! مثل این میمونه که دزد یه کلید جعلی داشته باشه که به همه قفلها میخوره.
۲. احراز هویت نشده (Broken Authentication)
مثال: یه سایت، پسورد رو ضعیف ذخیره میکنه (مثلاً بدون رمزنگاری). دزد میاد دیتابیس رو میدزده و همه پسوردها رو میبینه. مثل اینه که کلید خونه رو زیر گلدون بذاری و دزد پیداش کنه.
۳. مدیریت نشدهٔ Session
مثال: وقتی لاگین میکنی، یه کوکی میگیری. اگر این کوکی به درستی باطن نشه، حتی بعد از خروج از حساب، دزد میتونه با همون کوکی وارد حساب تو بشه. مثل اینه که تو هتل کارت کلید رو پس ندی و یه نفر دیگه ازش استفاده کنه.
۴. XSS (Cross-Site Scripting)
مثال: توی یه سایت نظر میذاری. یه کاربر مخرب توی نظرش یه کد JavaScript مخرب مینویسه. وقتی مدیر سایت نظرات رو میبینه، اون کد اجرا میشه و اطلاعات مدیر دزدیده میشه. مثل اینه که یه نفر یه دستگاه استراق سمع توی اتاق بذاره.
۵. آدرسهای حساس در دسترس
مثال: آدرس site.com/admin برای همه قابل دسترسه. دزد میتونه حدس بزنه و وارد بخش ادمین بشه. مثل اینه که در پشتی خونه قفل نداشته باشه.
⚪️ چیکار کنیم؟
· ورودی کاربر رو چک کن (همه رو فرض کن خرابکارن!).
· پسوردها رو قوی رمزنگاری کن.
· بعد از خروج، Session رو پاک کن.
· دسترسیها رو محدود کن.
#باگ_امنیتی
📰 اخبار جعلی سریعتر از حقیقت پخش میشوند — اما هوش مصنوعی میتواند جلوی آن را بگیرد.
امروز درباره BERT صحبت میکنم؛ یکی از قویترین مدلهای ترنسفورمر که میتواند برای تشخیص خبر جعلی استفاده شود.
🧠 BERT معنی کلمات را در زمینه جمله میفهمد.
مثال:
“The bat flew out of the cave.” → 🦇 (یعنی خفاش، نه چوب بیسبال ⚾️)
همین توانایی باعث میشود بعد از آموزش روی اخبار واقعی و جعلی بتواند به ما بگوید:
✅ واقعی یا ❌ جعلی.
💡 سوال:
شما تا حالا از مدلهای NLP برای تشخیص اخبار جعلی استفاده کردهاید؟
کدام مدل برایتان بهترین نتیجه را داده؟
#AI #MachineLearning #BERT #FakeNewsDetection #NLP #DeepLearning #Transformers