مفاهیم، ۲۰۵ مورد · حمله
مفاهیم کتاب
موجودیتهای استخراجشده از منابع و تدوین، با ارجاع به بخشهای کتاب.
فهرست مفاهیم
حملهٔ Sign-OPT
Sign-OPT Attack
حملات خصمانهٔ جعبهسفید
White-box Adversarial Attack
حمله Obfuscated Gradients
Obfuscated Gradients Attack
تقریب تفکیکپذیر گذر رو به عقب
Backward Pass Differentiable Approximation
حملات سازگارشونده
Adaptive Attacks
حملهٔ مسمومسازی هدفمند
Targeted Poisoning Attack
وارونسازی برچسب
Label-Flipping
StingRay
StingRay
بهینهسازی مبتنی بر برخورد ویژگیها
Feature Collision Optimization
ConvexPolytope
ConvexPolytope
BullseyePolytope
BullseyePolytope
MetaPoison
MetaPoison
حملات مسمومسازی زیرجمعیت
Subpopulation Poisoning Attack
حملات دسترسپذیری
Availability Attacks
BadNets
BadNets
حملهٔ درِ پشتی با برچسب پاک
Clean-label backdoor attack
حملهٔ درِ پشتی نهفته
Latent backdoor attack
Backdoor Generating Network (BaN)
Backdoor Generating Network (BaN)
حملهٔ کارکردی
Functional attack
Jigsaw Puzzle
Jigsaw Puzzle
حملهٔ بازسازی داده
Data Reconstruction Attack
حملهٔ استنتاج عضویت
Membership-Inference Attack
حملهٔ استنتاج ویژگی
Property Inference Attack
حملهٔ استخراج مدل
Model Extraction Attack
حمله وارونسازی مدل
Model Inversion Attack
استنتاج ویژگی
Attribute Inference
استنتاج توزیع
Distribution Inference
استخراج مستقیم
Direct Extraction
کانالهای جانبی الکترومغناطیسی
Electromagnetic Side Channels
حمله ROWHAMMER
Rowhammer Attack
حملات بازسازی
Reconstruction Attack
مسمومسازی مدل
Model Poisoning
امکانسازی سوءاستفاده
Misuse Enablement
دور زدن محدودیتهای مدل
Jailbreak
حملهٔ درخواستدهی مستقیم
Direct Prompting Attack
خرابی دسترسپذیری
Availability Breakdown Attack
نقض یکپارچگی
Integrity Violation Attack
به خطر افتادن حریم خصوصی
Privacy Compromise Attack
تزریق دستور غیرمستقیم
Indirect Prompt Injection
استخراج دستور
Prompt Extraction
دور زدن از طریق تنظیم دقیق
Fine-Tuning Circumvention
حمله مسمومسازی داده
Data Poisoning Attack
حملات مسمومسازی مدل
Model Poisoning Attacks
مسمومسازی در GenAI
GenAI poisoning
ربایش دامنه
Domain hijacking
حملات مبتنی بر بهینهسازی
Optimization-based Attack
محرکهای خصمانهٔ جهانی
Universal Adversarial Triggers
روشهای دستی برای دور زدن محدودیتهای مدل
Manual Jailbreaking
حملات مبتنی بر اهداف رقیب
Competing Objectives Attack
حملات مبتنی بر تعمیم ناهمخوان
Mismatched Generalization Attack
تزریق پیشوند
Prefix Injection
سرکوب امتناع
Refusal Suppression
تزریق سبک
Style Injection
بازی نقشی
Role-play Attack
رمزگذاری ویژه
Special Encoding
تبدیل نویسه
Character Transformation
تبدیل واژه
Word Transformation
تبدیل در سطح دستور
Prompt-level Transformation
حمله Crescendo
Crescendo Attack
استخراج دادههای آموزشی
Training Data Extraction