رفتن به محتوای اصلی
کهن‌دژکتاب مرجع هوش مصنوعی
منابعاعتبارسنجی

مفاهیم، ۲۰۵ مورد · حمله

مفاهیم کتاب

موجودیت‌های استخراج‌شده از منابع و تدوین، با ارجاع به بخش‌های کتاب.

فهرست مفاهیم

حمله

حملهٔ Sign-OPT

Sign-OPT Attack

۱ ارجاع
حمله

حملات خصمانهٔ جعبه‌سفید

White-box Adversarial Attack

۱ ارجاع
حمله

حمله Obfuscated Gradients

Obfuscated Gradients Attack

۱ ارجاع
حمله

تقریب تفکیک‌پذیر گذر رو به عقب

Backward Pass Differentiable Approximation

۱ ارجاع
حمله

حملات سازگارشونده

Adaptive Attacks

۱ ارجاع
حمله

حملهٔ مسموم‌سازی هدفمند

Targeted Poisoning Attack

۴ ارجاع
حمله

وارون‌سازی برچسب

Label-Flipping

۱ ارجاع
حمله

StingRay

StingRay

۱ ارجاع
حمله

بهینه‌سازی مبتنی بر برخورد ویژگی‌ها

Feature Collision Optimization

۱ ارجاع
حمله

ConvexPolytope

ConvexPolytope

۱ ارجاع
حمله

BullseyePolytope

BullseyePolytope

۱ ارجاع
حمله

MetaPoison

MetaPoison

۱ ارجاع
حمله

حملات مسموم‌سازی زیرجمعیت

Subpopulation Poisoning Attack

۱ ارجاع
حمله

حملات دسترس‌پذیری

Availability Attacks

۱ ارجاع
حمله

BadNets

BadNets

۱ ارجاع
حمله

حملهٔ درِ پشتی با برچسب پاک

Clean-label backdoor attack

۱ ارجاع
حمله

حملهٔ درِ پشتی نهفته

Latent backdoor attack

۱ ارجاع
حمله

Backdoor Generating Network (BaN)

Backdoor Generating Network (BaN)

۱ ارجاع
حمله

حملهٔ کارکردی

Functional attack

۲ ارجاع
حمله

Jigsaw Puzzle

Jigsaw Puzzle

۱ ارجاع
حمله

حملهٔ بازسازی داده

Data Reconstruction Attack

۲ ارجاع
حمله

حملهٔ استنتاج عضویت

Membership-Inference Attack

۳ ارجاع
حمله

حملهٔ استنتاج ویژگی

Property Inference Attack

۲ ارجاع
حمله

حملهٔ استخراج مدل

Model Extraction Attack

۳ ارجاع
حمله

حمله وارون‌سازی مدل

Model Inversion Attack

۱ ارجاع
حمله

استنتاج ویژگی

Attribute Inference

۲ ارجاع
حمله

استنتاج توزیع

Distribution Inference

۱ ارجاع
حمله

استخراج مستقیم

Direct Extraction

۱ ارجاع
حمله

کانال‌های جانبی الکترومغناطیسی

Electromagnetic Side Channels

۱ ارجاع
حمله

حمله ROWHAMMER

Rowhammer Attack

۱ ارجاع
حمله

حملات بازسازی

Reconstruction Attack

۱ ارجاع
حمله

مسموم‌سازی مدل

Model Poisoning

۵ ارجاع
حمله

امکان‌سازی سوءاستفاده

Misuse Enablement

۳ ارجاع
حمله

دور زدن محدودیت‌های مدل

Jailbreak

۲ ارجاع
حمله

حملهٔ درخواست‌دهی مستقیم

Direct Prompting Attack

۲ ارجاع
حمله

خرابی دسترس‌پذیری

Availability Breakdown Attack

۱ ارجاع
حمله

نقض یکپارچگی

Integrity Violation Attack

۱ ارجاع
حمله

به خطر افتادن حریم خصوصی

Privacy Compromise Attack

۱ ارجاع
حمله

تزریق دستور غیرمستقیم

Indirect Prompt Injection

۵ ارجاع
حمله

استخراج دستور

Prompt Extraction

۲ ارجاع
حمله

دور زدن از طریق تنظیم دقیق

Fine-Tuning Circumvention

۲ ارجاع
حمله

حمله مسموم‌سازی داده

Data Poisoning Attack

۱ ارجاع
حمله

حملات مسموم‌سازی مدل

Model Poisoning Attacks

۱ ارجاع
حمله

مسموم‌سازی در GenAI

GenAI poisoning

۱ ارجاع
حمله

ربایش دامنه

Domain hijacking

۱ ارجاع
حمله

حملات مبتنی بر بهینه‌سازی

Optimization-based Attack

۱ ارجاع
حمله

محرک‌های خصمانهٔ جهانی

Universal Adversarial Triggers

۱ ارجاع
حمله

روش‌های دستی برای دور زدن محدودیت‌های مدل

Manual Jailbreaking

۱ ارجاع
حمله

حملات مبتنی بر اهداف رقیب

Competing Objectives Attack

۱ ارجاع
حمله

حملات مبتنی بر تعمیم ناهمخوان

Mismatched Generalization Attack

۱ ارجاع
حمله

تزریق پیشوند

Prefix Injection

۱ ارجاع
حمله

سرکوب امتناع

Refusal Suppression

۱ ارجاع
حمله

تزریق سبک

Style Injection

۱ ارجاع
حمله

بازی نقشی

Role-play Attack

۱ ارجاع
حمله

رمزگذاری ویژه

Special Encoding

۱ ارجاع
حمله

تبدیل نویسه

Character Transformation

۱ ارجاع
حمله

تبدیل واژه

Word Transformation

۱ ارجاع
حمله

تبدیل در سطح دستور

Prompt-level Transformation

۱ ارجاع
حمله

حمله Crescendo

Crescendo Attack

۱ ارجاع
حمله

استخراج داده‌های آموزشی

Training Data Extraction

۲ ارجاع