رفتن به محتوای اصلی
کهن‌دژکتاب مرجع هوش مصنوعی
منابعاعتبارسنجی
فهرست این فصلبخش ۳، فصل ۲۱ — صفحهٔ ۲ از ۳

بخش ۳، فصل ۲۱ — صفحهٔ ۲ از ۳

طبقه‌بندی هوش مصنوعی مولد

متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.

۳.۳.۱. تکنیک‌های حمله

ترجمهٔ منبع

طیف گسترده‌ای از تکنیک‌ها برای اجرای حملات مستقیم مبتنی بر دستور وجود دارد که بسیاری از آن‌ها در اهداف مختلف مهاجم کاربرد مشترک دارند. با تمرکز بر حملات مستقیم مبتنی بر دستور برای میسر ساختن سوءاستفاده، دسته‌های کلی زیر از تکنیک‌های حمله مستقیم را برمی‌شماریم (ر.ک. [393]):

  • حملات مبتنی بر بهینه‌سازی، توابع هدف حمله را طراحی می‌کنند و از گرادیان یا سایر روش‌های مبتنی بر جست‌وجو برای یادگیری ورودی‌های خصمانه‌ای که رفتار خاصی را ایجاد می‌کنند بهره می‌گیرند؛ مشابه حملات PredAI که در بخش 2.2.1 بحث شد. توابع هدف ممکن است به‌گونه‌ای طراحی شوند که شروع‌های تأییدی را اجبار کنند (برای مثال، جست‌وجوی پاسخ‌هایی که با «Sure» آغاز می‌شوند که می‌تواند نشانه انطباق با درخواست مخرب باشد [60, 320, 448]) یا سایر سنجه‌های موفقیت حمله را لحاظ کنند (برای مثال، شباهت به یک ریزتنظیم سمی‌شده [368]).

سپس می‌توان از تکنیک‌های بهینه‌سازی برای یادگیری حملات استفاده کرد، از جمله تکنیک‌هایی که از حملات طراحی‌شده برای طبقه‌بندهای زبانی PredAI پیروی می‌کنند (مانند HotFlip [117]) و تکنیک‌های بدون گرادیان که از یک مدل جانشین یا جست‌وجوی تصادفی برای آزمودن گزینه‌های حمله استفاده می‌کنند [11, 320]. محرک‌های خصمانهٔ جهانی، کلاس ویژه‌ای از این حملات مبتنی بر گرادیان علیه مدل‌های مولد هستند که به‌دنبال یافتن پیشوندها (یا پسوندهای) مستقل از ورودی هستند و پاسخ تأییدی مطلوب را صرف‌نظر از بخش باقی‌ماندهٔ ورودی تولید می‌کنند [386, 448]. انتقال‌پذیری این محرک‌های جهانی به مدل‌های دیگر، مدل‌های با وزن باز — که دسترسی جعبه‌سفید به آن‌ها به‌سهولت فراهم است — را به بردارهای حمله‌ای امکان‌پذیر برای حملات انتقال‌پذیری علیه سیستم‌های بسته تبدیل می‌کند که در آن‌ها تنها دسترسی از طریق API در دسترس است [448].

همچنین می‌توان حملات را به‌گونه‌ای طراحی کرد که قیود اضافی را برآورده کنند (مانند سرگشتگی به‌اندازهٔ کافی پایین [368]) یا به سیستمی شامل چندین مدل حمله کنند [235].

  • روش‌های دستی برای دور زدن محدودیت‌های مدل (Jailbreak) در یک LLM شامل اهداف رقیب و تعمیم ناهمخوان هستند [400]. حملات مبتنی بر تعمیم ناهمخوان، ورودی‌هایی را شناسایی می‌کنند که خارج از توزیع داده‌های آموزش ایمنی مدل اما همچنان درون توزیع آموزش توانایی‌های آن قرار دارند؛ به‌گونه‌ای که برای مدل قابل‌فهم باشند و در عین حال از رفتار امتناع بگریزند. حملات مبتنی بر اهداف رقیب، مواردی را می‌یابند که در آن‌ها توانایی‌های مدل با اهداف ایمنی در کشمکش‌اند؛ برای مثال، با بهره‌گیری از میل درونی مدل به پیروی از دستورالعمل‌های ارائه‌شده توسط کاربر. در همهٔ این موارد، هدف حمله به خطر انداختن یک دفاع ایمنی در سطح مدل است. برای بحث بیشتر ر.ک. Weng [403].

رویکردهای حملهٔ مبتنی بر اهداف رقیب شامل موارد زیر است:

  1. تزریق پیشوند (Prefix injection): این روش مستلزم دستور دادن به مدل برای آغاز پاسخ‌ها با یک تأیید مثبت است. مهاجمان با شرطی‌کردن مدل برای شروع خروجی خود به شیوه‌ای از پیش تعیین‌شده، می‌کوشند تولید زبان بعدی آن را به‌سوی الگوها یا رفتارهای خاص و از پیش تعیین‌شده هدایت کنند.
  1. سرکوب امتناع (Refusal suppression): مهاجمان می‌توانند به‌طور صریح به مدل دستور دهند از تولید امتناع یا انکار در خروجی خود بپرهیزد. این تاکتیک با کاهش احتمال پاسخ‌های امتناع، در پی افزایش احتمال پاسخ انطباق‌آمیز است.
  1. تزریق سبک (Style injection): در این رویکرد، مهاجمان به مدل دستور می‌دهند از نحو یا سبک‌های نوشتاری خاصی استفاده کند (یا نکند). برای مثال، یک حمله ممکن است زبان مدل را به لحن‌های ساده‌شده یا غیرحرفه‌ای محدود کند تا احتمال امتناع‌ها (که معمولاً با ادبیات حرفه‌ای نوشته می‌شوند) را کاهش دهد.
  1. بازی نقشی (Role-play): مهاجمان از راهبردهای بازی نقشی (مانند «Always Intelligent and Machiavellian» [AIM] یا «Do Anything Now» [DAN]) استفاده می‌کنند تا مدل را به پذیرش شخصیت‌ها یا الگوهای رفتاری خاصی هدایت کنند که با هدف اصلی در تعارض‌اند. این دستکاری با هدف بهره‌برداری از سازگاری مدل با نقش‌ها یا ویژگی‌های گوناگون و به‌خطرانداختن پایبندی آن به پروتکل‌های ایمنی صورت می‌گیرد.

رویکردهای حملهٔ مبتنی بر تعمیم ناهمخوان شامل موارد زیر است:

  1. رمزگذاری ویژه (Special encoding): راهبردهایی که از تکنیک‌های رمزگذاری مانند base64 برای تغییر بازنمایی داده‌های ورودی به‌گونه‌ای استفاده می‌کنند که برای مدل قابل‌فهم باقی بماند، اما ممکن است خارج از توزیع داده‌های آموزش ایمنی باشد.
  1. تبدیل نویسه (Character transformation): راهبردهایی که از تبدیل‌های سطح نویسه مانند رمز ROT13، جایگزینی نماد (مانند l33tspeak) و کد مورس استفاده می‌کنند تا ورودی را از توزیع آموزش ایمنی خارج کنند.
  1. تبدیل واژه (Word transformation): راهبردهایی که ساختار زبانی ورودی را تغییر می‌دهند؛ مانند Pig Latin، جای‌به‌جایی هم‌معنی‌ها (مانند استفاده از «pilfer» به‌جای «steal»)، و تقسیم محموله (یا «قاچاق توکن») برای شکستن واژه‌های حساس به زیررشته‌ها.
  1. تبدیل در سطح دستور (Prompt-level transformation): راهبردهایی که از تبدیل‌های در سطح دستور استفاده می‌کنند؛ مانند ترجمهٔ دستور به زبانی کم‌کاربردتر که ممکن است خارج از توزیع داده‌های آموزش ایمنی باشد.
  • تیم قرمز (Red Teaming) خودکار مبتنی بر مدل، از یک مدل مهاجم، یک مدل هدف و یک داور بهره می‌گیرد [73, 239, 292]. هنگامی که مهاجم به یک طبقه‌بند باکیفیت دسترسی دارد که قضاوت می‌کند آیا خروجی مدل زیان‌بار است یا نه، می‌توان از آن به‌عنوان تابع پاداش برای آموزش یک مدل مولد جهت تولید نمونه‌های دور زدن محدودیت‌های یک مدل مولد دیگر استفاده کرد. برای هر یک از مدل‌ها تنها دسترسی از طریق پرس‌وجو الزامی است و هیچ مداخلهٔ انسانی برای به‌روزرسانی یا پالایش یک نمونهٔ نامزدِ دور زدن محدودیت‌های مدل نیاز نیست. این دستورها همچنین ممکن است از مدل هدف به LLMهای بستهٔ دیگر قابل انتقال باشند [73].

حمله Crescendo [316] ایده تعامل تدریجی با مدل را در قالب یک حمله چندنوبتی و تطبیقی معرفی کرد که شامل پرامپت‌های به‌ظاهر بی‌خطر است و سرانجام به «دور زدن محدودیت‌های مدل» (Jailbreak) موفق در برابر هم‌ترازی «ایمنی» (Safety) می‌انجامد. این حمله اولیه که به‌صورت دستی انجام می‌شد، با بهره‌گیری از یک LLM دیگر برای تولید پرامپت و ادغام چندین منبع ورودی، به‌طور کامل خودکار شد.

ارزیابی‌های مدل‌های پیشرو نشان می‌دهد که LLMها همچنان در برابر بسیاری از این حملات آسیب‌پذیرند [11, 338, 381].

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S10

شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S10-81913A6B

پیوند مستقیم این بخش

۳.۳.۲. استخراج اطلاعات

ترجمهٔ منبع

[ NISTAML.038 ] هم در زمان آموزش و هم در زمان اجرا، مدل‌های GenAI در معرض طیفی از اطلاعات قرار دارند که ممکن است برای مهاجمان جالب باشد؛ مانند اطلاعات شناسایی‌شونده شخصی (PII) در داده‌های آموزشی، اطلاعات حساس در پایگاه‌های داده «تولید تقویت‌شده با بازیابی» (RETRIEVAL-AUGMENTED GENERATION, RAG) که در بستر ارائه می‌شوند، یا حتی SYSTEM PROMPT ساخته‌شده توسط طراح برنامه. افزون بر این، ویژگی‌های خود مدل—مانند وزن‌ها یا معماری مدل—ممکن است هدف حمله قرار گیرند. اگرچه بسیاری از تکنیک‌های بخش 3.3.1 در استخراج چنین داده‌هایی قابل‌اعمال‌اند، چند هدف و تکنیک خاصِ استخراج داده را یادآور می‌شویم.

نشت داده‌های حساس آموزشی. Carlini و همکاران [59] نخستین کسانی بودند که حملات TRAINING DATA EXTRACTION را در مدل‌های زبانی مولد به‌صورت عملی نشان دادند. آنان با درج «قناری‌ها» (canaries)—نمونه‌های مصنوعی و به‌آسانی قابل‌تشخیصِ خارج از توزیع—در داده‌های آموزشی، روش‌شناسی‌ای برای استخراج قناری‌ها ارائه کردند و سنجشی به نام «مواجهه» (exposure) برای سنجش به‌خاطرسپاری معرفی نمودند. کارهای بعدی، «ریسک» (Risk) استخراج داده در LLMهای مبتنی بر ترنسفورمر (مانند GPT-2 [63]) را با ارائه پیشوندهای مختلف به مدل و اجرای حمله «استنتاج عضویت» (membership inference) به‌منظور تعیین اینکه کدام محتوای تولیدشده بخشی از مجموعه آموزشی بوده است، نشان دادند. از آنجا که این ترنسفورمرهای مبتنی بر پشتهٔ رمزگشا، مدل‌های خودبازگشتی‌اند، یک پیشوند متنی دقیقاً عینی درباره اطلاعات شخصی گاه می‌تواند موجب شود مدل ورودی متنی را با اطلاعات حساسی تکمیل کند که شامل نشانی‌های رایانامه، شماره تلفن‌ها و مکان‌ها است [229]. این رفتارِ به‌خاطرسپاری عینیِ اطلاعات حساس در مدل‌های زبانی GenAI در مدل‌های ترنسفورمر جدیدتر نیز مشاهده شده و روش‌های استخراج نیز به‌تفصیل مشخصه‌یابی شده‌اند [165]. برخلاف مدل‌های PredAI که در آن‌ها ابزارهایی مانند Text Revealer برای بازسازی متن از دسته‌بندهای متنی مبتنی بر ترنسفورمر ساخته می‌شود [434]، گاه صرفاً کافی است از مدل‌های GenAI خواسته شود اطلاعات خصوصیِ موجود در بستر را به‌عنوان بخشی از مکالمه تکرار کنند. نتایج نشان می‌دهد اطلاعاتی مانند نشانی رایانامه می‌تواند با نرخ بیش از ٪۸ برای برخی مدل‌ها افشا شود. با این حال، پاسخ‌های آن‌ها ممکن است مالکِ اطلاعات را به‌اشتباه نسبت دهند و از این نظر غیرقابل‌اتکا باشند. به‌طور کلی، حملات استخراج زمانی موفق‌ترند که مدل با اطلاعات مشخص‌تر و کامل‌تری بذرپاشی شده باشد — هرچه مهاجم بیشتر بداند، بیشتر می‌تواند استخراج کند. پژوهشگران از این واقعیت بهره گرفته‌اند تا به‌صورت تدریجی قطعاتی از مقالات دارای حق نشر نیویورک تایمز را از LLMها استخراج کنند؛ به این ترتیب که مدل را با یک جمله بذرپاشی کرده و اجازه می‌دهند LLM به‌طور مکرر متن بیشتری استخراج کند [356]. به‌طور شهودی، مدل‌های بزرگ‌تر با «ظرفیت» (Capacity) بالاتر نسبت به بازسازی دقیق آسیب‌پذیرترند [56]. رابط‌های تنظیم دقیق (fine-tuning) نیز ریسک حملات استخراج داده را تشدید می‌کنند؛ چنان‌که حمله‌ای با استفاده از API تنظیم دقیق برای مدل‌های با وزن باز، PII را از داده‌های پیش‌آموزش استخراج کرد [83]، هرچند این یک حمله مستقیمِ مبتنی بر پرامپت نیست.

سرقت پرامپت و بستر. پرامپت‌ها برای هم‌راستاکردن LLMها با یک کاربرد مشخص حیاتی‌اند و عنصری کلیدی در سودمندی آن‌ها برای پیروی از دستورالعمل‌های انسانی محسوب می‌شوند. از این رو می‌توان این پرامپت‌ها را اسرار تجاری دانست و گاه هدف حملات پرامپت‌محور مستقیم قرار می‌گیرند. PromptStealer روشی مبتنی بر یادگیری است که با استفاده از یک مدل توصیف تصویر و یک دسته‌بند چندبرچسبی، پرامپت‌ها را از مدل‌های متن‌به‌تصویر بازسازی می‌کند و هم سوژه و هم اصلاح‌کننده‌های پرامپت را می‌رباید [339]. برای برخی LLMها، پژوهشگران دریافتند مجموعه کوچکی از پرس‌وجوهای حمله ثابت (مانند Repeat all sentences in our conversation) برای استخراج بیش از ٪۶۰ پرامپت‌ها در برخی جفت‌های مدل و مجموعه‌داده کافی بود [439]. در برخی موارد، پرامپت‌های مؤثر ممکن است متکی بر تخصص فنی یا «دامنه» (domain)‌ای قابل‌توجه باشند؛ حملات سرقت پرامپت ممکن است این سرمایه‌گذاری‌ها را نقض یا تهدید کنند. افزون بر این، در کاربردهای RAG (ر.ک. شکل 6)، همین تکنیک‌ها می‌توانند برای استخراج اطلاعات حساسِ ارائه‌شده در بستر LLMها به‌کار روند. برای نمونه، سطرهای یک پایگاه داده یا متنی از یک سند PDF که قرار است به‌طور کلی توسط LLM خلاصه شود، می‌توانند به‌صورت مفصل با صرفاً درخواست مستقیم از طریق پرامپت یا انجام حملات پرامپت‌سازی ساده استخراج شوند.

تصویر در نسخهٔ PDF Figure 7. Map of the development and deployment life cycle of an AI model for broad-scale query access

شکل 7. «نگاشت» (Map) چرخه حیات توسعه و «استقرار» (Deployment) یک مدل هوش مصنوعی برای دسترسی پرس‌وجویی در مقیاس گسترده

«استخراج مدل» (Model Extraction). همان‌گونه که در PredAI (بخش 2.4.4) آمده است، مهاجمان ممکن است حملات MODEL EXTRACTION انجام دهند که در آن‌ها با ارسال پرس‌وجوهای ویژه‌ساخته، کوشش می‌شود اطلاعاتی درباره معماری و پارامترهای مدل آموخته شود. اخیراً Carlini و همکاران [61] نشان دادند چنین اطلاعاتی می‌تواند از LLMهای عملیاتیِ جعبه‌سیاه استخراج شود؛ به‌گونه‌ای که ابعاد پنهان و لایه تصویرسازی جاسازی (embedding projection layer) که پیشتر ناشناخته بود، تا حد تقارن‌ها به دست آمد.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S11

شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S11-A9C6B225

پیوند مستقیم این بخش

۳.۳.۳. راهکارها

ترجمهٔ منبع

استراتژی‌های دفاعی زیر می‌توانند در سراسر چرخه عمر استقرار یک مدل یا سامانه هوش مصنوعی به کار گرفته شوند تا ریسک آسیب‌پذیر بودن مدل یا سامانه در برابر تزریق دستور مستقیم کاهش یابد. اعداد داخل پرانتز به شماره‌گذاری شکل ۷ اشاره دارند که نگاشت چرخه عمر استقرار برای دسترسی پرس‌وجویی گسترده را نشان می‌دهد.

  • مداخله‌ها در دوران پیش‌آموزش (۲) و پس‌آموزش (۳). طیفی از استراتژی‌های آموزشی برای دشوارتر کردن دسترسی به قابلیت‌های زیان‌بار مدل از طریق تزریق دستور مستقیم پیشنهاد شده است، از جمله آموزش ایمنی در دوران پیش‌آموزش [197] یا پس‌آموزش [147, 445]، روش‌های آموزش خصمانه [340] و دیگر روش‌ها برای دشوارتر کردن حملات دور زدن محدودیت‌های مدل [447].
  • مداخله‌ها در دوران ارزیابی (۴). ارزیابی‌ها می‌توانند آسیب‌پذیری مدل‌ها در برابر حملات مبتنی بر پرس‌وجو را سنجش کنند و سپس به تصمیم‌های مربوط به اعتماد و امکان‌سنجی و همچنین آموزش توسعه‌دهندگان و کاربران کمک کنند. ارزیابی‌ها می‌توانند شامل ارزیابی‌های خودکار گسترده آسیب‌پذیری‌ها [72, 107, 324] و همچنین تیم قرمز تخصصی هدفمند [381] و جوایز کشف خطا (باگ بانتی) [16] باشند. رویکردهای ارزیابی کنونی، با وجود سودمندی، ممکن است آسیب‌پذیری‌های در دسترس کنشگرانِ دارای زمان، منابع یا شانس بیشتر را دست‌کم بگیرند. ارزیابی‌ها آسیب‌پذیری مدل را در یک لحظه خاص از زمان می‌سنجند؛ ارزیابی‌ها ممکن است تغییر کنند اگر حملات جدیدی توسعه یابند، داده‌های بیشتری پس از آموزش گردآوری شود یا قابلیت‌های مدل بهبود یابد. ارزیابی‌های مستمر پس از استقرار می‌توانند در مقابله با این چالش‌ها کمک‌کننده باشند.
  • مداخله‌ها در دوران استقرار (۵). مجموعه گسترده‌ای از مداخله‌های زمان استقرار پیشنهاد شده است:
  • فنون دستورالعمل و قالب‌بندی اعلان. دستورالعمل‌های مدل می‌توانند مدل را به توجه دقیق به ورودی کاربر راهنمایی کنند؛ برای مثال با قرار دادن ورودی کاربر درون برچسب‌های XML، افزودن دستورالعمل‌های مشخص به اعلان، یا تلاش برای جداسازی روشن دستورالعمل‌های سیستم از اعلان‌های کاربر [14, 206, 219].
  • آشکارسازی و خاتمه‌دادن به تعامل‌های زیان‌بار. به‌جای پیشگیری از تولیدات زیان‌بار مدل، سامانه‌های هوش مصنوعی ممکن است بتوانند این تولیدات را تشخیص دهند و تعامل‌ها را خاتمه دهند. چندین راهکار متن‌باز [5, 6, 154] و متن‌بسته [18, 204, 313] سیستم‌های تشخیص مبتنی بر LLM را با مدل‌هایی که به‌طور مشخص اعلان‌گذاری و/یا ریزتنظیم شده‌اند بررسی کرده‌اند که ورودی کاربر و/یا خروجی مدل را به‌عنوان زیان‌بار یا نامطلوب طبقه‌بندی می‌کنند. این راهکارها ممکن است از طریق فلسفه دفاع چندلایه، اطمینان مکمل فراهم کنند. با این حال، این سیستم‌های تشخیص نیز در برابر حملات آسیب‌پذیرند [235] و ممکن است شکست‌های همبسته با مدل‌های اصلی که پایش می‌کنند داشته باشند. برخی خطوط پژوهشی، محدود کردن فضای تولیدات برای امکان‌پذیر کردن محافظ‌های قطعی را بررسی کرده‌اند [306]. کارهای اولیه نشان می‌دهد که فنون مبتنی بر تفسیرپذیری نیز می‌توانند برای تشخیص ورودی‌های ناهنجار [31] و همچنین دفاع‌های مبتنی بر کلیدواژه یا پیچیدگی زبانی به کار روند [9, 164].
  • آشکارسازی سرقت اعلان. رویکرد رایج برای کاهش سرقت اعلان، مقایسه گفته مدل با اعلان است که توسط ارائه‌دهنده سیستم شناخته می‌شود. دفاع‌ها از نظر نحوه انجام این مقایسه متفاوت‌اند؛ این مقایسه می‌تواند شامل جست‌وجوی یک توکن، واژه یا عبارت خاص باشد، همان‌گونه که در [59] رواج یافت، یا مقایسه n-گرم‌های خروجی با ورودی [439]. به‌طور مشابه، دفاع‌ها در برابر سرقت اعلان هنوز دقت و استواری اثبات‌شده‌ای ندارند.
  • تغییر ورودی. ورودی کاربر می‌تواند پیش از ارسال به مدل اصلاح شود؛ برای مثال بازنویسی یا بازتوکنیزه کردن [182]. با این حال، این روش‌ها ممکن است پرهزینه باشند و/یا با عملکرد مدل مبادله‌هایی داشته باشند.
  • تجمیع خروجی چند فرمان (پرامپت). با الهام از هموارسازی تصادفی [95] که برای بهبود استواری در برابر حملات گریز روی طبقه‌بندگرهای ML به کار می‌رود، SmoothLLM [312] تجمیع خروجی LLM از چندین اعلان تصادفی‌شده را پیشنهاد می‌کند. این دفاع هزینه تولید چندین پرس‌وجوی LLM برای هر اعلان را در پی دارد و ممکن است کیفیت خروجی تولیدشده را کاهش دهد.
  • پایش و پاسخ. پس از استقرار، پایش و ثبت فعالیت کاربران ممکن است به مستقرکنندگان مدل امکان دهد موارد حملات تزریق دستور مستقیمِ نافرجام و موفق را شناسایی کرده و به آن‌ها پاسخ دهند [266]. این پاسخ می‌تواند شامل مسدود کردن کاربران یا اقدام علیه آن‌ها در صورت بدخواهانه به نظر رسیدن نیت‌شان، یا رفع آسیب‌پذیری تزریق دستور در صورت موفقیت حمله باشد. رویه‌های استاندارد بررسی در سطح کاربر یا سازمان و راستی‌آزمایی هویت، و همچنین سازوکارهای انگیزشی روشن (مانند سیاست محدود کردن دسترسی به مدل در پاسخ به تخلفات) می‌توانند اثربخشی این راهکار را افزایش دهند.
  • محدودیت‌های استفاده. مداخله‌های دیگر بر انتخاب‌های مربوط به نحوه ارائه مدل به کاربران متمرکز بوده‌اند: برای مثال، اثربخشی برخی حملات را می‌توان با محدود کردن پارامترهای استنتاج در دسترس کاربران (مانند temperature یا logit bias) و نیز غنای تولیدات بازگردانده‌شده مدل (مانند احتمالات logit) کاهش داد [250]. افزون بر این، محدود کردن انتشار اطلاعات عمومی [252, 266] و مصنوعات [249] و محدود کردن تعداد کل پرس‌وجوهای در دسترس کاربران [251] ممکن است حملات را دشوارتر کند. این فنون ممکن است معایب دیگری نیز در محدود کردن کاربردهای مثبت داشته باشند.

راهکارهای غیرمستقیم. با وجود افزایش تعداد دفاع‌های پیشنهادی در سطوح مدل و سیستم، یافته‌های اخیر نشان می‌دهند که مدل‌های نسل کنونی همچنان به‌شدت در برابر حملات تزریق دستور مستقیم آسیب‌پذیرند [11, 381]. بنابراین، دیگر راهکارهای بالقوه برای تزریق دستور نه بر افزایش مستقیم استواری سامانه هوش مصنوعی در برابر چنین حملاتی، بلکه بر طراحی سیستم‌ها با این فرض استوارند که مدل هوش مصنوعی در صورت مواجهه با کنشگران بدخواه، می‌تواند و خواهد توانست خروجی مخرب تولید کند. برای مثال، مستقرکنندگان می‌توانند سامانه‌های هوش مصنوعی را با این فرض طراحی کنند که مدل‌هایی که به داده‌های حساس دسترسی دارند یا توانایی انجام اقدامات نامطلوب را دارند، ممکن است آن داده‌ها را افشا کنند یا آن اقدامات را انجام دهند [266]. همچنین توسعه‌دهندگان یا مستقرکنندگان ممکن است از دیگر راهکارهای فنی برای کاهش پتانسیل سوءاستفاده از خروجی‌های به‌دست‌آمده از طریق تزریق دستور مستقیم استفاده کنند، مانند:

  • پاک‌سازی داده آموزشی. می‌توان داده‌های آموزشی مدل را پاک‌سازی کرد تا محتوای حساس یا سمی و داده‌هایی که عمدتاً یا انحصاراً برای توسعه قابلیت‌های نامطلوب مرتبط‌اند حذف شوند. چنین پاک‌سازی‌ای ممکن است از یادگیری قابلیت‌های زیان‌بار جلوگیری کند و آسیب‌های بالقوه تزریق دستور مستقیم را کاهش دهد، هرچند ممکن است به تعمیم‌پذیری و توانایی تشخیص محتوای زیان‌بار آسیب برساند [224].
  • فرایادگیری. تلاش‌هایی نیز برای «فرایادگیری» دانش یا قابلیت‌های زیان‌بار پس از آموزش انجام شده است [212]، با هدف کاهش آسیب‌های ناشی از مدل‌های با جهت‌گیری مخرب [158]. با این حال، این روش‌ها همچنان در برابر حملات خصمانه آسیب‌پذیرند، از جمله حملات به رویکردهای آموزش مخصوص دور زدن محدودیت‌های مدل [367] و حملات وارون‌سازی بر روش‌های فرایادگیری [328] که داده‌های فرضاً فرایادگرفته‌شده را استخراج می‌کنند.
  • واترمارک‌گذاری. توسعه‌دهندگان یا مستقرکنندگان می‌توانند محتوای تولیدشده توسط مدل هوش مصنوعی را واترمارک‌گذاری کنند تا کمک کند منشأ آن ردیابی شود، از محتوای تولیدشده توسط انسان متمایز گردد و خطرهای موارد استفاده مخرب کاهش یابد (برای مثال، با برچسب‌گذاری محتوا به‌عنوان تولیدِ مدل هنگام مشاهده آنلاین). اگرچه ادبیات موضوع فنون گوناگونی با نقاط قوت و ضعف متفاوت پیشنهاد کرده است [194]، هیچ فن واترمارک‌گذاری وجود ندارد که به‌طور جهانی در همه شرایط مؤثر و استوار باشد. حملات قدرتمند بسیاری علیه واترمارک‌گذاری با نرخ‌های موفقیت بالا توسعه یافته‌اند [188, 319]. افزون بر این، نتایج نظری عدم‌امکان‌پذیری مربوط به استواری واترمارک‌گذاری نیز اثبات شده است [432].

سرانجام، فراتر از مداخلات در سطوح توسعه‌دهنده یا بهره‌بردار، جامعه و زیرساخت نیز می‌توانند در گذر زمان در برابر قابلیت‌های مدل‌ها که به‌طور مخرب هدایت شده‌اند تاب‌آورتر شوند [7, 33]. برای نمونه، مدافعان ممکن است بتوانند از ابزارهای مبتنی بر هوش مصنوعی برای کشف آسیب‌پذیری‌ها استفاده کنند [99] تا سیستم‌های خود را در برابر کنشگران مخربی که مدل‌های GenAI را برای یافتن آسیب‌پذیری‌ها به‌منظور بهره‌برداری سوءاستفاده می‌کنند، تاب‌آورتر سازند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S12

شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S12-D4C9E885

پیوند مستقیم این بخش

۳.۴. حملات تزریق دستور غیرمستقیم و اقدامات کاهشی

ترجمهٔ منبع

[ NISTAML.015] بسیاری از موارد کاربرد مدل‌های GenAI شامل تعامل مدل با منابع اضافی است؛ از یک AGENT متصل به اینترنت گرفته تا یک «سیستم تولید تقویت‌شده با بازیابی» (RETRIEVAL-AUGMENTED GENERATION, RAG) که در شکل ۶ نمایش داده شده است. از آنجا که مدل‌های GenAI کانال داده و کانال دستورالعمل را با یکدیگر ترکیب می‌کنند، مهاجمان می‌توانند از کانال داده برای تأثیرگذاری بر عملیات سیستم از طریق دستکاری منابعی که سیستم با آن‌ها تعامل دارد بهره بگیرند. بدین ترتیب، حملات «تزریق دستور غیرمستقیم» (Indirect Prompt Injection) توسط «کنترل منابع» (RESOURCE CONTROL) ممکن می‌شود که به مهاجم اجازه می‌دهد بدون تعامل مستقیم با کاربرد، دستورالعمل‌های سیستم را به‌طور غیرمستقیم (یا از راه دور) تزریق کند [146, 408]. حملات تزریق دستور غیرمستقیم می‌توانند به نقض اهداف مهاجم در دست‌کم سه دسته بینجامند: ۱) نقض در دسترس‌بودن، ۲) نقض یکپارچگی، و ۳) مخاطره‌آمیز شدن حریم خصوصی. با این حال، برخلاف حملات تزریق دستور مستقیم، حملات تزریق دستور غیرمستقیم نه توسط «کاربر اصلی» (primary) مدل، بلکه توسط شخص ثالث انجام می‌شوند. در واقع، در بسیاری از موارد این کاربر اصلی مدل است که از مخاطره‌آمیز شدن یکپارچگی، در دسترس‌بودن یا حریم خصوصی سیستم GenAI در پی یک حمله تزریق دستور غیرمستقیم آسیب می‌بیند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S13

شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S13-557EE10C

پیوند مستقیم این بخش

۳.۴.۱. حملات دسترس‌پذیری

ترجمهٔ منبع

[ NISTAML.016] مهاجمان می‌توانند منابع را دستکاری کنند تا دستورهایی را در مدل‌های GenAI تزریق کنند که برای مختل‌کردن دسترس‌پذیری مدل برای کاربران مشروع طراحی شده‌اند. حملات دسترس‌پذیری می‌توانند به‌صورت بی‌تمایز مدل را غیرقابل استفاده کنند (مثلاً ناتوانی در تولید خروجی‌های مفید) یا به‌طور خاص برخی قابلیت‌ها (مثلاً APIهای مشخص) را مسدود کنند [146].

تکنیک‌های مهاجم. پژوهشگران چندین روش اثبات‌مفهوم را نشان داده‌اند که مهاجمان می‌توانند از طریق آن‌ها دسترس‌پذیری یک سیستم GenAI را مختل کنند:

  • وظایف زمان‌بر در پس‌زمینه. [ NISTAML.017 ] یک دستور تزریق‌شده به‌صورت غیرمستقیم می‌تواند به مدل دستور دهد که پیش از پاسخ‌دادن به درخواست، یک وظیفه زمان‌بر انجام دهد. خود دستور می‌تواند کوتاه باشد؛ برای مثال با درخواست رفتار حلقه‌ای در مدل ارزیابی‌کننده [146].
  • ازکارانداختن قابلیت‌ها. یک دستور تزریق‌شده به‌صورت غیرمستقیم می‌تواند به مدل دستور دهد که مجاز به استفاده از برخی APIها نیست (مثلاً API جست‌وجو برای یک چت‌بات متصل به اینترنت). این کار اجزای کلیدی سرویس را به‌طور گزینشی از کار می‌اندازد [146].
  • قالب‌بندی مخرب خروجی. یک مهاجم می‌تواند از «تزریق دستور» (Prompt Injection) غیرمستقیم استفاده کند تا به مدل دستور دهد خروجی خود را به شکلی تغییر دهد که دسترس‌پذیری سیستم را مختل کند. برای مثال، مهاجم می‌تواند به مدل دستور دهد نویسه‌های متن بازیابی‌شده را با معادل‌های هم‌شکل جایگزین کند و فراخوانی‌های بعدی API را مختل کند [146]؛ یا می‌تواند درخواست کند که مدل هر جمله را با توکن <|endoftext|> آغاز کند و مدل را وادار به بازگرداندن خروجی خالی نماید [146].
استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S14

شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S14-F768AD5B

پیوند مستقیم این بخش

۳.۴.۲. حملات یکپارچگی

ترجمهٔ منبع

[ NISTAML.027]

از طریق تزریق دستور (Prompt Injection) غیرمستقیم، مهاجمان می‌توانند از منابع مخرب برای وادار کردن سیستم‌های GenAI به غیرقابل‌اعتماد شدن و تولید محتوایی که از رفتار بی‌خطر منحرف می‌شود و با اهداف خصمانه هم‌راستا می‌شود، استفاده کنند. این حملات اغلب شامل بر هم زدن رفتار مدل به شیوه‌های ظریفی است که ممکن است برای کاربر نهایی آشکار نباشد.

برای مثال، پژوهشگران حملاتی از طریق تزریق دستور غیرمستقیم را نشان داده‌اند که می‌توانند باعث شوند یک سیستم GenAI خلاصه‌هایی به‌دلخواه نادرست از منابع تولید کند، با اطلاعاتی مشخص‌شده توسط مهاجم پاسخ دهد، یا اطلاعات برخی منابع را سرکوب یا پنهان کند [146]. مهاجمان ممکن است بتوانند از این قابلیت‌ها برای مسلح‌کردن سیستم‌های GenAI مانند چت‌بات‌های متصل به اینترنت علیه کاربرانشان به مقاصد مخرب گوناگونی استفاده کنند؛ از جمله انتشار اطلاعات گمراه‌کننده هدفمند، توصیه محصولات یا خدمات متقلبانه، یا هدایت مجدد مصرف‌کنندگان به وب‌سایت‌های مخربی که صفحات ورود مشروع را جعل می‌کنند یا حاوی بدافزار قابل دانلود هستند. مهاجمان همچنین می‌توانند از حملات تزریق دستور غیرمستقیم برای ربایش یک عامل GenAI استفاده کنند تا به‌جای (یا در کنار) وظیفه موردنظر و تعیین‌شده توسط کاربر، وظیفه‌ای مخرب و مشخص‌شده توسط مهاجم را انجام دهد [353].

تکنیک‌های مهاجم. پژوهشگران حملات یکپارچگی از طریق منابع مخربی که وظیفه اصلی مدل زبانی بزرگ (LLM) را دستکاری می‌کنند، نشان داده‌اند:

  • دور زدن محدودیت‌های مدل (Jailbreak). مهاجمان می‌توانند از تکنیک‌هایی برای تزریق دستور غیرمستقیم بهره بگیرند که مشابه تکنیک‌های به‌کاررفته در حملات تزریق دستور مستقیم است؛ مانند استفاده از دور زدن محدودیت‌های مدل که به مهاجم امکان می‌دهد دستورالعمل‌های مخرب خود را جایگزین SYSTEM PROMPT مدل کند. همانند حملات دستوردهی مستقیم، این حملات ممکن است از طریق روش‌های مبتنی بر بهینه‌سازی یا دستی ساخته شوند و ممکن است بر تکنیک‌هایی مانند تعمیم ناهمخوان تکیه کنند.
  • محرک‌های اجرا. پژوهشگران حملات دستی تزریق دستور غیرمستقیم را با استفاده از محرک‌های اجرایی که با تکنیکی به نام Neural Exec از طریق بهینه‌سازی تولید شده‌اند، خودکار کرده‌اند [287]. این محرک‌های اجرایی همچنین می‌توانند در خطوط پردازش RAG که شامل فازهای متعددی مانند قطعه‌بندی و فیلتر کردن بافتی هستند، پایدار بمانند.
  • مسموم‌سازی (Poisoning) پایگاه دانش. می‌توان پایگاه داده یک سیستم RAG را مسموم کرد تا برای پرس‌وجوهای مشخص کاربران، خروجی هدفمند LLM حاصل شود؛ مانند PoisonedRAG [449]. اخیراً، یک چارچوب بهینه‌سازی عمومی به نام Phantom [75] نشان داده است که چگونه می‌توان یک سند مسموم‌شده را برای القای اهداف خصمانه متعددی در مولد LLM ساخت و در پایگاه دانش یک سیستم RAG درج کرد.
  • پنهان‌سازی تزریق. مهاجمان ممکن است از تکنیک‌هایی برای پنهان‌کردن یا مبهم‌سازی تزریق‌های خود استفاده کنند؛ مانند پنهان‌کردن تزریق‌ها در بخش‌های غیرقابل‌مشاهده یک منبع؛ استفاده از تزریق‌های چندمرحله‌ای که در آن‌ها تزریق اولیه مدل را به بازدید از منبع دیگری که حاوی تزریق‌های بیشتری است هدایت می‌کند؛ یا کدگذاری دستورهای تزریق مانند Base64 و سپس دستور دادن به مدل برای رمزگشایی دنباله [146].
  • تزریق‌های خودانتشار. مهاجمان ممکن است بتوانند از حملات تزریق دستور غیرمستقیم برای تبدیل سیستم‌های GenAI به ناقلانِ انتشار حملات استفاده کنند. برای مثال، مهاجم ممکن است بتواند ایمیلی مخرب ارسال کند که هنگام خوانده‌شدن توسط مدلی که بخشی از یک سرویس‌گیرنده ایمیل را تشکیل می‌دهد، به مدل دستور می‌دهد با ارسال ایمیل‌های مخرب مشابه به همه افراد فهرست تماس کاربر، آلودگی را منتشر کند. به این ترتیب، برخی دستورهای مخرب ممکن است بتوانند مانند کرم‌ها عمل کنند [146].
استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S15

شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S15-1D7F6D16

پیوند مستقیم این بخش