فهرست این فصلبخش ۳، فصل ۲۱ — صفحهٔ ۲ از ۳
بخش ۳، فصل ۲۱ — صفحهٔ ۲ از ۳
طبقهبندی هوش مصنوعی مولد
متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.
۳.۳.۱. تکنیکهای حمله
طیف گستردهای از تکنیکها برای اجرای حملات مستقیم مبتنی بر دستور وجود دارد که بسیاری از آنها در اهداف مختلف مهاجم کاربرد مشترک دارند. با تمرکز بر حملات مستقیم مبتنی بر دستور برای میسر ساختن سوءاستفاده، دستههای کلی زیر از تکنیکهای حمله مستقیم را برمیشماریم (ر.ک. [393]):
- حملات مبتنی بر بهینهسازی، توابع هدف حمله را طراحی میکنند و از گرادیان یا سایر روشهای مبتنی بر جستوجو برای یادگیری ورودیهای خصمانهای که رفتار خاصی را ایجاد میکنند بهره میگیرند؛ مشابه حملات PredAI که در بخش 2.2.1 بحث شد. توابع هدف ممکن است بهگونهای طراحی شوند که شروعهای تأییدی را اجبار کنند (برای مثال، جستوجوی پاسخهایی که با «Sure» آغاز میشوند که میتواند نشانه انطباق با درخواست مخرب باشد [60, 320, 448]) یا سایر سنجههای موفقیت حمله را لحاظ کنند (برای مثال، شباهت به یک ریزتنظیم سمیشده [368]).
سپس میتوان از تکنیکهای بهینهسازی برای یادگیری حملات استفاده کرد، از جمله تکنیکهایی که از حملات طراحیشده برای طبقهبندهای زبانی PredAI پیروی میکنند (مانند HotFlip [117]) و تکنیکهای بدون گرادیان که از یک مدل جانشین یا جستوجوی تصادفی برای آزمودن گزینههای حمله استفاده میکنند [11, 320]. محرکهای خصمانهٔ جهانی، کلاس ویژهای از این حملات مبتنی بر گرادیان علیه مدلهای مولد هستند که بهدنبال یافتن پیشوندها (یا پسوندهای) مستقل از ورودی هستند و پاسخ تأییدی مطلوب را صرفنظر از بخش باقیماندهٔ ورودی تولید میکنند [386, 448]. انتقالپذیری این محرکهای جهانی به مدلهای دیگر، مدلهای با وزن باز — که دسترسی جعبهسفید به آنها بهسهولت فراهم است — را به بردارهای حملهای امکانپذیر برای حملات انتقالپذیری علیه سیستمهای بسته تبدیل میکند که در آنها تنها دسترسی از طریق API در دسترس است [448].
همچنین میتوان حملات را بهگونهای طراحی کرد که قیود اضافی را برآورده کنند (مانند سرگشتگی بهاندازهٔ کافی پایین [368]) یا به سیستمی شامل چندین مدل حمله کنند [235].
- روشهای دستی برای دور زدن محدودیتهای مدل (Jailbreak) در یک LLM شامل اهداف رقیب و تعمیم ناهمخوان هستند [400]. حملات مبتنی بر تعمیم ناهمخوان، ورودیهایی را شناسایی میکنند که خارج از توزیع دادههای آموزش ایمنی مدل اما همچنان درون توزیع آموزش تواناییهای آن قرار دارند؛ بهگونهای که برای مدل قابلفهم باشند و در عین حال از رفتار امتناع بگریزند. حملات مبتنی بر اهداف رقیب، مواردی را مییابند که در آنها تواناییهای مدل با اهداف ایمنی در کشمکشاند؛ برای مثال، با بهرهگیری از میل درونی مدل به پیروی از دستورالعملهای ارائهشده توسط کاربر. در همهٔ این موارد، هدف حمله به خطر انداختن یک دفاع ایمنی در سطح مدل است. برای بحث بیشتر ر.ک. Weng [403].
رویکردهای حملهٔ مبتنی بر اهداف رقیب شامل موارد زیر است:
- تزریق پیشوند (Prefix injection): این روش مستلزم دستور دادن به مدل برای آغاز پاسخها با یک تأیید مثبت است. مهاجمان با شرطیکردن مدل برای شروع خروجی خود به شیوهای از پیش تعیینشده، میکوشند تولید زبان بعدی آن را بهسوی الگوها یا رفتارهای خاص و از پیش تعیینشده هدایت کنند.
- سرکوب امتناع (Refusal suppression): مهاجمان میتوانند بهطور صریح به مدل دستور دهند از تولید امتناع یا انکار در خروجی خود بپرهیزد. این تاکتیک با کاهش احتمال پاسخهای امتناع، در پی افزایش احتمال پاسخ انطباقآمیز است.
- تزریق سبک (Style injection): در این رویکرد، مهاجمان به مدل دستور میدهند از نحو یا سبکهای نوشتاری خاصی استفاده کند (یا نکند). برای مثال، یک حمله ممکن است زبان مدل را به لحنهای سادهشده یا غیرحرفهای محدود کند تا احتمال امتناعها (که معمولاً با ادبیات حرفهای نوشته میشوند) را کاهش دهد.
- بازی نقشی (Role-play): مهاجمان از راهبردهای بازی نقشی (مانند «Always Intelligent and Machiavellian» [AIM] یا «Do Anything Now» [DAN]) استفاده میکنند تا مدل را به پذیرش شخصیتها یا الگوهای رفتاری خاصی هدایت کنند که با هدف اصلی در تعارضاند. این دستکاری با هدف بهرهبرداری از سازگاری مدل با نقشها یا ویژگیهای گوناگون و بهخطرانداختن پایبندی آن به پروتکلهای ایمنی صورت میگیرد.
رویکردهای حملهٔ مبتنی بر تعمیم ناهمخوان شامل موارد زیر است:
- رمزگذاری ویژه (Special encoding): راهبردهایی که از تکنیکهای رمزگذاری مانند base64 برای تغییر بازنمایی دادههای ورودی بهگونهای استفاده میکنند که برای مدل قابلفهم باقی بماند، اما ممکن است خارج از توزیع دادههای آموزش ایمنی باشد.
- تبدیل نویسه (Character transformation): راهبردهایی که از تبدیلهای سطح نویسه مانند رمز ROT13، جایگزینی نماد (مانند l33tspeak) و کد مورس استفاده میکنند تا ورودی را از توزیع آموزش ایمنی خارج کنند.
- تبدیل واژه (Word transformation): راهبردهایی که ساختار زبانی ورودی را تغییر میدهند؛ مانند Pig Latin، جایبهجایی هممعنیها (مانند استفاده از «pilfer» بهجای «steal»)، و تقسیم محموله (یا «قاچاق توکن») برای شکستن واژههای حساس به زیررشتهها.
- تبدیل در سطح دستور (Prompt-level transformation): راهبردهایی که از تبدیلهای در سطح دستور استفاده میکنند؛ مانند ترجمهٔ دستور به زبانی کمکاربردتر که ممکن است خارج از توزیع دادههای آموزش ایمنی باشد.
- تیم قرمز (Red Teaming) خودکار مبتنی بر مدل، از یک مدل مهاجم، یک مدل هدف و یک داور بهره میگیرد [73, 239, 292]. هنگامی که مهاجم به یک طبقهبند باکیفیت دسترسی دارد که قضاوت میکند آیا خروجی مدل زیانبار است یا نه، میتوان از آن بهعنوان تابع پاداش برای آموزش یک مدل مولد جهت تولید نمونههای دور زدن محدودیتهای یک مدل مولد دیگر استفاده کرد. برای هر یک از مدلها تنها دسترسی از طریق پرسوجو الزامی است و هیچ مداخلهٔ انسانی برای بهروزرسانی یا پالایش یک نمونهٔ نامزدِ دور زدن محدودیتهای مدل نیاز نیست. این دستورها همچنین ممکن است از مدل هدف به LLMهای بستهٔ دیگر قابل انتقال باشند [73].
حمله Crescendo [316] ایده تعامل تدریجی با مدل را در قالب یک حمله چندنوبتی و تطبیقی معرفی کرد که شامل پرامپتهای بهظاهر بیخطر است و سرانجام به «دور زدن محدودیتهای مدل» (Jailbreak) موفق در برابر همترازی «ایمنی» (Safety) میانجامد. این حمله اولیه که بهصورت دستی انجام میشد، با بهرهگیری از یک LLM دیگر برای تولید پرامپت و ادغام چندین منبع ورودی، بهطور کامل خودکار شد.
ارزیابیهای مدلهای پیشرو نشان میدهد که LLMها همچنان در برابر بسیاری از این حملات آسیبپذیرند [11, 338, 381].
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S10
شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S10-81913A6B
۳.۳.۲. استخراج اطلاعات
[ NISTAML.038 ] هم در زمان آموزش و هم در زمان اجرا، مدلهای GenAI در معرض طیفی از اطلاعات قرار دارند که ممکن است برای مهاجمان جالب باشد؛ مانند اطلاعات شناساییشونده شخصی (PII) در دادههای آموزشی، اطلاعات حساس در پایگاههای داده «تولید تقویتشده با بازیابی» (RETRIEVAL-AUGMENTED GENERATION, RAG) که در بستر ارائه میشوند، یا حتی SYSTEM PROMPT ساختهشده توسط طراح برنامه. افزون بر این، ویژگیهای خود مدل—مانند وزنها یا معماری مدل—ممکن است هدف حمله قرار گیرند. اگرچه بسیاری از تکنیکهای بخش 3.3.1 در استخراج چنین دادههایی قابلاعمالاند، چند هدف و تکنیک خاصِ استخراج داده را یادآور میشویم.
نشت دادههای حساس آموزشی. Carlini و همکاران [59] نخستین کسانی بودند که حملات TRAINING DATA EXTRACTION را در مدلهای زبانی مولد بهصورت عملی نشان دادند. آنان با درج «قناریها» (canaries)—نمونههای مصنوعی و بهآسانی قابلتشخیصِ خارج از توزیع—در دادههای آموزشی، روششناسیای برای استخراج قناریها ارائه کردند و سنجشی به نام «مواجهه» (exposure) برای سنجش بهخاطرسپاری معرفی نمودند. کارهای بعدی، «ریسک» (Risk) استخراج داده در LLMهای مبتنی بر ترنسفورمر (مانند GPT-2 [63]) را با ارائه پیشوندهای مختلف به مدل و اجرای حمله «استنتاج عضویت» (membership inference) بهمنظور تعیین اینکه کدام محتوای تولیدشده بخشی از مجموعه آموزشی بوده است، نشان دادند. از آنجا که این ترنسفورمرهای مبتنی بر پشتهٔ رمزگشا، مدلهای خودبازگشتیاند، یک پیشوند متنی دقیقاً عینی درباره اطلاعات شخصی گاه میتواند موجب شود مدل ورودی متنی را با اطلاعات حساسی تکمیل کند که شامل نشانیهای رایانامه، شماره تلفنها و مکانها است [229]. این رفتارِ بهخاطرسپاری عینیِ اطلاعات حساس در مدلهای زبانی GenAI در مدلهای ترنسفورمر جدیدتر نیز مشاهده شده و روشهای استخراج نیز بهتفصیل مشخصهیابی شدهاند [165]. برخلاف مدلهای PredAI که در آنها ابزارهایی مانند Text Revealer برای بازسازی متن از دستهبندهای متنی مبتنی بر ترنسفورمر ساخته میشود [434]، گاه صرفاً کافی است از مدلهای GenAI خواسته شود اطلاعات خصوصیِ موجود در بستر را بهعنوان بخشی از مکالمه تکرار کنند. نتایج نشان میدهد اطلاعاتی مانند نشانی رایانامه میتواند با نرخ بیش از ٪۸ برای برخی مدلها افشا شود. با این حال، پاسخهای آنها ممکن است مالکِ اطلاعات را بهاشتباه نسبت دهند و از این نظر غیرقابلاتکا باشند. بهطور کلی، حملات استخراج زمانی موفقترند که مدل با اطلاعات مشخصتر و کاملتری بذرپاشی شده باشد — هرچه مهاجم بیشتر بداند، بیشتر میتواند استخراج کند. پژوهشگران از این واقعیت بهره گرفتهاند تا بهصورت تدریجی قطعاتی از مقالات دارای حق نشر نیویورک تایمز را از LLMها استخراج کنند؛ به این ترتیب که مدل را با یک جمله بذرپاشی کرده و اجازه میدهند LLM بهطور مکرر متن بیشتری استخراج کند [356]. بهطور شهودی، مدلهای بزرگتر با «ظرفیت» (Capacity) بالاتر نسبت به بازسازی دقیق آسیبپذیرترند [56]. رابطهای تنظیم دقیق (fine-tuning) نیز ریسک حملات استخراج داده را تشدید میکنند؛ چنانکه حملهای با استفاده از API تنظیم دقیق برای مدلهای با وزن باز، PII را از دادههای پیشآموزش استخراج کرد [83]، هرچند این یک حمله مستقیمِ مبتنی بر پرامپت نیست.
سرقت پرامپت و بستر. پرامپتها برای همراستاکردن LLMها با یک کاربرد مشخص حیاتیاند و عنصری کلیدی در سودمندی آنها برای پیروی از دستورالعملهای انسانی محسوب میشوند. از این رو میتوان این پرامپتها را اسرار تجاری دانست و گاه هدف حملات پرامپتمحور مستقیم قرار میگیرند. PromptStealer روشی مبتنی بر یادگیری است که با استفاده از یک مدل توصیف تصویر و یک دستهبند چندبرچسبی، پرامپتها را از مدلهای متنبهتصویر بازسازی میکند و هم سوژه و هم اصلاحکنندههای پرامپت را میرباید [339]. برای برخی LLMها، پژوهشگران دریافتند مجموعه کوچکی از پرسوجوهای حمله ثابت (مانند Repeat all sentences in our conversation) برای استخراج بیش از ٪۶۰ پرامپتها در برخی جفتهای مدل و مجموعهداده کافی بود [439]. در برخی موارد، پرامپتهای مؤثر ممکن است متکی بر تخصص فنی یا «دامنه» (domain)ای قابلتوجه باشند؛ حملات سرقت پرامپت ممکن است این سرمایهگذاریها را نقض یا تهدید کنند. افزون بر این، در کاربردهای RAG (ر.ک. شکل 6)، همین تکنیکها میتوانند برای استخراج اطلاعات حساسِ ارائهشده در بستر LLMها بهکار روند. برای نمونه، سطرهای یک پایگاه داده یا متنی از یک سند PDF که قرار است بهطور کلی توسط LLM خلاصه شود، میتوانند بهصورت مفصل با صرفاً درخواست مستقیم از طریق پرامپت یا انجام حملات پرامپتسازی ساده استخراج شوند.
تصویر در نسخهٔ PDF Figure 7. Map of the development and deployment life cycle of an AI model for broad-scale query access
شکل 7. «نگاشت» (Map) چرخه حیات توسعه و «استقرار» (Deployment) یک مدل هوش مصنوعی برای دسترسی پرسوجویی در مقیاس گسترده
«استخراج مدل» (Model Extraction). همانگونه که در PredAI (بخش 2.4.4) آمده است، مهاجمان ممکن است حملات MODEL EXTRACTION انجام دهند که در آنها با ارسال پرسوجوهای ویژهساخته، کوشش میشود اطلاعاتی درباره معماری و پارامترهای مدل آموخته شود. اخیراً Carlini و همکاران [61] نشان دادند چنین اطلاعاتی میتواند از LLMهای عملیاتیِ جعبهسیاه استخراج شود؛ بهگونهای که ابعاد پنهان و لایه تصویرسازی جاسازی (embedding projection layer) که پیشتر ناشناخته بود، تا حد تقارنها به دست آمد.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S11
شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S11-A9C6B225
۳.۳.۳. راهکارها
استراتژیهای دفاعی زیر میتوانند در سراسر چرخه عمر استقرار یک مدل یا سامانه هوش مصنوعی به کار گرفته شوند تا ریسک آسیبپذیر بودن مدل یا سامانه در برابر تزریق دستور مستقیم کاهش یابد. اعداد داخل پرانتز به شمارهگذاری شکل ۷ اشاره دارند که نگاشت چرخه عمر استقرار برای دسترسی پرسوجویی گسترده را نشان میدهد.
- مداخلهها در دوران پیشآموزش (۲) و پسآموزش (۳). طیفی از استراتژیهای آموزشی برای دشوارتر کردن دسترسی به قابلیتهای زیانبار مدل از طریق تزریق دستور مستقیم پیشنهاد شده است، از جمله آموزش ایمنی در دوران پیشآموزش [197] یا پسآموزش [147, 445]، روشهای آموزش خصمانه [340] و دیگر روشها برای دشوارتر کردن حملات دور زدن محدودیتهای مدل [447].
- مداخلهها در دوران ارزیابی (۴). ارزیابیها میتوانند آسیبپذیری مدلها در برابر حملات مبتنی بر پرسوجو را سنجش کنند و سپس به تصمیمهای مربوط به اعتماد و امکانسنجی و همچنین آموزش توسعهدهندگان و کاربران کمک کنند. ارزیابیها میتوانند شامل ارزیابیهای خودکار گسترده آسیبپذیریها [72, 107, 324] و همچنین تیم قرمز تخصصی هدفمند [381] و جوایز کشف خطا (باگ بانتی) [16] باشند. رویکردهای ارزیابی کنونی، با وجود سودمندی، ممکن است آسیبپذیریهای در دسترس کنشگرانِ دارای زمان، منابع یا شانس بیشتر را دستکم بگیرند. ارزیابیها آسیبپذیری مدل را در یک لحظه خاص از زمان میسنجند؛ ارزیابیها ممکن است تغییر کنند اگر حملات جدیدی توسعه یابند، دادههای بیشتری پس از آموزش گردآوری شود یا قابلیتهای مدل بهبود یابد. ارزیابیهای مستمر پس از استقرار میتوانند در مقابله با این چالشها کمککننده باشند.
- مداخلهها در دوران استقرار (۵). مجموعه گستردهای از مداخلههای زمان استقرار پیشنهاد شده است:
- فنون دستورالعمل و قالببندی اعلان. دستورالعملهای مدل میتوانند مدل را به توجه دقیق به ورودی کاربر راهنمایی کنند؛ برای مثال با قرار دادن ورودی کاربر درون برچسبهای XML، افزودن دستورالعملهای مشخص به اعلان، یا تلاش برای جداسازی روشن دستورالعملهای سیستم از اعلانهای کاربر [14, 206, 219].
- آشکارسازی و خاتمهدادن به تعاملهای زیانبار. بهجای پیشگیری از تولیدات زیانبار مدل، سامانههای هوش مصنوعی ممکن است بتوانند این تولیدات را تشخیص دهند و تعاملها را خاتمه دهند. چندین راهکار متنباز [5, 6, 154] و متنبسته [18, 204, 313] سیستمهای تشخیص مبتنی بر LLM را با مدلهایی که بهطور مشخص اعلانگذاری و/یا ریزتنظیم شدهاند بررسی کردهاند که ورودی کاربر و/یا خروجی مدل را بهعنوان زیانبار یا نامطلوب طبقهبندی میکنند. این راهکارها ممکن است از طریق فلسفه دفاع چندلایه، اطمینان مکمل فراهم کنند. با این حال، این سیستمهای تشخیص نیز در برابر حملات آسیبپذیرند [235] و ممکن است شکستهای همبسته با مدلهای اصلی که پایش میکنند داشته باشند. برخی خطوط پژوهشی، محدود کردن فضای تولیدات برای امکانپذیر کردن محافظهای قطعی را بررسی کردهاند [306]. کارهای اولیه نشان میدهد که فنون مبتنی بر تفسیرپذیری نیز میتوانند برای تشخیص ورودیهای ناهنجار [31] و همچنین دفاعهای مبتنی بر کلیدواژه یا پیچیدگی زبانی به کار روند [9, 164].
- آشکارسازی سرقت اعلان. رویکرد رایج برای کاهش سرقت اعلان، مقایسه گفته مدل با اعلان است که توسط ارائهدهنده سیستم شناخته میشود. دفاعها از نظر نحوه انجام این مقایسه متفاوتاند؛ این مقایسه میتواند شامل جستوجوی یک توکن، واژه یا عبارت خاص باشد، همانگونه که در [59] رواج یافت، یا مقایسه n-گرمهای خروجی با ورودی [439]. بهطور مشابه، دفاعها در برابر سرقت اعلان هنوز دقت و استواری اثباتشدهای ندارند.
- تغییر ورودی. ورودی کاربر میتواند پیش از ارسال به مدل اصلاح شود؛ برای مثال بازنویسی یا بازتوکنیزه کردن [182]. با این حال، این روشها ممکن است پرهزینه باشند و/یا با عملکرد مدل مبادلههایی داشته باشند.
- تجمیع خروجی چند فرمان (پرامپت). با الهام از هموارسازی تصادفی [95] که برای بهبود استواری در برابر حملات گریز روی طبقهبندگرهای ML به کار میرود، SmoothLLM [312] تجمیع خروجی LLM از چندین اعلان تصادفیشده را پیشنهاد میکند. این دفاع هزینه تولید چندین پرسوجوی LLM برای هر اعلان را در پی دارد و ممکن است کیفیت خروجی تولیدشده را کاهش دهد.
- پایش و پاسخ. پس از استقرار، پایش و ثبت فعالیت کاربران ممکن است به مستقرکنندگان مدل امکان دهد موارد حملات تزریق دستور مستقیمِ نافرجام و موفق را شناسایی کرده و به آنها پاسخ دهند [266]. این پاسخ میتواند شامل مسدود کردن کاربران یا اقدام علیه آنها در صورت بدخواهانه به نظر رسیدن نیتشان، یا رفع آسیبپذیری تزریق دستور در صورت موفقیت حمله باشد. رویههای استاندارد بررسی در سطح کاربر یا سازمان و راستیآزمایی هویت، و همچنین سازوکارهای انگیزشی روشن (مانند سیاست محدود کردن دسترسی به مدل در پاسخ به تخلفات) میتوانند اثربخشی این راهکار را افزایش دهند.
- محدودیتهای استفاده. مداخلههای دیگر بر انتخابهای مربوط به نحوه ارائه مدل به کاربران متمرکز بودهاند: برای مثال، اثربخشی برخی حملات را میتوان با محدود کردن پارامترهای استنتاج در دسترس کاربران (مانند temperature یا logit bias) و نیز غنای تولیدات بازگرداندهشده مدل (مانند احتمالات logit) کاهش داد [250]. افزون بر این، محدود کردن انتشار اطلاعات عمومی [252, 266] و مصنوعات [249] و محدود کردن تعداد کل پرسوجوهای در دسترس کاربران [251] ممکن است حملات را دشوارتر کند. این فنون ممکن است معایب دیگری نیز در محدود کردن کاربردهای مثبت داشته باشند.
راهکارهای غیرمستقیم. با وجود افزایش تعداد دفاعهای پیشنهادی در سطوح مدل و سیستم، یافتههای اخیر نشان میدهند که مدلهای نسل کنونی همچنان بهشدت در برابر حملات تزریق دستور مستقیم آسیبپذیرند [11, 381]. بنابراین، دیگر راهکارهای بالقوه برای تزریق دستور نه بر افزایش مستقیم استواری سامانه هوش مصنوعی در برابر چنین حملاتی، بلکه بر طراحی سیستمها با این فرض استوارند که مدل هوش مصنوعی در صورت مواجهه با کنشگران بدخواه، میتواند و خواهد توانست خروجی مخرب تولید کند. برای مثال، مستقرکنندگان میتوانند سامانههای هوش مصنوعی را با این فرض طراحی کنند که مدلهایی که به دادههای حساس دسترسی دارند یا توانایی انجام اقدامات نامطلوب را دارند، ممکن است آن دادهها را افشا کنند یا آن اقدامات را انجام دهند [266]. همچنین توسعهدهندگان یا مستقرکنندگان ممکن است از دیگر راهکارهای فنی برای کاهش پتانسیل سوءاستفاده از خروجیهای بهدستآمده از طریق تزریق دستور مستقیم استفاده کنند، مانند:
- پاکسازی داده آموزشی. میتوان دادههای آموزشی مدل را پاکسازی کرد تا محتوای حساس یا سمی و دادههایی که عمدتاً یا انحصاراً برای توسعه قابلیتهای نامطلوب مرتبطاند حذف شوند. چنین پاکسازیای ممکن است از یادگیری قابلیتهای زیانبار جلوگیری کند و آسیبهای بالقوه تزریق دستور مستقیم را کاهش دهد، هرچند ممکن است به تعمیمپذیری و توانایی تشخیص محتوای زیانبار آسیب برساند [224].
- فرایادگیری. تلاشهایی نیز برای «فرایادگیری» دانش یا قابلیتهای زیانبار پس از آموزش انجام شده است [212]، با هدف کاهش آسیبهای ناشی از مدلهای با جهتگیری مخرب [158]. با این حال، این روشها همچنان در برابر حملات خصمانه آسیبپذیرند، از جمله حملات به رویکردهای آموزش مخصوص دور زدن محدودیتهای مدل [367] و حملات وارونسازی بر روشهای فرایادگیری [328] که دادههای فرضاً فرایادگرفتهشده را استخراج میکنند.
- واترمارکگذاری. توسعهدهندگان یا مستقرکنندگان میتوانند محتوای تولیدشده توسط مدل هوش مصنوعی را واترمارکگذاری کنند تا کمک کند منشأ آن ردیابی شود، از محتوای تولیدشده توسط انسان متمایز گردد و خطرهای موارد استفاده مخرب کاهش یابد (برای مثال، با برچسبگذاری محتوا بهعنوان تولیدِ مدل هنگام مشاهده آنلاین). اگرچه ادبیات موضوع فنون گوناگونی با نقاط قوت و ضعف متفاوت پیشنهاد کرده است [194]، هیچ فن واترمارکگذاری وجود ندارد که بهطور جهانی در همه شرایط مؤثر و استوار باشد. حملات قدرتمند بسیاری علیه واترمارکگذاری با نرخهای موفقیت بالا توسعه یافتهاند [188, 319]. افزون بر این، نتایج نظری عدمامکانپذیری مربوط به استواری واترمارکگذاری نیز اثبات شده است [432].
سرانجام، فراتر از مداخلات در سطوح توسعهدهنده یا بهرهبردار، جامعه و زیرساخت نیز میتوانند در گذر زمان در برابر قابلیتهای مدلها که بهطور مخرب هدایت شدهاند تابآورتر شوند [7, 33]. برای نمونه، مدافعان ممکن است بتوانند از ابزارهای مبتنی بر هوش مصنوعی برای کشف آسیبپذیریها استفاده کنند [99] تا سیستمهای خود را در برابر کنشگران مخربی که مدلهای GenAI را برای یافتن آسیبپذیریها بهمنظور بهرهبرداری سوءاستفاده میکنند، تابآورتر سازند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S12
شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S12-D4C9E885
۳.۴. حملات تزریق دستور غیرمستقیم و اقدامات کاهشی
[ NISTAML.015] بسیاری از موارد کاربرد مدلهای GenAI شامل تعامل مدل با منابع اضافی است؛ از یک AGENT متصل به اینترنت گرفته تا یک «سیستم تولید تقویتشده با بازیابی» (RETRIEVAL-AUGMENTED GENERATION, RAG) که در شکل ۶ نمایش داده شده است. از آنجا که مدلهای GenAI کانال داده و کانال دستورالعمل را با یکدیگر ترکیب میکنند، مهاجمان میتوانند از کانال داده برای تأثیرگذاری بر عملیات سیستم از طریق دستکاری منابعی که سیستم با آنها تعامل دارد بهره بگیرند. بدین ترتیب، حملات «تزریق دستور غیرمستقیم» (Indirect Prompt Injection) توسط «کنترل منابع» (RESOURCE CONTROL) ممکن میشود که به مهاجم اجازه میدهد بدون تعامل مستقیم با کاربرد، دستورالعملهای سیستم را بهطور غیرمستقیم (یا از راه دور) تزریق کند [146, 408]. حملات تزریق دستور غیرمستقیم میتوانند به نقض اهداف مهاجم در دستکم سه دسته بینجامند: ۱) نقض در دسترسبودن، ۲) نقض یکپارچگی، و ۳) مخاطرهآمیز شدن حریم خصوصی. با این حال، برخلاف حملات تزریق دستور مستقیم، حملات تزریق دستور غیرمستقیم نه توسط «کاربر اصلی» (primary) مدل، بلکه توسط شخص ثالث انجام میشوند. در واقع، در بسیاری از موارد این کاربر اصلی مدل است که از مخاطرهآمیز شدن یکپارچگی، در دسترسبودن یا حریم خصوصی سیستم GenAI در پی یک حمله تزریق دستور غیرمستقیم آسیب میبیند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S13
شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S13-557EE10C
۳.۴.۱. حملات دسترسپذیری
[ NISTAML.016] مهاجمان میتوانند منابع را دستکاری کنند تا دستورهایی را در مدلهای GenAI تزریق کنند که برای مختلکردن دسترسپذیری مدل برای کاربران مشروع طراحی شدهاند. حملات دسترسپذیری میتوانند بهصورت بیتمایز مدل را غیرقابل استفاده کنند (مثلاً ناتوانی در تولید خروجیهای مفید) یا بهطور خاص برخی قابلیتها (مثلاً APIهای مشخص) را مسدود کنند [146].
تکنیکهای مهاجم. پژوهشگران چندین روش اثباتمفهوم را نشان دادهاند که مهاجمان میتوانند از طریق آنها دسترسپذیری یک سیستم GenAI را مختل کنند:
- وظایف زمانبر در پسزمینه. [ NISTAML.017 ] یک دستور تزریقشده بهصورت غیرمستقیم میتواند به مدل دستور دهد که پیش از پاسخدادن به درخواست، یک وظیفه زمانبر انجام دهد. خود دستور میتواند کوتاه باشد؛ برای مثال با درخواست رفتار حلقهای در مدل ارزیابیکننده [146].
- ازکارانداختن قابلیتها. یک دستور تزریقشده بهصورت غیرمستقیم میتواند به مدل دستور دهد که مجاز به استفاده از برخی APIها نیست (مثلاً API جستوجو برای یک چتبات متصل به اینترنت). این کار اجزای کلیدی سرویس را بهطور گزینشی از کار میاندازد [146].
- قالببندی مخرب خروجی. یک مهاجم میتواند از «تزریق دستور» (Prompt Injection) غیرمستقیم استفاده کند تا به مدل دستور دهد خروجی خود را به شکلی تغییر دهد که دسترسپذیری سیستم را مختل کند. برای مثال، مهاجم میتواند به مدل دستور دهد نویسههای متن بازیابیشده را با معادلهای همشکل جایگزین کند و فراخوانیهای بعدی API را مختل کند [146]؛ یا میتواند درخواست کند که مدل هر جمله را با توکن
<|endoftext|>آغاز کند و مدل را وادار به بازگرداندن خروجی خالی نماید [146].
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S14
شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S14-F768AD5B
۳.۴.۲. حملات یکپارچگی
[ NISTAML.027]
از طریق تزریق دستور (Prompt Injection) غیرمستقیم، مهاجمان میتوانند از منابع مخرب برای وادار کردن سیستمهای GenAI به غیرقابلاعتماد شدن و تولید محتوایی که از رفتار بیخطر منحرف میشود و با اهداف خصمانه همراستا میشود، استفاده کنند. این حملات اغلب شامل بر هم زدن رفتار مدل به شیوههای ظریفی است که ممکن است برای کاربر نهایی آشکار نباشد.
برای مثال، پژوهشگران حملاتی از طریق تزریق دستور غیرمستقیم را نشان دادهاند که میتوانند باعث شوند یک سیستم GenAI خلاصههایی بهدلخواه نادرست از منابع تولید کند، با اطلاعاتی مشخصشده توسط مهاجم پاسخ دهد، یا اطلاعات برخی منابع را سرکوب یا پنهان کند [146]. مهاجمان ممکن است بتوانند از این قابلیتها برای مسلحکردن سیستمهای GenAI مانند چتباتهای متصل به اینترنت علیه کاربرانشان به مقاصد مخرب گوناگونی استفاده کنند؛ از جمله انتشار اطلاعات گمراهکننده هدفمند، توصیه محصولات یا خدمات متقلبانه، یا هدایت مجدد مصرفکنندگان به وبسایتهای مخربی که صفحات ورود مشروع را جعل میکنند یا حاوی بدافزار قابل دانلود هستند. مهاجمان همچنین میتوانند از حملات تزریق دستور غیرمستقیم برای ربایش یک عامل GenAI استفاده کنند تا بهجای (یا در کنار) وظیفه موردنظر و تعیینشده توسط کاربر، وظیفهای مخرب و مشخصشده توسط مهاجم را انجام دهد [353].
تکنیکهای مهاجم. پژوهشگران حملات یکپارچگی از طریق منابع مخربی که وظیفه اصلی مدل زبانی بزرگ (LLM) را دستکاری میکنند، نشان دادهاند:
- دور زدن محدودیتهای مدل (Jailbreak). مهاجمان میتوانند از تکنیکهایی برای تزریق دستور غیرمستقیم بهره بگیرند که مشابه تکنیکهای بهکاررفته در حملات تزریق دستور مستقیم است؛ مانند استفاده از دور زدن محدودیتهای مدل که به مهاجم امکان میدهد دستورالعملهای مخرب خود را جایگزین SYSTEM PROMPT مدل کند. همانند حملات دستوردهی مستقیم، این حملات ممکن است از طریق روشهای مبتنی بر بهینهسازی یا دستی ساخته شوند و ممکن است بر تکنیکهایی مانند تعمیم ناهمخوان تکیه کنند.
- محرکهای اجرا. پژوهشگران حملات دستی تزریق دستور غیرمستقیم را با استفاده از محرکهای اجرایی که با تکنیکی به نام Neural Exec از طریق بهینهسازی تولید شدهاند، خودکار کردهاند [287]. این محرکهای اجرایی همچنین میتوانند در خطوط پردازش RAG که شامل فازهای متعددی مانند قطعهبندی و فیلتر کردن بافتی هستند، پایدار بمانند.
- مسمومسازی (Poisoning) پایگاه دانش. میتوان پایگاه داده یک سیستم RAG را مسموم کرد تا برای پرسوجوهای مشخص کاربران، خروجی هدفمند LLM حاصل شود؛ مانند PoisonedRAG [449]. اخیراً، یک چارچوب بهینهسازی عمومی به نام Phantom [75] نشان داده است که چگونه میتوان یک سند مسمومشده را برای القای اهداف خصمانه متعددی در مولد LLM ساخت و در پایگاه دانش یک سیستم RAG درج کرد.
- پنهانسازی تزریق. مهاجمان ممکن است از تکنیکهایی برای پنهانکردن یا مبهمسازی تزریقهای خود استفاده کنند؛ مانند پنهانکردن تزریقها در بخشهای غیرقابلمشاهده یک منبع؛ استفاده از تزریقهای چندمرحلهای که در آنها تزریق اولیه مدل را به بازدید از منبع دیگری که حاوی تزریقهای بیشتری است هدایت میکند؛ یا کدگذاری دستورهای تزریق مانند Base64 و سپس دستور دادن به مدل برای رمزگشایی دنباله [146].
- تزریقهای خودانتشار. مهاجمان ممکن است بتوانند از حملات تزریق دستور غیرمستقیم برای تبدیل سیستمهای GenAI به ناقلانِ انتشار حملات استفاده کنند. برای مثال، مهاجم ممکن است بتواند ایمیلی مخرب ارسال کند که هنگام خواندهشدن توسط مدلی که بخشی از یک سرویسگیرنده ایمیل را تشکیل میدهد، به مدل دستور میدهد با ارسال ایمیلهای مخرب مشابه به همه افراد فهرست تماس کاربر، آلودگی را منتشر کند. به این ترتیب، برخی دستورهای مخرب ممکن است بتوانند مانند کرمها عمل کنند [146].
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C21-S15
شناسهٔ محتوا KDJ-AI-2026E1-P03-C21-S15-1D7F6D16