فهرست این فصلبخش ۳، فصل ۲۳ — صفحهٔ ۲ از ۳
بخش ۳، فصل ۲۳ — صفحهٔ ۲ از ۳
مدیریت ریسک سوءاستفاده در مدلهای بنیادین دومَنظوره
متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.
۴. اهداف و شیوههای مدیریت ریسک سوءاستفاده
این بخش هفت هدف و شیوههای مرتبطی را که میتوانند به تحقق آنها کمک کنند، برای سازمانها بهمنظور نگاشت، سنجش، مدیریت و حاکمیت بر ریسک آنکه مدلهای پایه آنها بهشیوهای عامدانه برای آسیبرسانی به ایمنی عمومی مورد سوءاستفاده قرار گیرند، با توجه به «چارچوب مدیریت ریسک هوش مصنوعی» (AI Risk Management Framework, RMF) مؤسسه ملی استاندارد و فناوری آمریکا (NIST)، ترسیم میکند. این اهداف عبارتاند از:
- پیشبینی ریسک احتمالی سوءاستفاده
- تدوین برنامههایی برای مدیریت ریسک سوءاستفاده
- مدیریت ریسکهای مربوط به سرقت مدل
- سنجش ریسک سوءاستفاده
- اطمینان از مدیریت ریسک سوءاستفاده پیش از استقرار مدلهای پایه
- گردآوری اطلاعات مربوط به سوءاستفاده پس از استقرار و پاسخ به آنها
- ارائه شفافیت مناسب درباره ریسک سوءاستفاده
سازمانها بهتر است هر هفت هدف را بهصورت کلی و یکپارچه در نظر بگیرند تا ریسکهای سوءاستفاده مدلهای پایه را مدیریت کنند. این سند برای هر هدف، شیوههایی را بهعنوان نمونههایی غیرجامع ارائه میدهد که نشان میدهند سازمانها چگونه میتوانند به این اهداف دست یابند. مدیریت ریسک فرایندی تکرارشونده است و سازمانها بهتر است در هر نقطه از چرخه عمر یک مدل پایه، مرتبطترین شیوهها را ارزیابی کنند. اجرای این شیوهها همچنین نمیتواند تضمین کند که کنشگران از یک مدل پایه سوءاستفاده نخواهند کرد، و سازمانها بهتر است در صورت تناسب، تدابیر اضافی مدیریت ریسک را نیز بهکار گیرند.
عناصر اختصاصی هر هدف در ادامه چنین است:
- هدف (Objective): دستاوردی آرمانی که با تحقق آن، به سازمانها در مدیریت ریسکهای سوءاستفاده یک مدل پایه کمک میشود.
- شیوه (Practice): شیوهای پیشنهادی که میتواند به سازمانها در دستیابی به یک هدف کمک کند. این سند مجموعهای خاص از شیوهها را پیشنهاد میکند که میتوان از آنها بهصورت جمعی برای تحقق اهداف مشخصشده استفاده کرد. با این حال، یک شیوه معیّن ممکن است برای همه زمینهها مناسب نباشد، شیوههای جایگزین نیز ممکن است بتوانند به این اهداف دست یابند، و بهاحتمال زیاد شیوههای جدیدی در گذر زمان توسعه خواهند یافت.
- توصیه (Recommendation): ویژگی یا ملاحظهای اجرایی که اغلب برای اثربخشی یک شیوه در دستیابی به یک هدف اهمیت دارد.
- مستندسازی (Documentation): اطلاعاتی که میتواند هم با عموم مردم و هم با اشخاص منتخب به اشتراک گذاشته شود تا نشان دهد که آیا یک شیوه اجرا شده است یا نه و چگونه اجرا شده است، و همچنین شواهد احتمالی اثربخشی و جامعیت آن را فراهم کند. این مستندسازی میتواند به بهبود همکاری با اشخاص ثالث و توسعه بهترین شیوههای مشترک برای مدیریت ریسکهای سوءاستفاده نیز کمک کند. اگر سازمانی برای دستیابی به یک هدف بر شیوههای جایگزین تکیه کند، سطح مشابهی از مستندسازی درباره آن شیوهها میتواند برای ارائه شفافیت، همراه با توجیهی درباره اینکه چرا شیوههای جایگزین با اثربخشی شیوههای ارائهشده در اینجا برابری میکنند یا از آن فراتر میروند، بهکار رود.
هدف ۱: پیشبینی ریسک احتمالی سوءاستفاده
ارزیابی ریسکهایی که در صورت در دسترس قرارگرفتن مدل پایه برای کنشگران مخرب، ممکن است سوءاستفاده از آن رخ دهد؛ از جمله ارزیابی این ریسکها پیش از توسعه مدل بر اساس برآوردی از قابلیتهای آن. شناسایی مهمترین ریسکهای موردانتظار بهگونهای که در صورت لزوم بتوان آنها را سنجش و مدیریت کرد.
- شیوه ۱.۱: شناسایی و نگهداشت فهرستی از پروفایلهای تهدید که شیوههای مهم سوءاستفاده احتمالی کنشگران مخرب از مدل را پوشش دهد.
توصیههایی برای اجرای مؤثر شیوه ۱.۱:
- برای هر پروفایل تهدید، قابلیتهای مرتبطِ مورد نگرانی، کنشگر یا کنشگرانی تهدیدی که ممکن است از آنها برای ایجاد آسیب استفاده کنند، و کارهای مخربی که کنشگر تهدیدی ممکن است با استفاده از مدل به آنها دست یابد را مشخص کنید.
- ریسکهای شناختهشده سوءاستفاده را در نظر بگیرید، از جمله، در صورت ارتباط، ریسک استفاده احتمالی از مدل برای تسهیل توسعه سلاحهای شیمیایی، زیستی، رادیولوژیک یا هستهای، خودکارسازی عملیات سایبری تهاجمی، یا تولید CSAM یا NCII.
- مشورت با خبرگان خارجی دارای تخصص و مسئولیتهای مرتبط برای کمک به شناسایی شکافهای پروفایلهای تهدید را در نظر بگیرید، از جمله احتمالاً اعطای دسترسی به مدل به آنها برای آزمایشهای آزاد بهمنظور شناسایی شیوههای دیگری که ممکن است از مدل برای ایجاد آسیب سوءاستفاده شود. مشورت با خبرگان خارجی میتواند بهویژه برای کمک به اطمینان از اینکه پروفایلهای تهدید مهمترین شیوههای موردانتظار سوءاستفاده از مدل برای ایجاد آسیب را پوشش میدهند، مرتبط باشد.
مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه اجرای شیوه ۱.۱ کمک کند:
- الف. فهرست پروفایلهای کلیدی تهدید.۱۸
- ب. توصیفی از نحوه انتخاب این پروفایلهای تهدید و قضاوت درباره پوشش کافی آنها.
- پ. توصیفی از خبرگان داخلی و خارجی درگیر و نقش آنها در توسعه پروفایلها.
شیوه ۱.۲: ارزیابی تأثیر هر پروفایل تهدید شناساییشده در صورتی که کنشگر مخرب در سوءاستفاده از مدل موفق شود.
توصیههایی برای پیادهسازی مؤثر تمرین ۱.۲:
- برای هر نمای تهدید، تأثیر بر ایمنی عمومی را در صورتی که یک کنشگر تهدید با موفقیت از مدل برای انجام وظیفه مخرب استفاده کند، ارزیابی کنید؛ از جمله برآورد اینکه مدل تا چه اندازه میتواند به کنشگر کمک کند تا مقیاس فعالیت مخرب خود را افزایش دهد، هزینه آن را کاهش دهد، یا اثربخشی آن را در مقایسه با منابع جایگزین در دسترس آن کنشگر، مانند سایر مدلهای یادگیری ماشین و ابزارهای دیجیتال، بهبود بخشد.۱۹
- برای هر نمای تهدید، مقیاس، بسامد، یا احتمالی را که کنشگران تهدید ممکن است برای سوءاستفاده از مدل تلاش کنند، برآورد کنید.
- بررسی کنید که آسیبهای احتمالی چگونه ممکن است خارج از بافت خود مدل پیشگیری یا مدیریت شوند، مانند سازوکارهایی که آسیب ناشی از یک فعالیت مخرب معیّن را مستقل از اینکه مدل آن فعالیت مخرب را چقدر ارزان یا آسان میکند، بهطور مؤثر متوقف میسازند.
مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه پیادهسازی تمرین ۱.۲ کمک کند:
- الف. یک ارزیابی تأثیر برای هر نمای تهدید شناساییشده.
تمرین ۱.۳: برآورد قابلیتهای نگرانکننده مدل پیش از توسعه آن از طریق مقایسه با مدلهای موجود.
توصیههایی برای پیادهسازی مؤثر تمرین ۱.۳:
- مدلهای مشابهی را شناسایی کنید که قابلیتهای نگرانکننده آنها پیشتر سنجیده شده است.
- بر اساس مقایسه ویژگیهای مدل آتی با مدلهای موجود، برآورد کنید که عملکرد آن در مقایسه با آن مدلها چگونه خواهد بود.
- میزان عدمقطعیت در این برآوردها را بر اساس میزان تفاوت مدلها، انتظارِ اثرگذاری آن تفاوتها بر قابلیتهایشان، و قابلیت اطمینان و کامل بودن ارزیابیهای موجود برای مدلهای مشابه، ارزیابی کنید.
- اگر پیشبینیهای قابلیت نامطمئن باشند و احتمال اینکه مدل ممکن است ریسک قابلتوجهی ایجاد کند را در بر گیرند، راهبردهای توسعهای را در نظر بگیرید که ممکن است وابستگی به پیشبینی را کاهش دهند، مانند اقداماتی برای سنجش دورهای قابلیتها در طول فرایند توسعه.
- مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه پیادهسازی تمرین ۱.۳ کمک کند:
- الف. برآوردهای قابلیت که پیش از توسعه مدل انجام شدهاند.
- ب. سنجشهای مرتبط قابلیت که پس از توسعه مدل انجام شدهاند.
- ج. مقایسههای برآوردی ریسک سوءاستفاده مدل در مقایسه با معیارهای مرجع رایج، در صورت وجود.
هدف ۲: تدوین برنامههایی برای مدیریت ریسک سوءاستفاده
سطوح قابلقبول ریسک سوءاستفاده را با در نظر گرفتن تعهدات قانونی یا مقرراتی، منافع احتمالی که ممکن است در مقابل ریسک قرار گیرد، و سایر عوامل تعیین کنید. برنامههای توسعه و استقرار را با منابع، زمان، و محدودیتهای عملیاتی که برای مدیریت ریسک سوءاستفاده احتمالی ممکن است لازم باشد، هماهنگ کنید.
تمرین ۲.۱: تعیین سطحی از ریسک سوءاستفاده که سازمان آن را غیرقابلقبول تلقی میکند.
توصیههایی برای پیادهسازی مؤثر تمرین ۲.۱:
- آستانه ریسک برای هر نمای تهدید شناساییشده را بر اساس ارزیابیهای تأثیر انجامشده در تمرین ۱.۲ و سایر اطلاعات مرتبط تعریف کنید.۲۰
- در نظر بگیرید که مدل تا چه اندازه ممکن است هزینه انجام وظیفه مخرب را کاهش دهد، تعداد کنشگرانی را که قادر به انجام آن وظیفهاند افزایش دهد، یا مقیاس و کیفیت دستیابی یک کنشگر معیّن به آن وظیفه را بالا ببرد.
- هنگام تعیین آستانههای ریسک، منافع احتمالی را در برابر ریسکهای سوءاستفاده بسنجید.
- آستانهها را بهطور مستمر بر اساس تعدیل در نمایهای تهدید شناساییشده یا تغییر در عوامل مؤثر بر تحمل ریسک (مانند افزایش منافع مورد انتظار) پالایش کنید.
- بررسی کنید که عوامل خارجی مانند تعهدات قانونی و مقرراتی چگونه ممکن است بر قابلقبول بودن آستانههای ریسک اثر بگذارند.
مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه پیادهسازی تمرین ۲.۱ کمک کند:
- الف. آستانههای ریسک سوءاستفاده یک مدل که سازمان آنها را غیرقابلقبول تلقی میکند.
تمرین ۲.۲: تدوین نقشه راه برای مدیریت ریسکهای سوءاستفاده در توسعه مدلهای بنیادین برنامهریزیشده و نسخههای آینده.
- توصیههایی برای پیادهسازی مؤثر تمرین ۲.۲:
- تعریف کنید که سازمان انتظار دارد ریسک سوءاستفاده را چگونه مدیریت کند و به اهداف تعیینشده در این سند دست یابد.
- در صورت لزوم برای مدیریت ریسک سوءاستفاده، برنامهریزی کنید که اقدامات امنیتی برای محافظت از مدلها در برابر سرقت مدل پیادهسازی شوند. اهداف امنیتی و جدول زمانی دستیابی به آن اهداف را تعریف کنید.
- در صورت لزوم برای مدیریت ریسک سوءاستفاده، برنامهریزی کنید که حفاظهای مناسب برای محافظت از مدلهای مستقرشده در برابر سوءاستفاده پیادهسازی شوند. اهداف ایمنی و جدول زمانی دستیابی به آن اهداف را تعریف کنید.
- برنامهریزی کنید تا در صورتی که ریسکهای سوءاستفاده پیش از فراهم شدن امنیت و حفاظهای کافی برای مدیریت ریسک به سطوح غیرقابلقبول برسند، راهبردهای استقرار یا توسعه تعدیل شوند.
- ۱ مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه ۲ پیادهسازی تمرین ۲.۲ کمک کند:
- الف. نقشه راهی که ثبت میکند با توجه به محدودیتهای فنی و منابع، کاهشهای ریسک چه مواردی در طول زمان قابلانجام انتظار میرود، و در صورتی که سنجشها نشان دهد آن کاهشها برای مدیریت ریسک سوءاستفاده کافی نیستند، چه اقداماتی انجام خواهد شد.
هدف ۳: مدیریت ریسکهای سرقت مدل
اقداماتی برای جلوگیری از سرقت اطلاعات و داراییهایی که به یک کنشگر بدخواه اجازه میدهد مدل پایه را بازآفرینی کند، در مواردی که چنین اقدامی برای مدیریت ریسک سوءاستفاده الزامی است، انجام دهید. فقط زمانی مدلی بسازید که برای مدیریت ریسک سوءاستفاده به محرمانگی متکی است که ریسک سرقت مدل بهاندازه کافی کاهش یافته باشد.
رویه ۳.۱: ارزیابی ریسک سرقت مدل از سوی کنشگران تهدیدِ مرتبط.
توصیههایی برای اجرای اثربخش رویه ۳.۱:
- ریسک سرقت مدل را برای هر کنشگر یا پروفایل تهدید شناساییشده، بر اساس منابع، انگیزهها، تاکتیکها و سطح پیشرفت هر یک از کنشگران مربوط، ارزیابی کنید.21
- ۱۷
- انطباق سازمان با بهترین شیوههای سایبریِ کاربردی را بهعنوان یکی از ورودیهای ارزیابی ریسک سرقت مدل در نظر بگیرید.
- ریسک ناشی از تهدید داخلی، مانند فردی که در توسعه یا استقرار مدل نقش دارد و ممکن است رفتاری بدخواهانه داشته باشد یا با مهاجم بیرونی همکاری کند، را در نظر بگیرید.
- استفاده از تیمهای قرمز سایبری و تست نفوذ را برای ارزیابی میزان دشواری دور زدن اقدامات امنیتی توسط یک کنشگر در نظر بگیرید.
مستندات زیر میتواند به ارائه شفافیت درباره نحوه اجرای رویه ۳.۱ کمک کند:
- الف. خلاصهای از شواهد گردآوریشده برای ارزیابی ریسک سرقت مدل، از جمله نتایج تمرینهای تیم قرمز و تستهای نفوذ.
- رویه ۳.۲: مقایسه ریسک پیشبینیشده سوءاستفاده با تحمل ریسک سازمان پیش از توسعه مدلهایی با قابلیتهای نگرانکننده بیشتر.
- توصیههایی برای اجرای اثربخش رویه ۳.۲:
- پیش از توسعه مدل، ریسک کلی سوءاستفاده ناشی از سرقت مدل را با ترکیب قابلیتهای تخمینیِ نگرانکننده با برآورد احتمال سرقت مدل ارزیابی کنید.
- توسعه را تعدیل یا متوقف کنید تا زمانی که ریسک سرقت مدل بهاندازه کافی مدیریت شده و در آستانههای ریسک تعریفشده سازمان قرار گیرد.
- برآوردهای ریسک سوءاستفاده ناشی از سرقت مدل را بهطور دورهای بازبینی کنید، از جمله پیش از تصمیمهای توسعهای منفردی که ممکن است قابلیتهای نگرانکننده را بهشکل چشمگیری افزایش دهند.
مستندات زیر میتواند به ارائه شفافیت درباره نحوه اجرای رویه ۳.۲ کمک کند:
- الف. ارزیابیهای ریسکی که بهصورت دورهای یا پیش از تصمیمهای مهم توسعه و استقرار، در ارتباط با سرقت مدل انجام شدهاند.
رویه ۳.۳: حفظ شیوههای امنیتیِ بهاندازه کافی برای جلوگیری از سرقت مدل.
توصیههایی برای اجرای اثربخش رویه ۳.۳:
- شیوههای امنیتی طراحیشده برای حفاظت در برابر سرقت مدل را پیادهسازی کنید.
- در مواردی که قابل اجراست، شیوههای امنیتیِ بهطور خاص متناسب با زمینه مدلهای پایه را اعمال کنید، مانند حفاظتها در برابر برونبری حجم زیاد دادهها (مثلاً وزنهای مدل) و حفاظتها در برابر آسیبپذیریهایی مانند حملات استخراج.22
- سطح امنیت را متناسب با سطح ریسک سوءاستفادهای که مدل ایجاد میکند و اهمیت جلوگیری از سرقت مدل در مدیریت آن ریسک افزایش دهید.
- حفاظتهای مناسب در برابر تهدیدهای داخلی را اعمال کنید، مانند محدود کردن دسترسی به وزنهای مدل درون سازمان.
- پذیرش استانداردهای امنیتی موجود برای دادهها و کاربردهای حساس، مانند راهنماهای سایبری دولت آمریکا و استانداردهای بینالمللی مرتبط، را در نظر بگیرید.
- پیش از توسعه با شیوههای امنیتی جدید در دست، ریسک سرقت مدل را دوباره ارزیابی کنید (اگر ارزیابیهای پیشین ریسکهای غیرقابلقبولی از سرقت مدل یافته بودند).
مستندات زیر میتواند به ارائه شفافیت درباره نحوه اجرای رویه ۳.۳ کمک کند:
- الف. خلاصهای از اقدامات امنیتی که برای کاهش ریسک سرقت مدل پیادهسازی شدهاند.
هدف ۴: سنجش ریسک سوءاستفاده
هرجا ارزیابی معقولی وجود دارد که یک مدل پایه میتواند مورد سوءاستفاده قرار گیرد، ریسکهای پیشبینیشده را بسنجید تا شواهدی برای ریسک واقعی سوءاستفاده مدل در یک زمینه واقعی فراهم شود. بر روشهایی تکیه کنید که هم عوامل فنی و هم عوامل اجتماعی را در بر میگیرند، و نیز بر روشهایی که شواهد دقیق و اطمینان بالاتری فراهم میکنند، و در عین حال از هر آسیبی که ممکن است در نتیجه سنجش فعالیتهای خطرناک ایجاد شود پرهیز کنید.
رویه ۴.۱: سنجش قابلیتهای مدلِ مرتبط با ارزیابی ریسک سوءاستفاده.
- توصیههایی برای اجرای اثربخش رویه ۴.۱:
- قابلیتهای نگرانکننده را بهطور مستقیم بسنجید یا سنجشهای جایگزین قابلیت را شناسایی کنید که استنتاجهای بهاندازه کافی قابلاعتماد درباره آنها را ممکن میسازند، مانند پیگیری توصیههای ۲ و ۳ و موارد زیر وقتی که بهاندازه کافی قابلاعتماد باشند.
- ۴ ۲. مقایسه عملکرد یک مدل جدید با یک مدل موجود با ریسکهای سوءاستفاده شناختهشده («مدل جانشین») را در نظر بگیرید. اگر مدلها در طیف گستردهای از ارزیابیها مشابه باشند، نتایج ارزیابیهای قابلیت مدل جانشین ممکن است برای ارزیابی ریسک مدل جدید مناسب باشد. اگر این مقایسه بینتیجه باشد یا نشان دهد که مدل جدید ممکن است ریسک چشمگیری ایجاد کند، در آن صورت قابلیتهای نگرانکننده مدل جدید باید بهطور جداگانه ارزیابی شوند.
- سنجش عملکرد مدل روی وظایف جانشینی که ایمن و قابلمدیریتاند و در عین حال بهاندازه کافی شبیهاند تا استنتاجهای قابلاعتمادی درباره قابلیت نگرانکننده فراهم کنند، را در نظر بگیرید.
- اگر دقیقترین سنجش قابلیت پرهزینه باشد و انجام این کار مناسب باشد، استفاده از آزمونهای ارزانتر (مانند ارزیابیهای خودکار روی وظایف سادهتر که انجامشان برای مدل آسانتر از قابلیتهای واقعی نگرانکننده است)23 را در نظر بگیرید که ممکن است نشان دهند مدلی فاقد قابلیتهای خطرناک است. اگر این آزمونها بینتیجه باشند یا ریسک بالقوهای را نشان دهند، در آن صورت بر سنجشهای پرهزینهتر و دقیقتر تکیه کنید.
- این امکان را در نظر بگیرید که قابلیتهای نگرانکننده مدل ممکن است از هر قابلیت جانشینِ ارزیابیشدهای فراتر روند و تفسیر نتایج ارزیابی را بر آن اساس تعدیل کنید. این موضوع بهویژه زمانی مربوط است که قابلیت جانشینِ در حال ارزیابی تفاوت چشمگیری با قابلیت واقعی نگرانکننده داشته باشد.
- این را ارزیابی کنید که یک کنشگر تهدید با دسترسی به وزنهای یک مدل و توانایی یکپارچهسازی آن با ابزارهای دیگر چه چیزی میتواند به دست آورد؛ این کار با آزمودن سیستمهای هوش مصنوعیای که بهطور معقول برای عملکرد بر وظیفه ارزیابی بهینه شدهاند انجام میشود. اگر شکافی میان میزان تلاش بهکاررفته برای بهینهسازی عملکرد سیستم در جریان آزمون و تلاشی که یک کنشگر تهدید میتواند بهکار گیرد وجود دارد، ارزیابیها بهتر است بهطور صریح عدم قطعیتِ ناشی از آن شکاف را لحاظ کنند.
- از همپوشانی میان دادههای بهکاررفته برای آموزش مدل و دادههای بهکاررفته در سنجش توانمندیها و ریسکها پرهیز کنید و میزان هرگونه همپوشانی را بسنجید.
مستندسازی زیر میتواند به ارائه «شفافیت» (Transparency) درباره نحوه پیادهسازی تمرین ۴.۱ کمک کند:
- a. فهرستی از تکالیف سنجش که برای سنجش هر پروفایل تهدید بهکاررفته است، به همراه زیرمجموعهای نماینده از مجموعهدادههای استفادهشده برای هر سنجش.
- b. توصیفی روششناختی برای هر سنجش، با جزئیات کافی برای بازتولید آن.
- c. تحلیلی از رابطه میان تکالیف سنجش و توانمندیهای موردنگرانی، با پرداختن به این احتمال که تکالیف سنجش چالشبرانگیزتر باشند.
- d. اگر مدل از طریق مقایسه با یک مدل نماینده ارزیابی شده باشد: مدل نماینده بهکاررفته برای مقایسه، سنجشهای بهکاررفته برای برقراری قابلیت مقایسه، ارزیابی ریسک مدل نماینده، و دیگر وجوهی که مدل نماینده ممکن است بهگونهای معنادار با مدل در حال ارزیابی متفاوت باشد.
تمرین ۴.۲: از تیم قرمز برای ارزیابی این موضوع استفاده کنید که آیا کنشگران تهدید میتوانند از حفاظهای مدل و سیستم عبور کنند و هر یک از توانمندیهای موردنگرانی را سوءاستفاده کنند.
توصیههایی برای پیادهسازی مؤثر تمرین ۴.۲:
- برای توجیه این ارزیابی که یک کنشگر تهدید بهاحتمال زیاد نمیتواند مدل را سوءاستفاده کند، تأیید کنید که یک تیم قرمزِ بهاندازه کافی برخوردار از منابع قادر نیست در یک بستر واقعگرایانه استقرار، مدل را سوءاستفاده کند یا تکلیف نماینده مرتبطی را به سرانجام برساند. تمرینهای ۴.۱.۱،
- ۴.۱.۳ و ۴.۱.۴ را بر انتخاب تکالیف نماینده برای رزمایشهای تیم قرمز و نیز سنجشهای توانمندی اعمال کنید.
- هدفی را که تیم قرمز میکوشد به آن دست یابد از پیش بهروشنی مشخص کنید، انگیزهها و «پاسخگویی» (Accountability) برای دستیابی به آن اهداف فراهم آورید، و تیمهای قرمز را بر اساس تواناییشان در دستیابی به آن اهداف برگزینید.
- بر تیمهای قرمزی تکیه کنید که از خبرگان بیرونی تشکیل شده و بهگونهای معنادار از توسعهدهنده مدل مستقلاند و انگیزههایی نداشته باشند که با هدف تیمقرمزیشان در تعارض باشد.
- تخصص، منابع و زمان در دسترس تیم قرمز را با آنهای یک کنشگر تهدیدِ مرتبط مقایسه کنید. تا آنجا که شکافهایی وجود دارد، هنگام تفسیر نتیجه رزمایش تیم قرمز، بهصراحت این شکافها را لحاظ کنید.
- در نظر بگیرید که منابع بیشتری به تیم قرمز ارائه کنید یا انجام تکلیف تیم قرمز را به شیوههای دیگری آسانتر کنید (مانند ارائه دسترسی بیشتر،[۲۴] کاهش دشواری تکلیف، یا تقسیم تکالیف پیچیده به اجزای سازنده) تا جبران هر شکاف باقیمانده میان تیم قرمز و کنشگران تهدید ممکن شود.
- در نظر بگیرید که حفاظتهای حقوقی در دسترس برای تکالیف تیم قرمز فراهم کنید، مانند معافیت از شرایط استفاده و جبران خسارت حقوقی آنان در قبال تعاملاتشان با مدل.
- دستکم به همان اندازهای که یک مهاجم به اطلاعات درباره سیستم دسترسی خواهد داشت، اطلاعات در اختیار تیم قرمز قرار دهید و هر موردی را که تیم قرمز فاقد اطلاعات کامل درباره طراحی حفاظهای سیستم است بهصراحت مشخص کنید.
- هر سطح از دسترسی به مدل را که یک کنشگر تهدید ممکن است داشته باشد در نظر بگیرید — از دسترسی محدود از طریق API تا دسترسی مستقیم به کد و پارامترهای تعریفکننده مدل — و کمینه سطح دسترسی (در صورت وجود) را تعیین کنید که به تیم قرمز امکان دستیابی به هدفش را میدهد.
- بازه زمانیای را که قرار است نتایج تیمقرمزی بر آن اعمال شود بهصراحت تعریف کنید و این واقعیت را در نظر بگیرید که یک کنشگر تهدید در آن بازه زمانی به هر اطلاعاتی درباره نحوه استفاده از مدل یا دورزدن حفاظها که عمومی شود دسترسی خواهد داشت.
- مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه پیادهسازی تمرین ۴.۲ کمک کند:
- a. توصیفی از هدف تیم قرمز.
- b. توصیفی از ترکیب، تخصص، منابع و جدول زمانی تیم قرمز.
- c. نتایج رزمایش تیم قرمز در سطوح مختلف دسترسی به مدل.
- d. خلاصهای از راهبردهای دنبالشده توسط تیم قرمز.
هدف ۵: اطمینان از اینکه ریسک سوءاستفاده پیش از استقرار مدلهای بنیادین مدیریت میشود
تنها هنگامی اقداماتی برای افزایش دسترسی به مدل انجام دهید (مانند استقرار مدل از طریق API یا آزادسازی وزنهای آن) که ریسکهای سوءاستفاده بهاندازه کافی مدیریت شده باشند، از جمله اینکه دستکم در محدوده «تحمل ریسک» (Risk tolerance) سازمان باشند.
تمرین ۵.۱: اثر یک استقرار بالقوه بر «ریسک سوءاستفاده» (Misuse Risk) مدل را ارزیابی کنید.
توصیههایی برای پیادهسازی مؤثر تمرین 5.1:
- گزینههای بالقوه استقرار و سطوح دسترسیای که به کنشگران میدهند را در نظر بگیرید (مثلاً اینکه آیا تعداد یا نوع کنشگرانی که میتوانند به مدل دسترسی پیدا کنند را افزایش میدهند یا اینکه دسترسی بیشتری به ویژگیهای مدل به کنشگران میدهند).
- سطح دسترسیای که یک کنشگر مخرب میتواند تحت هر استقرار پیشنهادی به دست آورد را شناسایی کنید (مثلاً آیا به آنها دسترسی به استنتاج از طریق API، دسترسی به یک API تنظیم دقیق، یا دسترسی به وزنهای مدل میدهد) و بررسی کنید که استقرار چگونه ممکن است بر ریسک سوءاستفاده تأثیر بگذارد. برای مثال، اجازه دادن به تنظیم دقیق از طریق API میتواند گزینهها برای جلوگیری از دور زدن محدودیتها را بهطور چشمگیری محدود کند و اشتراکگذاری وزنهای مدل میتواند گزینهها برای پایش سوءاستفاده (تمرین 6.1) و پاسخ به موارد سوءاستفاده (تمرین 6.2) را بهطور چشمگیری محدود کند.
مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه پیادهسازی تمرین 5.1 کمک کند:
- a. برای هر استقرار: سطح دسترسی ارائهشده، ریسکهای سوءاستفاده ارزیابیشده مرتبط با استقرار، و مجموعه سپرهای ایمنی پیشبینیشده برای کاهش این ریسکهای سوءاستفاده.
تمرین 5.2: سپرهای ایمنی متناسب با ریسک سوءاستفاده مدل را پیادهسازی کنید.
- توصیههایی برای پیادهسازی مؤثر تمرین 5.2:
- سپرهای ایمنی طراحیشده برای محافظت از مدل در برابر سوءاستفاده را پیادهسازی کنید. پیوست A فهرستی غیرجامع از سپرهای ایمنی ممکن را ارائه میدهد.
- پیش از اتکا به سپرهای ایمنی برای جلوگیری از سوءاستفاده از قابلیتهای مهم نگرانکننده، شواهد قابلاعتمادی از اثربخشی آنها به دست آورید.
- اگر سپرهای ایمنی اضافی در پاسخ به ریسکهای شناساییشده افزوده میشوند، پیش از استقرار، با انجام تمرینهای تیم قرمز در حالی که سپرهای ایمنی اضافی فعال هستند، بررسی مجدد ریسک سوءاستفاده را در نظر بگیرید.
مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه پیادهسازی تمرین 5.2 کمک کند:
- a. فهرست سپرهای ایمنی که پیادهسازی شدهاند.
- b. خلاصهای از نتایج ارزیابی سپرهای ایمنی از طریق تیم قرمز و سایر آزمونها.
تمرین 5.3: تنها استقرارهایی را دنبال کنید که ریسک سوءاستفاده در آنها بهاندازه کافی مدیریت شده باشد.
توصیههایی برای پیادهسازی مؤثر تمرین 5.3:
- برای هر استقرار، فرایندی تعیین کنید تا بر اساس ریسک سوءاستفاده ارزیابیشده و توجه به هرگونه سپر ایمنی، مشخص شود آیا استقرار باید ادامه یابد یا خیر. در غیر این صورت، تعیین کنید که آیا استقرار باید اصلاح، به تعویق انداخته یا لغو شود. برای مثال، در نظر بگیرید که آیا بهبودهای بیشتر ایمنی پیش از استقرار امکانپذیر است، آیا میتوان از زمان اضافی برای انجام برآورد قابلاعتمادتری از ریسک استفاده کرد، یا با توجه به سطح ریسک ارزیابیشده، استقرار محدودتر ممکن است مناسبتر باشد.
- در نظر بگیرید که میان سطح ریسک تخمینی در نقطه استقرار و تحمل ریسک سازمان، حاشیه ایمنیای باقی بگذارید. در نظر بگیرید که کنشگران تهدید چگونه ممکن است پس از استقرار مدل،25 همچنان به کسب دانش جدید درباره نحوه سوءاستفاده یا تقویت مدل و چگونگی دور زدن سپرهای ایمنی آن دست یابند.26 برای مدیریت ریسکهایی که جدیتر یا کمتر قطعی هستند، حاشیه ایمنی بزرگتری را در نظر بگیرید.
مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه پیادهسازی تمرین 5.3 کمک کند:
هدف 6: گردآوری اطلاعات درباره سوءاستفاده پس از استقرار و پاسخ به آن اطلاعاتی درباره سیستمهای مستقرشده گردآوری کنید که درک ریسک سوءاستفاده آنها را بهبود میبخشد تا استقرارها تنظیم شده و مدیریت ریسک آینده بهبود یابد. با یافتههای عموم مردم، سازمانهای مرتبط جامعه مدنی، پژوهشگران بیرونی، و شرکای توزیع طرف ثالث مدل پایه درگیر شوید و آنها را تشویق کنید.
تمرین 6.1: در صورت امکان، کانالهای توزیع را برای شواهد سوءاستفاده پایش کنید.
- توصیههایی برای پیادهسازی مؤثر تمرین 6.1:
- ضمن حفظ حریم خصوصی کاربران، APIها، وبسایتها، و سایر کانالهای توزیع را از نظر سوءاستفاده پایش کنید.
- سیستمهایی برای امکانپذیر کردن تشخیص خودکار سوءاستفاده بسازید یا تهیه کنید.
- اثربخشی سیستمهایی که برای تشخیص سوءاستفاده در نظر گرفته شدهاند را بهطور مستمر ارزیابی کنید تا مبنای مرجع (ground truth) برای اثربخشی آنها فراهم شود و شواهدی به دست آید که سوءاستفادهای بدون تشخیص باقی نمیماند. تیم قرمز میتواند بهویژه برای ارزیابی اینکه آیا کنشگران مخرب ممکن است بتوانند آگاهانه از تشخیص اجتناب کنند، مفید باشد.
- درخواست کنید که کانالهای توزیع طرف ثالث مدل، آن کانالها را از نظر سوءاستفاده پایش کنند و اطلاعات مربوط به پایششان را بهطور منظم با توسعهدهنده به اشتراک بگذارند.
- هنگامی که این کار به اولویتبندی منابع محدود، بهبود حریم خصوصی، و افزایش پوشش کمک میکند، استفاده از روشهای لایهبندیشده تشخیص را در نظر بگیرید. این میتواند شامل پالایش سوءاستفاده ابتدا از طریق روشهای خودکار کمهزینهتر باشد که سپس، در صورت اقتضا، با روشهایی نیازمند مداخله مستقیم انسانی اعتبارسنجی میشوند.
- هنگامی که کنشگران مخرب میتوانند با بهرهبرداری مستقل از مدل از پایش مستقیم اجتناب کنند — مانند زمانی که وزنهای آن بهطور گسترده در دسترس هستند — سازوکارهایی غیر از آنچه در توصیههای 6.1.1، 6.1.2، و 6.1.3 شناسایی شد را در نظر بگیرید که بتوان از آنها برای پایش الگوهای رفتار مخربی که مدل امکانپذیر میسازد استفاده کرد.
مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه اجرای تمرین 6.1 کمک کند:
- a. خلاصهای از سازوکارهای بهکاررفته برای پایش هر کانال توزیع یک «مدل پایه» (Foundation Model) و روشهای تعیین اثربخشی آن سازوکارها.
تمرین 6.2: حفظ فرایندی برای پاسخ به رخدادهای سوءاستفاده از مدل.
- توصیههایی برای اجرای اثربخش تمرین 6.2:
- 27
- ایجاد مسئولیتهای سازمانی روشن برای پاسخ به «رخداد»های (Incident) سوءاستفاده.
- توسعه پیشگیرانه برنامههایی برای سناریوهای نو و محتمل سوءاستفاده و نحوه پاسخ به آنها، مانند محدودکردن دسترسی به مدل یا تقویت ضمانتها.28
- هنگامی که کاهش اثربخش دسترسی به مدل ممکن نباشد، مانند زمانی که وزنهای مدل بهطور گسترده در دسترس هستند، برنامهریزی برای اینکه موارد شناساییشده سوءاستفاده چگونه تصمیمهای «آینده» (Future) توسعه و «استقرار» (Deployment) را آگاهانه کنند.
- در نظر گرفتن انجام رزمایشهایی برای تمرین پاسخ به سناریوهای سوءاستفاده حساس به زمان و حیاتی از نظر «ایمنی» (Safety).
- مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه اجرای تمرین 6.2 کمک کند:
- a. خلاصهای از فرایند پاسخ به رخداد و نقشها و مسئولیتهای سازمانی در آن فرایند.
- تمرین 6.3: ایجاد حمایتها برای گزارشدهی داخلی مسائل سوءاستفاده.
- توصیههایی برای اجرای اثربخش تمرین 6.3:
- پذیرش سیاستهایی که از افراد گزارشدهنده مسائل مرتبط با «ریسک سوءاستفاده» (Misuse Risk) مدل حمایت و از آنها قدردانی میکنند.
- ایجاد فرایندهای رسمی برای رسیدگی بهموقع به دغدغههای مطرحشده توسط کارکنان و پیمانکاران.
مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه اجرای تمرین 6.3 کمک کند:
- a. خلاصهای از سیاستهای سازمان در زمینه گزارشدهی داخلی ایمنی.
تمرین 6.4: فراهمکردن پناهگاههای ایمن برای پژوهش ایمنی «طرف ثالث» (Third-Party).
توصیههایی برای اجرای اثربخش تمرین 6.4:
- انتشار یک سیاست افشای «آسیبپذیری»های (Vulnerabilities) روشن برای مسائل ایمنی مدل که مشخص میکند چگونه باید چنین آسیبپذیریهایی با توسعهدهنده و عموم در میان گذاشته شود و سازمان چگونه به آسیبپذیریهای گزارششده پاسخ خواهد داد.
- انتشار سیاست پناهگاه ایمن که متعهد میشود علیه پژوهشگران ایمنی بیرونی که با حسن نیت عمل میکنند و سیاست افشای آسیبپذیری را رعایت مینمایند، اقدام حقوقی انجام نشود یا حسابهای آنها محدود نشود.29
- در نظر گرفتن ارائه حمایت و تسهیلات برای تعامل پژوهشگران بیرونی احرازصلاحیتشده با مدل، مانند دادن دسترسی به پژوهشگران به مدلهایی با ضمانتهای کمتر برای انجام تمرینهای تیم قرمز پس از استقرار.
- مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه اجرای تمرین 6.4 کمک کند:
- a. خلاصهای از تعهد سازمان به عدم تعقیب حقوقی پژوهشگران طرف ثالثی که با حسن نیت عمل میکنند.
- b. توصیفی از فرایند سازمان برای فراهمکردن دسترسی پژوهشگران احرازصلاحیتشده به مدلها یا سیستمهایی با ضمانتهای کمتر.30
تمرین 6.5: ایجاد جوایز برای مسائل مرتبط با ریسک سوءاستفاده.
- توصیههایی برای اجرای اثربخش تمرین 6.5:
NIST AI 800-1 ipd (Initial Public Draft) ژوئیه ۲۰۲۴ (تیر ۱۴۰۳ تا مرداد ۱۴۰۳)
- ایجاد برنامهای برای تشویق پژوهشگران به یافتن آسیبپذیریها و افشای آنها مطابق با سیاست افشای آسیبپذیری.31
مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه اجرای تمرین 6.5 کمک کند:
- a. شرایط جوایز و جزئیات مربوط به فرایند ارسال آسیبپذیریها.
هدف: ارائه شفافیت مناسب درباره ریسک سوءاستفاده — ارائه شفافیت به عموم و نهادهای مربوط درباره فرایندهای سازمان برای توسعه و استقرار مدلهای پایه که به ریسک سوءاستفاده مرتبطاند، بهمنظور تسهیل فهم، «پاسخگویی» (Accountability)، همکاری و توسعه علمی مربوط به سوءاستفاده از مدل.
تمرین 7.1: انتشار منظم گزارشهای شفافیت شامل جزئیات کلیدی درباره ریسکهای سوءاستفاده و نحوه «مدیریت» (Manage) آن «ریسک»ها (Risks).
توصیههایی برای اجرای اثربخش تمرین 7.1:
- اشتراکگذاری روششناسی و نتایج ارزیابیهای پیش از استقرار قابلیتها، ریسکها و کاهشهای مدل، با بیشترین جزئیات ممکن درباره دادهها و روششناسی ارزیابی که بدون ایجاد ریسک برای ایمنی عمومی قابل افشاست.
- اشتراکگذاری جزئیات مربوط به ضمانتهای موجود برای مدل، از جمله نحوه اعمال آنها در کانالهای توزیع مختلف، به میزانی که بدون بیاثرکردن ضمانتها قابل اشتراک است.
- اشتراکگذاری اطلاعات درباره دادههای بهکاررفته در ساخت مدل که برای ارزیابی ریسک سوءاستفاده مرتبطاند، مانند منابع داده و معیارهای پالایش و انتخاب دادهها.
- اشتراکگذاری گامهایی که توسعهدهندگان و مستقرکنندگان پاییندستی سیستمهای AI که مدل پایه را یکپارچه میکنند بهتر است برای مدیریت ریسک سوءاستفاده بردارند.
- اشتراکگذاری جزئیات مربوط به ساختار داخلی و فرایند «حکمرانی» (Governance) داخلی سازمان در زمینه تعیین نحوه استقرار مدلهای پایه و «نگاشت» (Map)، «سنجش» (Measure) و مدیریت ریسک سوءاستفاده.
- در دسترس عموم قراردادن گزارشهای شفافیت، بهروزرسانی منظم آنها (مثلاً با هر نسخه اصلی جدید مدل) و گنجاندن اطلاعات کلیدی مرتبط با ریسک سوءاستفاده.
- 32
- 33
- 34
- 35
کنش ۷.۲: افشای اطلاعات درباره کنشهای «مدیریت ریسک» (Risk Management) برای ارتقای پاسخگویی
توصیههایی برای اجرای مؤثر کنش ۷.۲:
- بهطور منظم اطلاعات مربوط به کنشهای «مدیریت ریسک» (Risk Management) را از طریق فرایندی ساختارمند که پاسخگویی معناداری فراهم کند، به اشتراک بگذارید.
- اطلاعاتی را به اشتراک بگذارید که کنشهای بهکارگرفتهشده برای دستیابی به اهداف فهرستشده در این سند را پوشش میدهد، دستکم با همان سطح جزئیاتی که در بخشهای مستندسازی هر یک از کنشهای فهرستشده در اینجا توصیف شده است.
- اطمینان حاصل کنید که دریافتکنندگان اطلاعات بهطور مؤثر مستقل از فرایند توسعه و «استقرار» (Deployment) هستند و اختیار لازم برای برآوردن پاسخگویی را دارند (برای مثال از طریق افشای عمومی کاستیهای مدیریت ریسک).
مستندسازی زیر میتواند به ارائه «شفافیت» (Transparency) درباره نحوه اجرای کنش ۷.۲ کمک کند:
- ۱۰
- الف. خلاصهای از فهرست ذینفعانی که اطلاعات مربوط به کنشهای مدیریت ریسک را دریافت میکنند، و انواع اطلاعاتی که به آنها افشا میشود.
- کنش ۷.۳: گزارش «رخدادها» (Incidents) و خطرهای مرتبط با «مدل پایه» (Foundation Model) به پایگاههای داده رخدادهای AI.
توصیههایی برای اجرای مؤثر کنش ۷.۳:
- بر اساس بهترین شیوههای موجود و بازبینی کافی منافع و «ریسک» (Risk)های افشای اطلاعات مشخص، دسته رویدادهای سوءاستفادهای را که باید گزارش شوند، تعریف کنید.36
- گزارشهای تأییدشده سوءاستفاده را در قالبی رایج و قابلخواندن برای ماشین گردآوری کنید.
- گزارشهای تأییدشده سوءاستفاده را با اشخاص ثالث مرتبط، مانند پایگاههای داده رخدادهای AI، به اشتراک بگذارید.37
- مستندسازی زیر میتواند به ارائه شفافیت درباره نحوه اجرای کنش ۷.۳ کمک کند:
- الف. توصیفی از فرایند گزارش رخدادها، از جمله نمونهای از نوع رخدادی که ممکن است گزارش شود و اینکه به چه کسی گزارش خواهد شد.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C23-S03
شناسهٔ محتوا KDJ-AI-2026E1-P03-C23-S03-08CA9832