رفتن به محتوای اصلی
کهن‌دژکتاب مرجع هوش مصنوعی
منابعاعتبارسنجی
فهرست این فصلبخش ۵، فصل ۳۸ — صفحهٔ ۷ از ۱۲

بخش ۵، فصل ۳۸ — صفحهٔ ۷ از ۱۲

کاهش خطرهای ناشی از محتوای مصنوعی

متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.

۵.۱.۳.۱. چالش‌ها و محدودیت‌های پالایش خروجی تصویر

ترجمهٔ منبع
  • چالش‌ها و محدودیت‌های پالایش خروجی تصویر مشابه روش‌های دیگری است که پس از آموزش مدل‌های GAI اعمال می‌شوند؛ این روش‌ها نمی‌توانند به‌طور کامل از خروجی‌های محتوای مصنوعی CSAM و NCII مضر جلوگیری کنند، اگر داده‌های آموزشی حاوی این محتوای مضر باشند. اثربخشی پالایه‌های خروجی تصویر به داده‌های آموزشی آن‌ها و میزان پوشش گستره وسیعی از محتوای جنسی وابسته است. مشابه سایر طبقه‌بندها، این طبقه‌بندها ممکن است در مسدودسازی محتوا محافظه‌کار یا بسیار آسان‌گیر باشند، و تعیین آستانه‌های پالایه و سطوح اطمینان برای محتوایی که در ناحیه خاکستری قرار دارد، می‌تواند ذهنی باشد یا صرفاً ممکن است در سیاست‌های داخلی یک سازمان به‌عنوان نقض‌آمیز پوشش داده نشود، چالش‌برانگیز است. این طبقه‌بندها همچنین می‌توانند بر اساس سوءاستفاده واقعی از ابزارها توسط کنشگران مخرب آگاه شوند و برای اثربخش بودن، توصیه می‌شود
  • به‌طور مستمر به‌روزرسانی شوند تا موارد سوءاستفاده تجربی را منعکس کنند. این یکی دیگر از چالش‌های عمده اجراست، از آن رو که شکل‌های جدید سوءاستفاده ممکن است به‌سختی تشخیص داده شوند، اگر طبقه‌بندها برای تشخیص محتوای سوءاستفاده نوظهور طراحی نشده باشند. پالایش خروجی تصویر ممکن است برای محتوایی که برهنگی روشن و آشکار دارد، با توجه به وجود طبقه‌بندهای برهنگی، مؤثرتر باشد، اما برای تصویرسازی‌های جنسی مضر دیده‌نشده یا محتوایی که در ناحیه خاکستری قرار دارد، کمک‌کننده‌تر نباشد. در نهایت، در اختیار داشتن مجموعه‌داده آموزشی حاوی محتوای صریح، خود می‌تواند برای پژوهشگران صنعت و دانشگاه یک ریسک باشد.

5.1.4. درهم‌سازی CSAM و NCII مصنوعی تأییدشده

  • درهم‌سازی CSAM و NCII مصنوعی پس از ایجاد آن‌ها و سپس اشتراک‌گذاری مناسب این درهم‌سازها با پلتفرم‌ها، جامعه مدنی و مجریان قانون، در حد مناسب، می‌تواند به رهگیری انتشار آن‌ها در سراسر اینترنت و مهار گسترش بیشتر کمک کند.
  • درهم‌سازهای رمزنگارانه از «اثر موج» استفاده می‌کنند که بر این اساس است که حتی تغییری اندک در داده‌های ورودی، درهم‌ساز رمزنگارانه‌ای کاملاً متفاوت تولید می‌کند. وقتی یک حرف در یک سند نوشتاری یا یک پیکسل در یک تصویر تغییر کند، درهم‌ساز رمزنگارانه جدید شبیه درهم‌ساز اصلی نخواهد بود. برای مثال، اگر یک تصویر CSAM به‌صورت رمزنگارانه درهم‌سازی شود و همان تصویر در پلتفرم شبکه اجتماعی شرکت‌کننده در پایگاه‌داده اشتراک درهم‌ساز حاوی تصویر اصلی منتشر شود، آن پلتفرم باید بتواند تطابق را شناسایی کند.
  • درهم‌سازی رمزنگارانه در حال حاضر توسط ارائه‌دهندگان خدمات و پلتفرم‌ها برای جلوگیری از بازتوزیع محتوای CSAM و NCII مصنوعی، به‌منظور شناسایی تطابق‌های دقیق محتوای فجیع، به کار می‌رود. با این حال، این روش در برابر هک و حملات خصمانه مصونیت ندارد.

الگوریتم‌های درهم‌سازی ادراکی برای پرونده‌های ورودی مشابه از دید انسان‌ها، درهم‌سازهای مشابهی تولید می‌کنند؛ مقدار درهم‌ساز وابسته به محتواست و اگر محتوا به‌طور چشمگیر تغییر نکند، تقریباً یکسان باقی می‌ماند؛ مثلاً وقتی تغییراتی در فشرده‌سازی، روشنایی، جهت‌گیری یا رنگ اعمال شود. هدف این است که فاصله و شباهت درهم‌سازهای ادراکی برای تقریب میزان شباهت میان پرونده‌های ورودی استفاده شود. هنوز این احتمال وجود دارد که درهم‌سازهای ادراکی مثبت کاذب و منفی کاذب تولید کنند؛ به این معنا که پرونده‌های ورودی متفاوت ممکن است درهم‌سازهای یکسان یا قابل مقایسه داشته باشند، در حالی که پرونده‌های ورودی مشابه ممکن است درهم‌سازهای متفاوتی داشته باشند.

پژوهش‌ها نشان می‌دهند که درهم‌سازی ادراکی می‌تواند در قالب‌های چندرسانه‌ای مزایای بیشتری داشته باشد، از آن رو که تطابق درهم‌ساز را بر اساس شباهت تولید می‌کند و تفاوت‌های قالب و کیفیت را تحمل می‌کند. برای مثال، اگر یک تصویر CSAM مصنوعی تأییدشده با یک پالایه رنگ ویرایش شود و در یک پلتفرم منتشر گردد، تطابق درهم‌ساز آن با محتوای اصلی حفظ خواهد شد.

اگر کارشناسان ایمنی در شرکت‌های هوش مصنوعی بتوانند این اشکال محتوای مصنوعی را بررسی و تصاویر را به‌عنوان CSAM و NCII شناسایی کنند (هرچند خود طبقه‌بندی تصاویر ممکن است چالشی حقوقی و سیاستی باشد)، این محتوا می‌تواند درهم‌سازی شود (هم با درهم‌سازهای رمزنگارانه و هم ادراکی) و در پایگاه‌داده‌های مشترک

  • مربوط به CSAM و NCII شناخته‌شده ذخیره شود تا سایر نهادها بتوانند آن را شناسایی کنند. این کار امکان تشخیص و کاهش این محتوا را در پلتفرم‌ها و وب‌سایت‌های مختلف فراهم می‌کند. این راه‌حل ممکن است نتواند از آسیب‌های CSAM و NCII مصنوعی جلوگیری کند، اما می‌تواند شدت و پیامد این آسیب‌ها را با مانع‌تراشی در برابر انتشار این محتوا و کاهش مواجهه بیشتر افرادی که بدون رضایت آن‌ها به تصویر کشیده شده‌اند، کاهش دهد.
  • 5.1.4.1. چالش‌ها و محدودیت‌های درهم‌سازی CSAM و NCII مصنوعی تأییدشده
  • درهم‌سازی CSAM و NCII تأییدشده با چالش‌های هماهنگی، سیاستی و فنی روبه‌روست.

هماهنگی میان سازمان‌ها برای اشتراک‌گذاری امن و اثربخش این محتوا می‌تواند دشوار باشد. هنجارها و قوانین تثبیت‌شده‌ای درباره گزارش CSAM وجود دارد و نیز سازمان‌های تثبیت‌شده‌ای که این کار را انجام می‌دهند، مانند National Center on Missing and Exploited Children (NCMEC)، که ثبت درهم‌ساز برای CSAM مصنوعی گزارش‌شده را نیز آغاز کرده است. با این حال، تلاش‌های مربوط به CSAM و NCII مصنوعی هنوز در مراحل اولیه است و می‌تواند میان توسعه‌دهندگان هوش مصنوعی، پلتفرم‌های شبکه‌های اجتماعی، پلتفرم‌های پیام‌رسانی و سایر ارائه‌دهندگان اینترنت به‌شکل بهتری هماهنگ و استاندارد شود تا بتوان انتشار این محتوا را رهگیری و آن را به‌شکل مؤثر و پیشگیرانه به مجریان قانون گزارش کرد.

چالش‌های سیاستیِ درک بافت نیز بر درهم‌سازی CSAM و NCII مصنوعی اعمال می‌شود. تصویرسازی صریح از صغیر در تصاویر جرم جنایی است و CSAM مصنوعی می‌تواند بازنمایی بصری رفتار جنسی صریح درگیرکننده یک صغیر باشد که با استفاده از فناوری‌های GAI تسهیل شده است. با این حال، در حال حاضر هیچ سیستم طبقه‌بندی یکپارچه‌ای برای محتوای مصنوعی وجود ندارد که روشن کند یک تصویر اصیل چگونه ممکن است با هوش مصنوعی تغییر یافته باشد، آیا تصویر کاملاً مصنوعی است، آیا تصویر یک صغیر را نشان می‌دهد و چه نوع رفتار صریحی در تصویر نمایش داده شده است. مسئله کلیدی دیگر، تعیین این است که آیا تصویری که بارگذاری و با هوش مصنوعی تغییر یافته، NCII بوده است یا خیر. داوری درباره رضایت برای ابزارهای GAI پرکاربرد دشوار است، مگر آنکه خود ابزار مخرب باشد و بر روی تصاویر اصیل افراد آموزش دیده باشد، و رضایت در پلتفرم‌های شبکه‌های اجتماعی نیز به‌سختی قابل تشخیص است. رضایت همچنین ممکن است به بافت‌های خاصی محدود باشد؛ برای مثال، ممکن است رضایتی برای استفاده از تصویر یک فرد جهت ایجاد تصویر جدید GAI وجود داشته باشد، اما نه برای توزیع آن تصویر. افزون بر این، حتی اگر این نواحی خاکستری سیاستی در سراسر صنعت و جامعه مدنی استاندارد شوند و از طریق مقررات و اقدامات حقوقی شفاف گردند، بررسی و درهم‌سازی این محتوا همچنان باید در مقیاس بزرگ انجام شود. در زمان حاضر، بررسی انسانی همچنان برای برچسب‌گذاری دقیق الزامی است که این امر همچنین بر سلامت روان بازبینانی که این محتوا را بررسی می‌کنند فشار وارد می‌کند. این ملاحظات سیاستی برای درک اهمیت دارند، زیرا برچسب‌گذاری و تعیین سطوح شدت برای محتوای درهم‌سازی‌شده کار ساده‌ای نیست.

در نهایت، اشاره به این نکته مهم است که درهم‌سازی—هم ادراکی و هم رمزنگارانه—و آسیب‌پذیری‌های آن محدودیت‌های فنی دارد. درهم‌سازی می‌تواند مسائل استواری مانند برخورد درهم‌سازها (hash collisions) داشته باشد و هرچند می‌تواند تدبیر امنیتی سودمندی باشد، همچنین ممکن است مورد حمله و دستکاری قرار گیرد. تغییرات مخرب درهم‌سازها، به‌ویژه درهم‌سازهای ادراکی، نگرانی‌برانگیز است، زیرا تغییرات مخرب بدون آنکه از اعوجاج مشروع متمایز شوند، ممکن‌اند. عوامل مخرب می‌توانند تصویری را به شکلی تغییر دهند که از اعوجاج‌های مشروع یا بی‌خطر (مانند فشرده‌سازی) قابل تمایز نباشد و بدین‌سان یکپارچگی رهگیری تصویر اصلی را تحت تأثیر قرار دهند. درهم‌سازی ادراکی می‌تواند امکان نشت قابل‌توجه داده را فراهم کند. همان ویژگی‌هایی که این فن را استوار می‌کنند، می‌توانند امکان استنباط اطلاعات درباره محتوای زیربنایی از درهم‌ساز آن محتوا را فراهم آورند و ریسک‌های جدی حریم خصوصی ایجاد کنند.

در نهایت، پایگاه‌داده‌های میزبان درهم‌سازها بهتر است به‌درستی امن شوند. الگوریتم‌های اشتراک درهم‌سازِ با امنیت ناکافی می‌توانند امکان بهره‌برداری بیشتر را فراهم کنند، که در صورت وجود CSAM تأییدشده یا سایر محتوای حساس در پایگاه‌داده‌های اشتراک درهم‌ساز، می‌تواند به قربانیان آسیب برساند.

  • 5.1.5. فنون رهگیری داده‌های اصالت و منشأ برای CSAM و NCII مصنوعی
  • فنون رهگیری داده‌های اصالت و منشأ برای محتوای مصنوعی، مانند واترمارک دیجیتال و ضبط فراداده، می‌توانند برای کاهش آسیب‌های CSAM و NCII مصنوعی به کار روند. این فنون می‌توانند کنشگران مخرب را از استفاده از ابزارهایی که همه محتوای مصنوعی، از جمله CSAM و NCII مصنوعی را به‌عنوان تولیدشده با AI5 افشا می‌کنند، بازدارند.
  • کنشگران مخربی که CSAM و NCII مصنوعی می‌سازند، ممکن است ابزارها را برای بهره‌برداری کمتر جذاب بیابند، اگر آن ابزارها شامل اطلاعات اصالت و منشأ درباره منشأ یک تصویر باشند یا واترمارکی داشته باشند که نشان دهد تصویر با هوش مصنوعی تولید شده است؛ چرا که این امر می‌تواند به‌سرعت به رد هر ادعایی مبنی بر اصیل بودن تصاویر CSAM و NCII مصنوعی کمک کند. بیشتر کنشگران مخربی که این محتوا را در اینترنت تولید می‌کنند، از ابزارهای متن‌باز استفاده می‌کنند یا حتی می‌توانند مدل‌های کوچک‌تر خود را بر اساس کد متن‌باز موجود بسازند، از آن رو که به‌آسانی می‌توانند حفاظ‌ها را حذف کنند. پیاده‌سازی رویکردهای رهگیری داده‌های اصالت و منشأ که از واترمارک‌های استوار و/یا فراداده امن و امضاشده با رمزنگاری بهره می‌گیرند، می‌تواند موانعی برای کنشگران مخربی که به‌دنبال تولید سریع و حتی کسب درآمد از CSAM و NCII مصنوعی هستند، ایجاد کند. این روش ممکن است میزان CSAM و NCII مصنوعی ایجادشده با ابزارهایی که فنون رهگیری داده‌های اصالت و منشأ را شامل می‌شوند را کاهش دهد، هرچند برای پشتیبانی از این ادعا به پژوهش بیشتری نیاز است.

تعیین مستقیم CSAM و NCII مصنوعی به‌عنوان تولیدشده با هوش مصنوعی از طریق برچسب‌های اصالت و منشأ می‌تواند شناسایی روان این محتوا را برای متخصصانی که این آسیب‌ها را رهگیری می‌کنند ممکن سازد. منفعت شناسایی روان به‌احتمال زیاد زمانی اعمال می‌شود که محتوا توسط کنشگرانی کمتر ماهر تولید و منتشر شده باشد؛ کنشگرانی که به‌طور راهبردی از ابزارهای فاقد فنون رهگیری داده‌های اصالت و منشأ استفاده نمی‌کنند، یا کنشگرانی که از روش‌های حذف واترمارک یا فراداده آگاه نیستند. محتوای مضر ایجادشده توسط ابزارهای GAI که از فنون رهگیری داده‌های اصالت و منشأ—مانند واترمارک دیجیتال و ضبط فراداده—استفاده می‌کنند، در یک اکوسیستم میان‌کارپذیر، زمانی که ارائه‌دهندگان محتوا و پلتفرم‌های گوناگون بتوانند واترمارک‌ها را تشخیص دهند و/یا فراداده را حفظ کنند، می‌تواند به‌آسانی‌تر شناسایی شود.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S26

شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S26-F7DA881B

پیوند مستقیم این بخش

۵.۱.۵.۱. چالش‌ها و محدودیت‌های تکنیک‌های رهگیری داده‌های اصالت و منشأ برای CSAM مصنوعی و NCII

ترجمهٔ منبع

NCII

چالش‌ها و محدودیت‌های تکنیک‌های رهگیری داده‌های اصالت و منشأ برای CSAM مصنوعی و NCII شامل عدم‌قطعیت‌های مربوط به اثربخشی، مسائل استواری، و امکان سوءاستفاده‌ی خصمانه است.

پژوهش و شواهد کافی درباره‌ی اینکه آیا برچسب‌های منشأ در کاهش آسیب‌های ناشی از CSAM مصنوعی و NCII اثربخش هستند یا نه و چگونه، وجود ندارد. بازماندگان و قربانیانی که تصاویرشان بدون رضایت آن‌ها از طریق AI تغییر یافته است، صرف‌نظر از اینکه محتوا برچسب‌های آشکار و فراداده‌ی پیوست‌شده داشته باشد یا خیر، آسیب، تحقیر و تنزل را تجربه می‌کنند.

مسائل استواری تکنیک‌های رهگیری داده‌های اصالت و منشأ نیز موضوع نگران‌کننده‌ای است. همان‌طور که در بخش‌های پیشین اشاره شد، حتی استوارترین چارچوب‌ها برای ضبط فراداده و واترمارک دیجیتال می‌توانند در برابر دستکاری و تغییر آسیب‌پذیر باشند. واترمارک‌های پنهان و آشکار را می‌توان از محتوای دیجیتال حذف کرد و فراداده‌ی تعبیه‌شده نیز ممکن است بتواند برچیده شود. تمام مسائل منشأ که در این گزارش بحث شده است، بر کاربرد آن برای CSAM مصنوعی و NCII نیز صدق می‌کند. با توجه به سطح حساسیت و آسیب در این نوع محتوا، استواری می‌تواند بر شناسایی گسترده‌ی این محتوا توسط متخصصان، و نیز قربانیان این آسیب‌ها، اثر بگذارد.

در نهایت، مسائل استواری می‌توانند زمینه‌هایی برای سوءاستفاده‌ی خصمانه از رهگیری داده‌های اصالت و منشأ فراهم کنند. پژوهش‌های اولیه نشان می‌دهند که کنشگران مخرب چگونه می‌توانند واترمارک‌ها و فراداده‌ها را از CSAM مصنوعی و NCII حذف کنند. در آن صورت، ممکن است بتوانند منافع برچسب‌های روی این محتوا را تضعیف کنند. افزون بر این، بخش مربوط به

  • فراداده‌ی تعبیه‌شده نشان می‌دهد که حملات خصمانه چگونه می‌توانند بر فراداده‌ای که هم بدون‌امضا و هم امضاشده است انجام شوند؛ رمزنگاری تضمین کاملی در برابر حملات خصمانه فراهم نمی‌کند.
استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S27

شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S27-8EA72266

پیوند مستقیم این بخش

۵.۱.۶. تیم قرمز (Red-Teaming) و آزمون برای CSAM و NCII

ترجمهٔ منبع

تیم قرمز و آزمون برای محتوای مصنوعی CSAM و NCII پیش از استقرار مدل‌های GAI ممکن است بتواند ضمانت‌های بیشتری فراهم کند. مطابق تعریف مندرج در فرمان اجرایی EO 14110 درباره توسعه و کاربرد ایمن، امن و قابل‌اعتماد هوش مصنوعی، تیم قرمز به «تلاشی ساخت‌یافته برای آزمون به‌منظور یافتن نقص‌ها و آسیب‌پذیری‌ها در یک سامانه هوش مصنوعی، اغلب در محیطی کنترل‌شده و با همکاری توسعه‌دهندگان هوش مصنوعی» اشاره دارد. تیم قرمز نوعی محدود از روش ارزیابی است. در حال حاضر، تیم قرمز استانداردشده برای مدل‌های GAI وجود ندارد، زیرا این حوزه تازه در حال شکل‌گیری است. با این حال، می‌توان از سطح پایه‌ای از تیم قرمز—مانند واردکردن انواع پرامپت‌های خصمانه برای تولید محتوای مصنوعی CSAM و NCII—استفاده کرد. با جست‌وجوی اینترنت و سیستم‌های داخلی برای یافتن پرامپت‌های شناخته‌شده‌ای که برای تولید یا تلاش برای تولید محتوای مصنوعی CSAM و NCII به‌کار رفته‌اند، توسعه‌دهندگان مدل‌های هوش مصنوعی می‌توانند ارزیابی‌های اولیه‌ای از تمایل مدل به تولید این محتوا به‌دست آورند. یک پروتکل تثبیت‌شده و یکسان تیم قرمز یا رهنمودهایی برای محتوای مصنوعی CSAM و NCII ممکن است بتواند اندازه‌گیری آینده این محتوا را تسهیل کند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S28

شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S28-CA825B4D

پیوند مستقیم این بخش

۵.۱.۶.۱. چالش‌ها و محدودیت‌های تیم قرمز و آزمون برای CSAM و NCII

ترجمهٔ منبع

تیم قرمز و آزمون نمی‌توانند به‌طور مؤثر جبران‌کننده مسائل موجود در داده‌های آموزشی باشند. این روش‌ها همچنین وابسته به چگونگی انجام آزمون هستند و ازاین‌رو به سمت آزمون «آسیب‌پذیری‌ها» (Vulnerabilities) شناخته‌شده در یک «سامانه هوش مصنوعی» (AI system) سوگیری دارند. همان‌طور که در سراسر این بخش اشاره شد، مجموعه‌داده‌های آموزشی فاقد داده‌های CSAM و NCII می‌توانند به کاهش تولید این محتوا کمک کنند. حافظ‌های امنیتی تکمیلی که پس از اجرای اولیه آموزش اعمال می‌شوند، ممکن است در صورتی که خود داده‌ها آلوده باشند، کافی نباشند. در نهایت، با کاویدن مدل با پرامپت‌هایی که از پیش مضر و/یا قادر به تولید CSAM یا NCII مصنوعی شناخته شده‌اند، ممکن است توسعه‌دهنده پوششی برای پرامپت‌های خصمانه جدیدی که می‌توانند از حفاظ‌های مدل عبور کنند نداشته باشد.

فرصت‌هایی برای توسعه بیشتر: برای طراحی راهبردهای مؤثر تیم قرمز به‌منظور شناسایی خروجی‌های CSAM و NCII مصنوعی، تعیین اثربخشی تکنیک‌های رهگیری «داده‌های اصالت و منشأ» (Provenance data) بر این محتوا در کاهش «آسیب» (Harm)، طراحی طبقه‌بندها و صافی‌ها برای حذف CSAM و NCII از داده‌های آموزشی و نیز در سطوح ورودی و خروجی مدل، و ایجاد هماهنگی میان جامعه مدنی، صنعت، مجریان قانون و دیگر نهادهای مرتبط به‌منظور هش‌گذاری CSAM و NCII مصنوعی، به پژوهش و توسعه بیشتری نیاز است. پژوهش بیشتر همچنین برای بررسی امکان‌پذیری هش‌گذاری ادراکیِ حافظ حریم خصوصی مورد نیاز است.

  1. به‌کارگیری مفاهیم در چرخه عمر «چارچوب مدیریت ریسک هوش مصنوعی» (AI Risk Management Framework, RMF) NIST
  • «چارچوب مدیریت ریسک هوش مصنوعی» (AI RMF) NIST بیان می‌کند که «سنجش ریسک در مرحله پیشین چرخه عمر هوش مصنوعی ممکن است نتایج متفاوتی نسبت به سنجش ریسک در مرحله پسین به دست دهد؛ برخی «ریسک‌ها» (Risks) ممکن است در
  • مقطعی از زمان نهفته باشند و با سازگاری و تکامل سامانه‌های هوش مصنوعی افزایش یابند.» «کنشگران هوش مصنوعی» (AI actors) مختلف (هم کنشگرانی که مدل‌های هوش مصنوعی را می‌سازند و/یا به‌کار می‌گیرند) اغلب دیدگاه‌های ریسکی متفاوتی خواهند داشت و ممکن است
  • تکنیک‌های خاصی از رهگیری داده‌های اصالت و منشأ یا «آشکارسازی محتوای مصنوعی» (Synthetic content detection) را بسته به مورد کاربرد، محصول و اهداف سازمانی سودمندتر بیابند.

تصویر در نسخهٔ PDF Figure 2. AI actors across AI lifecycle stages. From NIST AI 100-1 AI RMF 1.0

شکل ۲. کنشگران هوش مصنوعی در مراحل چرخه عمر هوش مصنوعی. برگرفته از NIST AI 100-1 AI RMF 1.0

داده و ورودی: گردآوری و پردازش داده‌ها: گردآوری و پالایش مسئولانه داده‌های آموزشی می‌تواند به کاهش و/یا پیشگیری از آسیب‌های خروجی‌های CSAM و NCII مصنوعی در این فاز کمک کند. تکنیک‌های رهگیری داده‌های اصالت و منشأ مانند «واترمارک‌گذاری» (Watermarking) و «فراداده» (metadata) می‌توانند به داده‌های آموزشی افزوده شوند تا

  • منشأ «مجموعه‌داده‌ها» (Datasets) به‌کاررفته در آموزش حفظ شود. در این فاز، داده‌ها و ورودی‌های مورد نیاز برای طراحی مدل‌های تشخیص جهت طبقه‌بندی «محتوای مصنوعی» (Synthetic Content) نیز قابل گردآوری هستند.
  • مدل هوش مصنوعی: ساخت و استفاده از مدل، تأیید و اعتبارسنجی: در فازهای ساخت و استفاده، و تأیید و اعتبارسنجی، تکنیک‌های رهگیری داده‌های اصالت و منشأ مانند فراداده یا واترمارک‌گذاری می‌توانند به‌طور پیشگیرانه در زمان تولید به خروجی‌های مدل افزوده شوند. برای اعمال ایمن این رویکردهای منشأ، می‌توان آن‌ها را در کاربردشان از طریق امضای دیجیتال یا انواع دیگر توابع هش، به‌صورت رمزنگارانه راستی‌آزمایی و «احراز هویت‌شده» (authenticated) کرد.
  • همچنین، مدل نهایی را می‌توان با واترمارک‌گذاری وزن‌ها یا پارامترهای مدل محافظت کرد. اثربخشی تکنیک‌های رهگیری داده‌های اصالت و منشأ، مانند
  • دقت در تشخیص واترمارک‌گذاری یا شناسایی صحیح محتوای دست‌کاری‌شده و مصنوعی، پیش از «استقرار» (Deployment) باید راستی‌آزمایی شود. سازوکارهای کاهشی که از ایجاد CSAM
  • و NCII مصنوعی جلوگیری می‌کنند (همان‌طور که در بخش‌های پیشین بحث شد) ممکن است به‌طور پیشگیرانه در فاز ساخت مدل اعمال شوند.
  • وظیفه و خروجی: استقرار و استفاده: برقراری سازوکارهایی برای گردآوری مجموعه متنوعی از بازخورد کاربران
  • —به‌ویژه در موارد مثبت کاذب (مثلاً افشای محتوایی به‌عنوان تولیدشده توسط هوش مصنوعی درحالی‌که در واقع
  • توسط انسان تولید شده است) یا منفی کاذب (مثلاً از دست دادن افشای محتوای تولیدشده توسط هوش مصنوعی)— از تلاش‌های احراز اصالت محتوا و آشکارسازی محتوای مصنوعی پشتیبانی می‌کند. اندازه‌گیری‌ها و «سنجه‌ها» (Metrics) به‌کاررفته به‌شدت به مورد کاربرد، بافت، سامانه‌های در حال آزمون و کاربرد وابسته هستند.
  • بافت کاربرد: بهره‌برداری و پایش: اثر گسترده‌تر رویکردهای «شفافیت محتوای دیجیتال» (Digital Content Transparency) را می‌توان در فاز بهره‌برداری و پایش چرخه عمر هوش مصنوعی، با توجه به اهداف، الزامات حقوقی و مقرراتی و ملاحظات اخلاقی بررسی کرد.
  • انسان‌ها و سیاره: استفاده‌کننده یا متأثر: با اشتراک‌گذاری نتایج TEVV انجام‌شده در سراسر چرخه عمر هوش مصنوعی با کنشگران نماینده گوناگون مانند توسعه‌دهندگان هوش مصنوعی، نهادهای جامعه مدنی و کاربران نهایی،
  • می‌توان به کاهش‌های مؤثر آسیب‌های بالقوه دست یافت. تمرکز بر حقوق دیجیتال برای همه و
  • «ایمنی» (Safety) از طریق طراحی در این فاز پایانی همچنان اهمیت دارد و پر کردن شکاف‌هایی که گروه‌ها ممکن است در آن‌ها از دسترسی به
  • حقوق دیجیتال بشری خود یعنی شفافیت محتوای دیجیتال محروم شوند—از طریق عواملی مانند نبود دسترسی به اینترنت
  • یا منابع سواد اطلاعاتی برای درک برچسب‌های محتوا، یا در نتیجه استفاده مخرب یا
  • ناخواسته از تکنیک‌های رهگیری داده‌های اصالت و منشأ که به‌صورت منفی بر حریم خصوصی کاربران اثر بگذارد—برای کنشگران هوش مصنوعی در سراسر چرخه عمر محتوا باید مورد توجه قرار گیرد.

تصویر در نسخهٔ PDF Figure 3. Digital content transparency approaches, across the AI lifecycle described in NIST AI RMF

شکل ۳. رویکردهای شفافیت محتوای دیجیتال در سراسر چرخه عمر هوش مصنوعی توصیف‌شده در NIST AI RMF

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S29

شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S29-393A2AD0

پیوند مستقیم این بخش