فهرست این فصلبخش ۵، فصل ۳۸ — صفحهٔ ۵ از ۱۲
بخش ۵، فصل ۳۸ — صفحهٔ ۵ از ۱۲
کاهش خطرهای ناشی از محتوای مصنوعی
متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.
۳.۱.۴.۴. آشکارسازی متن مصنوعی
پیشرفت قابلیتهای «مدل زبانی بزرگ» (Large Language Model, LLM) این موضوع را برای انسانها دشوار ساخته است که متن تولیدشده توسط AI را از متن نوشتهشده بهدست انسان تشخیص دهند؛ این امر بر ضرورت «شفافیت» (Transparency) درباره استفاده از مدلهای زبانی بزرگ در زمینههای گوناگون تأکید میکند. مدلهای زبانی بزرگ بهواسطه تولید خروجیهای نادرست یا غلط شناخته شدهاند که «توهم» یا «دروغبافی» نامیده شدهاند و همچنین میتوان از آنها برای تولید اطلاعات نادرست و/یا گمراهکننده در مقیاس بزرگ استفاده کرد. به همین دلایل، توانایی تشخیص محتوای تولیدشده توسط مدلهای زبانی بزرگ برای افزایش «شفافیت محتوای دیجیتال» (Digital Content Transparency) اهمیت دارد.
آشکارسازهای متن مصنوعی از پارامترهایی بر پایه ویژگیهای متنی مانند زبان، ساختار، پیچیدگی پیشبینی و تکانسنجی استفاده میکنند. پیچیدگی پیشبینی میسنجد که مدل تا چه اندازه میتواند کلمه بعدی را در یک دنباله از کلمات پیشبینی کند. تکانسنجی میزان قابلپیشبینی بودن یک قطعه محتوا را از طریق یکنواختی طول و ساختار جملهها میسنجد. برخی آشکارسازها بر «مدلهای زبانی» (Language Model, LM) مشابه آنهایی که در ابزارهای نگارش AI به کار میروند تکیه میکنند تا
- قابلیت پیشبینی و الگوهای زبانی متن را ارزیابی کنند. از این آشکارسازهای محتوا
- توسط برخی مربیان برای بررسی نوشتههای دانشجویان،
- توسط کسبوکارها برای اطمینان از اصالت محتوای منتشرشده،
- و توسط افراد برای راستیآزمایی «اصالت» (authenticity) متن در اینترنت استفاده میشود. برخی آشکارسازهای دیگر بر
- ناسازگاریهای واقعی (برای نمونه، پایگاهداده راستیآزمایی واقعیت و مدلهای استدلال) و تحلیل «فراداده» (metadata) (برای نمونه،
- آشکارسازی ناهنجاریها در فراداده محتوا مانند مهرهای زمانی، موقعیت مکانی و اطلاعات نویسنده) تکیه میکنند. باید توجه داشت که
- اثربخشی بسیاری از ابزارهای تشخیصی از این دست محل بحث است.
- فنون آشکارسازی متن مصنوعی
- فنونی که در پیوست D نشان داده شدهاند را میتوان در ردههای زیر طبقهبندی کرد:
| آشکارسازهای «واترمارکگذاری» (Watermarking) | دو جزء دارند: تعبیه و آشکارسازی. تعبیه، متنی با واترمارک (مانند یک سیگنال یا الگوی پنهان) را در خروجی مدلهای زبانی بزرگ درج میکند که به «رهگیری» (tracking) «دادههای اصالت و منشأ» (Provenance data) کمک میکند، در حالی که آشکارسازی، واترمارک را از متن تولیدشده توسط AI شناسایی میکند. |
| آشکارسازهای صفر-شات | متن تولیدشده توسط AI را بدون نیاز به آموزش قبلی روی دادههای برچسبخورده یا نمونههای تنظیم دقیق آشکار میسازند. این فن از ویژگیها و آمارههای متمایز (مانند تحلیلهای دستوری، تراکم واژگان، ویژگیهای ساختاری، طول مؤلفهها و ناسازگاریها) بهعنوان شاخصهای کلیدی در تمایز میان متن تولیدشده توسط AI و متن تولیدشده توسط انسان بهره میگیرد. |
| آشکارسازهای مبتنی بر تنظیم دقیق مدل زبانی | از روش «مدل زبانی» (Language Model, LM) تنظیمشده دقیق در آشکارسازی متن تولیدشده توسط مدلهای زبانی بزرگ استفاده میکنند. این کار شامل گرفتن یک مدل زبانی پیشآموزشدیده و تطبیق آن با مجموعهداده یا وظیفه مشخص مورد نظر است. این روش اجزای فرعی مشخصی از مدل را با یک تابع هزینه بهمنظور آشکارسازی خطاها یا ناسازگاریها در متن بهینه میسازد. بیشتر رویکردها برای فرایندهای آموزش نظارتشده به نمونههای جفتی نیاز دارند. |
| مدلهای زبانی بزرگ بهعنوان آشکارساز | از تنظیم دستورالعملی (Instruction Tuning) مدلهای زبانی بزرگ برای آشکارسازی متن سند و جمله استفاده میکنند و به مدلهای زبانی بزرگ امکان میدهند با بهرهگیری از دانش پیشآموزش خود، متن تولیدشده را آشکار کنند. این روش شامل بررسی متقابل یک مدل زبانی بزرگ با مدل زبانی بزرگ دیگر برای تمایز متن تولیدشده توسط خودشان یا سایر مدلهای زبانی بزرگ است و از روانی متن و خطاهای موجود در آن بهره میگیرد. |
| آشکارسازهای یادگیری خصمانه | متن تولیدشده توسط انسان و متن تولیدشده توسط مدلهای زبانی بزرگ را با در معرض قرار دادن آنها به «نمونههای خصمانه» (adversarial examples) از یکدیگر متمایز میسازند و از این راه دقت خود را بهبود میبخشند. این کار شامل پیکربندی یک مدل حمله در کنار یک مدل آشکارسازی است، بهگونهای که رویارویی تکراری میان این دو به آشکارسازی تقویتشده میانجامد. |
| آشکارسازهای با کمک انسان | از هر دو قابلیت تمیز انسان و ماشین برای تمایز کارآمد میان متن تولیدشده توسط انسان و متن تولیدشده توسط مدلهای زبانی بزرگ استفاده میکنند؛ بهگونهای که از دانش پیشین و مهارتهای تحلیلی انسان بهره میگیرند و همزمان از رفتار «مدل» (model's) میآموزند. |
- عملکرد آشکارسازی متن مصنوعی
- برای سنجش عملکرد آشکارسازهای متن مصنوعی، بسته به کاربرد آنها در سناریوهای مختلف، از سنجههای گوناگونی استفاده میشود. عملکرد آشکارسازی بسته به روشها و مجموعهدادههای
- بهکاررفته متغیر است. فناوری واترمارکگذاری در سالهای اخیر پیشرفت چشمگیری داشته است و اکنون میتواند بهطور مکرر متن تولیدشده توسط مدلهای زبانی را برچسبگذاری و شناسایی کند. آشکارسازهای صفر-شات میتوانند دقت آشکارسازی را افزایش دهند،
- و برخی آشکارسازهای مبتنی بر مدل زبانی بزرگ قادر به نمایش عملکرد آشکارسازی برتر، «استواری» (Robustness) و «تابآوری» (Resilience) در برابر حملات گوناگون هستند. مدلهای زبانیِ تنظیم دقیقشده اغلب مستعد بیشبرازش روی دادههای آموزشی خود یا توزیع آموزشی مدل مبدأ هستند که به افت عملکرد هنگام مواجهه با دادههای خارج از «دامنه» (domain) یا دیدهنشده میانجامد. افزون بر این، آشکارسازهای مبتنی بر مدل زبانی در پردازش دادههای تولیدشده توسط مدلهای متفاوت محدودیت دارند، زیرا این آشکارسازها روی مجموعهدادههای مشخصی برای یک وظیفه معین تنظیم دقیق شدهاند.
- برچسبگذاران با کمک انسان میتوانند عملکرد خود را در گذر زمان بهبود بخشند، اما در پردازش حجم بالای دادهها محدودیت دارند.
در مجموع، عملکرد آشکارسازی با حملات گوناگونی مانند حملات بازنویسی، حملات خصمانه و حملات پرامپت، و همچنین بهدلیل ابهام دادهها، بهطور چشمگیری کاهش مییابد. اگرچه برخی پژوهشهای اولیه نشان دادهاند که روشهای آشکارسازی مبتنی بر بازیابی «ممکن است بتواند» (could) استواری آشکارسازی متن تولیدشده توسط AI را در برابر حملات بازنویسی افزایش دهد، برای دفاع در برابر انواع مختلف حملات، پژوهش بیشتری مورد نیاز است. علاوه بر این، انجام مطالعات معیار در سناریوهای آزمونی متنوع ضروری است. آزمون و ارزیابی دقیق میتواند به درک بهتر قابلیتها و محدودیتهای آشکارسازها کمک کند و در توسعه راهبردهای مؤثرتر برای شناسایی متن تولیدشده توسط مدلهای زبانی بزرگ سودمند باشد. روشهای موجود آشکارسازی متن همچنان در حال تکامل هستند و برای همراستاسازی ادعاهای عملکرد بالا با استواری، «قابلیت اطمینان» (Reliability) و «تعمیمپذیری» (generalizability) واقعی، به ارزیابی و بهبود بیشتری نیاز دارند.
مسائل تکمیلی برای توجه
استواری و کیفیت آشکارسازی: استواری و کیفیت آشکارسازی از مسائل کنونی در آشکارسازی متن مصنوعی هستند. بیشتر آشکارسازها برای متنهای انگلیسی طراحی شدهاند و بهینهسازی عملکرد آنها در زبانهای گوناگون مورد نیاز است. عملکرد آشکارسازها در سناریوهای واقعی کاهش مییابد که بر ضرورت بهبود استواری آنها برای کاربردهای عملی تأکید میکند. کیفیت متن تولیدشده توسط مدلهای زبانی بزرگ نیز تحت تأثیر «پیچیدگی» (Complexity) یا یادگیری پرامپتهای بهکاررفته قرار دارد و این میتواند آشکارسازی دقیق متنهای تولیدشده از طریق پرامپتهای پیچیده را برای آشکارسازها دشوار سازد. این موضوع همچنین اندازهگیری عملکرد آشکارساز را برای ارزیابان چالشبرانگیز میکند.
برخی آشکارسازها متن تولیدشده توسط AI را با تحلیل پارامترهایی مانند وقوع واژه، جایگاه، «بسامد» (frequency) و سبک شناسایی میکنند. با این حال، ممکن است نتوانند میان انواع مختلف مدلهای GAI تمایز قائل شوند. افزون بر این، دامنه و تنوع مجموعهدادههای معیاری که میتوان برای ارزیابی جامع فناوریهای موجود آشکارسازی متن تولیدشده توسط AI بهکار برد، محدود است؛ ر.ک. جزئیات در پیوست D.
کاربردهای پرریسک: از مسائل «اجتماعیـفناورانه» (Socio-technical) قابل توجه، استفاده از فنون نابالغ آشکارسازی متن در کاربردهای پرریسک است. این کاربردها میتوانند شامل محیطهای دانشگاهی یا آشکارسازی اطلاعات نادرست و نشر اکاذیب تولیدشده توسط AI باشند. هنگامی که آشکارسازها در محیطهای دانشگاهی برای تأیید صداقت علمی نوشتهها به کار رفتهاند، بهدلیل فقدان دقت، دانشجویانی بهناروا متهم به تقلب با فناوری AI شدهاند که آینده تحصیلی آنها را در معرض خطر قرار داده است. مثبتهای کاذب در آشکارسازهای متنی مبتنی بر AI بهعنوان مشکل روشنی با پیامدهای خطرناک گزارش شدهاند. به همین ترتیب، آشکارسازهای متنی میتوانند برای تعیین مصنوعی بودن یا نبودن محتوا و همچنین برای تعیین اینکه آیا روایتهای اطلاعات نادرست و/یا نشر اکاذیب ممکن است توسط AI تولید شده باشند، ابزارهایی نادقیق و ناکامل باشند. این مسئله بهویژه در زبانهای غیرانگلیسی مشکلساز است، زیرا بیشتر آشکارسازها برای کاربردهای زبان انگلیسی طراحی شدهاند. پیچیدگی مدلهای زبانی نیز
- بهسرعت در حال افزایش است و آشکارسازی را به چالشی بزرگتر تبدیل میکند. افزون بر این، برخی پژوهشها نشان میدهند که استفاده از برخی از این آشکارسازها در سناریوهای مختلف «ممکن است» (may) مناسب نباشد.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S15
شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S15-E24E1E1F
۳.۱.۴.۵. آشکارسازی صدای مصنوعی
- با پیشرفت کیفیت تولید صدای مصنوعی، چالشها و پیچیدگیهای آشکارسازی نیز در حال افزایش است. دو نوع حوزه برای صدای مصنوعی وجود دارد: مبتنی بر تبدیل متن به گفتار (TTS)6 و مبتنی بر تقلید.
- روش مبتنی بر TTS، متن را در زمان واقعی طی دو مرحله به گفتار طبیعی تبدیل میکند. نخست، صدای خامِ تمیز و ساختاریافته به همراه متنِ پیادهسازیشدهی آن گردآوری میشود. دوم، مدل TTS با استفاده از دادههای گردآوریشده آموزش میبیند تا یک مدل تولید صدای مصنوعی ساخته شود.
- روش مبتنی بر تقلید، گفتار منبع (صدای محرمانه) را بهگونهای تغییر میدهد که بدون تغییر محتوای زبانی، شبیه به گفتار دیگری (صدای هدف) به نظر برسد. هدف اصلی آن، صدای محرمانه است. برای بازتولید ویژگیهای یک صدای خاص، ممکن است سبک، آهنگ یا تکیهی سیگنال گفتاری تنظیم شود. این امر میتواند برای کاربردهایی نظیر جعل صدا مفید باشد.
- علاوه بر روشهای سنتی تولید صدا، برخی از فنون تولید، اثر انگشت صوتی و ناهماهنگیهایی را نشان میدهند که میتوانند از طریق تحلیل دامنه بسامد روی طیفنگار (Spectrogram) ثبت شوند. «ضرایب سپسترال فرکانس مل» (Mel Frequency Cepstral Coefficients, MFCCs) معمولاً در فنون پردازش گفتار استفاده میشوند. نشان داده شده است که استفاده از MFCCها نسبت به خوراندن مستقیم سیگنال صوتی خام به مدل، نتایج بهتری برای «کارایی آشکارسازی صدای مصنوعی» (Synthetic Audio Detection Performance) به همراه دارد.
«فنون آشکارسازی صوت مصنوعی» (Synthetic Audio Detection Techniques)
- فنون آشکارسازی را میتوان به روشهای یادگیری ماشین (ML) و یادگیری عمیق (DL) زیر تقسیم کرد. یادگیری عمیق زیرمجموعهای از یادگیری ماشین در نظر گرفته میشود که از شبکههای عصبی چندلایه استفاده میکند تا ماشینها بتوانند بازنماییهای پیچیدهتری از دادهها را به شیوهای انسانگونه بیاموزند:
| آشکارسازهای ML | شامل شناسایی الگوهای گفتاری یا تشخیص ناهنجاریها در ویژگیهایی است که از ویژگیهای گفتار طبیعی منحرف میشوند؛ مانند محتوای آکوستیک و طیفی، خطاهای تلفظ، بسامدهای فرمانت، تغییرات زیروبمی، و نویز و ناهماهنگیهای پسزمینه. این روش به دلیل آموزش بیشازحد و استخراج دستی ویژگیها که نیازمند نیروی کار گسترده برای آمادهسازی دادههاست، از نظر مقیاسپذیری با تعداد زیادی فایل صوتی محدودیت دارد. |
| آشکارسازهای DL | از ویژگیهایی مانند بسامدهای فرمانت، تغییرات زیروبمی و ظرافتهای لحن برای شناسایی مغایرتهایی که یک صدای مصنوعی را متمایز میکند، بهره میبرد. این روش میتواند از «فراداده» (metadata) و الگوهای نویز پسزمینه برای تمایز بین صداهای اصیل و مصنوعی استفاده کند و هنگام استفاده از الگوریتمهای DL، نیازمند تبدیلهای خاص (مثلاً ویژگیهای صوتی مانند طیفنگارها) روی فایلهای صوتی است. |
- ر.ک. جزئیات بیشتر درباره روشهای آشکارسازی صدای مصنوعی و «مجموعهدادهها» (Datasets) در پیوست D.
- کارایی آشکارسازی صدای مصنوعی
- کارایی آشکارسازهای صدای مصنوعی بسته به روشهای آشکارسازی خاص، نوع مجموعهدادهها و فنون پیشپردازش صوتی بهکاررفته، متفاوت است.
- سنجشهای کارایی برای آشکارسازی صدای مصنوعی بر اساس سه معیار «نرخ برابری خطا» (Equal Error Rate, EER)، «تابع هزینه تصمیم» (Decision Cost Function, DCF) تاندم (t-DCF) و دقت انجام شدهاند. EER نقطهای است که در آن «نرخ مثبت کاذب» (False Positive Rate, FPR) و «نرخ کاذب منفی» (False Negative Rate, FNR) برابر هستند و t-DCF «قابلیت اطمینان» (Reliability) تصمیمات اتخاذشده توسط آشکارسازها را میسنجد. EER برای صوت از ۰.۴۳٪ تا ۴۲.۵٪، t-DCF از ۰.۰۰۸ تا ۰.۳۹ و دقت از ۵۰٪ تا ۹۹٪ متغیر است. روشهای بهکاررفته برای تولید دادههای صدای مصنوعی میتوانند بر کارایی روشهای آشکارسازی تأثیر بگذارند. برای نمونه، یکی از روشهایی که در مقایسه با سایر روشها هنگام اعمال بر مجموعهدادههای مبتنی بر TTS نرخ خطای بسیار پایینی دارد، هنگام اعمال بر مجموعهدادههای مبتنی بر تقلید، عملکرد ضعیفی دارد.
بهطور کلی، روشهای آشکارسازی مبتنی بر ML، توضیحات و تفسیرهای بهتری از نتایج آشکارسازی ارائه میدهند، در حالی که روشهای آشکارسازی مبتنی بر DL مانند شبکههای عصبی پیچشی (CNN) نسبت به روشهای مبتنی بر ML، از نظر مجموعهداده و نوع دادههای مصنوعی، پایدارتر و سازگارتر در نظر گرفته میشوند.
مسائل اضافی برای ملاحظه
پوشش زبانهای غیرانگلیسی: بیشتر پژوهشهای کنونی بر توسعه روشهای آشکارسازی برای شناسایی صداهای مصنوعی که به زبان انگلیسی صحبت میکنند، متمرکز است. یک مدل آشکارسازی که برای یک زبان خاص توسعه یافته است، ممکن است برای سایر زبانها یا گویشها عملکرد یکسانی نداشته باشد، بهویژه برای زبانها یا گویشهایی که دادههای موجود برای آنها محدود است. اکثر روشهای آشکارسازی صرفاً بر شناسایی صدای مصنوعی تمرکز دارند، بدون اینکه لهجهها یا گویشها را در نظر بگیرند. فقدان پوشش زبانی برای آشکارسازی صوت میتواند نابرابریها را در سایر نقاط جهان مانند جنوب جهانی (Global South)، بهویژه در دورههای انتخاباتی افزایش دهد و میتواند منجر به تقویت دیپفیکهای صوتی زیانبار به زبانهای غیرانگلیسی شود.
آشکارسازی در سناریوهای دنیای واقعی: به دلیل گستره وسیع فناوریهای تولید گفتار مصنوعی، هنوز تشخیص برخی خانوادههای ترکهای صدای مصنوعی در موقعیتهای مجموعهباز23 (Open-set) دشوار است. سناریوی مجموعهباز به آشکارسازی یک صدای مصنوعی اشاره دارد، حتی اگر با استفاده از مدلی تولید شده باشد که قبلاً دیده نشده است.
فرصتهایی برای توسعه بیشتر برای تمامی فنون آشکارسازی: آشکارسازهای موجود عمدتاً بر تمایز بین «محتوای مصنوعی» (Synthetic Content) و محتوای تولیدشده توسط انسان تأکید دارند. «تشخیص» (Detection) و توصیف قصد، مسئلهای مرتبط است که نیاز به پژوهش بیشتری دارد، زیرا تشخیص و توصیف قصدِ پشتِ محتوای دستکاریشده یا مصنوعی میتواند بهشدت بر نظرات یا رفتارهای فردی تأثیر بگذارد و بهطور گسترده بر فضاهای اطلاعات نادرست و اطلاعات گمراهکننده اثر بگذارد. اگرچه برنامه DARPA SemaFor پیشرفتهایی در پرداختن به این چالش داشته است، اما هنوز جای بهبود برای توسعه و پذیرش گسترده فناوریهای تشخیص قصد معنایی وجود دارد. پژوهشهای بیشتر همچنین بهتر است شامل بررسی چگونگی بهبود مؤثر کارایی آشکارسازی بر محتوای مصنوعی باشد که پسپردازش شده یا توسط نویز، انتقال، فشردهسازی خراب شده یا توسط یک پلتفرم رسانه اجتماعی متفاوت بازفرمت شده است. بهطور خاص برای آشکارسازی صوت، پژوهشهای آینده نیز بهتر است بررسی کنند که اگر ضبطهای صوتی توسط نویز، کدگذاری یا مشکلات انتقال خراب شوند، و همچنین ضبطهای صدای مصنوعی که در سایتهای رسانههای اجتماعی منتشر شده یا بهصورت زنده در تماسهای تلفنی استفاده میشوند، چه اتفاقی میافتد. در نهایت، احتمالاً پژوهشهای بیشتری برای ارزیابی اثربخشی فنون کمکگرفته از انسان برای یاری به تلاشهای آشکارسازی، مانند تعیین اثربخشی برچسبهای انسانی، مورد نیاز است.
- آزمون و ارزیابی «دادههای اصالت و منشأ» (Provenance data) و فنون آشکارسازی محتوای مصنوعی
- سنجش اثربخشی رهگیری دادههای اصالت و منشأ و فنون آشکارسازی محتوای مصنوعی از طریق آزمون و ارزیابی میتواند مسائل مربوط به «شفافیت محتوای دیجیتال» (Digital Content Transparency) را شناسایی کند.
- آزمون عبارت است از «فعالیتی که در آن یک سیستم یا مؤلفه تحت شرایط مشخص اجرا میشود، نتایج مشاهده یا ثبت میشوند و ارزیابیای از جنبهای از سیستم یا مؤلفه صورت میگیرد.»
- ارزیابی عبارت است از (۱) «تعیین نظاممند میزانی که یک موجودیت معیارهای مشخصشده خود را برآورده میکند؛ (۲) اقدامی که ارزش چیزی را میسنجد.»
آزمون و ارزیابی فنون شفافیت دیجیتال که در این بخش توصیف شدهاند، بر آزمون و ارزیابی رهگیری دادههای اصالت و منشأ و فنون آشکارسازی محتوای مصنوعی تمرکز دارند. سنجش افت کیفیت از دقت خروجی سیستمِ یک سیستم (با استفاده از یک تابع زیان) در طول آموزش، یک رویه معمول است. بسیاری از توابع زیان و «سنجهها» (Metrics) برای آموزش با سنجهها و مدلهای ارزیابی همپوشانی دارند. اگرچه بخش زیادی از آزمون و ارزیابی خودکار است، اما برخی آزمونها شامل بررسی انسانی یا دستی نتایج هستند، بهویژه در زمینههایی که تخصص موضوعی اهمیت دارد. ر.ک. پیوست E برای جزئیات بیشتر.
آزمون و ارزیابی فنون رهگیری دادههای اصالت و منشأ
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S16
شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S16-1D1B4776
۴.۱.۱. آزمون و ارزیابی روشهای «واترمارک دیجیتال» (Digital Watermarking)
واترمارکهای دیجیتال معمولاً از طریق حمله و سنجش «تابآوری» (Resilience) آنها آزمون میشوند. انواع مختلف حمله عبارتاند از: حملات حذف (یعنی حذف واترمارک بدون شکستن رمزنگاری یا «امنیت» (Security))؛ تحریف واترمارکها برای فریب آشکارساز؛ شکستن تدابیر امنیتی برای حذف واترمارک؛ و جعل واترمارکها.
روشهای مختلف طراحی آزمایش و سنجش «استواری» (Robustness) واترمارکها شامل آزمایشهایی است که مجموعهای از حملات را اجرا میکنند و درصد حملاتی که واترمارکها را از بین میبرند یا درصد واترمارکهایی که آشکار نمیشوند را میسنجند. رویکرد دیگر، استفاده از «سنجهها» (Metrics) کیفیت تصویر برای مقایسه شباهت تصاویر میان یک تصویر اصلی بدون واترمارک، یک تصویر واترمارکشده و یک تصویر واترمارکشدهٔ مورد حمله/تغییر یافته است. این رویکرد آزمایشی بررسی میکند که آیا تصاویر پس از یک تغییر خنثی (مانند بازفشردهسازی) مشابه باقی میمانند، اما در صورت حمله به واترمارک ناهمسان میشوند یا خیر. طرح آزمایشی دیگر از سنجههای فاصله تصویر برای مقایسه فاصله یا تفاوت میان تصاویر واترمارکشده با نسخههای تغییر یافتهٔ خنثی آنها استفاده میکند، مشابه آزمایشهای انگشتنگاری دیجیتال؛ سپس یک آستانه فاصله تعیین میشود تا مشخص گردد کدام تصاویر متفاوت تلقی میشوند.
سنجههای شباهت تصویر که بیشتر مختص «واترمارکگذاری» (Watermarking) هستند عبارتاند از: «ظرفیت (آبmark)» (Capacity) پنهانسازی (HC)، یعنی تعداد بیتهایی که میتوان در یک تصویر پنهان کرد؛ نسبت سیگنال به نویز اوج (PSNR)؛ و «شاخص تشابه ساختاری» (Structural Similarity Index Measure, SSIM)؛ و گاهی از سنجههای عمومی شباهت تصویر و سنجههای فاصله تصویر (شامل نُرم L_2) استفاده میشود. سنجهٔ دیگری مرتبط با واترمارکگذاری، تعداد بیت در هر پیکسل تصویر است که تعیین میکند چه مقدار اطلاعات را میتوان در تصویر درج کرد، بهعنوان یک موازنه با امنیت واترمارک.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S17
شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S17-5E7A8BFC
۴.۱.۲. آزمون و ارزیابی روشهای ضبط فراداده
یکی از راههای ضبط ایمن «فراداده» (metadata)، پیوستن آن به اثر انگشتی دیجیتال محتوای دیجیتال است؛ این اثر انگشتی دیجیتال معمولاً از طریق درهمسازی بهدست میآید، چنانکه پیشتر توضیح داده شد. مفهوم آن است که:
- تصاویر مختلف بهتر است درهمسازیهای متفاوتی داشته باشند (و برخورد رخ ندهد)، اما دو نسخه از یک تصویر یکسان بهتر است درهمسازیهای یکسانی داشته باشند.
- افزون بر این، کارهایی در زمینه آزمون و راستیآزمایی انسانی فراداده در جریان است. یکی از روشها آن است که انسانها «منشأ» (Provenance) را مستقیماً از نظر دقت بررسی کنند و زیرمجموعهای از «دادههای اصالت و منشأ» (Provenance data) را بهصورت دستی راستیآزمایی نمایند. آزمونهای آماری روی منشأ کل مجموعهدادههای بهکاررفته در آموزش میتواند مکمل راستیآزمایی انسانی باشد. برای مثال، یک پرسوجو میتواند تعیین کند چه کسری از هر نمونه داده ویژگی خاصی را دارد. نرمافزار تولیدکننده منشأ (یا نرمافزاری که بهطور خودکار فراداده تولید میکند) را میتوان از نظر درستی کارکردی آزمود؛ بدین صورت که بررسی شود پرسوجوهای خودکار مشخصی درباره فراداده اصالت و منشأ، نتایج مورد انتظار را بازمیگردانند.
- منشأ را همچنین میتوان با اجرای مدلهای تولیدکننده منشأ روی یک کاربرد شناختهشده و بررسی دستی خروجیهای تولیدشده ارزیابی کرد.
آزمون و ارزیابی روشهای آشکارسازی محتوای مصنوعی
آزمون و ارزیابی آشکارسازهای «محتوای مصنوعی» (Synthetic Content) میتواند به اعتمادسازی نسبت به این سیستمها کمک کند. رایجترین راه سنجش و ارزیابی یک سیستم آشکارسازی محتوای مصنوعی (یا متمایزساز)، ساخت یک مجموعهارزیابی با برچسبگذاری مناسب ورودیهای انسانیساخته (اصیل) (مانند تصاویر و ویدیوها) و ورودیهای مصنوعی است. از آشکارساز پرسیده میشود تا تشخیص دهد کدام تصاویر مصنوعیاند؛ در این آزمایش، آشکارساز برای هر ورودی یک عدد حقیقی ارائه میدهد که نشان میدهد ورودی چهاندازه بهاحتمال زیاد مصنوعی است، بهگونهای که عدد بزرگتر بیانگر مصنوعیبودن ورودی است. سپس، این خروجی همان آزمایش توضیحدادهشده در ضمیمه E این گزارش را بازتاب میدهد و بر مبنای یک سنجه دقت نمرهدهی میشود. برای وظایف «تشخیص» (Detection)، دو سنجه خاص، «سطح زیر منحنی مشخصه عملکرد گیرنده» (Area Under the Receiver Operator Curve, AUC) و «موازنه خطای آشکارسازی» (Detection Error Tradeoff, DET) هستند. این طرح آزمایشی را میتوان برای آزمون همه انواع مختلف روشهای آشکارسازی محتوای مصنوعی بهکار برد.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S18
شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S18-F7D3C58C
۴.۲.۱. آزمون و ارزیابی تکنیکهای تشخیص خودکار مبتنی بر محتوا
آزمون تشخیص مستلزم توجه دقیق به مجموعهدادههای آموزش و ارزیابی است که در طراحی آزمون به کار میروند. مهم است که انواع و ارتباط محتوای اصیل و «محتوای مصنوعی» (Synthetic Content) مورد آزمون، و نیز منابع ورودیها، متعادل باشند. سیستمها باید از نظر عملکردشان در «تشخیص» (Detection) تصاویر هنگامی که تغییر اندازه داده میشوند و فشرده میشوند آزمون شوند. برای تصاویر، اندازهٔ تصاویر و همچنین اندازهٔ نواحی دستکاریشدهٔ تصویر، هنگام ساخت مجموعهدادههای ارزیابی ملاحظات مهمی هستند.
هنگام طراحی این آزمایشهای آزمون تشخیص، ملاحظات خاصی دربارهٔ نحوهٔ ساخت مجموعهٔ آموزش و مجموعهٔ ارزیابی (مجموعهای از ورودیها که از آشکارساز خواسته میشود تعیین کند کدامیک اصیل و کدامیک مصنوع هستند) توسط افرادی که آشکارسازهای محتوای مصنوعی را آزمون میکنند وجود دارد. این دغدغهها شامل تعادل کلاسها و تنوع موقعیتهای مرتبط و مختلفی است که به زمینه وابستهاند، بهگونهای که مجموعهدادهٔ مورد استفاده بازنمایی متعادلی از موقعیت باشد. در نتیجه، مجموعهدادههای ارزیابی اغلب بهصورت سفارشی برای آزمایشهای تشخیص ساخته میشوند، و ممکن است از چندین مجموعهدادهٔ ارزیابی برای ارزیابی یک آشکارساز استفاده شود. یکی از ملاحظات، آزمون آشکارسازها در شرایطی است که مجموعههای آموزش و آزمون از یک مجموعهٔ ورودی واحد باشند و در شرایطی که مجموعههای آموزش و آزمون از مجموعههای ورودی متفاوتی باشند. ملاحظهٔ دیگر، ساخت دادههایی است که آشکارسازهای تصویر را آزمون میکنند تا بررسی شود این آشکارسازها در برابر تصاویری که پسپردازش شدهاند، مانند تغییر اندازه و فشردهسازی، مقاوم هستند. برای تصاویر، اندازهٔ تصاویر و همچنین اندازهٔ نواحی دستکاریشدهٔ تصویر ملاحظهٔ مهمی است که هنگام ساخت مجموعهدادههای ارزیابی به کار میرود.
برای محتوای ویدئویی، آشکارسازها در موقعیتهایی آزمون شدهاند که در آنها قابهایی به ویدئو درج، حذف یا تکثیر شده بودند. برای تشخیص کپیـچسباندن (اشیایی که درون قابهای مشخص کپی و چسبانده میشوند، یعنی جعلهای درونقابی)، دقت آشکارسازهای مختلف از ۵۴٫۹٪ تا ۹۹٫۳٪ بسته به سیستم و «پیچیدگی» (Complexity) جعل متغیر بود. برای تشخیص جعلهای بینقابی با درج، تکثیر و حذف قابها، دقتها از ۵۷٫۹٪ تا ۹۹٫۳٪ بسته به سیستم، تعداد قابهای درجشده/حذفشده/تکثیرشده و پیچیدگی جعل متغیر بود. طراحی دیگر شامل ساخت مجموعهدادهٔ ارزیابی با تصاویری است که از حملات مشخصی برای فریب دادن آشکارساز تولید شدهاند.
- 4.2.2. آزمون و ارزیابی تکنیکهای تشخیص «منشأ» (Provenance)
- آشکارسازهای «واترمارکگذاری» (Watermarking) را میتوان به شیوهای مشابه آزمون آشکارسازهای «پسوقوع» (post-hoc) آزمون کرد: به یک آشکارساز واترمارک، تصاویر علامتگذاریشده و تصاویر فاقد علامت داده میشود و از آن خواسته میشود
- واترمارکها را تشخیص دهد. در ادامه نمونهای از چنین آزمایشی برای آزمون آشکارساز واترمارکگذاری آمده است.
- بهطور خاص برای تشخیص واترمارکگذاری، بهجای استفاده از سنجهٔ دقت، میتوان آزمایش دیگری طراحی کرد که در آن به آشکارساز واترمارک مجموعهای از ورودیها داده میشود و از آن خواسته میشود واترمارک را بازیابی کند. سپس تصویر علامتگذاریشدهٔ بهدستآمده بر مبنای همبستگی پیکسلیاش با واترمارک اصلی سنجیده میشود. در آزمایش دیگری که در آن واترمارکها آماری هستند، تصاویر مصنوعی تولید میشوند و نرخ خطای بیت آشکارساز واترمارک اندازهگیری شده و با مقادیر بهینهٔ نظری مقایسه میشود.
یکی از راههای ارزیابی تکنیکهای تشخیص «فراداده» (metadata) این است که رسانهای اصیل با فرادادهٔ اصیل گرفته شود و سپس فرادادهٔ نادرستی به محتوای رسانه تزریق شود. سپس آشکارساز فراداده از این نظر آزمون میشود که آیا میتواند فرادادهٔ نادرست را شناسایی کند یا خیر.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S19
شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S19-C58CA62D