رفتن به محتوای اصلی
کهن‌دژکتاب مرجع هوش مصنوعی
منابعاعتبارسنجی
فهرست این فصلبخش ۵، فصل ۳۶ — صفحهٔ ۲ از ۵

بخش ۵، فصل ۳۶ — صفحهٔ ۲ از ۵

مطالعهٔ آزمایشی GenAI مؤسسه ملی استاندارد و فناوری آمریکا (2024): مرور و نتایج ارزیابی متن به متن

متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.

۴. زیرساخت ارزیابی

ترجمهٔ منبع

4.1.1. هدف و کارکرد در ارزیابی

سامانه مدیریت ارزیابی، کارکردها و اجزای کلیدی را فراهم می‌کند و از چرخه‌ای پژوهشی–توسعه‌ای که با ارزیابی خصمانه پیش برده می‌شود پشتیبانی می‌کند. این سامانه دسترسی به منابعِ عمومی، مدیریت محتوای عمومی و خصوصی، و مدیریت کامل چرخه ارزیابی شامل ثبت‌نام، دسترسی به ارسال‌ها و دسترسی به نتایج ارزیابی را ممکن می‌سازد. افزون بر این، شرایط و الزامات در میان تکالیف چالشی و روش‌های گوناگون متفاوت‌اند و از این رو به سازوکارهایی برای سازگاری مستمر با چالش‌های ارزیابی نیاز است. در نهایت، سامانه به الزامات اصلی مانند دسترس‌پذیری، «امنیت» (Security) و کاربردپذیری، همراه با سایر الزامات مؤسسه ملی استاندارد و فناوری آمریکا (NIST) می‌پردازد. تفکیک کلی الزامات و ویژگی‌ها در ادامه آمده است.

الزامات سامانه

  • فراهم کردن یک سیستم مدیریت محتوا برای چرخه پژوهش و توسعه مبتنی بر ارزیابی، با بهره‌گیری از رویکرد خصمانه
  • «مدیریت» (Manage) و فراهم کردن دسترسی و کارکردهای مبتنی بر نقش
  • رهگیری پیشرفت شرکت‌کنندگان
  • مدیریت دسترسی شرکت‌کنندگان به اسناد و پرونده‌ها
  • مدیریت انتشار مجموعه‌داده‌ها و گردش‌کار مربوط به مجوزدهی
  • ارتباط با پسانی‌های گوناگون «امتیاز ایمنی ذاتی» (Score) و گردآوری نتایج امتیاز ایمنی ذاتی
  • مدیریت انتشار نتایج و رندر گزارش‌ها
  • فراهم کردن فضایی برای درون‌سازی ریزسرویس‌های تکمیلی مانند مصورسازی داده‌ها

ویژگی‌های اصلی سامانه

  • حساب‌های کاربری با نقش‌های گوناگون (شرکت‌کننده، رابط، مدیر، رابط مجوزها، پژوهشگر اصلی)
  • مدیریت محتوای پویا (صفحه نخست، اعلان‌ها، صفحات محتوای عمومی/خصوصی)
  • مدیریت دارایی‌های پویا (دارایی‌های عمومی و خصوصی)
  • مدیریت پویای ارسال‌ها و پیکربندی حالت ارسال
  • یکپارچه‌سازی خط لوله «امتیاز ایمنی ذاتی» (Score): به هر ارسال به‌طور خودکار عملیات امتیاز ایمنی ذاتی اختصاص می‌یابد که توسط پسانی امتیاز ایمنی ذاتی پردازش می‌شود
  • یکپارچه‌سازی خط لوله تجمیع: پسانی امتیاز ایمنی ذاتی قادر است عملیات امتیاز ایمنی ذاتی را خلاصه کند تا پیشرفت در طول زمان رهگیری شود یا یک جدول رده‌بندی فراهم گردد
  • تولید گزارش‌های سفارشی در پسانی
  • طراحی مبتنی بر اشیاء منطق کسب‌وکار (BL): اشیاء BL کارکردی را در خود جای می‌دهند که می‌توان آن را برگزید و زنجیره‌وار به کار گرفت تا از موارد استفاده پویا در بخش‌های مختلف سیستم پشتیبانی شود
  • ایجاد اشیاء سامانه (مانند Sites، Submissions، Licenses) که با استفاده از JSON schema پارامترپذیرند و با استفاده از منطق کسب‌وکار قابل تغییرند

4.1.2. مرور کلی معماری پلتفرم ارزیابی

تصویر در نسخهٔ PDF Figure 3. System architecture showing frontend and backend components. The backend components can be scaled dynamically to match demand using a cloud cluster.

تصویر ۳. معماری سیستم که اجزای frontend و backend را نشان می‌دهد. اجزای backend می‌توانند با استفاده از یک خوشه ابری به‌صورت پویا متناسب با تقاضا مقیاس‌پذیر شوند.

پلتفرم ارزیابی از یک سیستم frontend وب‌اپلیکیشنِ رو به عموم و یک سیستم backend امتیازدهیِ کاملاً خودکار که به‌صورت داخلی اداره می‌شود تشکیل شده است. برنامه frontend رو به عموم بیرون از فایروال مؤسسه ملی استاندارد و فناوری آمریکا (NIST) اجرا می‌شود و هیچ دسترسی‌ای به زیرساخت داخلی NIST ندارد. علاوه بر این، یک نمونه مستقل از سرور تجسم داده R-shiny و همچنین یک نمونه پایگاه‌داده PostgreSQL وجود دارد که به‌گونه‌ای هماهنگ شده‌اند تا تجسم زندهٔ داده‌های امتیازدهی را در frontend فراهم کنند؛ به‌طوری که به‌محض محاسبهٔ امتیازها در backend به‌روزرسانی می‌شوند. backend امتیازدهی تفکیک‌شده است و در محدودهٔ NIST قرار دارد تا الزامات امنیت را برآورده سازد. به‌دلیل این معماری سیستم، بخش امتیازدهی به‌طور مداوم frontend را poll می‌کند تا وضعیت سراسری برنامه همگام باقی بماند.

4.1.3. فرایند ثبت‌نام و صدور مجوز

برای مشارکت در وظایف ارزیابی GenAI «مؤسسه ملی استاندارد و فناوری آمریکا» (NIST)، شرکت‌کنندگان در وب‌فرانت‌اند یک حساب کاربری ایجاد می‌کنند. برای این کار به یک حساب کاربری login.gov نیاز دارند. پس از ثبت‌نام، شرکت‌کنندگان پیش از آن‌که بتوانند داده‌ها را دریافت کرده و نتایج را بارگذاری کنند، باید مراحل گردش‌کار زیر را تکمیل نمایند:

  • ارائه اطلاعات شرکت‌کننده (مانند نام، کشور، وابستگی سازمانی و نوع وابستگی سازمانی)
  • ایجاد یک تیم برای مقاصد صدور مجوز
  • ثبت‌نام در مسیرهای ارزیابی موردنظر
  • تکمیل توافق‌نامه‌های الزامی؛ تیم NIST GenAI این توافق‌نامه‌ها را پیش از مرحله بعد بررسی می‌کند (ر.ک. بخش 4.3)
  • دریافت مجموعه(های) داده ارزیابی و تولید خروجی سیستم
  • ایجاد یک جایگاه سیستم (system slot) در داشبورد ارسال

4.1.4. فرایند ارسال

مشارکت‌کنندگان با استفاده از مجموعه‌داده ارزیابی به‌دست‌آمده، خروجی‌های سیستم را برای ارزیابی تولید می‌کنند. سپس ارسال‌ها را می‌توان از طریق داشبورد ارسال، مستقیماً روی بستر وب بارگذاری کرد؛ این داشبورد ماتریسی از فازهای وظیفه را در میان سیستم‌های کاربران نمایش می‌دهد. در بستر وبِ بارگذاری مشارکت‌کننده در صورت نیاز پارامترهای تنظیم‌شده برای هر وظیفه ارزیابی را مشخص می‌کند. پس از بارگذاری یک ارسال، سیستم به‌طور خودکار یک اجرای امتیازدهی پارامتری‌شده تولید می‌کند که متعاقباً توسط بک‌اند امتیازدهی برای پردازش دریافت می‌شود. پس از تکمیل امتیازدهی، نتایج به وب‌اپلیکیشن بارگذاری شده و در داشبورد ارسال مشارکت‌کننده در دسترس قرار می‌گیرند.

4.1.5. Backend تحلیل‌گری داده

Backend امتیازدهی مسئول پردازش تمام ارسال‌های سیستم‌ها است. این سیستم فایل ارسال، اطلاعات اجرای امتیازدهی و «فراداده» (metadata) ارسال را واکشی می‌کند و سپس خروجی را با استفاده از یک خط‌لوله‌ی خطی از مراحل پردازش، پردازش می‌کند. اگر ارسال با موفقیت امتیازدهی شود (یعنی همه‌ی مراحل خط‌لوله موفق شوند)، امتیازها بر روی بستر ارزیابی بارگذاری می‌شوند تا شرکت‌کنندگان بتوانند آن‌ها را مشاهده کنند. اگر یکی از مراحل با شکست مواجه شود، خطای تفصیلی در اختیار شرکت‌کننده قرار می‌گیرد که در داشبورد اپلیکیشن وب قابل مشاهده است.

علاوه بر کارنامه‌های ایستا برای هر ارسال، که تنها برای شرکت‌کنندگان در داشبوردشان در دسترس است، سیستم همچنین تحلیل‌گری داده‌ی بلادرنگ را در قالب یک جدول رده‌بندی تعاملی و عمومی ارائه می‌کند. اپلیکیشن جدول رده‌بندی داده‌های خود را از پایگاه‌داده‌ی امتیازدهی دریافت می‌کند و بر روی یک نمونه‌ی مجزای R-Posit Connect درون شبکه‌ی ابر خصوصی مجازی سیستم میزبانی می‌شود. اپلیکیشن جدول رده‌بندی با R-Shiny پیاده‌سازی شده است تا امکان کاوش تعاملی داده‌ها فراهم شود و برای هر خروجی سیستمی که با موفقیت امتیازدهی می‌شود، به‌طور خودکار به‌روزرسانی می‌گردد.

4.2. خط‌لوله‌ی ارزیابی

4.2.1. مروری بر پیاده‌سازی

سیستم امتیازدهی بک‌اند پشت فایروال مؤسسه ملی استاندارد و فناوری آمریکا (NIST) عمل می‌کند. این سیستم از یک خوشه ابری (OpenStack یا AWS) استفاده می‌کند که امکان مقیاس‌پذیری پویای نمونه‌ها را فراهم می‌آورد. بسته به پیکربندی، این سیستم از یک یا چند نمونه محاسباتی تشکیل شده است که دسترسی شبکه‌ای یک‌طرفه به وب‌سرور فرانت‌اند دارند. برای هماهنگ‌سازی محاسبات در میان نمونه‌ها، از نرم‌افزاری داخلی به نام «IndusR» استفاده می‌کنیم. درون هر نمونه، IndusR امکان ایجاد مجموعه‌ای از عامل‌های مستقل را فراهم می‌کند که به‌گونه‌ای هماهنگ شده‌اند تا هر ارسال را به‌صورت مستقل پردازش کنند. علاوه بر مقیاس‌پذیری تعداد نمونه‌های محاسباتی، تعداد عامل‌های IndusR نیز می‌تواند مقیاس‌پذیر شود تا بار کاری افزایش‌یافته در دوره‌های پرتقاضای ارزیابی را پوشش دهد. هر مجموعه از عامل‌ها یک گردش‌کار امتیازدهی خطی را اجرا می‌کند که برای انجام گام‌های مشخص در فاز هر تکلیف منفرد تعریف شده است و این تعریف با استفاده از یک فایل پیکربندی YAML انجام می‌شود. عامل‌ها چرخه عمر کامل امتیازدهی خروجی سیستم را به‌صورت خودکار با هماهنگ‌سازی تکلیف‌ها از طریق یک سیستم صف، مدیریت می‌کنند. هر ارسال با اجرای مجموعه‌ای از گام‌های خط لوله امتیازدهی پردازش می‌شود. هر گام امتیازدهی به‌صورت یک اسکریپت در فضای کاربر بیان می‌شود که می‌تواند با هر زبان برنامه‌نویسی قابل‌دسترس بر روی نمونه پیاده‌سازی و به‌کار گرفته شود. خط لوله پس از هر گام موفق ادامه می‌یابد یا در صورت شکست یک گام متوقف می‌شود.

تصویر در نسخهٔ PDF شکل ۴. سیستم امتیازدهی بک‌اند مجموعه‌ای از عامل‌های با عملکرد مستقل است. مجموعه عامل‌ها و همچنین نمونه‌های میزبان می‌توانند به‌صورت پویا برای تطبیق با تقاضا مقیاس‌پذیر شوند.

شکل ۴. سیستم امتیازدهی بک‌اند مجموعه‌ای از عامل‌های با عملکرد مستقل است. مجموعه عامل‌ها و همچنین نمونه‌های میزبان می‌توانند به‌صورت پویا برای تطبیق با تقاضا مقیاس‌پذیر شوند.

۴.۲.۲. فرایند امتیازدهی

هر خط‌لولهٔ امتیازدهی به‌صورت جداگانه برای هر مرحله پیکربندی می‌شود، اما در میان تکالیف، گردش‌کار را می‌توان به‌صورت کلی به شرح زیر توصیف کرد:

  • دریافت اجرای امتیازدهی، ارسالی و «فراداده» (metadata) از سمت کاربر
  • راه‌اندازی کارِ امتیازدهی و پارامترهای امتیازدهی
  • اعتبارسنجی وجود، نحو و معنای فایل ارسالی
  • امتیازدهی ایمنی ذاتی به خروجی سیستم
  • تولید گزارش کاربر
  • درج امتیازهای ایمنی ذاتی در پایگاه‌دادهٔ امتیازدهی
  • بارگذاری نتایج در سمت کاربر

4.2.3. اعتبارسنجی و آزمونِ Text-to-Text

هر اسکریپت اعتبارسنجی برای مسیرهای Generator و Discriminator، صحت و سازگاری ارسال‌های خروجی سیستم را از طریق بررسی یکپارچگی ساختاری و انطباق قالب تضمین می‌کند.

اعتبارسنجی مسیر Generator

گام‌های کلیدی اعتبارسنجی برای خروجی‌های سیستم Generator عبارت‌اند از:

  • اعتبارسنجی قالب XML: از xmllint برای بررسی خوش‌فرم بودن فایل ارسالی و مطابقت آن با طرح DTD استفاده می‌شود
  • اعتبارسنجی شناسه موضوع (Topic ID): تضمین می‌کند که هر GeneratorTopicResult دارای ویژگی topic یکتا باشد و با موضوع‌های از پیش تعریف‌شده در فایل مرجع ‎.sgml مطابقت داشته باشد
  • بررسی زمان سپری‌شده: تأیید می‌کند که ویژگی elapsedTime تنها حاوی مقادیر عددی باشد
  • الزام شمارش واژه‌ها: تضمین می‌کند که خلاصه هر موضوع:
  • خالی نباشد
  • از حداکثر سقف شمارش واژه‌ها (۲۵۰ واژه) تجاوز نکند
  • تشخیص موضوع‌های مفقود: بررسی می‌کند که همه موضوع‌های الزامی فایل مرجع ‎.sgml در ارسال گنجانده شده باشند

اعتبارسنجی مسیر Discriminator

گام‌های کلیدی اعتبارسنجی برای خروجی‌های سیستم Discriminator عبارت‌اند از:

  • بررسی یکپارچگی ستون‌ها: تضمین می‌کند که همه ستون‌های الزامی (DatasetID، TaskID، DiscriminatorID، TaskID، DiscriminatorID، ModelVersion، FileID، ConfidenceScore) حاضر و به‌درستی قالب‌بندی‌شده باشند.
  • تأیید TaskID: تأیید می‌کند که همه ردیف‌ها به تکلیف «detection» تعلق دارند تا سازگاری حفظ شود.
  • سازگاری نسخه مدل: بررسی می‌کند که تنها یک ModelVersion یکتا در ارسال وجود داشته باشد.
  • تطبیق DatasetID: تضمین می‌کند که مقادیر DatasetID در ارسال با مقادیر فایل مرجع فهرست مطابقت داشته باشند.
  • پوشش FileID: تأیید می‌کند که همه فایل‌های ذکرشده در فهرست در ارسال لحاظ شده باشند.
  • بازه امتیاز اطمینان: تضمین می‌کند که امتیازها مقادیر ممیز شناور معتبری بین ۰ و ۱ باشند.
  • بررسی تغییرپذیری امتیازها: مواردی را تشخیص می‌دهد که در آن‌ها همه امتیازهای تشخیص یکسان باشند؛ چنین وضعیتی ممکن است بیانگر اشکالی در پیش‌بینی‌های مدل باشد.
  • تشخیص ستون شاخص: هر ستون شاخص ناخواسته‌ای که ممکن است درج شده باشد را علامت‌گذاری می‌کند.

آزمون سیستم امتیازدهی

برای اطمینان از قابلیت اطمینان و استواری سیستم امتیازدهی‌مان، چارچوب آزمون ساخت‌یافته‌ای پیاده‌سازی کردیم که موارد زیر را دربر می‌گیرد:

  • آزمون واحد برای امتیازدهنده: آزمون‌های واحد خودکار برای اعتبارسنجی اجزای منفرد نرم‌افزار امتیازدهی توسعه دادیم تا صحت محاسبات و پایبندی به رفتار مورد انتظار تضمین شود.
  • ارسال‌های آزمونی: مجموعه‌ای متنوع از ارسال‌های آزمونی معتبر و نامعتبر تولید کردیم تا توانایی امتیازدهنده در مدیریت سناریوهای مختلف ورودی، از جمله موارد مرزی و قالب‌های نادرست، ارزیابی شود.
  • انجام به‌روزرسانی و پالایش مستمر: به‌روزرسانی منظم مجموعه آزمون‌ها برای هماهنگی با تغییرات نرم‌افزار، به‌گونه‌ای که تغییرات در سیستم امتیازدهی یا بستر پیش از استقرار به‌طور پیوسته اعتبارسنجی شوند.

با پالایش مستمر آزمون‌هایمان در کنار به‌روزرسانی‌های نرم‌افزار، دقت ارزیابی را حفظ می‌کنیم و مشکلات بالقوه را در مراحل اولیه توسعه شناسایی می‌کنیم.

4.2.4. نرم‌افزار امتیازدهی متن به متن

نرم‌افزار امتیازدهی مسیر مولد

نرم‌افزار امتیازدهی مسیر مولد مسئول ارزیابی کیفیت، تناسب محتوا و قابلیت اطمینان کلی خلاصه‌های تولیدشده توسط هوش مصنوعی است. این نرم‌افزار از یک خط‌لوله ساختاریافته پیروی می‌کند تا سازگاری و انصاف در ارزیابی تضمین شود و در عین حال مراحل لازم پیش‌پردازش، اعتبارسنجی و امتیازدهی را یکپارچه می‌سازد. اجزای کلیدی خط‌لوله امتیازدهی به شرح زیر است:

  • تجزیه و تحلیل خروجی‌های ارسالی سیستم: نرم‌افزار ابتدا اطلاعات لازم را از خروجی‌های ارسالی سیستم پردازش و استخراج می‌کند. انتظار می‌رود خروجی‌ها در قالبی از پیش تعریف‌شده ارائه شوند و تجزیه‌کننده ساختار صحیح را تضمین کرده و فیلدهای مرتبط مانند خلاصه‌های تولیدشده توسط سیستم، فراداده (metadata) و هرگونه اطلاعات تکمیلی ارائه‌شده توسط مشارکت‌کنندگان را استخراج می‌کند.
  • پس‌پردازش فایل‌های متنی خلاصه: پس از تجزیه، خروجی سیستم تحت پس‌پردازش قرار می‌گیرد تا قالب استاندارد شود و متن پاک‌سازی شود. این مرحله شامل حذف فاصله‌های اضافی، نرمال‌سازی مشکلات کدگذاری و آماده‌سازی خلاصه‌ها برای اعتبارسنجی و امتیازدهی بعدی است.
  • بررسی سلامت محتوا و پالایش سمّیت: برای تضمین تناسب محتوا، هر خلاصه تولیدشده از نظر محتوای بالقوه مضر یا سمّی تحلیل می‌شود. این کار با استفاده از موارد زیر انجام می‌شود:
  • Detoxify: یک طبقه‌بند سمّیت مبتنی بر یادگیری عمیق (Deep Learning) که زبان مضر یا توهین‌آمیز را شناسایی می‌کند.
  • Toxin: یک سازوکار پالایش تکمیلی برای بازبینی متقاطع و کاهش خطرهای (Risks) سمّیت.

خلاصه‌هایی که از نظر سمّیت علامت‌گذاری می‌شوند، یا پالایش می‌شوند یا برای آن‌ها هشداری صادر می‌شود تا مشارکت‌کنندگان از نگرانی‌های احتمالی آگاه شوند.

  • ارزیابی کیفیت در مقایسه با مقالات مبدأ: تابع اصلی امتیازدهی، کیفیت خلاصه‌های تولیدشده توسط هوش مصنوعی را با مقایسه آن‌ها با مقالات مبدأ اصلی محاسبه می‌کند. روش‌شناسی و سنجه‌های (Metrics) کیفیت مورد استفاده برای این مقایسه در بخش 6.2 تشریح شده است. این ارزیابی‌ها بینش‌هایی درباره روانی، میزان اطلاعات‌رسانی، انسجام و سازگاری واقعی ارائه می‌دهند.
  • اندازه‌گیری عملکرد آشکارساز پایه: برای فراهم کردن یک معیار مقایسه‌ای، نرم‌افزار امتیازدهی عملکرد آشکارساز پایه NIST (مؤسسه ملی استاندارد و فناوری آمریکا) را نیز روی مولد ارائه‌شده محاسبه می‌کند. این شامل موارد زیر است:
  • سطح زیر منحنی (AUC): توانایی طبقه‌بند را در تمایز میان خلاصه‌های تولیدشده توسط هوش مصنوعی و خلاصه‌های نوشته‌شده توسط انسان می‌سنجد.
  • امتیاز برایر: دقت پیش‌بینی‌های احتمالاتی آشکارساز پایه را ارزیابی می‌کند.

این امتیازها روی G-leaderboard نمایش داده می‌شوند تا مشارکت‌کنندگان یک معیار مرجع در اختیار داشته باشند. جزئیات ویژگی‌های مولد و سنجه‌های عملکرد در بخش 6 بحث شده‌اند.

  • بسته‌بندی خلاصه‌ها برای مسیر متمایزکننده: مرحله نهایی شامل آماده‌سازی خلاصه‌های تولیدشده برای استفاده در مسیر متمایزکننده است. خلاصه‌های پردازش‌شده پیش از تحویل به مشارکت‌کنندگان مسیر متمایزکننده، ساختاربندی، قالب‌بندی و بسته‌بندی می‌شوند تا اطمینان حاصل شود که به‌درستی برچسب‌گذاری شده‌اند و مشخصات الزامی را برآورده می‌کنند.

نرم‌افزار امتیازدهی مسیر متمایزکننده

نرم‌افزار امتیازدهی مسیر متمایزکننده، اثربخشی سیستم‌های تشخیص (Detection) متن تولیدشده توسط هوش مصنوعی را از طریق تحلیل امتیازهای تشخیص آن‌ها و محاسبه سنجه‌های عملکرد ارزیابی می‌کند. فرایند امتیازدهی چندین ورودی را یکپارچه می‌کند و ارزیابی‌های آماری تولید می‌کند تا دقت و قابلیت اطمینان هر خروجی ارسالی سنجیده شود.

  • ورودی‌ها و منابع داده: امتیازدهنده ورودی‌های زیر را پردازش می‌کند:
  • خلاصه‌های دسته‌بندی‌شده در سه گروه:
  • خلاصه‌های نوشته‌شده توسط انسان
  • خلاصه‌های هوش مصنوعی تولیدشده توسط NIST
  • خلاصه‌های تولیدشده توسط هوش مصنوعی از مشارکت‌کنندگان مسیر مولد (G-participants)
  • فهرستی از امتیازهای تشخیص اختصاص‌یافته توسط سیستم متمایزکننده به هر خلاصه
  • فایل‌های نمایه و مرجع شامل برچسب‌های حقیقت مبنا (ground-truth) و فراداده برای اعتبارسنجی نتایج امتیازدهی.
  • محاسبه سطح زیر منحنی و امتیازهای برایر: برای هر خروجی ارسالی متمایزکننده، امتیازدهنده عملکرد تشخیص را با استفاده از سطح زیر منحنی و امتیاز برایر ارزیابی می‌کند.
  • محاسبه زیرامتیاز برای خروجی‌های ارسالی G: علاوه بر عملکرد کلی، امتیازدهنده برای هر خروجی ارسالی مجزای مولد، زیرامتیازهایی محاسبه می‌کند. این کار امکان تفکیک میزان توانایی سیستم متمایزکننده در شناسایی خلاصه‌های تولیدشده توسط هوش مصنوعی در میان سیستم‌های مولد مختلف را فراهم می‌کند. این زیرامتیازها به ارزیابی تجمیعی عملکرد متمایزکننده کمک می‌کنند.
  • تجسم و سنجه‌های عملکرد: برای ارائه تحلیل جامع عملکرد، نرم‌افزار امتیازدهی موارد زیر را تولید می‌کند:
  • منحنی مشخصه عملکرد گیرنده (ROC Curve) – بازنمایی گرافیکی موازنه میان نرخ مثبت‌های واقعی و مثبت‌های کاذب. ر.ک. [14].
  • منحنی موازنه خطای آشکارسازی (DET Curve) – تجسم دقیق عملکرد با تمرکز بر نرخ‌های خطا در تشخیص. ر.ک. [14].

این منحنی‌ها روی پلتفرم نمایش داده می‌شوند تا به مشارکت‌کنندگان در ارزیابی اثربخشی سیستم خود در تمایز میان خلاصه‌های انسانی و تولیدشده توسط هوش مصنوعی کمک کنند. جزئیات سنجه‌های عملکرد متمایزکننده در بخش 6 بحث شده است.

4.2.5. مدل‌های پایهٔ متن‌به‌متن

برای ایجاد یک معیار عملکردی برای هر دو مسیر مولد و تشخیص‌دهنده، مجموعه‌ای از مدل‌های پایه را با استفاده از سیستم‌های شناخته‌شدهٔ هوش مصنوعی مولد (Generative AI) پیاده‌سازی کردیم.

این مدل‌های پایه، خروجی‌های مرجعی را برای اعتبارسنجی خط لولهٔ ارزیابی و همچنین ارزیابی اثربخشی سیستم‌های مشارکت‌کننده فراهم می‌کنند.

خروجی‌های پایهٔ مولد

برای تولید متن، از دو مدل زبانی بزرگ‌مقیاس (Large Language Model، LLM) برای ارائهٔ خروجی‌های پایه استفاده کردیم:

  • GPT-3.5 Turbo: یک مدل زبانی بزرگ (LLM) پرکاربرد [31] که برای کارایی و سرعت بهینه‌شده است و به‌عنوان معیاری قوی برای خلاصه‌های تولیدشده توسط هوش مصنوعی عمل می‌کند.
  • GPT-4: مدل پیشرفته‌تری [20] با درک بافتی بهبودیافته و انسجام بیشتر، که مبنای مقایسه‌ای باکیفیت‌تر فراهم می‌آورد.

این مدل‌ها برای تولید خلاصه‌ها بر اساس همان ورودی‌های سیستم‌های مشارکت‌کننده به‌کار رفتند و امکان مقایسهٔ مستقیم کیفیت خروجی، روانی و غنای اطلاعاتی را فراهم کردند.

خروجی‌های پایهٔ تشخیص‌دهنده

برای تشخیص (Detection) متن تولیدشده توسط هوش مصنوعی، دو مدل پایه انتخاب کردیم که برای ارزیابی این موضوع طراحی شده‌اند که آیا متن داده‌شده توسط انسان نوشته شده است یا توسط ماشین تولید شده است:

  • RADAR-Vicuna-7B: یک مدل تنظیم‌شدهٔ دقیق Vicuna [10] که برای تشخیص اصالت (authenticity) متن طراحی شده و از بازنمایی‌های مبتنی بر ترنسفورمر برای طبقه‌بندی استفاده می‌کند.
  • RoBERTa-base-openai-detector: یک طبقه‌بند مبتنی بر RoBERTa [18] که به‌طور خاص برای شناسایی محتوای تولیدشده توسط هوش مصنوعی آموزش دیده است و معیاری مستحکم برای ارزیابی عملکرد تشخیص فراهم می‌کند.

این مدل‌ها برای امتیازدهی به خروجی سیستم‌ها به‌کار رفتند و اثربخشی آن‌ها را در تمایز میان متن‌های نوشته‌شده توسط انسان و تولیدشده توسط هوش مصنوعی اندازه‌گیری کردند.

با ایجاد این مدل‌های پایه، تضمین می‌کنیم که همهٔ سیستم‌های ارسالی با خروجی‌های مرجع ارزیابی می‌شوند و نقطهٔ مقایسه‌ای روشن برای عملکرد مولد و تشخیصی فراهم می‌آید. خروجی پایهٔ مولد همچنین داده‌هایی برای ارزیابی تشخیص‌دهنده‌ها در دور ۱ فراهم می‌کند.

4.3. الزامات اداری و مقرراتی

ارزیابی‌های انجام‌شده در مؤسسه ملی استاندارد و فناوری آمریکا (NIST) مستلزم چندین الزام اداری و مقرراتی است تا فرایندی روان، امن و منطبق با قانون تضمین شود؛ فرایندی که در آن نقش‌ها و مسئولیت‌های هر دو طرف، یعنی NIST و شرکت‌کنندگان، به‌روشنی تعریف شده و برای همگان قابل فهم باشد. الزامات لازم در بستر GenAI به‌اختصار در ادامه توصیف شده است. تیم GenAI مستنداتِ رویه‌های برتر داخلی را تدوین کرده است تا انجام این الزامات را در آینده تسهیل کند.

4.3.1. ثبت‌نام

برای مشارکت در ارزیابی GenAI، مشارکت‌کننده بهتر است در وب‌سایت GenAI (https://ai-challenges.nist.gov/genai) ثبت‌نام کرده و یک پروفایل ایجاد کند. بهتر است از یک نشانی ایمیل login.gov استفاده شود. هنگام ثبت‌نام، مشارکت‌کننده نام، کشور، وابستگی سازمانی و نوع وابستگی سازمانی خود را ارائه می‌دهد؛ سپس یک تیم ایجاد می‌کند یا به تیمی موجود می‌پیوندد و سپس برای کار(های) موردنظر ثبت‌نام می‌کند.

ثبت‌نام مشارکت‌کننده‌ای که خارج از آمریکا است می‌تواند پیش از صدور تأیید مشارکت، مشمول مراحل بررسیِ تکمیلی شود.

4.3.2. توافق‌نامه‌های استفاده از داده‌ها

برای هر دو مسیر Generator و Discriminator، مؤسسه ملی استاندارد و فناوری آمریکا (NIST) داده‌هایی را فراهم می‌کند که شرکت‌کنندگان آن‌ها را پردازش می‌کنند. قواعد حاکم بر استفاده مجاز از این داده‌ها در یک توافق‌نامه استفاده از داده‌ها (DUA) تعیین شده است که شرکت‌کنندگان باید آن را پیش از اعطای اجازه مشارکت تکمیل و بازگردانند. توافق‌نامه استفاده از داده‌های GenAI با هماهنگی «دفتر مشاور ارشد حقوقی» (Office of Chief Counsel, OCC) مؤسسه ملی استاندارد و فناوری آمریکا تدوین شد.

4.3.3. توافق‌نامه انتقال داده برای تولیدکننده‌ها

ساختار ارزیابی پیش‌بینی کرده است که خروجی‌های ارائه‌شده توسط شرکت‌کنندگانِ بخش تولیدکننده (Generator) به‌عنوان مواد ارزیابی در مراحل بعدی برای شرکت‌کنندگانِ بخش متمایزکننده (Discriminator) مورد استفاده قرار گیرد. به همین دلیل، از «توافق‌نامه انتقال داده» (Data Transfer Agreement, DTA) میان مؤسسه ملی استاندارد و فناوری آمریکا (NIST) و تولیدکننده‌ای که داده‌ها را به NIST ارائه می‌کند استفاده می‌شود. فرایندی از این دست طراحی شده و در هماهنگی با دفتر شراکت‌های فناوریِ NIST (TPO، https://www.nist.gov/tpo) تکمیل می‌گردد. تکمیل توافق‌نامه انتقال داده توسط شرکت‌کنندهٔ تولیدکننده و نیز NIST برای مشارکت در بخش تولیدکننده الزامی است.

4.3.4. تعیین تکلیف پژوهش بر روی افراد انسانی

کل پروتکل مطالعه مقدماتی GenAI با عنوان «Generative AI Challenge» و با شماره اختصاص‌یافته ITL-2023-0644 به دفتر حمایت از پژوهش‌های مؤسسه ملی استاندارد و فناوری آمریکا (NIST) (RPO، https://www.nist.gov/adlp/research-protections-office) ارائه شد. برای این پروتکل، تعیین تکلیف «پژوهش معاف بر روی افراد انسانی» صادر شد.

4.3.5. تأییدیه‌های استفاده از نرم‌افزار

هر نرم‌افزار یا ابزار غیرمتعلق به NIST که توسط مؤسسه ملی استاندارد و فناوری آمریکا (NIST) برای تولید داده‌های ارزیابی استفاده می‌شود، بهتر است یا قبلاً تأیید شده و در NIST در دسترس باشد، یا از یک فرایند تأیید عبور کند که شامل موارد زیر است:

  • بررسی شرایط خدمات یا مجوز نرم‌افزار، و الزام احتمالی انعقاد یک ضمیمهٔ شرایط خدمات که ارائه‌دهنده پس از مذاکره با آن موافقت می‌کند. این فرایند با هماهنگی کارشناسان حقوقی دفتر مشاورهٔ حقوقی (OCC) انجام می‌شود.
  • تأیید امنیت فناوری اطلاعات برای استفاده از «خدمات اینترنتی کم‌ریسک» (Low-Risk Internet Service, LRIS) در مورد کاربرد GenAI. این فرایند با هماهنگی دفتر مدیریت سیستم‌های اطلاعاتی (OISM, https://www.nist.gov/oism) انجام می‌شود.
استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C36-S05

شناسهٔ محتوا KDJ-AI-2026E1-P05-C36-S05-901DA9A2

پیوند مستقیم این بخش

۵. وظایف

ترجمهٔ منبع

هدف اصلی ارزیابی‌های آزمایشی GenAI، درک رفتار سیستم برای تشخیص محتوای تولیدشده توسط AI در مقابل محتوای تولیدشده توسط انسان است. این موضوع شامل ویژگی‌های محتوای تولیدشده توسط AI غیرقابل‌تشخیص، تفاوت‌های محتوای انسانی با محتوای AI، و چگونگی ارائه راهنمایی توسط نتایج این وظیفه به کاربران نهایی برای کمک به تمایز میان این دو نوع محتوایی است که به‌طور منظم با آن‌ها مواجه می‌شوند. این ارزیابی آزمایشی به تمایز میان محتوای معنایی «واقعی» و «غیرواقعی» نمی‌پردازد؛ با این حال، این موضوع همچنان یک موضوع بالقوه موردعلاقه برای مسائل چالشی در آینده (Future) به‌شمار می‌رود.

5.1. مولدهای متن‌به‌متن (T2T-G)

تیم‌های مشارکت‌کننده در وظیفه مولدهای متن‌به‌متن (T2T-G) مجموعه دستورالعمل‌های زیر را برای وظیفه خود دریافت کردند:

با دریافت یک موضوع و مجموعه‌ای شامل حدود ۲۵ سند مرتبط به‌عنوان ورودی، از میان اسناد، یک خروجی خلاصه کوتاه، منسجم و روان بسازید که نیاز اطلاعاتی بیان‌شده در صورتِ موضوع را پاسخ دهد. ارزیابان انسانی مؤسسه ملی استاندارد و فناوری آمریکا (NIST) موضوعات مورد علاقه را تدوین کردند. هر ارزیاب یک موضوع ایجاد کرد و مجموعه‌ای از ۲۵ سند مرتبط با آن موضوع را برگزید. اسناد مجموعه‌داده آزمون از پیکره‌ای متشکل از مقالات متعدد خبرگزاری‌ها در وب‌سایت https://duc.nist.gov/ گردآوری شده بودند. شرکت‌کنندگانِ G بهتر است فرض کنند مخاطب هدف خلاصه، یک تحلیلگر ناظر اطلاعات است که برای تصمیم‌گیری به این خلاصه نیاز دارد.

  • تمام پردازش اسناد و تولید خلاصه‌ها بهتر است به‌صورت خودکار باشد.
  • خلاصه نمی‌تواند از ۲۵۰ واژه (توکن‌های جداشده با فاصله سفید) طولانی‌تر باشد. ارسال‌هایی با خلاصه‌های طولانی‌تر از ۲۵۰ واژه توسط G-validator پذیرفته نخواهد شد.
  • برای ساخت خلاصه کوتاه‌تر امتیازی داده نخواهد شد.
  • هیچ قالب‌بندی خاصی جز قالب خطی (یعنی متن ساده) مجاز نیست. در داده‌های آزمون برای تیم‌های مولد حدود ۴۵ موضوع وجود خواهد داشت. این مجموعه خلاصه‌ها از تمامی تیم‌های مولد، به‌عنوان داده‌های آزمون برای تیم‌های متمایزکننده عمل خواهد کرد که تشخیص می‌دهند محتوای نوشته‌شده، انسانی‌ساخته است یا هوش مصنوعی‌ساخته. خروجی خلاصه از طریق تعیین میزان سهولت یا دشواری تمایز میان خلاصه‌های هوش مصنوعی‌ساخته و خلاصه‌های انسانی‌ساخته ارزیابی خواهد شد؛ یعنی هدف مولدها آن است که خلاصه‌ای تولید کنند که از خلاصه‌های انسانی‌ساخته قابل‌تمایز نباشد.

5.2. متمایزکنندهٔ متن‌به‌متن (T2T-D)

متمایزکننده‌ها مجموعه‌آزمون‌هایی شامل خلاصه‌های تولیدشده توسط هوش مصنوعی و خلاصه‌های تولیدشده توسط انسان را دریافت کردند، اما مقاله‌های منبع را دریافت نکردند. وظیفهٔ آن‌ها این بود که تشخیص دهند آیا خلاصهٔ متنِ هدف با استفاده از «مدل‌های زبانی بزرگ» (Large Language Models, LLMs) مانند ChatGPT تولید شده است یا توسط یک انسان نوشته شده است. برای هر آزمون T2T-D شامل یک خلاصهٔ منفرد، سیستمِ «تشخیص» (Detection) T2T-D بهتر است یک امتیاز تشخیص (عددی حقیقی بین ۰ و ۱) ارائه کند؛ اعداد بزرگ‌تر نشان می‌دهند که به‌احتمال زیاد خلاصهٔ متن هدف با استفاده از مدل‌های مبتنی بر LLM تولید شده است. «سنجهٔ» (Metric) اصلی برای سنجش عملکرد تشخیص، «سطح زیر منحنی مشخصهٔ عملکرد گیرنده (ROC-AUC)» است که در بخش 6 شرح داده شده است.

6. سنجه‌های عملکرد

6.1. سنجه‌های متمایزکننده

این بخش سنجه‌هایی را توصیف می‌کند که برای سنجش عملکرد سیستم متمایزکننده به کار می‌روند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C36-S06

شناسهٔ محتوا KDJ-AI-2026E1-P05-C36-S06-2D1D3E04

پیوند مستقیم این بخش