رفتن به محتوای اصلی
کهن‌دژکتاب مرجع هوش مصنوعی
منابعاعتبارسنجی
فهرست این فصلبخش ۴، فصل ۳۰ — صفحهٔ ۴ از ۶

بخش ۴، فصل ۳۰ — صفحهٔ ۴ از ۶

پایه‌های روان‌شناختی تبیین‌پذیری و تفسیرپذیری در هوش مصنوعی

متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.

۳. تعریف‌های علوم کامپیوتر از تفسیرپذیری و تبیینپذیری

ترجمهٔ منبع

بحث پیشین بر این نکته تأکید می‌کند که «تفسیرپذیری» (interpretability) و «تبیینپذیری» (explainability) توابع کاربر، مورد استفاده و سایر عوامل بافتی هستند، به همان اندازه که توابع سیستم مورد استفاده نیز می‌باشند. با این حال، ویژگی‌های روان‌سنجی (psychometric) کاربران عموماً تحت کنترل طراحان نیستند. در اینجا، آخرین وضعیت (state-of-the-art) الگوریتم‌های هوش مصنوعی (AI) تبیینپذیر و اینکه سیستم‌ها چگونه ممکن است برای ارتقای تفسیرپذیری و تبیینپذیری طراحی شوند را بررسی می‌کنیم.

3.1 مقایسهٔ بازنمایی‌های ذهنی با الگوهای کنونی یادگیری ماشین

در حالی که انسان‌ها چندین «بازنمایی ذهنی» (mental representations) را به‌صورت موازی می‌سازند، الگوریتم‌های «یادگیری سطحی» هنگام بازنمایی یک مجموعه‌داده تنها یک مدل، یا توزیعی از مدل‌های یک خانوادهٔ ریاضی واحد تولید می‌کنند — فرایندی تحت‌اللفظی. فراتر از یادگیری سطحی، چندین تکنیک «یادگیری ماشین» (Machine Learning, ML) وجود دارد که چندین بازنمایی تولید می‌کنند. برای مثال، یادگیری گروهی فرایندی است که در طی آن چندین مدل تولید و در نهایت برای شکل‌دادن به یک فرضیهٔ واحد تجمیع می‌شوند. با این حال، این مدل‌ها از نظر سطح دقت با یکدیگر تفاوتی ندارند — آن‌ها صرفاً خانواده‌های متفاوتی از عملگرهای ریاضی را بر یک مجموعهٔ ویژگی واحد اعمال می‌کنند. در مقابل، الگوریتم‌های یادگیری چندوظیفه‌ای می‌کوشند انعطاف‌پذیری بازنمایی‌های کُلیِ انسانی را با آموزش دادن یک مدل برای تولید بازنمایی مشترکی از چندین محرک از حوزه‌های مختلف بازسازی کنند و بدین‌ترتیب «انتقال دور» را ممکن سازند. هنگامی که این کار موفق‌آمیز باشد، چنین مدل‌هایی ممکن است بازنمایی‌های انتزاعی‌تری بیاموزند که در ظاهر شبیه بازنمایی‌های کلی هستند؛ اما آن‌ها همچنان تنها یک مدل واحد تولید می‌کنند. سرانجام، شبکه‌های عصبی عمیق چندین بازنمایی از یک مجموعه‌داده تولید می‌کنند؛ اما این کار را با استخراج بازنمایی‌های انتزاعی از بازنمایی‌های عینی‌تر انجام می‌دهند، در حالی که انسان‌ها این بازنمایی‌ها را به‌طور همزمان و موازی رمزگذاری می‌کنند؛ این بدان معناست که انسان‌ها تفسیرهای ساده‌تر را از بازنمایی‌های تفصیلی‌تر استخراج نمی‌کنند [118].

3.2 پارادایم‌های الگوریتمی طراحی‌شده برای ارتقای تفسیرپذیری و تبیین‌پذیری

مروری جامع و اخیر بر ادبیات رویکردهای محاسباتی به هوش مصنوعی تبیین‌پذیر (Explainable AI) خاطرنشان می‌کند که برای دانشمندان علوم رایانه، مفاهیم تفسیرپذیری (Interpretability) و تبیین‌پذیری (Explainability) «تنگاتنگ با هم مرتبط‌اند» [6]. این نویسندگان اظهار می‌دارند که «سیستم‌های قابل تفسیر در صورتی قابل تبیین‌اند که عملیات آن‌ها توسط انسان‌ها قابل درک باشد» (صص. 52140–52141؛ تأکید اضافه شده است). اگرچه تبیین‌پذیری و تفسیرپذیری گاهی در ادبیات علوم رایانه به‌جای هم به کار می‌روند، این مرور داده‌هایی ارائه می‌دهد که از این ادعا پشتیبانی می‌کند که «در جامعه ML، اصطلاح ‘interpretable’ بیش از ‘explainable’ به کار می‌رود» (ص. 52141؛ ر.ک. همچنین [42])، به‌ویژه در مقایسه با کاربرد این اصطلاحات توسط عموم مردم. این یافته، همسو با تعاریف روان‌شناختی ارائه‌شده در بالا، می‌تواند نشان‌دهنده این باشد که تولیدکنندگان محصولات AI به دلیل برخورداری از دانش پیش‌زمینه‌ای تخصصی، توانایی بیشتری در تفسیر خروجی این سیستم‌ها دارند. در واقع، Bhatt و همکاران [11] فرض می‌کنند که این تمایز می‌تواند از تفاوت در اهداف طراحی این گروه‌های کاربر ناشی شود: توسعه‌دهندگان الگوریتم معمولاً به‌دنبال تبیین‌ها هستند تا بتوانند الگوریتم‌های خود را اشکال‌زدایی یا به شیوه‌ای دیگر بهبود دهند، و بنابراین ممکن است ابزارهای هوش مصنوعی تبیین‌پذیر را برای همین هدف توسعه دهند. بدین ترتیب، از نگاه دانشمندان علوم رایانه، تبیین عموماً نشان می‌دهد که یک سیستم محاسباتی چگونه به یک خروجی معین دست یافته یا آن را تولید کرده است. یک تبیین خوب اغلب علّی (causal) است و نسبت به پیاده‌سازی سیستم توجیه می‌شود — برای مثال، «الگوریتم به رد درخواست رواداری سوگیری دارد زیرا داده‌های آموزشی نامتوازن‌اند». این نوع تبیین برای اشکال‌زدایی این سیستم‌های پیچیده بسیار سودمند است، اما فقط در صورتی که کاربر دانش پیش‌زمینه‌ای و تخصص فنی مناسب برای این کار را داشته باشد.۱۶ برای مثال، تبیین ذکرشده در بالا، توسعه‌دهنده را به گردآوری داده‌های متوازن‌تر و بازآموزی الگوریتم رهنمون می‌شود، اما برای کاربر نهایی اقدام فوری‌ای پیشنهاد نمی‌کند، مگر شاید رهاکردن استفاده از الگوریتم.

3.2.1 اهمیت ویژگی‌های محلی

بخش عمده‌ای از پژوهش‌ها در حوزه «هوش مصنوعی توضیح‌پذیر» (Explainable Artificial Intelligence, XAI) می‌کوشد تا به توسعه‌دهندگان کمک کند ارتباط‌های ساده، ازبردانسته و تحت‌اللفظی میان ورودی‌ها و خروجی‌ها را تعیین کنند تا بتوانند سازوکارهای بالقوه علّی را استنباط کنند. برای مثال، الگوی اهمیت ویژگی‌های محلی (برای نمونه، [33, 87, 125]) می‌تواند رایج‌ترین راه برای تعامل کارشناسان عمل با توضیحات فنی باشد. این رویکرد می‌خواهد نشان دهد که چگونه تغییرهای کوچک در ویژگی‌های مشخص می‌تواند به تغییرهایی در خروجی‌های مشخص مدل منجر شود.

«توضیحات مدل‌ناوابسته محلی تفسیرپذیر» (Local Interpretable Model-agnostic Explanations, LIME). LIME [125] که یکی از الگوریتم‌های پیشرو در استفاده از الگوی اهمیت ویژگی‌های محلی است، هدفش آن است که «پیش‌بینی‌های هر طبقه‌بند یا رگرسور را به شیوه‌ای وفادار توضیح دهد، از راه تقریب محلی آن با یک مدل تفسیرپذیر... و با ارائه مصنوع‌های متنی یا بصری که فهم کیفی رابطه میان مؤلفه‌های نمونه (مانند واژه‌ها در متن یا وصله‌ها در تصویر) و پیش‌بینی مدل را ممکن می‌سازند.» LIME می‌تواند به توسعه‌دهندگان کمک کند بفهمند که چگونه تغییر در ویژگی‌های منفرد ممکن است خروجی مدل را حول یک پیش‌بینی مشخص تغییر دهد. تا جایی که این بینش‌ها تعمیم‌پذیر باشند و بر ویژگی‌های معنادار استوار باشند، ممکن است به توسعه‌دهندگان در استنباط سازوکارهای علّی مدل کمک کنند؛ با این حال، این رویکردها ممکن است گمراه‌کننده شوند اگر درگیر همبستگی‌های کاذب قرار گیرند. برای مثال، شکل ۵ خروجی LIME را نشان می‌دهد که روی پاراگرافی از متن اعمال شده که به‌جای «مسیحیت»، در دسته «بی‌خدایی» طبقه‌بندی شده بود. این طبقه‌بند به‌نظر می‌رسد بر ویژگی‌های نویسنده (مانند این که خاستگاه او یک مؤسسه دانشگاهی است، چنان‌که پسوند ‎.edu در نشانی رایانامه‌اش نشان می‌دهد) و ویژگی‌های سبک‌سنجی مشخص (مانند به‌کارگیری واژه‌های «have» و «there») متمرکز است، نه واژه‌هایی که ممکن است بیانگر محتوا باشند.

تصویر در نسخهٔ PDF شکل ۵. نمونه‌ای از خروجی LIME که بر ویژگی‌های متنی تأکید می‌کند و باعث شده یک پاراگراف مشخص به‌جای مسیحیت، در دسته بی‌خدایی طبقه‌بندی شود. تصویر اصلی در این نشانی در دسترس است: https://github.com/marcotcr/lime/blob/master/doc/images/twoclass.png

شکل ۵. نمونه‌ای از خروجی LIME که بر ویژگی‌های متنی تأکید می‌کند و باعث شده یک پاراگراف مشخص به‌جای مسیحیت، در دسته بی‌خدایی طبقه‌بندی شود. تصویر اصلی در این نشانی در دسترس است: https://github.com/marcotcr/lime/blob/master/doc/images/twoclass.png

LIME در این فرایند توجه کاربران را به ویژگی‌های مشخصی جلب می‌کند که مدل برای انجام یک پیش‌بینی مشخص از آن‌ها استفاده می‌کند و بدین‌سان یک خروجی مشخص را به بازنمایی ساده‌شده‌ای از مدلی که آن خروجی را تولید کرده است پیوند می‌زند. برای مثال، شکل ۶ نشان می‌دهد که یک طبقه‌بند که برای تشخیص تمایز میان گرگ و هاسکی طراحی شده، یک تصویر خاص را بر پایه وجود برف در پس‌زمینه طبقه‌بندی کرده است (و نه بر پایه ویژگی‌های کالبدشناختی که در واقع این دو گونه را از یکدیگر متمایز می‌کند). یک دانشمند داده با دانش دامنه‌ای مناسب می‌توانست از این اطلاعات برای اصلاح یا به‌طور کلی عیب‌یابیِ این طبقه‌بندی معیوب بهره گیرد.

بدین‌سان، این فرایند تا اندازه‌ای به تعریف توضیحی که پیش‌تر ارائه شد شباهت دارد؛ اما تفاوت‌های مهمی نیز وجود دارد. نخست، LIME به کاربر توضیحی از خودِ مدل نمی‌دهد، بلکه در اختیار کاربران مدلی ساده‌شده قرار می‌دهد که مدل پیچیده‌تری را که الگوریتم می‌کوشد توضیح دهد تقریب می‌زند. در عمل، LIME توصیفِ علّی و پیچیده‌ی سازوکارهای درونی مدل را با توصیفی ساده‌تر از مدلی دیگر جایگزین می‌کند که نتایج آن تنها با مدل اصلی همبسته است. برای مثال، LIME هیچ اطلاعاتی درباره این که آیا طبقه‌بند گرگ در برابر هاسکی در شکل ۶ بر تصویرهایی که برف در پس‌زمینه ندارند پیش‌بینی‌های دقیقی انجام خواهد داد یا نه، ارائه نمی‌کند.

شکل ۶. نمونه‌ای از خروجی LIME که بر ویژگی‌های ورودی تأکید می‌کند که برای یک طبقه‌بندی تصویری مشخص تشخیصی هستند. در این مورد، تصویری از یک هاسکی به‌سبب وجود برف در پس‌زمینه، به‌اشتباه به‌عنوان گرگ طبقه‌بندی شده است. چنین اطلاعاتی ممکن است به توسعه‌دهندگان ابزار در عیب‌یابی طبقه‌بندهای بیش‌برازش‌یافته کمک کند. این تصویر نخستین‌بار در [125] ارائه شده است.

نویسندگان LIME استدلال می‌کنند که این مدل‌های ساده‌شده (مانند مدل‌های رگرسیون با تعداد اندکی ضریب) ذاتاً تفسیرپذیرترند، زیرا «فهم کیفی میان متغیرهای ورودی و پاسخ را فراهم می‌کنند.» هرچند این هدف تا حد زیادی با تعریف «چکیده‌فهم» در نظریه ردو-ردیابی (Fuzzy-Trace Theory) هم‌خوان است، چکیده‌فهم‌ها، هنگامی که آموزش‌دیده باشند، بینش یک متخصص انسانی را درباره این که کدام ویژگی‌ها به‌احتمال زیاد تعمیم‌پذیرند، در بر می‌گیرند. فن‌هایی مانند LIME می‌توانند در تولید چنین بازنمایی‌هایی به انسان‌ها کمک کنند و در واقع، آزمایش‌های مقدماتی به‌نظر می‌رسد نشان می‌دهند که آزمودنی‌های انسانی می‌توانستند از این فن‌ها برای حذف ویژگی‌هایی که با دقت پیش‌بینی تداخل داشتند استفاده کنند — یعنی می‌توانستند طبقه‌بندی بهتری بسازند — و نمونه کوچکی از آزمودنی‌های انسانی با تخصص در علم داده (و به‌ویژه آشنایی با مفهوم همبستگی کاذب) ممکن است بتواند از LIME برای استخراج توضیحات بهتر بهره گیرد.

SHapley Additive exPlanations (SHAP). خانواده مدل‌های SHAP [87] همانند LIME از این پیش‌فرض آغاز می‌کند که «بهترین توضیح برای یک مدل ساده، خودِ آن مدل است» و در نتیجه می‌کوشد مدل‌های پیچیده را با مدل‌های ساده‌تر بازنمایی کند. از این رو، SHAP امتیازهای اهمیت را برای هر ویژگی بازمی‌گرداند که مشابه ضرایب رگرسیون هستند. برای یک پیش‌بینی معین، امتیازهای SHAP نشان می‌دهند که هر یک از این ویژگی‌ها چه اندازه در آن پیش‌بینی نقش داشته است، همان‌گونه که در شکل ۷ نشان داده شده است.

از این دید، مدل‌های SHAP بسیاری از نقاط قوت و ضعف مشترک با LIME را دارند،

شکل ۷. نمونه‌ای از خروجی SHAP که مقدار پایه‌ی مدل، سهم‌های حاشیه‌ای هر یک از ویژگی‌ها، و پیش‌بینی نهایی را نشان می‌دهد. چنین رویکردی مشابه یک تفسیر گرافیکی از ضرایب رگرسیون خطی است. تصویر اصلی را می‌توان در https://github.com/slundberg/shap یافت.

هرچند با قابلیت تعمیم به طبقه‌ی وسیع‌تری از مدل‌های یادگیری ماشین همراه است. این مدل‌ها به معنای تحت‌اللفظیِ کلمه «کلمه‌به‌کلمه» هستند؛ یعنی مجموعه‌ای از قواعد (امتیازهای اهمیت ویژگی‌ها) را به‌دست می‌دهند که می‌توان آن‌ها را به‌شیوه‌ای مکانیکی به‌کار گرفت تا توضیحی پسینی برای پیش‌بینی موردنظر تولید شود. با این حال، این مدل‌ها سازوکارهای علّی را منتقل نمی‌کنند و هنگامی که مدل به خارج از همسایگی محلیِ یک پیش‌بینی مشخص اعمال می‌شود، در معرض خطای ناشناخته قرار می‌گیرند. افراد انسانی منفرد ــ مانند متخصصان آگاه ــ که تمایل و توانایی بررسی عمیق این یافته‌ها را داشته باشند، می‌توانند از دانش پیش‌زمینه‌ی خود برای تولید یک توضیح بهره بگیرند؛ اما SHAP اطلاعات کافی برای کمک به این متخصصان جهت تشخیص زمانی که مدل دیگر کاربرد ندارد، در اختیار نمی‌گذارد. در عمل، این فن‌ها به کاربران انسانی محرکی می‌دهند که باید آن را توضیح دهند یا تفسیر کنند، حال آن‌که مدل‌های واقعاً «جعبه‌سیاه» حتی این محرک را نیز فراهم نمی‌کنند.

شبکه‌های عصبی توضیح‌پذیر (Explainable Neural Networks, XNNs). در حالی که SHAP و LIME می‌کوشند مدل‌های پیچیده را با پارادایمی شبیه رگرسیون (یعنی یک تابع جمعی خطی) توضیح دهند، Explainable Neural Networks (XNNs) [144] از صورت‌بندی عمومی‌تری بر پایه‌ی «مدل شاخص جمعی» [127] استفاده می‌کنند. در اینجا، الگوریتم می‌کوشد تابعی بازگرداند که توصیف می‌کند پیش‌بینی‌های مدل چگونه با تغییر پارامترهای منفرد (و اخیراً زوج‌های پارامتر [148]) تغییر می‌کنند. همانند LIME و SHAP، این مدل‌ها می‌توانند به دانشمندان داده‌ی دارای آموزش مناسب کمک کنند تا دریابند تغییر یک ویژگی مشخص چگونه ممکن است پیش‌بینی مدل را تغییر دهد، هرچند با ریسک استنباط همبستگی‌های کاذب همراه است. این رویکردها به‌ویژه بر مدل‌های شبکه عصبی عمیق اعمال شده‌اند؛ در این مدل‌ها یک شبکه‌ی عصبی برای ارائه‌ی بازنمایی ساده‌شده از شبکه‌ی دیگر به‌کار می‌رود و سپس در قالب جدولی مشابه تحلیل واریانس ارائه می‌شود که اثرهای اصلی و در برخی موارد برهم‌کنش‌های دوعاملی را نشان می‌دهد [35].

با این حال، LIME نیز محدودیت‌هایی دارد: توضیحاتی که تحلیلگران ممکن است از به‌کارگیری این ابزارها استخراج کنند، خود می‌توانند مبتنی بر همبستگی‌های کاذب باشند یا می‌توانند اطمینان کاذبی نسبت به پیش‌بینی‌های مدل در خارج از محدوده‌ی همسایگی نزدیک نقطه‌داده‌ای که LIME می‌کوشد آن را توضیح دهد، پدید آورند۱۷. بدتر آن‌که ممکن است این توضیحات گمراه‌کننده توسط مهاجمانی مهندسی شوند که در پی بهره‌برداری از تمایل انسان‌ها به اسناد علّیت در جایی که علّیتی وجود ندارد، هستند [134].

نگاشت فعال‌سازی کلاس مبتنی بر گرادیان (Gradient-weighted Class Activation Mapping, Grad-CAM). Grad-CAM روشی است که برای توضیح مدل‌های بینایی کامپیوتر که از معماری‌های یادگیری عمیق (به‌طور خاص، شبکه‌های عصبی کانولوشنی ــ معماری پیشرفته‌ی فعلی در بینایی کامپیوتر) استفاده می‌کنند، طراحی شده است. به‌طور مشخص، Grad-CAM «از گرادیان‌های هر مفهوم هدف (مثلاً «سگ» در یک شبکه‌ی طبقه‌بندی یا دنباله‌ای از واژه‌ها در یک شبکه‌ی تولید زیرنویس تصویر) که به لایه‌ی کانولوشنی نهایی جریان می‌یابند، برای تولید یک نگاشت موضعی‌سازی درشت‌دانه که نواحی مهم تصویر را برای پیش‌بینی مفهوم برجسته می‌کند، بهره می‌گیرد» [129]. Grad-CAM از معماری لایه‌ای شبکه‌های عصبی کانولوشنی (CNNs) برای شناسایی نواحی از تصویر که بیشترین دلالت را درباره‌ی یک پیش‌بینی خاص دارند، استفاده می‌کند. برای مثال، شکل ۸ نشان می‌دهد که چگونه خروجی Grad-CAM می‌تواند توجه کاربر را به بخشی از تصویر جلب کند که دلالت‌گر پیش‌بینی مشخصی است که کاربر می‌خواهد آن را توضیح دهد. این نسخه‌ای بصری از پارادایم اهمیت ویژگی است ــ که در آن ویژگی‌ها مجموعه‌هایی از پیکسل‌های مشخص هستند ــ همراه با چند مورد از نقاط قوت و محدودیت‌های متناظر با آن.

3.2.2 «مدل‌های ساده‌تر ذاتاً تفسیرپذیری بیشتری دارند»

Rudin [128] تکنیک‌هایی را که در پی تولید توضیح‌های ساده برای مدل‌های پیچیده هستند، به‌شدت نقد کرده و استدلال می‌کند که این تکنیک‌ها می‌توانند عملکرد درونی واقعی این مدل‌ها را به شیوه‌ای گمراه‌کننده برای تصمیم‌گیرندگان و تحلیلگران مبهم سازند. مدل‌هایی که از نظر موضعی دقیق (locally-accurate) هستند، اطلاعاتی درباره میزان آن دقت یا اینکه افت آن تدریجی است یا ناگهانی، ارائه نمی‌دهند. Rudin به‌جای تلاش برای تقریب مدل‌های پیچیده‌تر با مدل‌های ساده‌تر، استدلال می‌کند که بهتر است مستقیماً از مدل‌های ساده‌تر استفاده شود، زیرا این مدل‌ها «تفسیرپذیرتر» هستند (یعنی برای دانشمندان داده)، به‌ویژه هنگامی که ریسک بالا باشد. دلیل این رویکرد آن است که دست‌کم دانشمندان داده ممکن است عملکرد درونی مدل را درک کنند.

فهرست‌های قاعده‌ای بیزی مقیاس‌پذیر. فهرست‌های قاعده‌ای بیزی مقیاس‌پذیر (Scalable Bayesian Rule Lists) [147] نمونه‌ای از تکنیکی هستند که هدفش پرهیز از پیچیدگی مدل است. برخلاف تکنیک‌های برشمرده در بالا که در پی ارائه بازنمایی‌های پیوسته از مدل‌های پیچیده هستند، فهرست‌های قاعده‌ای بیزی مقیاس‌پذیر صراحتاً تلاش نمی‌کنند با «طبقه‌بند‌های جعبه‌سیاه مانند شبکه‌های عصبی، ماشین‌های بردار پشتیبان، تقویت گرادیان یا جنگل‌های تصادفی رقابت کنند. این روش زمانی سودمند است که ابزارهای یادگیری ماشین به‌عنوان یار تصمیم برای انسان‌ها به کار روند؛ انسان‌هایی که برای اعتماد به مدل و اتخاذ تصمیم‌های داده‌محور باید آن را درک کنند.» از این رو، SBRLها هدفشان دستیابی هم‌زمان به دقت پیش‌بینی بالا و تبیین‌پذیری نیست؛ بلکه در پی ارائه مجموعه‌ای از قواعد احتمالاتی ساده‌شده (عیناً) هستند که می‌توان از آن‌ها برای تقسیم‌بندی یک مجموعه داده استفاده کرد (ر.ک. به جدول ۲).

مدل‌های افزایشی تعمیم‌یافته با برهم‌کنش‌های زوجی. رویکردی که ممکن است نقد Rudin را پاسخ دهد، بر استفاده از مدل‌های افزایشی تعمیم‌یافته با برهم‌کنش‌های زوجی (GA²Ms) استوار است – رده‌ای از مدل‌ها که «سهم یک ویژگی واحد در پیش‌بینی نهایی» را تنها به آن ویژگی وابسته می‌سازند [34]. مقصود از این مدل‌ها آن است که هر ویژگی را از همه ویژگی‌های دیگر تفکیک کنند تا بتوان آن‌ها را مستقل از یکدیگر ارزیابی کرد. شکل ۹ خروجی یک GA²M را نشان می‌دهد که بر مجموعه داده‌ای اعمال شده است که ریسک بستری شدن ۳۰ روزه بیمارستانی برای ذات‌الریه را پیش‌بینی می‌کند. مانند قبل، این مدل‌ها

تصویر در نسخهٔ PDF Fig. 8. An example of output from Grad-CAM, indicating which pixels in an image are diagnostic of the predicted class (dog or cat). The original image may be found at [129]

شکل ۸. نمونه‌ای از خروجی Grad-CAM که نشان می‌دهد کدام پیکسل‌ها در یک تصویر نشانه‌گذارِ کلاس پیش‌بینی‌شده (سگ یا گربه) هستند. تصویر اصلی را می‌توان در [129] یافت.

Table 2. Example of SBRL output, which seeks to explain whether a customer will leave the service provider. PP = Probability that the label is positive. Source: [147]

جدول ۲. نمونه‌ای از خروجی SBRL که می‌کوشد توضیح دهد آیا مشتری ارائه‌دهنده خدمات را ترک خواهد کرد یا خیر. PP = احتمال مثبت بودن برچسب. منبع: [147]

فهرست قواعدPPدقت آزمون
if ( Contract=One year&StreamingMovies=Yes ),0.200.81
else if ( Contract=Two year ),0.0320.98
else if ( Contract=One year ),0.0540.97
else if ( tenure<1year&InternetService=Fiber optic ),0.700.72
else if ( PaymentMethod=Electronic check & InternetService=Fiber optic ),0.480.45
else ( TechSupport=No&OnlineSecurity=No ),0.420.64
else ( default ),0.220.78

بنیاداً همبستگی‌اند و می‌توانند به متخصصان دامنه در گزینش ویژگی‌ها کمک کنند – برای نمونه، نویسندگان اشاره می‌کنند که ریسک بستری مجدد ناشی از ذات‌الریه با آسم کاهش می‌یابد، نه افزایش؛ یافته‌ای خلاف شهود. این مدل آن یافته را آشکار می‌سازد. با این حال، متخصصان دامنه باید آن‌گاه آن یافته را پس از واقعه چنین توضیح دهند:

[ب]یمارانی که سابقه آسم داشتند و با ذات‌الریه مراجعه کردند، معمولاً نه‌تنها به بیمارستان، بلکه مستقیماً به ICU (واحد مراقبت ویژه) بستری می‌شدند. خبر خوب این است که مراقبت تهاجمی‌ای که بیماران آسمی مبتلا به ذات‌الریه دریافت می‌کردند چنان مؤثر بود که ریسک مرگ آنان بر اثر ذات‌الریه را در مقایسه با جمعیت عمومی کاهش می‌داد. خبر بد این است که چون پیش‌آگهی این بیماران بهتر از میانگین است، مدل‌هایی که بر این داده‌ها آموزش دیده‌اند به‌اشتباه می‌آموزند که آسم ریسک را کاهش می‌دهد، در حالی که در واقع افراد آسمی ریسک بسیار بالاتری دارند (اگر بستری نشوند) [34].

بحث بالا نشان می‌دهد که این دغدغه‌ها بر تبیین‌پذیری – که هدف آن یاری رساندن به دانشمند داده برای درک چگونگی کارکرد یک مدل است – حاکم‌اند، اما شاید کمتر بر تفسیرپذیری مصداق پیدا کنند؛ جایی که هدف بنیادین، کمک به تصمیم‌گیرنده برای پیوند دادن خروجی مدل به یک تمایز معنادار است که به او امکان می‌دهد ارزش‌ها، اهداف و ترجیحات خود را برای انتخاب یک گزینه به کار گیرد. به‌طور مشخص، توضیح ارائه‌شده در بالا شاید به کاربر در اشکال‌زدایی از مدل، یا حتی در تصمیم‌گیری درباره اعتماد یا عدم اعتماد به مدل کمک کند؛ اما ممکن است صراحتاً اطلاعات معناداری به کاربر ندهد که بتواند تصمیم نهایی او درباره درمان را روشن سازد.

ماشین‌های گرادیان‌بوستینگ با قید یکنوایی ماشین‌های گرادیان‌بوستینگ (Gradient-Boosting Machines) در پی به‌کارگیری مجموعه‌ای از «یادگیرنده‌های ضعیف» — یعنی مدل‌هایی با دقت پیش‌بینی پایین — هستند تا به‌طور مشترک پیش‌بینی‌های دقیقی ارائه کنند. این رویکرد به بهبود چشمگیر توانایی پیش‌بینی منجر می‌شود، اما به بهای پیچیدگی (Complexity) مدل. برای مقابله با این پیچیدگی، ماشین‌های گرادیان‌بوستینگ با قید یکنوایی (Monotonically Constrained Gradient-Boosting Machines) قیدی را اعمال می‌کنند که بر اساس آن هر ویژگی معین در مدل باید رابطه‌ای یکنوایی با خروجی داشته باشد. این امر از نظر نظری به افزایش تبیین‌پذیری (Explainability) می‌انجامد، زیرا این روابط یکنوا رابطهٔ میان ویژگی‌ها و پیش‌بینی‌ها را به جهت‌گیری‌های کیفی روشن محدود می‌کنند — افزایش یک ویژگی باید به‌طور پیوسته به افزایش یا کاهش

تصویر در نسخهٔ PDF شکل ۹. نمونه‌ای از خروجی یک GA²M که نشان می‌دهد چندین ویژگی (محورهای افقی) چگونه با ریسک (Risk) نسبی بستری مجدد در اثر سینه‌پهلو در بازهٔ ۳۰ روز (محور عمودی) تغییر می‌کنند. برهم‌کنش‌های زوجی در نقشه‌های حرارتی پایین شکل نشان داده شده‌اند. تصویر اصلی در [34] آمده است.

شکل ۹. نمونه‌ای از خروجی یک GA²M که نشان می‌دهد چندین ویژگی (محورهای افقی) چگونه با ریسک نسبی بستری مجدد در اثر سینه‌پهلو در بازهٔ ۳۰ روز (محور عمودی) تغییر می‌کنند. برهم‌کنش‌های زوجی در نقشه‌های حرارتی پایین شکل نشان داده شده‌اند. تصویر اصلی در [34] آمده است.

پیش‌بینی منجر شود. همان‌گونه که پیش‌تر گفته شد، این مدل‌ها مفروض می‌گیرند که صورت‌های تابعی ساده‌تر ذاتاً تبیین‌پذیرترند. با این حال، این مدل‌ها، در شکل کنونی‌شان، ممکن است صرفاً شکلی از منظم‌سازی را به‌کار گیرند که لزوماً بر دانش دامنه (domain) استوار نیست. یکنوایی ممکن است در برخی موارد — مانند منحنی دوز–پاسخ — مناسب باشد، اما در موارد دیگر — مانند مدل‌سازی موج‌ها یا دیگر رفتارهای سینوسی — مناسب نباشد. برای تعیین اینکه آیا قیدهای یکنوایی یا هر قید دیگری مناسب هستند یا نه، به دانش دامنه نیاز است. در نبودِ آن دانش دامنه، به‌کارگیری چنین قیدهایی ممکن است مدل را ساده کند، اما این ساده‌سازی ممکن است به شیوه‌ای گمراه‌کننده صورت گیرد که به استنباط تبیین‌های نادرست دامن بزند.

3.2.3 محدودیت‌های مدل‌های کنونی هوش مصنوعی توضیح‌پذیر

به‌طور کلی، این فرض که مدل‌های ساده‌شده به‌طور ذاتی تفسیرپذیرند، مستلزم برخوردار بودن کاربران مدل از نوعی دانش دامنه‌ای است – یعنی اینکه آن‌ها تخصص کافی در علم داده داشته باشند تا بتوانند مدل‌های خطی، درخت‌های تصمیم، فهرست‌های قاعده و مانند آن‌ها را درک کنند. افزون بر این، این مدل‌های «تفسیرپذیر» ممکن است زمینهٔ کافی برای کاربران فراهم نکنند تا بتوانند ارزش‌ها، اهداف و اصول خود را به‌کار گرفته و به تصمیم‌گیری برسند. این تکنیک‌ها به‌معنای واقعی کلمه «واژه‌به‌واژه»اند، به این معنا که قاعده‌ای ارائه می‌دهند، اما هیچ بینشی دربارهٔ سازوکار واقعی الگوریتم به دست نمی‌دهند. آن‌ها همبستگی ارائه می‌کنند، نه علیت؛ اما ممکن است در استنباط علیت به متخصصان حوزه یا دانشمندان داده کمک کنند. این تکنیک‌ها می‌توانند متخصصان دارای پیشینهٔ تخصصی مناسب را تشویق کنند که سازوکارهایی را که منجر به یک طبقه‌بندی خاص شده‌اند، عمیق‌تر بررسی کنند، هرچند خودِ آن سازوکارها را صریح نمی‌سازند. بدین ترتیب، یک متخصص فنی شاید بتواند با بهره‌گیری از دانش پیشینه‌ای خود دربارهٔ نوع الگوریتم به‌کاررفته، از این ابزارها علیت را استنباط کند. این امر ممکن است به آن‌ها امکان دهد توضیحی بسازند، همان‌گونه که یک عضو هیئت منصفه یا خواننده می‌تواند از متنی منسجم، ساختاری هماهنگ استنباط کند. با این حال، در نهایت انسان است که توضیح را به خروجی مدل نسبت می‌دهد. تکنیک‌های برشمردهٔ بالا بازنمایی‌های صریحی از سازوکارهای علّی ارائه نمی‌دهند و با ارزش‌ها، اهداف یا ترجیحات کاربران تعامل ندارند؛ بلکه برای کارآمدی خود باید بر دانش پیشینه‌ای انسان‌ها تکیه کنند. از این رو، این مدل‌ها انتظارات زیادی از بیننده دارند، از جمله دانش دامنه‌ایِ احتمالاً قابل‌توجه دربارهٔ معنای اصطلاحات فنی (مانند «هماتوکریت» در مثال تشخیص ذات‌الریهٔ GA²M)، توانایی تمایز میان متغیرهای پیوسته و گسسته و غیره. به‌طور مشابه، کاربران باید تخصص گسترده‌ای در موضوع داشته باشند تا بتوانند برای مثال تشخیص دهند که بهتر است سابقهٔ قبلی آسم با ریسک پایین‌تر ذات‌الریه مرتبط دانسته نشود. بنابراین، مدل به‌خودی‌خود به‌معنایی که روان‌شناسان این اصطلاحات را درک می‌کنند، تفسیرپذیر یا توضیح‌پذیر نیست، اما ممکن است به کاربرانی که دانش پیشینه‌ای مناسب و تمایل به بررسی دارند، کمک کند تا نتیجه‌گیری‌های معنادارتر و دقیق‌تری به دست آورند.

از آنجا که این مدل‌ها ذاتاً همبستگی‌اند، ممکن است در معرض همبستگی‌های کاذب قرار گیرند. در واقع، از دیرباز در علوم اجتماعی [130] پذیرفته شده است که شناسایی ساختاری معنادار در داده‌ها (مثلاً در نتیجهٔ یک همبستگی یا رگرسیون) تنها گام نخست در نسبت‌دادن یک سازوکار علّی است و در غیاب یک سناریوی خلاف‌واقع (مانند یک گروه کنترل آزمایشی)، نمی‌توان برای ادعاهای علّی بر آن تکیه کرد. بدین ترتیب، رویکردهایی که مدل‌های پیچیده را با کاهش آن‌ها به مجموعه‌ای از روابط یکنوا ساده می‌کنند، ممکن است کاربران را به‌گونه‌ای گمراه کنند که سازوکار علّی‌ای را درون مدل نسبت دهند که وجود ندارد. این مشکل ویژهٔ سیستم‌های محاسباتی نیست، بلکه ویژگی عامی از سیستم‌های مهندسی‌شدهٔ پیچیده با اجزای متعدد در حال تعامل است [29]. بنابراین، پژوهش‌های آینده در حوزهٔ هوش مصنوعی توضیح‌پذیر می‌تواند به‌طور ثمربخشی بر این موضوع متمرکز شود که چگونه می‌توان به دانشمندان داده و متخصصان دامنه کمک کرد تا ادعاهای علّی را به‌طور دقیق نسبت دهند و در عین حال از استنباط مبتنی بر همبستگی کاذب پرهیز کنند.

3.2.4 رابط‌های کاربری گرافیکیِ هدفمند

به‌طور کلی، رویکردهای برشمرده در بالا می‌کوشند تبیین‌پذیری را با کمک به کاربران برای فهم اینکه چگونه تغییر یک ویژگی مشخص می‌تواند خروجی مدل را تغییر دهد، ارتقا دهند. هرچند نظریه‌پردازی می‌شود که این رویکردها زمانی تبیین‌پذیری را ارتقا می‌دهند که یک دانشمند داده بتواند از آن‌ها برای استنباط سازوکارهای علّیِ نحوه کار الگوریتم بهره گیرد، این تکنیک‌ها ممکن است برای برقراری تفسیرپذیری – یعنی معناداری در بستر برای کاربر نهایی – کارایی کمتری داشته باشند. در حالی که توسعه‌دهندگان باید بدانند سیستم چگونه کار می‌کند تا بتوانند نواقص پیاده‌سازی خود را شناسایی و رفع کنند، اعضای عموم مردم یا متخصصان حوزه‌های دیگر معمولاً فاقد آموزش فنی عمیق و تخصص دانشمندان رایانه هستند؛ و نباید انتظار داشت که چنین تخصصی پیدا کنند. برای مثال، یک وکیل مهاجرت ممکن است بخواهد پیامدهای حقوقی الگوریتم بررسی ویزا را بداند، یا یک تحلیلگر مالی ممکن است بخواهد پیامدهای مالی الگوریتم رتبه‌بندی اعتباری را بداند. این کاربران اغلب صرفاً فرض می‌کنند که الگوریتم به‌درستی پیاده‌سازی شده و داده‌های آموزشی به‌اندازه کافی نماینده بوده‌اند. سرانجام، متقاضیان شغل/ویزا/اعتبار طبعاً می‌خواهند بدانند با چه معیارهایی ارزیابی می‌شوند و آیا برای موقعیت مشخصی رقابت‌پذیر هستند یا خیر. این کاربران لازم است بدانند چرا یک سیستم نتیجه‌ای تولید کرده است. یعنی آن‌ها می‌کوشند خروجی مدل را چنان معنا کنند که بتوانند آن را در قالب‌هایی که برایشان معنادار است، در بستر قرار دهند.

در برخی موارد، «رابط‌های کاربری گرافیکی» (Graphical User Interfaces, GUIs) مانند ابزار What-If شرکت Google ممکن است همراه با خروجی مدل به کار رود تا به کاربرانی که دانش عددی یا آماری محدودی دارند در «درک کلی مطلب» کمک کند. برای مثال، مجموعه‌ای از پژوهش‌ها در تصمیم‌گیری پزشکی، به تفاوت‌های فردی در سواد نموداری (مانند [48]) و تکنیک‌هایی می‌پردازد که می‌تواند برای غلبه بر این تفاوت‌ها و انتقال کلیت اطلاعات پیچیده پزشکی به کار رود [37, 37, 145]. با این حال، طراحان باید مراقب باشند که فرض نکنند یک قالب نموداری لزوماً تفسیرپذیرتر است. بلکه خروجی نموداری باید با نمایش‌های مناسبِ نرخ‌های پایه، آستانه‌ها و دیگر شاخص‌های تمایزهای معنادار طبقه‌ای، در بستر قرار گیرد؛ که در بسیاری از موارد ممکن است لازم باشد از خود کاربران پرسیده شود. سرانجام، تفسیرهای تولیدشده توسط ماشین تنها در صورتی می‌توانند مؤثر باشند که برحسب دانش پس‌زمینه و اهداف در بستر قرار گیرند و با تفاوت‌های فردی سازگار شوند.

3.2.5 مدل‌های موضوعی منسجم

مدل‌های موضوعی خانواده‌ای از الگوریتم‌های استنتاج بیزی هستند که به‌طور گسترده بر روی داده‌های متنی برای بازیابی اطلاعات و خلاصه‌سازی اسناد به کار رفته‌اند [13]. پرکاربردترین این الگوریتم‌ها، «تخصیص دیریشله نهفته» (Latent Dirichlet Allocation, LDA) است [14] که موضوع‌های نهفته‌ای را استنتاج می‌کند

تصویر در نسخهٔ PDF Fig. 10. A visualization of Latent Dirichlet Allocation output from [13]. Probabilistic topic models such as LDA map each word in a text corpus to a topic. The most frequent words in that topic are then presented to humans for interpretation.

شکل ۱۰. تجسمی از خروجی تخصیص دیریشله نهفته (LDA) برگرفته از [13]. مدل‌های موضوعی احتمالاتی مانند LDA هر واژه در یک پیکره متنی را به یک موضوع نگاشت می‌کنند. سپس پرتکرارترین واژه‌های آن موضوع برای تفسیر به انسان‌ها ارائه می‌شوند.

که فرض می‌شود محتوای معنایی مشترک میان اسناد متعدد را در بر می‌گیرند. در عمل، این موضوع‌ها در واقع توزیع احتمالی‌ای بر روی واژه‌های پیکره متنی هستند که مدل LDA بر روی آن آموزش دیده است. انسان‌ها از مدل‌های موضوعی به این صورت استفاده می‌کنند که واژه‌های برتر یا اسناد برتر هر موضوع معین را بررسی می‌کنند و سپس به آن موضوع‌ها معنا نسبت می‌دهند [59]؛ تا آنجا که برخی حتی ادعا کرده‌اند مدل‌های موضوعی اصل مطلب متن را به‌طور صریح می‌سنجند [60]. با این حال، پژوهش‌های جدیدتر نشان داده‌اند که انسان‌ها در تفسیر برخی خروجی‌های مدل‌های موضوعی دچار دشواری می‌شوند [36]، به‌ویژه هنگامی که با نحوه کارکرد الگوریتم آشنایی ندارند [83]. اگرچه دانشمندان رایانه برای بهبود انسجام خروجی مدل‌های موضوعی (که فرض شده است تفسیرپذیری را افزایش می‌دهد) سنجش‌هایی توسعه داده‌اند [81, 96]، خروجی حاصل به‌طور صریح تفسیری برای کاربران انسانی فراهم نمی‌کند، بلکه صرفاً فهرستی از واژه‌ها همراه با احتمال‌های موضوعی مربوط است که انسان‌ها باید آن را تفسیر کنند (ر.ک. شکل ۱۰). با این وجود، مدل‌های موضوعی شاید در میان الگوریتم‌های ML کم‌نظیر باشند، زیرا کاربرانشان کوشیده‌اند تفسیرپذیری را به‌طور صریح از طریق وظایفی که توسط انسان‌های غیرمتخصص بدون آگاهی از نحوه کارکرد الگوریتم ارزیابی می‌شوند، در ساختار و خروجی آن‌ها مهندسی کنند. پژوهش‌های آینده باید بر ارزیابی این رویکرد و به‌کارگیری احتمالی آن در دیگر پارادایم‌های الگوریتمی متمرکز شوند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P04-C30-S04

شناسهٔ محتوا KDJ-AI-2026E1-P04-C30-S04-1BD83495

پیوند مستقیم این بخش