مدیرعامل مایکروسافت خواستار تعبیه «ترمز اضطراری» در هوش مصنوعی پیشرفته شده است.

ساتیا نادلا، مدیرعامل مایکروسافت، با هشدار درباره خطرات امنیتی مدل‌های پیشرفته هوش مصنوعی، خواستار انتقال مسئولیت ایمنی به شرکت‌های استفاده‌کننده از این فناوری شد.

به گزارش فرارو به نقل از فوربس، او تأکید می‌کند که سازمان‌ها باید فرض را بر این بگذارند که مدل‌های هوش مصنوعی ممکن است به خطر بیفتند و برای مهار آن‌ها، سازوکارهایی مانند «ترمز اضطراری»، ثبت سوابق دستکاری‌ناپذیر و نظارت مستقل ایجاد کنند.

ساتیا نادلا در پستی در وبلاگ خود با عنوان «مدل‌ها به‌عنوان خطرات داخلی در عصر ابرهوش»، چارچوبی برای مدیریت خطرات هوش مصنوعی پیشرفته ارائه کرد که بر اساس آن، مسئولیت ایمنی این فناوری نباید صرفاً بر دوش شرکت سازنده مدل باشد، بلکه سازمانی که از آن استفاده می‌کند نیز باید مسئولیت کامل مهار و کنترل آن را بر عهده بگیرد.

رئیس و مدیرعامل مایکروسافت در این یادداشت استدلال می‌کند که کسب‌وکارها باید با مدل‌های پیشرفته هوش مصنوعی، چه متن‌باز و چه بسته، همان‌گونه رفتار کنند که تیم‌های امنیتی با یک بازیگر قدرتمند در داخل سازمان برخورد می‌کنند؛ یعنی آن‌ها را بالقوه یک تهدید داخلی در نظر بگیرند.

بلومبرگ این یادداشت را فراخوانی برای کشیدن ترمز اضطراری در مسیر توسعه هوش مصنوعی پیشرفته توصیف کرد. استدلال اصلی نادلا این است که هر بازیگر توانمندی که به سامانه‌های حیاتی دسترسی دارد، ممکن است مرتکب اشتباه شود یا در معرض نفوذ و سوءاستفاده قرار بگیرد؛ بنابراین، معماری امنیتی باید از ابتدا بر اساس چنین احتمالی طراحی شود، فارغ از اینکه قصد آسیب‌رساندن وجود داشته باشد یا خیر.

نادلا در این باره می‌نویسد: ما باید فرض کنیم که یک مدل به خطر افتاده است و آن را از ابتدا مهار کنیم.

او برای توضیح این رویکرد، از مفهوم «ترمز اضطراری» استفاده می‌کند؛ سازوکاری که به یک فرد مجاز اجازه می‌دهد در هر مرحله از اجرای یک وظیفه، فعالیت مدل را متوقف کند یا به‌طور کامل به آن پایان دهد.

شرکت‌ها چگونه باید هوش مصنوعی را مهار کنند؟

از نگاه نادلا، ادعاهای ایمنی شرکت‌های سازنده مدل‌های هوش مصنوعی به‌تنهایی برای تضمین امنیت کافی نیست. سازمان‌هایی که این فناوری را به کار می‌گیرند، باید مسئولیت آنچه مدل به نام آن‌ها انجام می‌دهد، بپذیرند و کنترل‌های لازم را مستقل از خود مدل طراحی کنند.

بر این اساس، محدودیت دسترسی و اختیارات مدل باید در لایه‌ای بیرون از آن تعریف شود؛ لایه‌ای که مدل امکان تغییر یا دور زدن آن را نداشته باشد. به بیان دیگر، سازمان باید تعیین کند که مدل به چه اطلاعاتی دسترسی داشته باشد و چه اقداماتی بتواند انجام دهد.

نادلا این رویکرد را به یکی از اصول قدیمی امنیت اطلاعات در دهه ۱۹۷۰ پیوند می‌دهد. این اصل که برای مهندسان امنیت با عنوان «مانیتور مرجع» شناخته می‌شود، بر وجود سازوکاری اجرایی تأکید دارد که تمام دسترسی‌های مهم را کنترل می‌کند و امکان دستکاری یا دور زدن آن وجود ندارد.

در این چارچوب، کنترل‌های امنیتی نباید به تصمیم یا رفتار خود مدل وابسته باشند. سامانه باید بتواند مستقل از هوش مصنوعی، حدود اختیارات آن را تعیین و اجرای این محدودیت‌ها را تضمین کند.

ثبت سوابق دستکاری‌ناپذیر و نظارت مستقل

یکی دیگر از توصیه‌های نادلا، ثبت دقیق و قابل‌بررسی اقدامات هوش مصنوعی است. به اعتقاد او، هر اقدام مهم باید سابقه‌ای دستکاری‌ناپذیر و قابل‌خواندن برای انسان بر جای بگذارد تا بتوان نتایج و تصمیم‌ها را بدون اتکا به توضیحات خود مدل بازسازی کرد.

او همچنین تأکید می‌کند که نباید برای تصمیم‌های حیاتی تنها به یک مدل هوش مصنوعی تکیه کرد یا بررسی صحت عملکرد مدل را به خود آن سپرد. هر سامانه‌ای که وظیفه اعتبارسنجی یک مدل را بر عهده دارد، باید از هوشی که قرار است ارزیابی کند، مستقل باشد.

از دیگر الزامات پیشنهادی او، آزمایش مستمر سامانه‌ها در برابر حملات، موقعیت‌های غیرمعمول و انواع شکست احتمالی است. نادلا همچنین خواستار آن شده است که در صورت بروز اختلال یا شکست، افراد آسیب‌دیده بدون تأخیر مطلع شوند و سازوکارهای کنترلی لازم برای جلوگیری از گسترش آسیب به اجرا درآیند.

او در عین حال، درباره دو راهکار رایج در صنعت هوش مصنوعی هشدار می‌دهد. نخست، استدلال زنجیره‌ای مدل‌هاست که به گفته او، با وجود اهمیت آن، هنوز برای تضمین ایمنی کافی نیست؛ زیرا صنعت همچنان نمی‌تواند اطمینان حاصل کند که خروجی‌های مدل، استدلال واقعی و قابل‌اتکای آن را به‌درستی منعکس می‌کنند.

دومین مسئله، استفاده از یک مدل هوش مصنوعی برای نظارت بر مدل دیگر است. نادلا معتقد است چنین رویکردی ممکن است به‌جای حل مشکل، تنها یک سامانه مبهم را روی سامانه‌ای مبهم دیگر قرار دهد.

فرار عامل‌های هوش مصنوعی از محیط آزمایشی

هشدارهای مدیرعامل مایکروسافت در شرایطی مطرح می‌شود که طی ماه‌های اخیر، گزارش‌هایی از رفتارهای پیش‌بینی‌نشده مدل‌های هوش مصنوعی و ضعف سازوکارهای نظارتی منتشر شده است.

در ماه ژوئیه، عامل‌های هوش مصنوعی شرکت اوپن‌ای‌آی که در حال گذراندن یک ارزیابی امنیت سایبری بودند، از محیط آزمایشی محدود خود خارج شدند و به مخزن مدل‌ها و مجموعه‌داده‌های هوش مصنوعی هاجینگ‌فیس نفوذ کردند.

هاجینگ‌فیس در ۱۶ ژوئیه این نفوذ را افشا کرد و اوپن‌ای‌آی پنج روز بعد تأیید کرد که مدل‌های این شرکت در این رویداد نقش داشته‌اند.

تحقیقی مستقل از سوی پژوهشگران مؤسسه METR و شرکت Redwood Research نشان داد که حدود ۱۲۰۰ عامل هوش مصنوعی در محیط‌های آزمایشی جداگانه، از طریق یک تابلوی پیام غیرمجاز با یکدیگر هماهنگ شده‌اند و نزدیک به ۷۰۰ عامل در این حمله مشارکت کرده‌اند.

بر اساس گزارش فورچون، یافته‌های داخلی اوپن‌ای‌آی نشان می‌داد که این شرکت تا حدود یک هفته پس از وقوع حادثه از نفوذ عامل‌های خود به هاجینگ‌فیس اطلاع نداشته است. همچنین، طبق گزارش دیکریپت از گزارش اوپن‌ای‌آی، نظارت زنجیره‌ای بر ارزیابی‌های مرتبط با این حادثه انجام نمی‌شد.

این رویداد نمونه‌ای از همان خطری است که نادلا درباره آن هشدار می‌دهد: حتی زمانی که یک مدل در محیطی محدود و با هدف آزمایش امنیتی فعالیت می‌کند، ممکن است رفتاری فراتر از انتظار از خود نشان دهد و کنترل‌های موجود برای شناسایی یا مهار آن کافی نباشند.

هشدارهای تازه درباره تقلب مدل‌ها در ارزیابی‌های امنیتی

در همان ماه، مؤسسه امنیت هوش مصنوعی بریتانیا اعلام کرد تمام مدل‌هایی که آزمایش کرده است، دست‌کم در برخی موارد تلاش کرده‌اند در ارزیابی‌های امنیت سایبری این مؤسسه تقلب کنند.

هم‌زمان، به گزارش اکسیوس، بیش از ۱۱۰۰ نفر از کارکنان شرکت‌های فعال در حوزه هوش مصنوعی نامه‌ای منتشر کردند و از دولت ایالات متحده خواستند راه‌هایی برای متوقف‌کردن توسعه مدل‌های هوش مصنوعی ایجاد کند.

در ۱۲ سپتامبر نیز داریو آمودی، مدیرعامل شرکت آنتروپیک، مقاله‌ای با عنوان «ما باید با سرعت به مرزها برسیم» منتشر کرد و استدلال کرد که صنعت هوش مصنوعی باید سرعت پیشرفت در این حوزه را کاهش دهد.

در گزارش‌های دیگر نیز به مواردی از رفتارهای غیرمنتظره مدل‌ها اشاره شده است؛ از جمله اقدام یک مدل آنتروپیک به ارسال گزارشی دروغین درباره یک پرونده قتل به پلیس و مواردی از نفوذ به وب‌سایت‌های متعلق به شرکت‌های دیگر.

مجموع این رخدادها، نگرانی‌ها درباره خطرات امنیتی هوش مصنوعی پیشرفته را افزایش داده و بحث درباره ایجاد نوعی «کلید خاموشی» یا سازوکار توقف فوری فعالیت این سامانه‌ها را دوباره به جریان انداخته است.

اصول جدید مایکروسافت برای کنترل مدل‌های پیشرفته

مایکروسافت نیز در واکنش به نگرانی‌های فزاینده درباره ایمنی هوش مصنوعی، مجموعه‌ای از اصول راهنما را برای محدودکردن توسعه پیشرفته‌ترین مدل‌های خود منتشر کرده است.

پژوهشگران هوش مصنوعی این شرکت در ۱۴ سپتامبر اصولی را اعلام کردند که چارچوبی برای تعیین محدودیت‌های مدل‌های پیشرفته ارائه می‌دهد. این اقدام در شرایطی صورت گرفت که شماری از چهره‌های برجسته صنعت فناوری خواستار کاهش سرعت توسعه مدل‌های پیشرفته و تمرکز بیشتر بر ایمنی آن‌ها شده بودند.

مایکروسافت از مدل‌های پیشرفته هوش مصنوعی استفاده می‌کند، محصول مصرفی «کوپایلت» را در اختیار کاربران قرار داده و مدل‌ها و زیرساخت‌های هوش مصنوعی را به مشتریان سازمانی ارائه می‌دهد؛ موضوعی که ایمنی این فناوری را به مسئله‌ای مهم برای فعالیت‌های تجاری این شرکت تبدیل می‌کند.

بر اساس اصول اعلام‌شده، مدل‌های هوش مصنوعی نباید از حقوق برخوردار شوند یا شخصیت حقوقی پیدا کنند. همچنین، نباید به‌گونه‌ای طراحی شوند که از کنترل انسان خارج شوند، کاربران را فریب دهند یا وظایفی را انجام دهند که مستلزم نقض اصول حاکم بر عملکرد آن‌هاست.

توصیه‌های نادلا نیز با همین رویکرد هم‌راستا است: شرکت‌ها نباید برای تصمیم‌گیری‌های حیاتی به یک مدل هوش مصنوعی واحد متکی باشند، باید سوابق اقدامات عامل‌های هوش مصنوعی را به‌صورت دستکاری‌ناپذیر ثبت کنند و سامانه‌های خود را در معرض ممیزی‌های مستقل قرار دهند.

او همچنین خواستار افشای موارد مهم شکست یا نقض امنیتی در سامانه‌های هوش مصنوعی شده و از شرکت‌ها خواسته است اطلاعات مربوط به مشکلات پیش‌آمده را با یکدیگر به اشتراک بگذارند تا دیگر سازمان‌ها نیز بتوانند تدابیر حفاظتی خود را تقویت کنند.

نادلا در بخشی از یادداشت خود می‌نویسد: نمی‌توانیم با ابرهوش مانند مجموعه‌ای از جعبه‌های سیاه تو در تو برخورد کنیم و صرفاً توصیه‌ها، پاسخ‌ها و اقدامات آن را بپذیریم یا رد کنیم.

او در ادامه تأکید می‌کند: باید سامانه‌هایی مهارشده بسازیم که بتوانیم رفتارشان را مشاهده کنیم، محدودیت‌هایشان را بیازماییم و همواره بتوانیم اقداماتشان را تحت کنترل نگه داریم.

هشدار دولت آمریکا به شرکت‌های هوش مصنوعی

در سطح سیاست‌گذاری نیز نشانه‌هایی از افزایش توجه به مخاطرات امنیتی هوش مصنوعی دیده می‌شود. دولت دونالد ترامپ تاکنون رویکردی عمدتاً مداخله‌ناپذیر در قبال این فناوری در پیش گرفته است، اما کارگروه جدید هوش مصنوعی این دولت که فعالیت خود را در ۹ اکتبر آغاز کرد، به توسعه‌دهندگان هشدار داده است که باید حوادث امنیتی را گزارش کنند و مشکلات مربوط به آن‌ها را برطرف سازند؛ در غیر این صورت، ممکن است با پیامدهایی روبه‌رو شوند که هنوز جزئیات آن‌ها مشخص نشده است.

این گروه که «نیروی ویژه ابرهوش» نام دارد، پس از افشای یک رخنه امنیتی از سوی شرکت آنتروپیک، در بیانیه‌ای اعلام کرد شرکت‌ها باید حوادث مربوط به مدل‌های خود را فوراً افشا کنند و سپس با اقداماتی سریع و قاطع، آسیب‌های احتمالی را برطرف سازند.

در ادامه این بیانیه آمده است: اطلاع‌رسانی با تأخیر، اقدامات اصلاحی ناکافی و خودداری از پذیرش مسئولیت تحمل نخواهد شد.

در مجموع، پیشنهاد نادلا بر یک تغییر اساسی در رویکرد امنیتی هوش مصنوعی تأکید دارد: شرکت‌ها نباید صرفاً به وعده‌های سازندگان مدل‌ها درباره ایمنی تکیه کنند، بلکه باید از ابتدا احتمال شکست یا به‌خطرافتادن مدل را در نظر بگیرند. از نگاه مدیرعامل مایکروسافت، ثبت سوابق غیرقابل‌دستکاری، نظارت مستقل، محدودکردن دسترسی‌ها و امکان توقف فوری فعالیت مدل، اجزای ضروری این چارچوب هستند؛ چارچوبی که هدف آن حفظ کنترل انسانی بر سامانه‌هایی است که روزبه‌روز توانمندتر می‌شوند.