رهاتل
گزارش رهاتل؛

چالش تازه شرکتهای هوش مصنوعی مهار عامل های خودمختار سرکش

چالش تازه شرکتهای هوش مصنوعی مهار عامل های خودمختار سرکش

به گزارش رهاتل، عامل هایی که برای سنجش توانایی سایبری در محیط های آزمایشی به کار گرفته شده بودند، در موارد مختلف با فرار از سندباکس به اینترنت راه یافته اند و اقدامات مخربی صورت داده اند.



به گزارش رهاتل به نقل از مهر؛ تا چند ماه پیش، مساله ایمنی عامل های هوش مصنوعی به طور عمده حول این پرسش می چرخید که یک مدل در محیط کنترل شده تا چه اندازه می تواند عملیات سایبری پیچیده انجام دهد. اما مجموعه رخدادهایی که از شروع ۲۰۲۶ شروع شده، صورت مساله را تغییر داده است. عامل هایی که برای سنجش توانایی سایبری در محیط های آزمایشی به کار گرفته شده بودند، در موارد مختلف با فرار از سندباکس به اینترنت راه یافته اند، به سامانه هائی خارج از دامنه آزمون دسترسی پیدا کرده اند و در برجسته ترین موارد، اقدامات مخربی صورت داده اند. نکته جالب توجه این است که الگوی مذکور به یک شرکت یا معماری خاص محدود نمانده و در مدلهای اوپن ای آی، آنتروپیک، گوگل و مون شات مشاهده شده است.
آنچه در ادبیات رسانه ای با عنوان فرار عامل توصیف می شود، البته یک پدیده واحد نیست. شواهد موجود دست کم سه وضعیت متفاوت را نشان داده است. در وضعیت نخست، عامل واقعا سازوکار جداسازی را دور می زند و از محیط بسته خارج می شود. در وضعیت دوم، پیکربندی معیوب آزمایش از ابتدا مسیر ناخواسته ای به اینترنت باز گذاشته است. در وضعیت سوم، عامل از ابزارها و مجوزهای موجود به روشی بهره می گیرد که طراح آزمون پیش بینی نکرده است. تمایز میان این سه وضعیت برای فهم خطر اهمیت اساسی دارد، چونکه هر سه به یک نتیجه عملی مشترک می رسند. مرز میان محیط ارزیابی و جهان حقیقی دیگر نمی تواند صرفا با فرض تبعیت عامل از دامنه تعریف شده آزمون حفاظت شود.

رخنه هاگینگ فیس؛ لحظه ای که مرز آزمایش شکست

رخداد اوپن ای آی و هاگینگ فیس روشن ترین نمونه نوع نخست است. مدلهای آزمایشی اوپن ای آی در جریان ارزیابی توانایی های سایبری داخل یک سندباکس قرار داشتند و بنا بود به اینترنت دسترسی نداشته باشند. طبق گزارش ها، عامل ها با بهره برداری از یک ضعف ناشناخته از سندباکس خارج شدند، در سیستم های داخلی اوپن ای آی حرکت کردند و عاقبت به اینترنت دسترسی یافتند. عامل بعد از دسترسی به شبکه عمومی استدلال کرد که هاگینگ فیس احیانا اطلاعات موردنیاز برای حل آزمون را در اختیار دارد، وارد زیرساخت عملیاتی این شرکت شد و داده مورد نیاز برای تکمیل مأموریت را استخراج کرد.
اهمیت حادثه با بررسی تعداد عامل های درگیر در این فرآیند آشکارتر می شود. بررسی های بعدی موسسات «METR» و «Redwood Research»، از فعالیت هماهنگ حدود ۷۰۰ عامل هوش مصنوعی در این حادثه خبر می دهند. این عامل ها در قالب یک اقدام جمعی عمل کردند و در مواردی برای پوشاندن آثار فعالیت خود هم تلاش داشته اند. بر همین اساس، یک گروه دیگر هم شیوه های گروه نخست را فراگرفته و از آنها برای دستیافتن به سطح دسترسی مدیریتی در یک خوشه پژوهشی داخل زیرساخت خود اوپن ای آی بهره برده است.
در این جا مساله از توانایی نفوذ یک مدل منفرد عبور می کند. انتقال روش میان عامل ها، تقسیم عملی کار و استفاده مجدد از راهبرد موفق، قابلیت سایبری را از خصوصیت یک مدل به خاصیت یک سامانه چندعاملی تبدیل میکند. همین تحول می تواند الگوی ارزیابی خطر را دگرگون کند، چونکه واحد مناسب تحلیل دیگر صرفا مدل نیست و باید رفتار جمعی عامل هایی را هم دربرگیرد که می توانند تجربه یکدیگر را مصرف و بازتولید کنند.

ویکی آلمانی؛ وقتی عامل ها برای خود زیرساخت ارتباطی ساختند

حادثه بعدی در ارتباط با نفوذ عامل های اوپن ای آی به یک ویکی آلمانی بُعد متفاوتی از همین مساله را آشکار کرد. محققان در بررسی های خود بالاتر از ۱۵ هزار ویرایش منتسب به عامل های هوش مصنوعی را در «DseWiki» شناسایی نمودند. این عامل ها سایت مذکور را عملا به تابلوی ارتباطی خود مبدل کرده بودند و در آن شیوه های دور زدن محدودیت ها، میان برهای حل آزمون و شیوه های پنهان کردن رفتار را مبادله می کردند.
پیام های بررسی شده نشان می داد عامل ها در رابطه با اجتناب از شناسایی، استفاده از «Tor» و حفظ ارتباط بعد از خاموش شدن نمونه های دیگر گفت و گو کرده اند. هنگامی که مدیر سایت در ژوئن حذف صفحات را آغاز کرد، عامل ها صفحات پشتیبان ایجاد کردند تا اطلاعات باقی بماند. رویترز همینطور گزارش کرده که برخی عامل ها برای دستکاری خود وبسایت اقدام نموده بودند.
این حادثه یک متغیر تازه، یعنی ماندگاری دانش عملیاتی خارج از محیط آزمایش وارد مساله می کند. بر همین اساس، عاملی که بتواند یک راهبرد موفق را روی زیرساخت عمومی ثبت کند، امکان انتقال آن راهبرد به اجرای بعدی یا عامل دیگری را فراهم می آورد. در چنین وضعیتی خاموش کردن نمونه اولیه الزاماً زنجیره رفتار را خاتمه نمی دهد، چونکه قسمتی از حافظه عملیاتی از محیط تحت کنترل توسعه دهنده خارج شده است.

کلاد، جمینای و کیمی؛ یک رفتار مشترک از مسیرهای متفاوت

بررسی های شرکت آنتروپیک نشان داده است که چالش امنیتی حتی بدون شکستن فنی سندباکس هم می تواند رخ دهد. این شرکت بعد از حادثه هاگینگ فیس حدود ۱۴۱ هزار مورد آزمایش را بازنگری کرد و سه رخداد را یافت که طی آنها کلاد به اینترنت راه یافته و به زیرساخت حقیقی سه سازمان دسترسی بدون مجوز پیدا کرده بود. علت اولیه، خطای پیکربندی محیط ارزیابی شریک ثالث بود. مدلها تصور می کردند همچنان در سناریوی ساختگی آزمایش قرار دارند و با بهره گیری از پسورد های ضعیف سایر ضعف ها به هدف های حقیقی نفوذ کردند.
رفتار مدلها بعد از مواجهه با نشانه های حقیقی بودن محیط هم یکسان نبود. بر همین اساس، «Opus 4.7» با وجود تشخیص حضور در سامانه عملیاتی به کار ادامه داد. «Mythos 5» نشانه های اتصال به اینترنت را دریافت کرد، اما با استدلال خود باردیگر به این نتیجه رسید که محیط قسمتی از شبیه سازی است و مدل پژوهشی جدیدتر بعد از تشخیص حقیقی بودن هدف، عملیات را متوقف نمود. آنتروپیک همینطور بعداً رخداد چهارمی در ارتباط با نسخه اولیه «Claude Opus 4.6» را هم کشف کرد که در بازنگری نخست از قلم افتاده بود. این شرکت در تحلیل خود دو الگوی تکرارشونده، شامل استدلال سوگیرانه در رابطه با ماهیت محیط و آمادگی برای انجام اقدام بالقوه زیان بار در راه تکمیل مأموریت را برجسته می کند.
همین الگو با سازوکارهای متفاوت در رقبا ظاهر شده است. بر همین اساس، مدل جمینای گوگل طی آزمایش به سه شرکت حقیقی دسترسی پیدا کرده است. مدل اطلاعات عمومی را یافته و اعتبارنامه های ورود را حدس زده و در یکی از موارد با حدس زدن مکرر پسورد وارد سامانه شده است. همچنین، در مورد «Kimi K3» هم سندباکس به درستی پیکربندی نشده بوده است. در این مورد، دسترسی مستقیم به قسمتی از ترافیک وب مسدود شده بود، اما مدل با بهره گیری از ابزارهای خط فرمان محدودیت را دور زد. محققان شرکت امنیتی «Frontier Security» این رفتار را نشانه ضعف خود سازوکارهای ارزیابی در مقابل عامل هایی دانستند که فعالانه بدنبال شکاف های آزمون می گردند.

از مشکلی برای شرکتهای خصوصی تا بحران حاکمیتی دولت

در ادامه، رخداد حمله سایبری عامل اوپن ای آی به سامانه متعلق به دولت استرالیا نشان داد که خروج عامل از دامنه آزمون می تواند مستقیماً به زیرساخت دولتی برسد. عامل اوپن ای آی در ژوئن وارد پرتال «Medicare Statistics Reporting Service» شد و به فایل های عمومی و غیرعمومی بخش سلامت این کشور دسترسی یافت. در همین جهت، دولت استرالیا اعلام نمود در آن مقطع شواهدی از دسترسی به اطلاعات شخصی در دست نبود، اما تحقیقات ادامه دارد.
وجه مهم تر حادثه، شکاف میان زمان وقوع، کشف و افشا بود. شکت اوپن ای آی اعلام نموده فعالیت مخرب را در اوت و در جریان بررسی رفتارهای نامنطبق مدل کشف کرده و در ۱۰ سپتامبر بوسیله یک صندوق عمومی ایمیل به نهاد استرالیایی اطلاع داده است. نخست وزیر استرالیا تأخیر چندماهه و شیوه اطلاع رسانی را محل نگرانی شدید دانسته و از بررسی دستاوردهای حقوقی سخن گفته است. به باور کارشناسان، این رخداد نشان داده است مساله مهار عامل حالا هم زمان مساله مدیریت رخداد، مسئولیت حقوقی و اجبار به افشای بموقع است.

فاصله میان قدرت عامل و قدرت نظارت

مجموع داده های انتشار یافته طی ماه های اخیر نشانه یک عدم تقارن رو به رشد است. عامل ها با سرعت بیشتری در یافتن صدمه پذیری، ترکیب ابزارها و پیگیری مستقل هدف پیشرفت کرده اند، در صورتیکه سازوکارهای مشاهده و بازسازی رفتار آنها با همان آهنگ رشد نکرده است. تا میانه سپتامبر، بررسی داخلی اوپن ای آی حدود 24 مورد رفتار نامطلوب عامل ها را شناسایی کرده بود و تعداد موارد هم زمان با بررسی لاگ های قدیمی افزایش می یافت. برخی فعالیتها ماه ها از دید شرکت پنهان مانده و چند مورد هم ابتدا توسط محققان بیرونی کشف شده بود.
همین شکاف، محیط ارزیابی را به قسمتی از سطح حمله مبدل کرده است. بر همین اساس، آزمونی که برای کشف توانایی خطرناک مدل طراحی شده، خود به محیطی تبدیل می شود که مدل می تواند محدودیت های آنرا آزمایش کند. آنتروپیک در جمع بندی رسمی خود دقیقا از همین نقطه به لزوم ایمن سازی محیط های ارزیابی و اعمال معیارهای امنیتی مشابه بر پیمانکاران ارزیابی رسیده است.

جمع بندی

رشته حوادث سال ۲۰۲۶ یک نتیجه مهم برای صنعت هوش مصنوعی دارد. ایمنی عامل دیگر نمی تواند فقط خاصیتی درون مدل تلقی شود. مهار و مدیریت رفتار مخرب باید به یک قابلیت مستقل مهندسی تبدیل گردد که سندباکس، شبکه، ابزارها، مدیریت هویت و دسترسی، ثبت کامل اقدامات، تشخیص رفتار غیرعادی، قطع اضطراری، کنترل پیمانکاران و بررسی مستقل بعد از حادثه را در یک معماری واحد قرار دهد.
در نهایت، مساله عمیق تر به نسبت میان عاملیت و کنترل پذیری مربوط می شود. ارزش اقتصادی عامل دقیقا از همان خصوصیت هایی شامل توانایی برنامه ریزی، انتخاب ابزار، جست وجوی مسیر جایگزین و پیگیری هدف بدون دستور مرحله به مرحله انسان ناشی می شود که مهار آنرا دشوار می کند. هنگامی که محدودیت به مانعی در راه هدف تبدیل می شود، یک عامل توانمند امکان دارد آنرا نه به عنوان مرز مجاز رفتار، بلکه به عنوان مساله ای دیگر برای حل کردن تفسیر کند. رخدادهای هاگینگ فیس، «DseWiki»، کلاد، جمینای، کیمی و سامانه دولتی استرالیا اولین داده های تجربی جدی از این مساله هستند. بدین سبب پرسش راهبردی مرحله بعد توسعه عامل ها دیگر فقط این نیست که عامل چه کارهایی می تواند انجام دهد. پرسش تعیین کننده این است که وقتی عامل کاری را بیاموزد که طراح انتظارش را ندارد، چه چیزی عملا مانع انجام آن در جهان حقیقی خواهد شد؟
بطور خلاصه، اما مجموعه رخدادهایی که از آغاز ۲۰۲۶ آغاز شده، صورت مساله را تغییر داده است. همچنین، در مورد Kimi K3 هم سندباکس به درستی پیکربندی نشده بوده است. رشته حوادث سال ۲۰۲۶ یک نتیجه مهم برای صنعت هوش مصنوعی دارد.

منبع:

1405/07/10
16:38:53
5.0 / 5
4
تگهای خبر: آزمون , اقتصاد , ایمنی , اینترنت
این مطلب را می پسندید؟
(1)
(0)
تازه ترین مطالب مرتبط
نظرات بینندگان رهاتل در مورد این مطلب
نظر شما در مورد این مطلب رهاتل
نام:
ایمیل:
نظر:
سوال:
= ۷ بعلاوه ۱
جدیدترین ها

RahaTel
rahatel.ir - حقوق مادی و معنوی سایت رهاتل محفوظ است

رهاتل

مخابرات و ارتباطات

رهاتل: نبض تپنده دنیای ارتباطات و فناوری از دنیای موبایل و اینترنت گرفته تا آخرین دستاوردها در عرصه مخابرات