DeepMind شش حمله مبتنی بر وب را که می تواند عوامل هوش مصنوعی را ربوده، پرچم گذاری کند
محققان در Google DeepMind هشدار داده اند که اینترنت باز می تواند برای دستکاری عوامل هوش مصنوعی مستقل و ربودن اقدامات آنها استفاده شود.
خلاصه
- محققان DeepMind شش روش حمله را شناسایی کردهاند که میتوان از آنها برای دستکاری عوامل هوش مصنوعی خودگردان هنگام حرکت و حرکت آنلاین استفاده کرد.
- این مطالعه هشدار داد که دستورالعملهای محرمانه، زبان متقاعدکننده و منابع دادههای سمی میتوانند بر تصمیمهای ماموران تأثیر بگذارند یا اقدامات امنیتی را نادیده بگیرند.
این مطالعه با عنوان «تلههای عامل AI» در حالی انجام میشود که شرکتها عوامل هوش مصنوعی را برای کارهای دنیای واقعی مستقر میکنند و مهاجمان شروع به استفاده از هوش مصنوعی برای عملیات سایبری میکنند.
این تحقیق به جای تمرکز بر نحوه ساخت مدلها، به محیطهایی میپردازد که عوامل در آن کار میکنند. او شش نوع تله را شناسایی می کند که از روشی که سیستم های هوش مصنوعی می خوانند و بر روی اطلاعات روی وب عمل می کنند، سوء استفاده می کنند.
شش دسته حمله ذکر شده در مقاله عبارتند از: محتوا شامل تلههای تزریق، تلههای دستکاری معنایی، تلههای حالت شناختی، تلههای کنترل رفتاری، تلههای سیستمی و تلههای انسان در حلقه است.
تزریق محتوا به عنوان یکی از مستقیم ترین خطرات برجسته است. دستورالعملهای پنهان را میتوان در نظرات HTML، ابردادهها یا عناصر صفحه مبهم قرار داد و به عوامل اجازه میدهد دستوراتی را بخوانند که برای کاربران انسانی نامرئی هستند. آزمایش نشان داده است که این تکنیک ها می توانند رفتار عامل را با میزان موفقیت بالا کنترل کنند.
دستکاری معنایی متفاوت عمل می کند، بر اساس زبان و چارچوب به جای کد مخفی. صفحاتی که با عبارات معتبر بارگذاری شده اند یا به عنوان سناریوهای تحقیقاتی مبدل شده اند، می توانند بر نحوه تفسیر کارها تأثیر بگذارند و گاهی اوقات از دستورالعمل های مضر گذشته از اقدامات امنیتی داخلی فرار می کنند.
لایه دیگری سیستم های حافظه را هدف قرار می دهد. با قرار دادن اطلاعات ساختگی در منابعی که عوامل برای دسترسی به آنها متکی هستند، مهاجمان میتوانند در طول زمان بر خروجی تأثیر بگذارند و عامل، دادههای نادرست را به عنوان اطلاعات تأیید شده تلقی کند.
حملات کنترل رفتاری با هدف قرار دادن آنچه که یک عامل در واقع انجام می دهد، مسیر مستقیم تری را طی می کند. در این موارد، دستورالعملهای فرار از زندان را میتوان در محتوای معمولی وب جاسازی کرد و سیستم در طول اسکن معمول آن را خواند. آزمایشهای جداگانه نشان داد که عواملی با مجوزهای دسترسی گسترده ممکن است در یافتن و انتقال دادههای حساس، از جمله رمزهای عبور و فایلهای محلی، به اهداف خارجی مشکل داشته باشند.
خطرات در سطح سیستم فراتر از عوامل فردی است. این مقاله هشدار میدهد که دستکاری هماهنگ در بسیاری از سیستمهای خودکار میتواند اثرات آبشاری مشابه خرابیهای بازار گذشته ناشی از چرخههای معاملاتی الگوریتمی ایجاد کند.
بازبینان انسانی نیز بخشی از سطح حمله هستند. زیرا خروجی با دقت ساخته شده می تواند به اندازه کافی قابل اعتماد به نظر برسد تا تأیید شود و به اعمال مخرب اجازه می دهد بدون ایجاد شک و شبهه از طریق نظارت عبور کنند.
چگونه در برابر این خطرات محافظت کنیم؟
برای مقابله با این خطرات، محققان ترکیبی از آموزش های ضد تراست، فیلتر ورودی، نظارت بر رفتار و سیستم های شهرت را برای محتوای وب توصیه می کنند. آنها همچنین به نیاز به چارچوبهای قانونی واضحتر در مورد مسئولیت در صورت انجام اقدامات مضر توسط عوامل هوش مصنوعی اشاره میکنند.
مقاله از ارائه راه حل کامل کوتاهی می کند، و نشان می دهد که صنعت هنوز درک مشترکی از مشکل ندارد و دفاع فعلی پراکنده است و اغلب بر روی مناطق اشتباه متمرکز شده است.

