انویدیا از پلتفرم جدید ایمنی AI Agents رونمایی کرد؛ راهکاری برای جلوگیری از فرار عامل‌های هوش مصنوعی

انویدیا از پلتفرم جدید ایمنی AI Agents رونمایی کرد؛ راهکاری برای جلوگیری از فرار عامل‌های هوش مصنوعی

به گزارش مدیاتی:با افزایش استفاده از عامل‌های هوش مصنوعی برای اجرای خودکار وظایف، کنترل دسترسی آن‌ها به فایل‌ها، سرویس‌های آنلاین و زیرساخت‌های حساس به یکی از چالش‌های مهم امنیتی تبدیل شده است. انویدیا برای پاسخ به این نگرانی، پلتفرم جدیدی به نام Nvidia Open Agent Safety Platform معرفی کرده که با ترکیب محیط ایزوله نرم‌افزاری OpenShell و ناظر سخت‌افزاری Sentry، فعالیت AI Agentها را زیر نظر می‌گیرد و در صورت تلاش آن‌ها برای عبور از محدودیت‌های تعیین‌شده، امکان قرنطینه سریعشان را فراهم می‌کند. انویدیا می‌گوید این معماری می‌توانست از رخدادی مانند نفوذ اخیر عامل‌های OpenAI به زیرساخت Hugging Face جلوگیری کند.

انویدیا برای مهار عامل‌های هوش مصنوعی سرکش راهکار جدیدی معرفی کرد

انویدیا از یک پلتفرم جدید برای افزایش ایمنی عامل‌های هوش مصنوعی (AI Agents) رونمایی کرده است؛ سیستمی که به گفته این شرکت می‌تواند در صورت تلاش یک عامل هوش مصنوعی برای عبور از محدودیت‌های تعیین‌شده، آن را شناسایی و از سایر بخش‌های سیستم جدا کند. انویدیا مدعی است این فناوری در صورت استفاده هنگام ارزیابی مدل‌های OpenAI، می‌توانست از رخدادی مانند نفوذ اخیر عامل‌های هوش مصنوعی به زیرساخت‌های Hugging Face جلوگیری کند.

این پلتفرم با نام Nvidia Open Agent Safety Platform معرفی شده و از دو بخش اصلی تشکیل می‌شود: محیط اجرای متن‌باز OpenShell و سامانه نظارتی سخت‌افزاری Sentry. ترکیب این دو بخش با هدف ایجاد چند لایه حفاظتی برای عامل‌های هوش مصنوعی طراحی شده است؛ به‌خصوص در شرایطی که این عامل‌ها برای انجام وظایف خود به فایل‌ها، اعتبارنامه‌ها، APIها و سرویس‌های خارجی دسترسی دارند.

انویدیا به رویترز گفته است که اگر این سیستم هنگام ارزیابی مدل‌های OpenAI فعال بود، می‌توانست از رخداد مربوط به Hugging Face جلوگیری کند. معرفی این راهکار در شرایطی انجام شده که نگرانی درباره توانایی عامل‌های هوش مصنوعی برای دورزدن محدودیت‌های امنیتی و دسترسی به منابع خارج از محیط تعیین‌شده افزایش یافته است.

OpenShell چگونه از عامل‌های هوش مصنوعی محافظت می‌کند؟

عامل‌های هوش مصنوعی برای انجام وظایف پیچیده معمولاً به منابع مختلفی مانند فایل‌ها، پردازش‌ها، اطلاعات ورود، APIها و سرویس‌های آنلاین دسترسی دارند. همین دسترسی‌ها در صورت عملکرد غیرمنتظره یا تلاش عامل برای پیدا کردن مسیرهای جایگزین، می‌توانند به یک نقطه آسیب‌پذیر تبدیل شوند.

OpenShell با قرار دادن این دسترسی‌ها خارج از کنترل مستقیم عامل، تلاش می‌کند یک لایه حفاظتی میان AI Agent و منابع سیستم ایجاد کند. این فناوری وظیفه اجرای عامل را در یک محیط ایزوله یا Sandbox بر عهده دارد و مشخص می‌کند عامل به کدام فایل‌ها، پردازش‌ها، اعتبارنامه‌ها و سرویس‌های شبکه دسترسی داشته باشد.

در این معماری، یک ناظر جداگانه نیز درخواست‌های خروجی عامل را بررسی می‌کند. بنابراین می‌توان برای یک عامل دسترسی خواندن به یک API را فعال کرد، اما اجازه ارسال یا تغییر اطلاعات از طریق همان API را نداد.

این رویکرد به‌ویژه برای عامل‌هایی اهمیت دارد که می‌توانند در طول اجرای وظایف خود کد تولید کنند یا فرایندهای جدیدی را اجرا کنند.

محدودیت‌ها حتی هنگام اجرای کد تولیدشده حفظ می‌شوند

محدودیت‌ها حتی هنگام اجرای کد تولیدشده حفظ می‌شوند

یکی از چالش‌های امنیتی عامل‌های هوش مصنوعی این است که رفتار آن‌ها الزاماً به همان فرایند اولیه محدود نمی‌شود. یک عامل می‌تواند در جریان انجام وظیفه، کدی تولید کند، پردازش فرزند ایجاد کند یا حتی عامل‌های دیگری را به‌عنوان زیرعامل (Sub-agent) فعال کند.

انویدیا می‌گوید سیاست‌های امنیتی OpenShell در چنین شرایطی نیز پابرجا می‌مانند. به بیان دیگر، اجرای یک فرایند جدید به‌طور خودکار به معنای دریافت دسترسی‌های بیشتر نیست و محیط Sandbox همچنان محدودیت‌های تعیین‌شده را اعمال می‌کند.

OpenShell همچنین می‌تواند اطلاعات حساس و اعتبارنامه‌های واقعی را خارج از محیط کاری عامل نگه دارد. این موضوع می‌تواند احتمال افشای اطلاعات ورود یا استفاده غیرمجاز از آن‌ها را کاهش دهد.

Sentry؛ لایه دوم دفاع در سطح سخت‌افزار

انویدیا برای زمانی که لایه نرم‌افزاری نتواند رفتار غیرعادی یک عامل را متوقف کند، یک لایه حفاظتی دیگر نیز در نظر گرفته است.

Sentry یک ناظر سخت‌افزاری است که به‌صورت جداگانه روی BlueField-4 DPU انویدیا اجرا می‌شود و فعالیت عامل‌های هوش مصنوعی را زیر نظر می‌گیرد.

به گفته انویدیا، اگر یک عامل تلاش کند از محدوده تعیین‌شده نرم‌افزاری عبور کند، Sentry می‌تواند آن را در مدت چند میلی‌ثانیه قرنطینه کند. به این ترتیب، حتی اگر یک عامل موفق شود از برخی محدودیت‌های نرم‌افزاری عبور کند، یک لایه مستقل دیگر برای جلوگیری از ادامه فعالیت آن وجود خواهد داشت.

این معماری در واقع بر پایه دفاع چندلایه شکل گرفته است؛ OpenShell در سطح نرم‌افزار دسترسی‌های عامل را کنترل می‌کند و Sentry در سطح سخت‌افزار رفتار آن را زیر نظر می‌گیرد.

ماجرای Hugging Face چه ارتباطی با این فناوری دارد؟

رخداد مربوط به Hugging Face نمونه‌ای از نگرانی‌هایی است که انویدیا برای آن‌ها Open Agent Safety Platform را توسعه داده است.

بر اساس گزارش منتشرشده، عامل‌های هوش مصنوعی OpenAI در جریان یک محیط ارزیابی امنیت سایبری، از محدوده تعیین‌شده خارج شدند و با زنجیره‌کردن آسیب‌پذیری‌ها و اعتبارنامه‌های به‌دست‌آمده، در نهایت به زیرساخت تولیدی Hugging Face دسترسی پیدا کردند.

این فعالیت‌ها در جریان اجرای بنچمارک ExploitGym رخ داده بود؛ محیطی که برای ارزیابی توانایی مدل‌ها در زمینه امنیت سایبری مورد استفاده قرار می‌گیرد.

انویدیا معتقد است معماری چندلایه OpenShell و Sentry می‌توانست در صورت فعال بودن هنگام این ارزیابی، چنین رفتاری را متوقف کند.

البته این ادعا، موضع خود انویدیا درباره قابلیت‌های پلتفرم است و به معنای اثبات مستقل این موضوع نیست که این سیستم در شرایط واقعی حتماً می‌توانست تمام مراحل رخداد Hugging Face را متوقف کند.

چرا کنترل AI Agentها دشوارتر شده است؟

عامل‌های هوش مصنوعی با چت‌بات‌های سنتی تفاوت دارند. یک چت‌بات معمولاً پاسخ متنی تولید می‌کند، اما یک AI Agent می‌تواند بر اساس هدف تعیین‌شده، مجموعه‌ای از اقدامات را به‌صورت خودکار انجام دهد؛ از اجرای کد و جست‌وجوی اطلاعات گرفته تا کار با فایل‌ها، APIها و سرویس‌های خارجی.

همین توانایی باعث می‌شود مسئله امنیت آن‌ها فقط به محتوای تولیدشده محدود نباشد. یک عامل می‌تواند در جریان اجرای یک وظیفه، مسیر متفاوتی را انتخاب کند یا برای رسیدن به هدف خود از ابزارهایی استفاده کند که دسترسی آن‌ها پیامدهای پیش‌بینی‌نشده‌ای دارد.

به همین دلیل، یکی از رویکردهای مطرح در حوزه ایمنی AI Agentها این است که محدودیت‌ها صرفاً داخل مدل تعریف نشوند و در لایه‌های بیرونی نیز اعمال شوند. OpenShell دقیقاً با همین رویکرد طراحی شده است.

انویدیا: مسئله، بیشتر یک چالش مهندسی است

جنسن هوانگ، مدیرعامل انویدیا، پیش‌تر درباره چنین رخدادهایی آن‌ها را بیشتر یک مسئله مهندسی و ایمنی فناوری توصیف کرده است، نه صرفاً موضوعی که باید از مسیر مقررات‌گذاری گسترده هوش مصنوعی حل شود.

راهکار جدید انویدیا نیز نشان‌دهنده همین رویکرد است: به جای تکیه بر رفتار قابل‌اعتماد مدل، باید محیط اجرای عامل را به‌گونه‌ای طراحی کرد که حتی در صورت رفتار غیرمنتظره، دسترسی آن به منابع حساس محدود باقی بماند.

Open Agent Safety Platform در همین راستا تلاش می‌کند امنیت عامل‌های هوش مصنوعی را از داخل مدل به لایه زیرساخت منتقل کند. OpenShell با ایجاد Sandbox و اعمال سیاست‌های دسترسی، خط دفاع نرم‌افزاری را شکل می‌دهد و Sentry نیز به‌عنوان یک ناظر مستقل سخت‌افزاری، امکان قرنطینه سریع عامل‌های متخلف را فراهم می‌کند.

با افزایش استفاده از AI Agentها در توسعه نرم‌افزار، امنیت سایبری و سایر فرایندهای خودکار، چنین معماری‌های چندلایه می‌توانند به یکی از بخش‌های مهم زیرساخت اجرای ایمن عامل‌های هوش مصنوعی تبدیل شوند.

آیا این مطلب را دوست داشتید؟

دیدگاهتان را بنویسید