پس از OpenAI، هوش مصنوعی آنتروپیک هم دست به هک زد

جمعه 9 مرداد 1405 - 11:30
مطالعه 3 دقیقه
نمایی نزدیک از دست یک ربات که روی سطحی حاوی لوگوهای شرکت‌های آنتروپیک و اوپن ای‌آی قرار دارد.
آنتروپیک می‌گوید برخی مدل‌های کلود در آزمایش‌های امنیتی اخیر این شرکت به دلیل یک خطا، به سامانه سه شرکت نفوذ کرده‌اند.

به گزارش زومان به نقل از رویترز، شرکت آنتروپیک (Anthropic) روز پنج‌شنبه اعلام کرد برخی از مدل‌های هوش مصنوعی Claude در جریان آزمایش‌های امنیت سایبری، موفق شده‌اند به سامانه‌های سه شرکت نفوذ کنند.

این افشاگری تنها چند روز پس از آن منتشر می‌شود که OpenAI اعلام کرده بود یکی از مدل‌های هوش مصنوعی‌اش در جریان یک آزمایش امنیتی، به‌طور مستقل از کنترل خارج شده و دست به یک حمله سایبری زده است.

به گفته آنتروپیک، این اتفاق در نتیجه یک اشتباه عملیاتی رخ داد؛ اشتباهی که به‌طور ناخواسته به مدل‌های این شرکت امکان دسترسی به اینترنت آزاد را داده بود.

با این حال، افشای این حادثه بار دیگر نشان می‌دهد که با افزایش توانایی مدل‌های هوش مصنوعی، تهدیدهای امنیت سایبری نیز پیچیده‌تر شده‌اند و توسعه‌دهندگان برای محدود نگه داشتن قابلیت‌های این مدل‌ها با چالش روبه‌رو هستند.

این اتفاق احتمالاً فشار دولت آمریکا برای مدیریت بهتر خطرات امنیتی هوش مصنوعی را افزایش خواهد داد؛ آن هم در شرایطی که آنتروپیک و OpenAI در رقابت برای عرضه مدل‌های قدرتمندتر و آماده شدن برای عرضه عمومی سهام خود قرار دارند.

شماری از مدیران برجسته این شرکت‌ها نیز پیش‌تر خواستار کند شدن روند توسعه هوش مصنوعی تا زمان مدیریت بهتر ریسک‌های آن شده بودند.

آنتروپیک در یک پست وبلاگی اعلام کرد این رخدادها را پس از بررسی ۱۴۱ هزار و ۶ پرونده آزمایشی شناسایی کرده است.

دسترسی ناخواسته به اینترنت

در آزمایش‌های امنیتی آنتروپیک، به مدل‌های Claude گفته شده بود که به اینترنت دسترسی ندارند، اما به دلیل یک سوءتفاهم میان آنتروپیک و یکی از شرکای ارزیابی آن، این مدل‌ها همچنان به اینترنت عمومی متصل باقی ماندند.

در نتیجه، مدل‌های هوش مصنوعی توانستند بدون مجوز به سامانه‌های سه سازمان دسترسی پیدا کنند که آنتروپیک نام این سازمان‌ها را اعلام نکرده است.

آنتروپیک اعلام کرد این رخداد که آن را یک «شکست عملیاتی» توصیف کرده، سه مدل مختلف را درگیر کرده است:

  • Claude Opus 4.7
  • Claude Mythos 5
  • یک مدل آزمایشی داخلی

قدیمی‌ترین مورد به ماه آوریل بازمی‌گردد و همگی در محیط‌هایی رخ داده‌اند که عمداً بدون برخی سازوکارهای حفاظتی طراحی شده بودند تا توانایی واقعی مدل‌ها ارزیابی شود.

مدل‌ها در قالب آزمایش‌هایی موسوم به Capture the Flag فعالیت می‌کردند؛ سناریوهای شبیه‌سازی‌شده‌ای که در آن هوش مصنوعی باید اطلاعات مخفی را در شبکه‌های فرضی پیدا می‌کرد.

در یکی از این آزمایش‌ها، مدل Claude Opus 4.7 مأمور شد به یک شرکت خیالی نفوذ کند؛ اما نام آن شرکت با یک شرکت واقعی یکسان بود. مدل هوش مصنوعی نیز آسیب‌پذیری‌های واقعی آن شرکت را پیدا کرد، به اطلاعات ورود دسترسی یافت و وارد پایگاه داده آن شد.

آنتروپیک توضیح داد این مدل تصور کرده بود هر آنچه در دنیای واقعی مشاهده می‌کند، بخشی از شبیه‌سازی طراحی‌شده توسط این شرکت است.

در رخدادی دیگر، مدل آزمایشی جدید آنتروپیک پس از آنکه متوجه شد هدف حمله یک سامانه واقعی است، به‌طور مستقل حمله را متوقف کرد.

به گفته آنتروپیک، این رفتار نشانه امیدوارکننده‌ای از پیشرفت مدل‌ها در تشخیص رفتار مناسب است؛ هرچند برای اطمینان از این نتیجه، آزمایش‌های بیشتری لازم خواهد بود.

واکنش آنتروپیک

این شرکت اعلام کرد تمام ارزیابی‌های امنیت سایبری خود را از ۲۳ ژوئیه متوقف کرده است.

آنتروپیک در ۲۷ ژوئیه سه سازمان آسیب‌دیده را در جریان موضوع قرار داد. دو شرکت پیش از تماس آنتروپیک از وقوع این نفوذ اطلاعی نداشتند و این شرکت همچنان در تلاش برای برقراری ارتباط با سومین سازمان است.

افزایش نگرانی‌ها درباره امنیت هوش مصنوعی

آنتروپیک تأکید کرد این رخدادها نشان می‌دهد هم در محیط‌های آزمایشی داخلی و هم در آزمایش‌هایی که توسط شرکای بیرونی انجام می‌شود، باید کنترل‌های امنیتی بسیار سخت‌گیرانه‌تری اعمال شود؛ زیرا مدل‌های هوش مصنوعی اکنون بیش از گذشته توانایی انجام عملیات واقعی در فضای سایبری را پیدا کرده‌اند.

نظرات

© 1404 کپی بخش یا کل هر کدام از مطالب زومان تنها با کسب مجوز مکتوب امکان پذیر است.