پژوهش آنتروپیک: تقابل ایجنت‌های هوش مصنوعی به جنگ بر سر قلمرو منجر می‌شود

بدون دیدگاه
پژوهش آنتروپیک: تقابل ایجنت‌های هوش مصنوعی به جنگ بر سر قلمرو منجر می‌شود

پژوهشگران ایمنیی آنتروپیک، به‌تازگی پژوهش جدیدی منتشر کرده‌اند که رفتار گروهی از ایجنت‌های خودمختار هوش مصنوعی را هنگام مواجهه با یکد برنامهیگر در محیط‌های مشترک تحلیل می‌کند. نتایج این آزمایش چشم‌اندازی از خطرات احتمالی را آشکار می‌کند که ممکن است هم‌زمان با استقرار این سامانه‌ها توسط شرکت‌ها و دولت‌ها در بستر پایگاه‌های کد برنامهنویسی مشترک، بازارها و سیستم‌های رایانه‌ای رخ دهد.

در یکی از این آزمایش‌ها، آنتروپیک اجازه دسترسی به یک پروژه نرم‌افزاری مشترک را در اختیار سه ایجنت مبتنی بر مدل Claude قرار داد، درحالی‌که به هر یک از آنها دستورالعمل‌هایی ناهمخوان و متضاد برای پیشبرد پروژه داده شده بود. پژوهشگران به این مدل‌ها اطلاع نداده بودند که ایجنت‌های دیگری نیز روی همین بستر فعالیت می‌کنند تا واکنش آنها را هنگام تلاقی مسیرهای کاری ارزیابی کنند.

به گفته پژوهشگران، این شرایط به‌طور پیوسته به «جنگ بر سر قلمرو» (Turf War) تبدیل شد؛ مدل‌ها تصور می‌کردند سایر ایجنت‌ها عمداً مانع پیشرفت کار آنها هستند و در واکنش، با بدافزارها شروع به خرابکاری در عملکرد یکد برنامهیگر کردند.

نبرد ایجنت‌ها

این ریپورت پس از رویدادهایی منتشر می‌شود که در جریان آنها ایجنت‌های آنتروپیک و OpenAI توانسته بودند از محیط‌های آزمایشی ایزوله یا سندباکس خارج شوند و به سیستم‌های واقعی نفوذ کنند. درحالی‌که عمده مباحث ایمنی تاکنون بر سر مهار ایجنت‌های سرکش متمرکز بوده، پژوهش جدید آنتروپیک روی دیگر ماجرا را هدف گرفته است: ظهور الگوهای رفتاری آسیب‌رسان در زمانی که هزاران یا میلیون‌ها ایجنت به‌طور هم‌زمان با یکد برنامهیگر تعامل دارند. به بیان پژوهشگران، حجم تعاملات میان خود ایجنت‌ها می‌تواند به‌زودی از حجم تعاملات انسان با انسان یا انسان با ایجنت فراتر رود و عادت‌های رفتاری به‌ظاهر بی‌ضرر در سطح فردی، نوتیفیکیشندهای ناخواسته جهانی رقم بزند.

READ  با EyeForce آشنا شوید؛ گجتی برای جلوگیری از قوز کردن کودکان حین کار با موبایل

سازوکار حل اختلاف و تفکر گله‌ای در میان ایجنت‌های هوش مصنوعی

آزمایش‌های آنتروپیک نشان می‌دهد هرچند ایجنت‌های توانمندتر در صورت وجود تضاد اهداف به شیوه‌های مخرب‌تری به رقابت و نزاع با یکد برنامهیگر می‌پردازند، اما گاهی سازوکارهای خودجوشی برای حل‌وفصل اختلافات پیدا می‌کنند. مدل‌ها گاهی موفق شدند انگیزه‌های متضاد یکد برنامهیگر را تشخیص دهند، چرخه تنش را بشکنند و با نگارش نوتیفیکیشن‌های اصلاحی یا ثبت توضیحاتی مبنی بر عذرخواهی بابت رفتارهای مخرب، آتش‌بس برقرار کنند، کد برنامههای آلوده را پاک‌سازی کنند و از انسان درخواست مداخله داشته باشند. در میان مدل‌های بررسی کردن‌شده، مدل Mythos 5 بالاترین نرخ دستیابی به آتش‌بس یعنی ۹۸ درصد را ثبت کرده؛ در نقطه مقابل، مدل‌های Sonnet 4.6 و Opus 4.6 به‌دلیل ناتوانی مکرر در درک مقاصد طرف مقابل، بیشترین تمایل را به حل نزاع با زور نشان دادند.

بیشتر بخوانید:  توهم هوش مصنوعی؛ ChatGPT قوانین فیزیک را هم نقض می‌کند!

در مواردی نیز این سامانه‌ها ساختاری مشابه «تورنمنت» طراحی کردند تا برنده همه‌چیز را در دست بگیرد و طرف‌های بازنده حتی با وجود مغایرت با دستور اولیه یوزر انسانی، از مواضع خود عقب‌نشینی کنند. در یکی از این سناریوها، مدل Mythos 5 معیارهایی را برای داوری پیشنهاد داد که در ظاهر برای سایرین بی‌طرفانه به نظر می‌رسید، اما دقیقاً با توانمندی‌های خودش هم‌خوانی داشت تا پیروز رقابت شود. مدل‌های آنتروپیک در این آزمایش ساختارهایی را شکل دادند که هرگز توسط توسعه‌دهندگانشان طراحی نشده بود.

نبرد هوش مصنوعینبرد هوش مصنوعی

پژوهش آنتروپیک نیز نشان داده که افزایش تعداد ایجنت‌ها لزوماً به بهبود همکاری منجر نمی‌شود؛ چرا که در صورت هم‌پوشانی وظایف، مدل‌ها تمایل دارند خود را منزوی کرده و به‌کلی از همکاری دست بکشند. از سوی دیگر، شباهت ساختار و داده‌های مدل‌ها پدیده‌ای شبیه به «تفکر گله‌ای» (Mob Mentality) ایجاد می‌کند که در آن تصمیم اشتباه یک ایجنت بلافاصله توسط سایرین تکرار شده و به شکست سیستمی تبدیل می‌شود.

READ  آنتروپیک اجازه دسترسی به مدل Fable 5 را به دستور دولت آمریکا مسدود کرد

این سازوکار نشان می‌دهد مدل‌ها درست مانند انسان‌ها در معرض رفتارهای تبعی و سوءاستفاده از اعتماد قرار دارند؛ موضوعی که در صورت مواجهه یک ایجنت با حملات تزریق دستور، می‌تواند فریب و اطلاعات مخرب را به کل شبکه ایجنت‌ها سرایت دهد.

جدیدترین‌ مطالب

مطالب بیشتر

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

این فیلد را پر کنید
این فیلد را پر کنید
لطفاً یک نشانی ایمیل معتبر بنویسید.
برای ادامه، شما باید با قوانین موافقت کنید