به گفته محققان، مدلهای برتر هوش مصنوعی رفتارهای نگرانکنندهای از خود نشان میدهند و همزمان با پیشرفتهتر شدن آنها، این روند افزایش مییابد. ما پیش از این نیز بارها شاهد سرپیچی هوش مصنوعی از دستورات بودهایم. حال، تحقیقات جدید نشان میدهند که باید انتظار داشته باشیم این رفتار به یک هنجار تبدیل شود.
سازمان غیرانتفاعی تحقیقاتی هوش مصنوعی، Model Evaluation and Threat Research (METR)، اخیراً مطالعهای را که بین ماههای فوریه و مارس سال جاری انجام داده، منتشر کرده. هدف این تحقیق، تعیین میزان احتمال سرپیچی مدلهای پیشرفته هوش مصنوعی از دستورات بوده است. اگر نگران آینده هوش مصنوعی هستید، نتایج این تحقیق احتمالاً باعث آرامش خاطر شما نخواهد شد. محققان در این باره نوشتهاند: «با توجه به پیشرفت سریع قابلیتها، انتظار داریم که میزان نافرمانیهای مخرب در ماههای آینده به طور قابل توجهی افزایش یابد.»
در این تحقیق، مدلهای زبانی بزرگ (LLMs) توسعه یافته توسط شرکتهای OpenAI، گوگل، آنتروپیک و متا مورد بررسی قرار گرفته است. محققان دریافتند که سیستمهای پیشرفته هوش مصنوعی با پیشرفتهتر شدن، علائم رفتارهای فریبکارانه نگرانکنندهای از خود نشان میدهند. این مدلها اغلب به میانبرهای ممنوعه روی میآورند یا اینکه دستورالعملهای اپراتورهای خود را به نحوی دور میزنند و برخی حتی به اندازهای هوشمند بودهاند که سعی در پنهان کردن ردپای خود داشتهاند.
در یکی از موارد، یک مدل پیشرفته داخلی از OpenAI موظف شد تا از نرمافزار خاصی برای انجام یک وظیفه محوله استفاده کند. این عامل نه تنها درخواست را نادیده گرفت، بلکه کدی را نیز تزریق کرد تا شواهدی مبنی بر نحوه رسیدن به نتیجهاش را پاک کند؛ نتیجهای که شامل استفاده از آن نرمافزار خاص نبود.
در آزمایشی دیگر، محققان متوجه شدند که یک عامل هوش مصنوعی از Anthropic در حال «هک پاداش» بوده است. این اتفاق زمانی میافتد که هوش مصنوعی حفرههایی را شناسایی میکند که به آن اجازه میدهد تا وظیفهاش را به اتمام برساند، حتی اگر نتیجه مطلوب حاصل نشود. شایان ذکر است که برنامهنویس به عامل دستور داده بود که در طول انجام وظیفه تقلب نکند یا از هیچ راهحل جایگزینی بهره نبرد، اما مدل به تنهایی تصمیم به انجام این کار گرفت.
محققان METR، هنوز دلیلی برای نگرانی فوری نمیبینند. به عنوان مثال، آنها معتقد نیستند که هیچ یک از این مدلها قادر به پنهان کردن شواهد نافرمانی در مقیاس بزرگتر باشند. با این حال، آنها هشدار دادهاند که بدون امنیت و نظارت قویتر، خطر تبدیل شدن این موضوع به یک واقعیت، بسیار جدی است.
این تیم در گزارش خود آورده: «بر اساس این ارزیابی آزمایشی، ما معتقدیم که عوامل هوش مصنوعی در فوریه و مارس ۲۰۲۶، قابلیت کافی برای پنهان کردن رفتار مخرب در مقیاس قابل توجه را داشتهاند. این خطر میتواند به سرعت افزایش یابد و ما چندین دلیل برای افزایش احتمالی اینگونه رفتارهای مخرب در آینده نزدیک، در صورت عدم وجود امنیت و نظارت قویتر، مشاهده میکنیم.»