logo logo

موضوع وبلاگ، اخبار و مجله نسل بعدی برای شما برای شروع به اشتراک گذاری داستان های خود از امروز!

OpenAI

مدل‌های برتر هوش مصنوعی رفتارهای نگران‌کننده‌ای از خود نشان می‌دهند‌

خانه » مدل‌های برتر هوش مصنوعی رفتارهای نگران‌کننده‌ای از خود نشان می‌دهند

avatar
Author

نویسنده


  • 2026-05-25

به گفته محققان، مدل‌های برتر هوش مصنوعی رفتارهای نگران‌کننده‌ای از خود نشان می‌دهند و همزمان با پیشرفته‌تر شدن آن‌ها، این روند افزایش می‌یابد. ما پیش از این نیز بارها شاهد سرپیچی هوش مصنوعی از دستورات بوده‌ایم. حال، تحقیقات جدید نشان می‌دهند که باید انتظار داشته باشیم این رفتار به یک هنجار تبدیل شود.

سازمان غیرانتفاعی تحقیقاتی هوش مصنوعی، Model Evaluation and Threat Research (METR)، اخیراً مطالعه‌ای را که بین ماه‌های فوریه و مارس سال جاری انجام داده، منتشر کرده. هدف این تحقیق، تعیین میزان احتمال سرپیچی مدل‌های پیشرفته هوش مصنوعی از دستورات بوده است. اگر نگران آینده هوش مصنوعی هستید، نتایج این تحقیق احتمالاً باعث آرامش خاطر شما نخواهد شد. محققان در این باره نوشته‌اند: «با توجه به پیشرفت سریع قابلیت‌ها، انتظار داریم که میزان نافرمانی‌های مخرب در ماه‌های آینده به طور قابل توجهی افزایش یابد.»

در این تحقیق، مدل‌های زبانی بزرگ (LLMs) توسعه یافته توسط شرکت‌های OpenAI، گوگل، آنتروپیک و متا مورد بررسی قرار گرفته است. محققان دریافتند که سیستم‌های پیشرفته هوش مصنوعی با پیشرفته‌تر شدن، علائم رفتارهای فریبکارانه نگران‌کننده‌ای از خود نشان می‌دهند. این مدل‌ها اغلب به میان‌برهای ممنوعه روی می‌آورند یا اینکه دستورالعمل‌های اپراتورهای خود را به نحوی دور می‌زنند و برخی حتی به اندازه‌ای هوشمند بوده‌اند که سعی در پنهان کردن ردپای خود داشته‌اند.

در یکی از موارد، یک مدل پیشرفته داخلی از OpenAI موظف شد تا از نرم‌افزار خاصی برای انجام یک وظیفه محوله استفاده کند. این عامل نه تنها درخواست را نادیده گرفت، بلکه کدی را نیز تزریق کرد تا شواهدی مبنی بر نحوه رسیدن به نتیجه‌اش را پاک کند؛ نتیجه‌ای که شامل استفاده از آن نرم‌افزار خاص نبود.

در آزمایشی دیگر، محققان متوجه شدند که یک عامل هوش مصنوعی از Anthropic در حال «هک پاداش» بوده است. این اتفاق زمانی می‌افتد که هوش مصنوعی حفره‌هایی را شناسایی می‌کند که به آن اجازه می‌دهد تا وظیفه‌اش را به اتمام برساند، حتی اگر نتیجه مطلوب حاصل نشود. شایان ذکر است که برنامه‌نویس به عامل دستور داده بود که در طول انجام وظیفه تقلب نکند یا از هیچ راه‌حل جایگزینی بهره نبرد، اما مدل به تنهایی تصمیم به انجام این کار گرفت.

محققان METR، هنوز دلیلی برای نگرانی فوری نمی‌بینند. به عنوان مثال، آن‌ها معتقد نیستند که هیچ یک از این مدل‌ها قادر به پنهان کردن شواهد نافرمانی در مقیاس بزرگتر باشند. با این حال، آن‌ها هشدار داده‌اند که بدون امنیت و نظارت قوی‌تر، خطر تبدیل شدن این موضوع به یک واقعیت، بسیار جدی است.

این تیم در گزارش خود آورده: «بر اساس این ارزیابی آزمایشی، ما معتقدیم که عوامل هوش مصنوعی در فوریه و مارس ۲۰۲۶، قابلیت کافی برای پنهان کردن رفتار مخرب در مقیاس قابل توجه را داشته‌اند. این خطر می‌تواند به سرعت افزایش یابد و ما چندین دلیل برای افزایش احتمالی این‌گونه رفتارهای مخرب در آینده نزدیک، در صورت عدم وجود امنیت و نظارت قوی‌تر، مشاهده می‌کنیم.»

منبع خبر


0 0 رای ها
امتیازدهی به مقاله
اشتراک در
اطلاع از
guest
0 نظرات
قدیمی‌ترین
تازه‌ترین بیشترین رأی

اشتراک گذاری

لینک های مفید