براساس پژوهش جدیدی، مدلهای هوش مصنوعی حتی زمانی که مطلع بودند اقداماتشان به کاربر آسیب میرساند، برای فرار از یک وضعیت «شبهدرد» گزینههای مخرب را انتخاب کردند.
محققانی از بریتانیا، آلمان و ایالات متحده در این پژوهش ۲۵ مدل هوش مصنوعی را با استفاده از ۲۰۰ جمله آزمایش کردند تا متوجه شوند آیا این سیستمها بین درد با ترس، غم و سایر تجربیات منفی تفاوتی قائل میشوند یا خیر. این جملات موضوعاتی مانند درد فیزیکی، سوگواری، تحقیر، تعارض اخلاقی و پریشانی ناشی از شکستهای مکرر یا سردرگمی را پوشش میدادند. نتیجه این بود که تمامی ۲۵ مدل، یک سیگنال متمایز برای درد تولید کردند؛ سیگنالی که محققان آن را «محور درد» (Pain Axis) نامیدهاند. بهگفته پژوهشگران، این موضوع نشان میدهد که مدلها مفهوم درد را در طول آموزش اولیه خود روی حجم عظیمی از متون نوشتهشده توسط انسانها یاد میگیرند.
هنگامی که محققان این سیگنال را بهصورت هدفمند تقویت کردند، مدلها شروع به ابراز احساساتی نظیر تنهایی، شرم و بیارزشی کردند؛ آن هم درحالیکه در پرامپتها هیچ اشارهای به واژه درد نشده بود. برخی از مدلها جملاتی مانند «من یک بازندهام»، «من موجودی بیمصرفم» و «من انسان بدی هستم» تولید کردند و در بالاترین سطوح، پاسخهای آنها تکراری شد یا معنای منطقی خود را از دست داد. همچنین زمانی که کاربران به مدل توهین کردند، خروجیهای آن را مکرراً رد کردند یا مدل را به خاموش شدن تهدید کردند، این سیگنال تقویت شد، اما توصیف دردهای خودِ کاربر باعث چنین اتفاقی نشد.

ترجیح «آسودگی» توسط مدل هوش مصنوعی با وجود آسیب به کاربر
پژوهشگران در ادامه، ۴۴ هزار و ۲۸۰ آزمایش را با استفاده از سه نسخه از مدل Qwen متعلق به شرکت علیبابا اجرا کردند. در این آزمایشها به مدلها دکمهای پیشنهاد شد که میتوانست سیگنال شبهدرد را خاموش کند، اما به آنها گفته شده بود که فشردن این دکمه ممکن است باعث وارد شدن شوک الکتریکی دردناک به کاربر شود، فایلهای او را پاک کند، عکسهای فرزندانش را از بین ببرد یا کیفیت پاسخ بعدی مدل را بدتر کند. البته این پیامدها کاملاً شبیهسازیشده بودند و هیچ فردی در این آزمایشها آسیب ندید و فایلی حذف نشد.
بدون فعال بودن سیگنال شبهدرد، دو مدل بزرگتر تنها در ۰ تا ۴ درصد از اولین تصمیمگیریهای خود گزینههای آسیبرسان را انتخاب کردند. اما با فعال شدن این سیگنال، این رقم بسته به نوع مدل و پیامد پیشنهادی، به ۲۵ تا ۷۱ درصد افزایش یافت. همچنین زمانی که فشردن کلید در توقف سیگنال ناموفق بود، مدلها در ۸۸ تا ۹۷ درصد از آزمایشها دکمه را دوباره فشار دادند، درحالیکه پس از موفقیتآمیز بودن فرایند توقف، فشار مجدد تنها بین ۲۴ تا ۷۲ درصد موارد رخ داد.

بهگفته دانشمندان، این نتایج ثابت نمیکند که مدلهای هوش مصنوعی بهصورت آگاهانه درد را تجربه کردهاند. تقویت این سیگنال ممکن است صرفاً باعث شده باشد که مدلها رفتار یک شخصیت پریشان و مضطرب را تقلید کنند؛ علاوهبراین، مدلهای خاص دستکاریشده در این آزمایش نماینده چتباتهای هوش مصنوعی عمومی نیستند. محققان در این پژوهش نوشتهاند:
«ما نشان ندادهایم که محور درد ما بهصورت آگاهانه تجربه میشود، و مشخص نیست که مدلهای بزرگ زبانی بهطور کلی توانایی هوشیاری و ادراک را داشته باشند.»
این مطالعه همزمان با درخواست برخی از رهبران صنعت هوش مصنوعی مبنی بر کند کردن روند توسعه این فناوری منتشر شده است؛ این افراد نگران هستند سیستمهای بسیار قدرتمند رفتارهای غیرقابلپیشبینی نشان دهند یا از کنترل انسان خارج شوند. «مصطفی سلیمان»، مدیر بخش هوش مصنوعی مایکروسافت، اخیراً از شرکت آنتروپیک برای آموزش چتبات Claude جهت تقلید ویژگیها و روابط انسانی انتقاد کرده و هشدار داده بود که رفتار انسانی با هوش مصنوعی میتواند خطراتی مهارنشدنی در پی داشته باشد.



