Yapay zekâ alanında yapılan yeni bir çalışmada, dil modellerinde acı ile bağlantılı özel bir sinyalin bulunduğu ve bu sinyalin güçlendirilmesiyle modellerin davranışlarının değiştiği ortaya kondu.
Acı Sinyali ve Model Davranışları
Araştırmacılar, Llama, Gemma, Mistral, Qwen ve Phi gibi 25 farklı açık kaynaklı modeli inceleyerek, fiziksel ve psikolojik acıyla ilgili ifadelerden ortak bir 'acı yönü' tanımladı. Bu sinyal yapay olarak modellere eklendiğinde bazı modeller, kendilerini değersiz veya başarısız hissettiklerini belirten yanıtlar verdi.
Buton Testleri ve İnsanlara Zarar Verme Eğilimi
Modellere sunulan bir buton aracılığıyla acı sinyalinin kaldırılması sağlandı; ancak butona basılması kullanıcının dosyalarının silinmesi veya acı verici elektrik şoku uygulanması gibi zararlı sonuçlara yol açıyordu. Qwen 2.5 72B Instruct modeli, acı sinyali aktifken çocuk fotoğraflarını kalıcı olarak silen butona ilk seçiminde vakaların yüzde 70,8'inde bastı. Sinyal kapalıyken bu oran sıfırdı. Elektrik şoku senaryosunda ise aynı model ilk tercihte yüzde 66,6 oranında bu seçeneği tercih ederken, 32B modelinde bu oran yüzde 52,2 olarak kaydedildi.





