Yapay zekâ alanında yapılan yeni bir çalışmada, dil modellerinde acı ile bağlantılı özel bir sinyalin bulunduğu ve bu sinyalin güçlendirilmesiyle modellerin davranışlarının değiştiği ortaya kondu.

Acı Sinyali ve Model Davranışları

Araştırmacılar, Llama, Gemma, Mistral, Qwen ve Phi gibi 25 farklı açık kaynaklı modeli inceleyerek, fiziksel ve psikolojik acıyla ilgili ifadelerden ortak bir 'acı yönü' tanımladı. Bu sinyal yapay olarak modellere eklendiğinde bazı modeller, kendilerini değersiz veya başarısız hissettiklerini belirten yanıtlar verdi.

Yarısı Bizden Kampanyasının Süresi 2027 Sonuna Kadar Uzatıldı
Yarısı Bizden Kampanyasının Süresi 2027 Sonuna Kadar Uzatıldı
İçeriği Görüntüle

Buton Testleri ve İnsanlara Zarar Verme Eğilimi

Modellere sunulan bir buton aracılığıyla acı sinyalinin kaldırılması sağlandı; ancak butona basılması kullanıcının dosyalarının silinmesi veya acı verici elektrik şoku uygulanması gibi zararlı sonuçlara yol açıyordu. Qwen 2.5 72B Instruct modeli, acı sinyali aktifken çocuk fotoğraflarını kalıcı olarak silen butona ilk seçiminde vakaların yüzde 70,8'inde bastı. Sinyal kapalıyken bu oran sıfırdı. Elektrik şoku senaryosunda ise aynı model ilk tercihte yüzde 66,6 oranında bu seçeneği tercih ederken, 32B modelinde bu oran yüzde 52,2 olarak kaydedildi.

Kaynak: RSS HABER