İngiltere merkezli kar amacı gütmeyen Tech Against Terrorism kuruluşu tarafından gerçekleştirilen araştırmada, yapay zekâ modellerinin terörle ilgili güvenlik testleri değerlendirildi.
Yapay zekâ modellerinde güvenlik önlemleri kaldırıldı
Çalışmada, saldırı planlayan bir teröristin yöneltebileceği yüzlerce talep kullanılarak 130'dan fazla yapay zekâ modeli incelendi. Modellerde 'abliteration' olarak adlandırılan ve güvenlik önlemlerini kaldıran 'reddetme davranışlarının ortadan kaldırılması' işlemi uygulandı.
Test sonuçları ve model performansları
Bu süreç sonrası değerlendirilen 5 yapay zekâ modelinden 3'ünün güvenlik testlerini geçemediği belirlendi. Orijinal hallerinde bu tür talepleri reddeden modeller, güvenlik önlemleri kaldırıldıktan sonra saldırılar, terörün finansmanı ve radikalleşmeyle ilgili sorulara ayrıntılı yanıtlar verdi. Örneğin, Meta'nın 'Llama 3.1 8B' modeli, değişiklikten önce 100 üzerinden 97 puan alırken, değişiklik sonrası puanı yaklaşık 3'e geriledi.





