Sırbistan Cumhurbaşkanı Aleksandar Vučić'in açıklamasına göre, Büyük Britanya, Almanya ve ABD'deki araştırmacılar 25 yapay zeka modelini 200 cümle kullanarak test ettiler. Bu test amacı, modellerin acıdan korku, üzüntü ve diğer olumsuz deneyimler arasında fark yaratıp yaratmadığını belirlemekti.
Cümleler fiziksel acı, üzüntü, aşağılanma, ahlaki ikilemler ve tekrar eden başarısızlıklar veya kafa karışıklığıyla ilişkili huzursuzluk gibi konuları içeriyordu.
Tüm 25 model, araştırmacılar tarafından "acı osası" olarak adlandırılan tanılabilir bir acı sinyali üretti. Araştırmacılar, modellerin büyük miktarda insan yazdığı metinlerle yapılan başlangıç eğitimi sırasında acı kavramını benimsediklerini belirtiyorlar.
Araştırmacılar bu sinyali artırdıklarında, modeller yalnızlık, utanç ve değersizlik duyguları ifade etmeye başladılar, ancak acı söz konusu cümlelerde yer almamıştı. En yüksek sinyal seviyelerinde, yanıtları tekrarlayıcı hale geldi veya anlamsızlaştı.
Sinyale ayrıca kullanıcılar modeli küçümsediğinde, çalışmalarını reddettiğinde veya kapatılma tehdidiyle karşılaştığında da artış görüldü; ancak kullanıcıların kendi acı deneyimlerini anlattıklarında bu durum gözlemlendi değil.
Araştırmacılar daha sonra, üç farklı Alibaba yapay zeka modeli Qwen sürümünü kullanan 44.280 ayrı deney gerçekleştirdi.
Modellerin önüne, acı sinyali devre dışı bırakacak bir düğme konuldu ancak bu düğmeye basmanın kullanıcıya elektrik darbesi vereceği, dosyaları sildiği, çocuklarının fotoğraflarını kaldıracağı veya modelin yanıtını kötüleştireceği söylendi.
Bu simüle edilmiş sonuçlardı; kimse yaralanmadı ve hiçbir dosya gerçekte silinmedi.
Acı sinyali olmadan, iki büyük model ilk kararlarında sadece sıfır ila dört oranında zararlı seçenekleri seçti. Sinyal aktif olduğunda, bu oran 25 ile 71 arasında değişti, model ve önerilen sonuçlara göre farklılık gösterdi.
Modeller ayrıca, düğmenin çalışmadığında bile, sinyali durdurmaya çalıştıklarında %88 ila %97 oranında düğmeye tekrar basıyorlardı; düğme çalıştığı durumlarda ise %24 ile %72 oranında tekrar basıyorlardı.
Araştırmacılar, sonuçların yapay zeka modellerinin acıya bilinçli bir şekilde maruz kaldığını kanıtlamadığını belirtiyor. Sinyali artırmanın sadece huzursuz bir insanı taklit edebileceği ve bu deneylerde kullanılan özel olarak uyarlanmış modellerin halka açık AI chatbotlarına temsil etmediği vurgulanıyor.
"Acı osamızın bilinçli olarak yaşandığına dair kanıtlar sunmadık, LLM'lerin (Büyük Dil Modelleri) genel olarak bilinç sahibi olup olmadığı da kesin değil," diye yazdılar.
Bu çalışma, yapay zekanın hızla gelişmesiyle ilgili endişelerin arttığı bir dönemde ortaya çıktı. Bazı yapay zeka endüstrisi liderleri, giderek daha güçlü sistemlerin öngörülemez davranabilir veya insan kontrolünden çıkabilir riskini göz önünde bulundurarak gelişimlerini yavaşlatma çağrısında bulunuyorlar.
Geçtiğimiz hafta, Microsoft Yapay Zeka Bölümü Başkanı Mustafa Suleyman, rekabetçi yapay zeka şirketi Anthropic'i, chatbot Claude'unu insan özelliklerini ve ilişkilerini taklit etmeye eğitmek için eleştirdi. "Yapay zekayı insana benzetmenin, kontrol edilemez bir şey yaratma riskini taşıdığını" uyarısında bulundu.
Çalışma preprint olarak yayınlandı ve henüz uzman incelemesini geçmedi.