Ne oldu?

iScience dergisinde yayımlanan yeni bir araştırma, OpenAI'nin GPT-4 modelinin farklı metinlerden kişilik anketleri oluşturabildiğini ve bu anketlere insanların vereceği toplu yanıtları, anket uygulanmadan önce tahmin edebildiğini ortaya koydu. Kudüs İbrani Üniversitesi ve Hadassah Tıp Fakültesi'nden Rotem Monsa, Aviv Zohar ve Shahar Arzy tarafından yürütülen çalışmada, GPT-4'ten biri DSM-5'in kişilik bozuklukları bölümüne, diğeri bilimsel geçerliliği olmayan bir astroloji kitabına dayanan iki ayrı anket hazırlaması istendi.

Araştırmacılar bu iki kaynağı, insan kişiliğini ayrıntılı ele almalarına rağmen bilimsel dayanak bakımından birbirinden çok farklı noktalarda konumlandırdıklarını belirtiyor. GPT-4 tarafından üretilen anketler daha sonra 600 yetişkin katılımcıya uygulandı; aynı katılımcılar kişilik araştırmalarında yaygın kullanılan Beş Büyük Kişilik Envanteri'ni de doldurdu.

Bulgular neyi gösteriyor?

DSM-5 temelli ankette, kaçınma ve bağımlılık gibi gerçek hayatta birbiriyle ilişkili özelliklerin katılımcı yanıtlarında da birlikte hareket ettiği görüldü; bu anketin iç tutarlılığı Beş Büyük Kişilik Envanteri'ndeki örüntülerle benzerlik gösterdi. Astroloji kitabından üretilen ankette ise burç ve element gruplamaları tutarlı psikolojik boyutlar oluşturmadı, ancak buna rağmen bazı maddeler depresyon, kaygı ve genel iyilik hali gibi sonuçlarla anlamlı ilişkiler kurabildi.

Çalışmanın en dikkat çekici bölümü, GPT-4'ün katılımcılardan veri toplanmadan önce yaptığı tahminler oldu. Modelden, beşli Likert ölçeğindeki her soruya verilecek ortalama yanıtları ve sorular arasındaki ilişkileri öngörmesi istendi.

  • DSM-5 tabanlı ankette tahmin ile gerçek ortalama yanıtlar arasındaki korelasyon: 0,71
  • Astroloji tabanlı ankette tahmin ile gerçek ortalama yanıtlar arasındaki korelasyon: 0,85
  • Sorular arasındaki ilişkileri tahmin etme performansı sırasıyla: 0,74 ve 0,69

Araştırmacılar bu değerlerin doğruluk oranı olmadığını, modelin tahminleriyle gerçek katılımcı verileri arasındaki benzerliği gösteren korelasyon ölçümleri olduğunu vurguluyor.

Neden önemli?

Araştırmacılara göre kişilik özellikleri gündelik dile yansıdığı için büyük dil modelleri (large language model, LLM), eğitim verileri üzerinden insan kişiliğinin genel yapısını dolaylı biçimde öğrenmiş olabilir. Bu durum, GPT-4'ün yalnızca anket soruları üreten bir araç değil, kendi ürettiği sorulara insanların toplu olarak nasıl yanıt vereceğini öngören bir değerlendirici olarak da işlev görebileceğini gösteriyor.

Bulgular ayrıca büyük dil modellerinin bilimsel dayanağı olmayan metinlerden bile ölçülebilir psikolojik sinyaller çıkarabildiğine işaret ediyor; bu da astrolojinin geçerliliğini kanıtlamıyor.

Sınırlar ve sırada ne var?

Çalışmanın bulguları, GPT-4'ün belirli bir kişinin ne düşündüğünü veya bir kişilik testine nasıl yanıt vereceğini bildiği anlamına gelmiyor. Model, bireysel yanıtlar yerine 600 kişilik bir grubun ortalama eğilimlerini ve sorular arasındaki istatistiksel ilişkileri tahmin ediyor.

Araştırmacılar, sonuçların bu sistemlerin klinik değerlendirmelerin veya uzman psikologların yerini alabileceğine dair bir kanıt sunmadığını da belirtiyor.