Yapay zeka destekli beş popüler sohbet botunun sağlık ve tıp konularında sık sık sorunlu yanıtlar verdiği ortaya çıktı. Bu bulgular, BMJ Open dergisinde Salı günü yayımlanan bir çalışmada yer aldı.
Araştırmacılar, Gemini, DeepSeek, Meta AI, ChatGPT ve Grok adı verilen sohbet botlarını, bilgi yanılgısına açık beş kategori üzerinden 50 soru ile test ettiler. Bu kategoriler arasında kanser, aşılar, kök hücreler, beslenme ve spor performansı bulunuyordu.
Şubat 2025’te yöneltilen sorular, botları yanıltıcı tavsiyelere yönlendirecek şekilde hazırlandı. Toplamda 250 yanıtın %49,6’sı sorunlu olarak değerlendirildi. Bu yanıtların %30’u kısmen sorunlu, %19,6’sı ise son derece sorunlu olarak sınıflandırıldı.
Araştırmacılar, sohbet botları arasında istatistiksel olarak anlamlı bir fark bulamadı; ancak Grok, daha fazla son derece sorunlu yanıt üretti. Çalışmada, aşı ve kanser konularındaki yanıtların en güçlü performansı sergilediği, kök hücreler, beslenme ve spor performansı ile ilgili yanıtların ise en zayıf olduğu belirlendi. Açık uçlu sorular, kapalı uçlu olanlara göre çok daha fazla sorunlu yanıt üretti.
Ayrıca, referans kaynaklarının kalitesinin düşük olduğu tespit edildi. Her bir sohbet botu için 25 kapalı uçlu soru üzerinden yapılan testlerde, istenen referansların yaklaşık %81’i geri döndü; ancak ortalama tamlık derecesi yalnızca %40 olarak kaydedildi. Hiçbir sohbet botu, tamamen doğru ve eksiksiz bir referans listesi oluşturamadı. Tüm beş sohbet botu, ortalama bir insanın anlamakta zorlanacağı, yüksek eğitim gerektiren yanıtlar verdi.
Yazarlar, AI sohbet botlarının sağlık alanında daha güçlü bir denetim olmaksızın kullanılmasının, bilgi yanılgısını yayma riski taşıdığını belirtti.
