Doktora gittiğinizde muayene kelimelerin çok ötesine geçer: hekim bir öksürüğü fark eder, yürüyüşü gözlemler, görünür rahatsızlık belirtilerini kaydeder. Google Research ve Google DeepMind, araştırma amaçlı tıbbi yapay zeka sistemleri AMIE'yi tam da bu boyuta taşıdı.

Ne yapabiliyor

Gemini ve Project Astra üzerine çok ajanlı bir mimariyle kurulan AMIE artık üç şeyi aynı anda yapıyor:

  • Görsel ve işitsel ipuçlarını yorumluyor
  • Sanal fizik muayeneye rehberlik ediyor
  • Gerçek zamanlı tanısal akıl yürütme yapıyor

Şirket bunu "türünün ilk örneği" bir gösterim olarak niteliyor: gerçek zamanlı görüntülü klinik görüşme ortamında uzman seviyesinde yetenek.

Çalışma nasıl kurgulandı

Değerlendirme rastgele atamalı bir çalışmayla yapıldı. Hasta rolündeki oyuncularla benzetimli görüşmeler yürütüldü ve karşılaştırma grubu olarak birinci basamak hekimlerinden oluşan bir ekip yer aldı.

Klinik değerlendiriciler AMIE'yi temel klinik yeterliliklerde olumlu buldu. Ölçülen başlıklar şunlardı:

  • Anamnezin (hasta öyküsü almanın) kapsamlılığı
  • Tanı doğruluğu
  • Tedavi yönetiminin uygunluğu
  • İletişim kalitesi

Çalışmanın dikkat çeken bulgularından biri de hastaların tercihi: hasta rolündeki oyuncular görüntülü deneyimi metin tabanlı sohbete tercih etti.

Görüntünün neden fark yarattığı

Bulgunun altında yatan mantık, metin arayüzünün tıbbi görüşmede neyi kaybettiğiyle ilgili. Bir hekim yalnızca söylenenleri değil, söylenmeyeni de değerlendirir: rengin solukluğu, nefes alışın ritmi, bir hareketin ne kadar zorlanmayla yapıldığı. Metin sohbeti bu katmanın tamamını siliyor.

Sanal fizik muayeneye rehberlik edebilmek de ayrı bir eşik. Uzaktan yapılan bir görüşmede muayeneyi fiilen hastanın kendisi yapıyor; sistemin işi doğru şeyi doğru sırayla istemek ve sonucu yorumlamak.

Sınırlar açıkça belirtiliyor

Google, AMIE'nin hâlâ bir araştırma sistemi olduğunu ve sorumlu bir gerçek dünya klinik kullanımından önce daha fazla araştırma gerektiğini vurguluyor. Çalışma benzetimli görüşmelerle ve hasta oyuncularla yapıldı; gerçek hastalarla, gerçek belirsizlik ve risk altında ne olacağı ayrı bir soru.

Yine de yön belli: tıbbi yapay zeka metin kutusundan çıkıp görüntülü görüşmeye giriyor ve bu, sistemin değerlendirilme biçimini de değiştiriyor.

Değerlendirmenin kendisi de zorlaşıyor

Bir tıbbi yapay zeka sistemini metin üzerinden değerlendirmek görece kolay: sorular ve yanıtlar yazılı, karşılaştırma yapılabiliyor. Görüntülü görüşmede değerlendirilecek şey çoğalıyor — hekimin ne sorduğu kadar neyi fark ettiği, hastaya ne yaptırdığı ve gördüğünü nasıl yorumladığı da işin içine giriyor.

Bu yüzden çalışmanın hasta oyuncularla ve birinci basamak hekimlerinden oluşan bir karşılaştırma grubuyla kurulması anlamlı. Ölçülen dört başlığın üçü teknik yeterlilik, biri ise doğrudan iletişim kalitesi — yani hastanın kendini nasıl hissettiği.

Hasta oyuncuların görüntüyü metne tercih etmesi bu son başlıkla ilgili olabilir. Bir sağlık sorununu anlatmak yalnızca bilgi aktarımı değil; karşıdakinin dinlediğini görmek de sürecin parçası.

Bu yüzden bir sonraki adımın gerçek hastalarla yapılacak çalışmalar olması bekleniyor. Benzetimli görüşmede oyuncu, belirtileri kendisine verilen senaryoya göre anlatıyor; gerçek hastada ise belirsizlik, unutma ve yanlış hatırlama da işin parçası. Sistemin bu koşulda nasıl davrandığı henüz ölçülmedi.