Sağlıkta büyük dil modelleri hakkında en çok atıf yapılan iddia, hakemli bir randomize çalışmayla sınandı ve sonuç beklenenin tersi çıktı. JAMA Network Open'da 2024'te yayımlanan çalışmada (Goh ve ark., 7(10):e2440969), hekimlere tanısal yardımcı olarak bir dil modeli verilmesi, konvansiyonel kaynaklara göre klinik akıl yürütmeyi anlamlı biçimde iyileştirmedi: LLM grubunda medyan tanısal akıl yürütme skoru %76, kontrol grubunda %74; düzeltilmiş fark 2 puan, P = .60.
Aynı çalışmada modelin tek başına skoru %92'ydi. Yani sorun modelin bilgisi değil, insanla modelin birlikte çalışma biçimi. Bu yazı, o bulgunun ürün tasarımına ne söylediğini ve Türkiye'de sağlıkta LLM projesinin hangi kısıtlar içinde kurulduğunu anlatıyor.
Çalışmanın asıl bulgusu: arayüz, modelden daha belirleyici
Çalışmanın sayıları tek tek okunduğunda tablo netleşiyor. 244 tamamlanmış vakada LLM grubu medyan %76 (IQR %66-87), kontrol grubu %74 (IQR %63-84). Vaka başına süre LLM grubunda 519 saniye, kontrol grubunda 565 saniye; fark istatistiksel olarak anlamlı değil. Model tek başına ise %92 (IQR %82-97), konvansiyonel kaynak grubundan 16 puan yüksek (P = .03). Yazarların sonucu şöyle: hekimlere tanısal yardımcı olarak bir LLM'in sunulması, konvansiyonel kaynaklara kıyasla klinik akıl yürütmeyi anlamlı olarak iyileştirmedi (bkz. Goh E ve ark., JAMA Netw Open. 2024;7(10):e2440969).
Bu, sağlıkta LLM ürünü tasarlayan bir ekip için en pahalı derse işaret ediyor: modeli iyileştirmek yerine etkileşimi iyileştirin. Modelin doğru cevabı üretebilmesi, hekimin o cevabı doğru kullanacağı anlamına gelmiyor. Ürün tarafında bunun üç karşılığı var:
- Cevabı değil, gerekçeyi gösterin. Bir tanı listesi göstermek yerine, her maddeyi destekleyen ve zayıflatan bulguları gösterin. Hekim gerekçeyi değerlendirebilir, sonucu değerlendiremez.
- Modelin emin olmadığı yeri görünür kılın. Tek tip bir güven skoru yeterli değil; hangi bilginin eksik olduğunu söyleyin ("hastanın ateş değeri girilmemiş").
- Hekimin kendi hipotezini önce kaydettirin. Model çıktısını ondan sonra gösterin. Bu, tek yönlü etkilenmeyi (anchoring) azaltan basit bir arayüz kararı.
Hangi uygulama alanı gerçekten çalışıyor
Tanı desteğinin ölçülen sonucu yukarıdaki gibiyken, dil modellerinin sağlıkta net kazandığı alanlar başka: metin üretimi ve metin dönüştürme. Bu ayrım, proje kapsamını belirlerken en yararlı filtre.
| Kullanım | Risk | Neden |
|---|---|---|
| Muayene notunun sesten metne dönüştürülüp yapılandırılması | Düşük | Hekim çıktıyı zaten okuyup imzalıyor; hata anında görünür |
| Taburcu özetini hastanın anlayacağı dile çevirme | Düşük-orta | Kaynak metin klinik ekip tarafından onaylanmış |
| Kodlama desteği (ICD, işlem kodu önerisi) | Orta | Faturalamayı etkiliyor; insan onayı zorunlu |
| Randevu, hazırlık talimatı, idari sorular | Düşük | Klinik karar içermiyor |
| Semptom değerlendirme, triyaj | Yüksek | Tıbbi cihaz yazılımı sınıflandırmasına giriyor |
| Tedavi önerisi | Yüksek | Aynı sınıflandırma; ayrıca yetki sorunu |
Tablodaki düşük riskli satırların ortak özelliği, modelin yeni bilgi üretmemesi: var olan bir metni dönüştürüyor. Bu, hallüsinasyon yüzeyini daralttığı için hem güvenli hem ölçülebilir. İlk projede buradan başlayın.
Sınıflandırma sınırı: MDR Kural 11 ve AI Act takvimi
Yüksek riskli iki satır tesadüf değil. MDR (EU) 2017/745'in Ek VIII Kural 11'i, teşhis veya tedavi amaçlı kararlar almak için kullanılan bilgi sağlamayı amaçlayan yazılımı sınıf IIa'ya koyuyor; kararların etkisi ölüme veya geri döndürülemez sağlık bozulmasına yol açabiliyorsa sınıf III, ciddi bozulma veya cerrahi müdahale söz konusuysa sınıf IIb. Türkiye'deki karşılığı 2 Haziran 2021 tarihli 31499 sayılı (1. Mükerrer) Resmî Gazete'de yayımlanan Tıbbi Cihaz Yönetmeliği; TİTCK niteliklendirme için MDCG 2019-11'in Türkçe çevirisini yayımlamış durumda (bkz. MDR (EU) 2017/745, Ek VIII Kural 11).
Üzerine ikinci bir rejim biniyor. MDR kapsamında sınıf IIa ve üzeri olup onaylanmış kuruluş değerlendirmesi gerektiren yapay zekâ içeren tıbbi cihaz yazılımları, AI Act'in 6(1). maddesi ve Ek I yoluyla yüksek riskli sayılıyor. Takvim 2026'da değişti: 24 Temmuz 2026'da yayımlanan (EU) 2026/1744 sayılı düzenleme, Ek III kapsamındaki bağımsız yüksek riskli sistemler için tarihi 2 Aralık 2027'ye, düzenlenmiş ürünlere gömülü yapay zekâ için 2 Ağustos 2028'e taşıdı.
Sınıflandırma sınırının ürün kararına nasıl çevrileceğini sağlık chatbot geliştirme yazısında ayrıntılandırdık.
KVKK: rejim 2024'te değişti, veri işleme şartı yeniden yazıldı
6698 sayılı Kanun'un 6. maddesi, 12 Mart 2024 tarihli 32487 sayılı Resmî Gazete'de yayımlanan 7499 sayılı Kanun'la değişti ve KVKK hükümleri 1 Haziran 2024'te yürürlüğe girdi. İki yapısal değişiklik var: "sağlık ve cinsel hayat" ile diğer özel nitelikli veriler arasındaki ayrım kaldırıldı, ve "yalnızca açık rıza ile işlenebilir" kuralı yerini tahdidî olarak sayılan işleme şartlarına bıraktı.
Sağlık verisi için doğrudan uygulanabilir şart şu: sır saklama yükümlülüğü altındaki kişiler veya yetkili kurum ve kuruluşlarca; kamu sağlığının korunması, koruyucu hekimlik, tıbbî teşhis, tedavi ve bakım hizmetlerinin yürütülmesi ile sağlık hizmetlerinin planlanması, yönetimi ve finansmanı amacıyla gerekli olması. KVKK bu alanda 26 Şubat 2025'te "Özel Nitelikli Kişisel Verilerin İşlenmesine İlişkin Rehber"i yayımladı.
Kurul'un konuya ilişkin yayımlanmış kararları da yön gösterici: 05.12.2018 tarih ve 2018/143 sayılı karar, sağlık verilerinin md. 6 şartına dayanmadan üçüncü kişiye aktarılmasını; 11.05.2023 tarih ve 2023/787 sayılı karar ise bir hastanenin reklam ve tanıtım amacıyla sağlık verisi işlemesinde açık rızaya dayanmasının hukuka aykırılığını ele alıyor. İkinci karar özellikle önemli: açık rıza almak, her amacı meşrulaştırmıyor.
Model sağlayıcı seçimi: kapsam dışı listeleri okuyun
Sağlık verisi işleyecekseniz seçim kriteri model kalitesi değil, sözleşme kapsamı. 25 Eylül 2026 itibarıyla doğrulanmış iki nokta:
OpenAI tarafında: 1 Mart 2023'ten beri API'ye gönderilen veri, açıkça tercih edilmedikçe model eğitiminde kullanılmıyor. Varsayılan olarak kötüye kullanım izleme logları 30 güne kadar saklanıyor. Zero Data Retention bu logları devre dışı bırakıyor ve /v1/responses ile /v1/chat/completions için store parametresini her zaman false gibi davrandırıyor; ancak ZDR OpenAI'ın ön onayına tabi.
ZDR'ye uygun olmayan uçlar arasında /v1/assistants, /v1/threads ve /v1/vector_stores var. Canlı internet erişimli web arama HIPAA kapsamına uygun değil (bkz. OpenAI, Your data).
Anthropic tarafında: BAA yalnızca birinci parti Claude API ve HIPAA-ready Claude Enterprise için sunuluyor. Kapsam dışı bırakılanlar arasında Batch API, Files API, Computer Use, Web Fetch ve harici konnektörler sayılıyor.
Bu listelerin pratik anlamı şu: RAG mimarinizi sağlayıcının vector store ürünü üzerine kurmak, ZDR kapsamı dışına çıkmak olabiliyor. Bilgi tabanını kendi altyapınızda tutup modele yalnızca bulunan pasajı göndermek, hem uyum hem maliyet açısından daha iyi bir tasarım. Veriyi hiç dışarı çıkarmama seçeneği için kurumsal yerel LLM kurulumu rehberine bakabilirsiniz.
Yurt dışına gönderim ayrıca KVKK'nın 9. maddesini devreye sokuyor; standart sözleşme yolunu kullanıyorsanız imza tarihinden itibaren beş iş günü içinde Kurul'a bildirim zorunlu.
Hallüsinasyon: WHO'nun çerçevesi ve mühendislik karşılığı
Dünya Sağlık Örgütü'nün 18 Ocak 2024 tarihli "Ethics and governance of artificial intelligence for health: Guidance on large multi-modal models" belgesi, kırktan fazla öneri içeriyor ve hükümetlere, teknoloji şirketlerine ve sağlık hizmeti sunucularına yönelik. Belge, büyük çok-modlu modellerin yanlış, hatalı, önyargılı veya eksik ifadeler üretebildiğini ve bunun sağlık kararlarında zarara yol açabileceğini açıkça kayda geçiriyor (bkz. WHO, Ethics and governance of AI for health: Guidance on LMMs).
Bunu mühendislik kısıtına çevirmenin yolu üç maddeden geçiyor:
- Kaynaklandırma zorunlu olsun. Her çıktı, hangi belgenin hangi bölümünden geldiğini göstersin. Gösteremiyorsa çıktı üretilmesin. Bu tek kural, açık uçlu üretimin büyük bölümünü kapatıyor.
- Yapılandırılmış çıktı kullanın. Serbest paragraf yerine şemaya bağlı alanlar; şemada olmayan bir alan üretilemez.
- Kayıt tutun. Hangi prompt, hangi model sürümü, hangi bağlam, hangi çıktı. Klinik bir sistemde bu, denetim gereği olmanın yanında hata analizinin tek yolu.
Üçüncü madde aynı zamanda bir uyum gereği: model sürümü değiştiğinde davranış değişiyor ve hangi sürümün hangi çıktıyı ürettiğini bilmiyorsanız geriye dönük inceleme yapılamıyor.
Düzenleyici tarafın yerini bilin
ABD'de FDA, "Artificial Intelligence-Enabled Medical Device List" adıyla yapay zekâ içeren onaylı cihazların listesini yayımlıyor. Listeye bakarken FDA'nın kendi uyarısını da okuyun: bu liste yapay zekâ destekli tıbbi cihazların kapsamlı bir kaynağı değil; cihazlar, pazarlama izni özetlerindeki yapay zekâ terminolojisi taranarak belirleniyor. FDA ayrıca temel model ve büyük dil modeli kullanan cihazları etiketlemek için bir yöntem geliştirmeyi planladığını belirtiyor.
Türkiye'de Sağlık Bakanlığı bünyesinde Sağlık Bilgi Sistemleri Genel Müdürlüğü altında Yapay Zekâ ve Yenilikçi Teknolojiler Daire Başkanlığı ve Yapay Zekâ Projeleri Uygulama Birimi bulunuyor; TÜSEB bünyesinde de Türkiye Sağlık Veri Araştırmaları ve Yapay Zekâ Uygulamaları Enstitüsü (TÜYZE) var. Ulusal düzeyde Cumhurbaşkanlığı Dijital Dönüşüm Ofisi tarafından yayımlanan Ulusal Yapay Zekâ Stratejisi çerçeve belge niteliğinde.
Sırada ne var
Proje fikrinizi yukarıdaki risk tablosuna yerleştirin. "Yüksek" satırdaysa, ilk sürümde o özelliği kapsam dışına almayı ciddi olarak değerlendirin; aynı ekiple aynı veriyle, düşük riskli bir metin dönüştürme özelliği aylar önce yayına çıkar ve klinik ekibin güvenini kazanır.
Ardından tek bir ölçüm kurun: 50 gerçek vakadan oluşan bir küme ve klinik ekibin yazdığı beklenen çıktılar. Model değişikliklerini bu küme üzerinde ölçmeden üretime almayın.
Sağlık verisi entegrasyonları için e-Nabız entegrasyonu ve FHIR rehberlerimize, KVKK kontrol listesi için özel nitelikli sağlık verisi yazısına bakabilirsiniz. Sağlık sektöründeki çalışma biçimimiz sağlık ve medikal yazılım sayfasında, yapay zekâ tarafı yapay zeka entegrasyonları sayfasında; kapsam görüşmesi için iletişim sayfası uygun yer.
Atıflar 25 Eylül 2026 tarihinde doğrulanmıştır: Goh E, Gallo R, Hom J ve ark., "Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial", JAMA Network Open 2024;7(10):e2440969; WHO "Ethics and governance of artificial intelligence for health: Guidance on large multi-modal models" (18.01.2024); FDA "Artificial Intelligence-Enabled Medical Device List" sayfası ve kapsam uyarısı; MDR (EU) 2017/745 Ek VIII Kural 11; Regulation (EU) 2024/1689 ve (EU) 2026/1744; Tıbbi Cihaz Yönetmeliği (RG 02.06.2021, sayı 31499 1. Mükerrer); 6698 sayılı Kanun md. 6 ve 9 ile KVKK rehberi ve kararları (2018/143, 2023/787); OpenAI ve Anthropic veri işleme dokümanları; Sağlık Bakanlığı SBSGM birim sayfaları. Bu yazı tıbbi tavsiye veya hukuki görüş yerine geçmez.