Dental Radyolojide Büyük Dil Modellerinin Kalitesi ve Okunabilirliği: FRE, FKGL ve DISCERN Kullanılarak Yapılan Karşılaştırmalı Analiz

Author :  

Year-Number: 2026-TJHS Vol 7 Issue 2
Language : English
Subject : Oral, Dental and Maxillofacial Radiology
Number of pages: 79-85
Mendeley EndNote Alıntı Yap

Abstract

Amaç: Bu çalışmanın amacı, önde gelen beş büyük dil modelinin (LLM), ChatGPT, Claude, Gemini, DeepSeek ve Copilot’un, diş radyolojisine ilişkin özgün sorulara verdikleri yanıtların hem okunabilirliğini hem de içerik kalitesini karşılaştırmalı olarak değerlendirmektir. Değerlendirme, bu modellerin akademik ve klinik eğitim ortamlarındaki potansiyel kullanımına odaklanmaktadır.

Gereç ve Yöntem: Radyasyonun biyolojik etkileri, koruyucu önlemler, görüntüleme teknikleri ve klinik protokoller olmak üzere dört tematik kategoriyi kapsayan, uzmanlar tarafından doğrulanmış toplam 20 soru, öncesinde herhangi bir etkileşim olmaksızın aynı koşullar altında her bir LLM’ye yöneltilmiştir. Elde edilen yanıtlar, okunabilirliği değerlendirmek amacıyla Flesch Okuma Kolaylığı (FRE) ve Flesch-Kincaid Sınıf Düzeyi (FKGL) indeksleri, içerik kalitesini değerlendirmek amacıyla ise DISCERN aracı kullanılarak analiz edilmiştir. Okunabilirlik skorları iki bağımsız araştırmacı tarafından hesaplanmış ve istatistiksel karşılaştırmalar Kruskal-Wallis H testi ile Dunn-Bonferroni post hoc testi kullanılarak yapılmıştır.

Bulgular: Tüm modeller, hasta odaklı materyaller için önerilen okunabilirlik eşiklerini aşan düzeyde karmaşık içerikler üretmiştir. FRE skorları 14,44 (Copilot) ile 29,32 (DeepSeek) arasında, FKGL skorları ise 10,7 ile 15,0 arasında değişmiştir. Claude, 57,4 ± 13,01 DISCERN skoru ile “iyi” düzeyde değerlendirilen tek model olurken, diğer modeller orta veya düşük düzeyde kalmıştır. Dört içerik alanı arasında “Koruyucu Önlemler” başlığına verilen yanıtlar en yüksek okunabilirliğe sahipken, “Görüntüleme Teknikleri” başlığına verilen yanıtlar en karmaşık bulunmuştur. Modeller arasında genel olarak istatistiksel açıdan anlamlı bir fark saptanmamış (p > 0,05), ancak konuya özgü bazı eğilimler gözlenmiştir.

Sonuç: Güncel LLM’ler diş radyolojisi alanında olgusal açıdan doğru içerikler üretebilse de yanıtlarının okunabilirliği ve kalitesi çoğu zaman eğitimsel ve iletişimsel standartların altında kalmaktadır. LLM’lerin özelleşmiş sağlık alanlarında kullanımının optimize edilmesi için hedefe yönelik istem tasarımı veya yanıtların sonradan düzenlenmesi önemini korumaktadır.

Keywords

Abstract

Objective: This study aims to comparatively assess both the readability and content quality of responses generated by five prominent large language models (LLMs)—ChatGPT, Claude, Gemini, DeepSeek, and Copilot—to original questions in dental radiology. The evaluation focuses on their potential utility in academic and clinical educational contexts.

Materials and Methods: A total of 20 expert-validated questions covering four thematic categories—biological effects of radiation, protective measures, imaging techniques, and clinical protocols—were submitted to each LLM in identical conditions with no prior interaction. The resulting responses were analyzed using Flesch Reading Ease (FRE) and Flesch-Kincaid Grade Level (FKGL) indices to measure readability, and the DISCERN tool to assess content quality. Readability scores were computed by two independent researchers, and statistical comparisons were made using the Kruskal-Wallis H and Dunn-Bonferroni post hoc tests.

Results: All models produced content that exceeded recommended readability thresholds for patient-oriented materials, with FRE scores ranging from 14.44 (Copilot) to 29.32 (DeepSeek) and FKGL scores between 10.7 and 15.0. Claude was the only model to reach a "good" DISCERN rating (57.4 ± 13.01), whereas others remained at moderate or poor levels. Among the four content domains, responses to "Protective Measures" were the most readable, while "Imaging Techniques" were the most complex. No statistically significant differences were found across models overall (p > .05), though topic-specific trends emerged.

Conclusion: While current LLMs can generate factually accurate content in dental radiology, their readability and quality often fall short of educational and communicative standards. Targeted prompt design or post-editing remains essential for optimizing LLM use in specialized healthcare domains.

Keywords

Large Language Models, Readability, Dental Radiology, Artificial Intelligence, Quality


                                                                                                                                                                                                        
  • Article Statistics