Göz Hastalıkları Alanında Türkçe Başasistanlık Sınavlarında Geniş Dil Modellerinin (ChatGPT-3.5, ChatGPT-4, Bing ve Bard) Performansların Değerlendirilmesi: Karşılaştırmalı Bir Çalışma


CANLEBLEBİCİ M., DAL A., ERDAĞ M.

Türkiye Klinikleri Oftalmoloji Dergisi, cilt.33, sa.3, ss.163-170, 2024 (TRDizin)

Özet

Amaç: Yapay zekâ alanında, özellikle de büyük dil modellerindeki [large language models (LLM)] son gelişmeler, bunların tıp eğitiminde araş- tırılmasına yol açmıştır. Bu çalışma, ChatGPT-3.5, ChatGPT-4.0, Bing ve Bard’ı değerlendirerek, LLM’lerin Türkçe ba şasistan oftalmoloji s ınavla- rındaki yeterliliğini araştırmaktadır. Çalışmanın amacı, 6 ana oftalmoloji konusunu kapsayan 200 soruyu yanıtlamadaki doğruluk oranlarını karşılaş- tırmak ve tıp eğitimindeki potansiyel uygulamalarına ilişkin alanları tartış- maktır. Gereç ve Yöntemler: Araştırmada kullan ılmak üzere, önceki yıllarda Millî Eğitim Bakanlığı tarafından uygulanan ve Türkçe sorulan ba- şasistanlık sınavı soruları internet üzerinden elde edildi. Toplam 200 soru Ekim 2023’te her bir LLM’ye ChatGPT-3.5, ChatGPT-4.0, Bing ve Bard olmak üzere tek tek sunulmuştur. Sorular, Grup 1 olarak Retina ve Vitreus, Grup 2 olarak Kornea, Katarakt ve Ön Segment, Grup 3 olarak Glokom, Grup 4 olarak Pediatrik Oftalmoloji, Genetik ve Klinik Refraksiyon, Grup 5 ola- rak Adneksa, Uvea ve Oküloplastik ve Grup 6 olarak Nöro-Oftalmoloji ve Şaşılık olmak üzere 6 grubu kapsamaktadır. Birincil değerlendirme ölçütü, bu 6 ana başlık altında gruplandırılan konularla birlikte doğru yanıtlama oranı- dır. Yanıtların doğruluğunu ve güvenilirliğini değerlendirmek için Pearson’ın ki-kare testi ile istatistiksel analizler yap ılmıştır. Bulgular: ChatGPT-4.0 %77,5 doğruluk oranıyla en iyi performansı gösteren LLM olmuştur ve onu %63,0 ile Bing takip etmektedir. Buna kar şılık, ChatGPT-3.5 ve Bard s ıra- sıyla %51 ve %45,5 ile daha düşük doğruluk oranı sergilemektedir. Alt grup analizleri ChatGPT-4.0’ın tüm bran şlardaki üstünlüğünü vurgulayarak çe- şitli oftalmoloji konularındaki etkinliğini ortaya koymaktadır. Sonuç: Umut verici sonuçlara rağmen bu çalışma doğruluk konusundaki sorunları göster- mekte ve özellikle eğitim ve klinik uygulamalar alanında LLM’lerde sürekli iyileştirmeler yapılması zorunluluğunun altını çizmektedir.
Objective: Recent strides in artificial intelligence, particu- larly in large language models (LLM), have prompted their exploration in medical education. This study investigates the proficiency of LLMs in Turk- ish chief-assistant ophthalmology exams, assessing ChatGPT-3.5, ChatGPT- 4.0, Bing, and Bard. The aim is comparing their accuracy in answering 200 questions spanning six critical ophthalmology topics, providing insights into their potential applications in medical education. Material and Methods: The questions were asked in Turkish and obtained from the chief-assistant exam administered by the Ministry of National Education from internet. A total of 200 questions were presented to each LLM as fallows ChatGPT- 3.5, ChatGPT-4.0, Bing, and Bard, in October 2023. The questions covered six groups, including Retina and Vitreous as Group-1, Cornea, Cataract and Anterior Segment as Group-2, Glaucoma as Group-3, Pediatric Ophthal- mology, Genetics and Clinical Refraction as Group-4, Adnexa, Uvea and Oculoplastic as Group-5, and Neuro-Ophthalmology and Strabismus as Group-6. The primary outcome measure was response accuracy, with top- ics grouped under these six main headings. Statistical analyses were em- ployed to assess the accuracy and reliability of the responses with Pearson's chi-square test. Results: ChatGPT-4.0 emerges as the most accurate LLM with a 77.5% correct response rate, followed by Bing at 63.0%. In contrast, ChatGPT-3.5 and Bard exhibit lower accuracy at 51% and 45.5%, respec- tively. Subgroup analyses emphasize ChatGPT-4.0's superiority across all branches, showcasing its efficacy in diverse ophthalmology topics. Con- clusion: Despite promising results, the study acknowledges challenges in accuracy and underscores the imperative for continual improvements in LLMs, especially in the realm of clinical applications and education.