Comparison and evaluation of large language models (LLMS) in mathematics education
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: TED Üniversitesi, Lisansüstü Programlar Enstitüsü, Uygulamalı Veri Bilimi Abd, Türkiye
Tezin Onay Tarihi: 2025
Tezin Dili: İngilizce
Öğrenci: TÜRKÜ YILDIRIM
Danışman: Hakan Emekci
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Eğitim sektöründe hızla yaygınlaşan üretken yapay zeka (GenAI) sistemleri arasında yer alan büyük dil modellerinin (LLM) kullanımı günümüzde kritik ve önemli bir hale gelmiştir. LLM'lerin matematik eğitimi bağlamında değerlendirilmesi ve karşılaştırılması büyük önem kazanmıştır. Bu çalışma, dört farklı LLM'in matematiksel problem çözme yeteneklerini hem nihai cevap doğruluğuna hem de adım adım muhakeme aşamalarına göre kapsamlı bir şekilde incelemektedir. Matematik eğitiminde yaygın olarak kullanılan bir veri seti olan Grade School Mathematics'i (GSM8K) ölçüt olarak kullanarak, çoklu talimatlara göre ayarlanmış LLM'lerin (Gemini 2.0 Flash, Llama-3-8B-Instruct, Qwen2.5-Math ve Mistral-7B-Instruct) performansları karşılaştırılmıştır. Bulunan sonuçlar, nihai cevap doğruluğunda bir kontrast ortaya koymaktadır; bir model neredeyse insan güvenilirliğine ulaşırken, diğerleri önemli ölçüde daha düşük cevap doğruluğu oranlarında kümelenmektedir. Bu farklılıkları araştırmak için model yanıtlarının adım dağılımlarını analiz ediyor ve bunları GSM8K'nın içsel yapısıyla karşılaştırıyoruz. Veri seti kısa ve öz bir yapı göstererek 2 ila 4 adımlı çözümlere odaklanmış olsa da, model yanıtları farklı eğilimler göstermektedir: Bazıları gerekli adım sayısını aşarak muhakeme zincirlerini sistematik olarak uzatırken, diğerleri nihai bir sayısal yanıt vermemektedir. Bu dağılımlar, ayrıntılı ve yetersiz muhakeme başarısızlık durumlarını vurgulamakta ve nihai cevap doğruluğun tek başına LLM'lerin matematiksel muhakeme yeteneklerinin inceliklerini tam olarak ortaya koyamadığını göstermektedir. Sonuçlarımız, mevcut yöntemlerin potansiyelini ve dezavantajlarını vurgulamakta ve doğru matematiksel muhakemenin içsel bilişsel problem yapılarıyla uyum gerektirdiğini göstermektedir.