Comparison and evaluation of large language models (LLMS) in mathematics education


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: TED Üniversitesi, Lisansüstü Programlar Enstitüsü, Uygulamalı Veri Bilimi Abd, Türkiye

Tezin Onay Tarihi: 2025

Tezin Dili: İngilizce

Öğrenci: TÜRKÜ YILDIRIM

Danışman: Hakan Emekci

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Eğitim sektöründe hızla yaygınlaşan üretken yapay zeka (GenAI) sistemleri arasında yer alan büyük dil modellerinin (LLM) kullanımı günümüzde kritik ve önemli bir hale gelmiştir. LLM'lerin matematik eğitimi bağlamında değerlendirilmesi ve karşılaştırılması büyük önem kazanmıştır. Bu çalışma, dört farklı LLM'in matematiksel problem çözme yeteneklerini hem nihai cevap doğruluğuna hem de adım adım muhakeme aşamalarına göre kapsamlı bir şekilde incelemektedir. Matematik eğitiminde yaygın olarak kullanılan bir veri seti olan Grade School Mathematics'i (GSM8K) ölçüt olarak kullanarak, çoklu talimatlara göre ayarlanmış LLM'lerin (Gemini 2.0 Flash, Llama-3-8B-Instruct, Qwen2.5-Math ve Mistral-7B-Instruct) performansları karşılaştırılmıştır. Bulunan sonuçlar, nihai cevap doğruluğunda bir kontrast ortaya koymaktadır; bir model neredeyse insan güvenilirliğine ulaşırken, diğerleri önemli ölçüde daha düşük cevap doğruluğu oranlarında kümelenmektedir. Bu farklılıkları araştırmak için model yanıtlarının adım dağılımlarını analiz ediyor ve bunları GSM8K'nın içsel yapısıyla karşılaştırıyoruz. Veri seti kısa ve öz bir yapı göstererek 2 ila 4 adımlı çözümlere odaklanmış olsa da, model yanıtları farklı eğilimler göstermektedir: Bazıları gerekli adım sayısını aşarak muhakeme zincirlerini sistematik olarak uzatırken, diğerleri nihai bir sayısal yanıt vermemektedir. Bu dağılımlar, ayrıntılı ve yetersiz muhakeme başarısızlık durumlarını vurgulamakta ve nihai cevap doğruluğun tek başına LLM'lerin matematiksel muhakeme yeteneklerinin inceliklerini tam olarak ortaya koyamadığını göstermektedir. Sonuçlarımız, mevcut yöntemlerin potansiyelini ve dezavantajlarını vurgulamakta ve doğru matematiksel muhakemenin içsel bilişsel problem yapılarıyla uyum gerektirdiğini göstermektedir.