🩺 Makine Öğrenmesi ile Hastalık Riskinin Sınıflandırılması: KNN ve SVM Karşılaştırmalı Analizi
Yazar: Doruk Çelik
🩺 Makine Öğrenmesi ile Hastalık Riskinin Sınıflandırılması: KNN ve SVM Karşılaştırmalı Analizi
Yazar: Doruk Çelik
Eğitim: Dokuz Eylül Üniversitesi — İstatistik | Anadolu Üniversitesi — YBS
Program: Türkiye Yapay Zeka Akademisi & Huawei Student Developers (HSD) Bootcamp Final Çalışması
📌 1. Projenin Amacı
Sağlık sektöründe erken teşhis ve risk analizi, hayat kurtarıcı bir role sahiptir. Yaş, vücut kitle indeksi (VKİ), glukoz seviyesi, kan basıncı ve aile öyküsü gibi biyometrik verileri değerlendirerek bir bireyin hastalık riskini önceden tahmin etmek; hem sağlık sistemlerinin yükünü hafifletir hem de koruyucu hekimlik süreçlerini destekler.
Bu projenin temel amacı; kişilerin biyometrik verilerini kullanarak hastalık risk grubunu (0: Düşük Risk, 1: Yüksek Risk) yüksek hassasiyetle sınıflandıran bir makine öğrenmesi modeli geliştirmektir. Proje kapsamında mesafeye dayalı K-En Yakın Komşu (KNN) ve ayrıştırıcı hiper-düzlem tabanlı Destek Vektör Makineleri (SVM) algoritmaları eğitilmiş, performansları klinik değerlendirme metrikleri ışığında karşılaştırılmıştır.
📊 2. Veri Seti ve Sınıf Dağılımı
Projede 1,000 bireye ait biyometrik ölçümleri içeren 8 sütunluk bir veri kümesi kullanılmıştır.
Veri Boyutu: 1000 Satır, 8 Sütun
Hedef Değişken (
hastalik_riski):
0 (Düşük Risk): 646 Kişi (%64.6)
1 (Yüksek Risk): 354 Kişi (%35.4)
🛠️ 3. Veri Hazırlama ve Ön İşleme Aşamaları
Veri setini makine öğrenmesi modellerine beslemeden önce iki temel adım uygulanmıştır:
A. Train — Test Bölünmesi (Train-Test Split)
Veri seti, modelin görmediği veriler üzerindeki genelleştirme yeteneğini ölçmek amacıyla %80 Eğitim (Train) ve %20 Test seti olarak ayrılmıştır (200 test örneği). Sınıf dağılımı dengesini korumak için
stratify=yyöntemi kullanılmıştır.
B. Standart Ölçekleme (StandardScaler) — Projenin En Kritik Adımı
Hem KNN hem de SVM algoritmaları uzaklık/mesafe (Öklid mesafesi) ve karar sınırı (hiper-düzlem) hesabı üzerine kuruludur.
⚠️ Neden Ölçekleme Şart?
Örneğin,
kolesteroldeğişkeni 150–250 mg/dL aralığında değerler alırken,haftalik_egzersiz_saati0–10 aralığındadır. Ölçekleme yapılmadığı takdirde büyük aralığa sahip değişkenler mesafe hesabını domine eder. Bu durumu engellemek için tüm değişkenlere StandardScaler uygulanmıştır.
🤖 4. Model Eğitimi ve Hiperparametre Optimizasyonu
Cross-validation ve
GridSearchCVkullanılarak modellerin en optimum parametreleri bulunmuştur:
- K-En Yakın Komşu (K-Nearest Neighbors — KNN)
Best Parameters:
{'n_neighbors': 5, 'weights': 'distance'}
- Destek Vektör Makineleri (Support Vector Machines — SVM)
Best Parameters:
{'C': 10, 'gamma': 'scale', 'kernel': 'rbf'}
📈 5. Model Sonuçları ve Değerlendirme Metrikleri
Sağlık alanındaki projelerde Recall (Duyarlılık / Yakalama Oranı) metriği en kritik metriktir. Hastalıklı bir bireye “sağlıklı” teşhisi koymak (False Negative — Yanlış Negatif) kabul edilemez bir risktir.
📊 Model Performans Karşılaştırması
Support Vector Machine (SVM) — En İyi Performans
Accuracy (Doğruluk): %90.00
Precision (Kesinlik): %89.23
Recall (Duyarlılık): %81.69
F1-Score: %85.29
ROC-AUC: %94.49
K-Nearest Neighbors (KNN)
Accuracy (Doğruluk): %84.50
Precision (Kesinlik): %88.46
Recall (Duyarlılık): %64.79
F1-Score: %74.80
ROC-AUC: %93.17


6. Elde Edilen Çıkarımlar ve Tıbbi / İş Yorumları
SVM Modelinin Ezici Üstünlüğü: SVM modeli, %90.00 Doğruluk ve %94.49 ROC-AUC skoru ile KNN modelini belirgin bir şekilde geride bırakmıştır.
Kritik Yanlış Negatif (FN) Analizi:
KNN Modeli, 71 yüksek riskli hastanın 25 tanesini gözden kaçırmıştır (FN = 25, Recall = %64.79).
SVM Modeli ise
RBFçekirdeği sayesinde bu kaçırma sayısını 13'e düşürmüş (FN = 13) ve Recall başarısını %81.69 seviyesine çıkarmıştır.
Klinik Entegrasyon: Elde edilen SVM modeli, hastane otomasyon sistemlerine entegre edilerek biyometrik tahlili alınan hastalar için otomatik risk skoru üretebilir ve öncelikli triyaj olanağı sağlayabilir.
🎯 Sonuç
Bu projede, biyometrik veriler üzerinden hastalık riskinin sınıflandırılmasında Standart Ölçekleme adımı ve SVM (RBF Kernel) algoritmasının yüksek boyutlu tıbbi verilerdeki ayırma başarısı somut çıktılarla kanıtlanmıştır.
👤 Yazar Hakkında
Doruk Çelik | Dokuz Eylül Üniversitesi — İstatistik | Anadolu Üniversitesi — YBS
📚 KAYNAKÇA
Scikit-Learn Documentation: K-Neighbors & Support Vector Machines Guide.
Türkiye Yapay Zeka Akademisi & HSD Bootcamp Ders Notları (2026).
메타데이터
- post_id
- 88c4aa5dfbb7
- slug
- makine-öğrenmesi-ile-hastalık-riskinin-sınıflandırılması-knn-ve-svm-karşılaştırmalı-analizi-88c4aa5dfbb7
- url
- https://medium.com/@cdoruk248/makine-%C3%B6%C4%9Frenmesi-ile-hastal%C4%B1k-riskinin-s%C4%B1n%C4%B1fland%C4%B1r%C4%B1lmas%C4%B1-knn-ve-svm-kar%C5%9F%C4%B1la%C5%9Ft%C4%B1rmal%C4%B1-analizi-88c4aa5dfbb7
- canonical_url
- https://medium.com/@cdoruk248/makine-%C3%B6%C4%9Frenmesi-ile-hastal%C4%B1k-riskinin-s%C4%B1n%C4%B1fland%C4%B1r%C4%B1lmas%C4%B1-knn-ve-svm-kar%C5%9F%C4%B1la%C5%9Ft%C4%B1rmal%C4%B1-analizi-88c4aa5dfbb7
- author_url
- https://medium.com/@cdoruk248
- status
- ok
- fetched_at
- 2026-08-09 05:12:45