← Back to list

🩺 Makine Öğrenmesi ile Hastalık Riskinin Sınıflandırılması: KNN ve SVM Karşılaştırmalı Analizi

Yazar: Doruk Çelik

Doruk Çelik · 2026-08-08 19:43 · 0 claps · 2.6 min read
#machine-learning #data-science #python #healthcare #artificial-intelligence
Open on Medium ↗
Wiki topics: ML · Machine Learning AI · AI · General EDU · Education & Learning 🔬 · Science · General

🩺 Makine Öğrenmesi ile Hastalık Riskinin Sınıflandırılması: KNN ve SVM Karşılaştırmalı Analizi

Yazar: Doruk Çelik

Eğitim: Dokuz Eylül Üniversitesi — İstatistik | Anadolu Üniversitesi — YBS

Program: Türkiye Yapay Zeka Akademisi & Huawei Student Developers (HSD) Bootcamp Final Çalışması

📌 1. Projenin Amacı

Sağlık sektöründe erken teşhis ve risk analizi, hayat kurtarıcı bir role sahiptir. Yaş, vücut kitle indeksi (VKİ), glukoz seviyesi, kan basıncı ve aile öyküsü gibi biyometrik verileri değerlendirerek bir bireyin hastalık riskini önceden tahmin etmek; hem sağlık sistemlerinin yükünü hafifletir hem de koruyucu hekimlik süreçlerini destekler.

Bu projenin temel amacı; kişilerin biyometrik verilerini kullanarak hastalık risk grubunu (0: Düşük Risk, 1: Yüksek Risk) yüksek hassasiyetle sınıflandıran bir makine öğrenmesi modeli geliştirmektir. Proje kapsamında mesafeye dayalı K-En Yakın Komşu (KNN) ve ayrıştırıcı hiper-düzlem tabanlı Destek Vektör Makineleri (SVM) algoritmaları eğitilmiş, performansları klinik değerlendirme metrikleri ışığında karşılaştırılmıştır.

📊 2. Veri Seti ve Sınıf Dağılımı

Projede 1,000 bireye ait biyometrik ölçümleri içeren 8 sütunluk bir veri kümesi kullanılmıştır.

Veri Boyutu: 1000 Satır, 8 Sütun

Hedef Değişken (hastalik_riski):

0 (Düşük Risk): 646 Kişi (%64.6)

1 (Yüksek Risk): 354 Kişi (%35.4)

🛠️ 3. Veri Hazırlama ve Ön İşleme Aşamaları

Veri setini makine öğrenmesi modellerine beslemeden önce iki temel adım uygulanmıştır:

A. Train — Test Bölünmesi (Train-Test Split)

Veri seti, modelin görmediği veriler üzerindeki genelleştirme yeteneğini ölçmek amacıyla %80 Eğitim (Train) ve %20 Test seti olarak ayrılmıştır (200 test örneği). Sınıf dağılımı dengesini korumak için stratify=y yöntemi kullanılmıştır.

B. Standart Ölçekleme (StandardScaler) — Projenin En Kritik Adımı

Hem KNN hem de SVM algoritmaları uzaklık/mesafe (Öklid mesafesi) ve karar sınırı (hiper-düzlem) hesabı üzerine kuruludur.

⚠️ Neden Ölçekleme Şart?

Örneğin, kolesterol değişkeni 150–250 mg/dL aralığında değerler alırken, haftalik_egzersiz_saati 0–10 aralığındadır. Ölçekleme yapılmadığı takdirde büyük aralığa sahip değişkenler mesafe hesabını domine eder. Bu durumu engellemek için tüm değişkenlere StandardScaler uygulanmıştır.

🤖 4. Model Eğitimi ve Hiperparametre Optimizasyonu

Cross-validation ve GridSearchCV kullanılarak modellerin en optimum parametreleri bulunmuştur:

  1. K-En Yakın Komşu (K-Nearest Neighbors — KNN)

Best Parameters: {'n_neighbors': 5, 'weights': 'distance'}

  1. Destek Vektör Makineleri (Support Vector Machines — SVM)

Best Parameters: {'C': 10, 'gamma': 'scale', 'kernel': 'rbf'}

📈 5. Model Sonuçları ve Değerlendirme Metrikleri

Sağlık alanındaki projelerde Recall (Duyarlılık / Yakalama Oranı) metriği en kritik metriktir. Hastalıklı bir bireye “sağlıklı” teşhisi koymak (False Negative — Yanlış Negatif) kabul edilemez bir risktir.

📊 Model Performans Karşılaştırması

Support Vector Machine (SVM) — En İyi Performans

Accuracy (Doğruluk): %90.00

Precision (Kesinlik): %89.23

Recall (Duyarlılık): %81.69

F1-Score: %85.29

ROC-AUC: %94.49

K-Nearest Neighbors (KNN)

Accuracy (Doğruluk): %84.50

Precision (Kesinlik): %88.46

Recall (Duyarlılık): %64.79

F1-Score: %74.80

ROC-AUC: %93.17

6. Elde Edilen Çıkarımlar ve Tıbbi / İş Yorumları

SVM Modelinin Ezici Üstünlüğü: SVM modeli, %90.00 Doğruluk ve %94.49 ROC-AUC skoru ile KNN modelini belirgin bir şekilde geride bırakmıştır.

Kritik Yanlış Negatif (FN) Analizi:

KNN Modeli, 71 yüksek riskli hastanın 25 tanesini gözden kaçırmıştır (FN = 25, Recall = %64.79).

SVM Modeli ise RBF çekirdeği sayesinde bu kaçırma sayısını 13'e düşürmüş (FN = 13) ve Recall başarısını %81.69 seviyesine çıkarmıştır.

Klinik Entegrasyon: Elde edilen SVM modeli, hastane otomasyon sistemlerine entegre edilerek biyometrik tahlili alınan hastalar için otomatik risk skoru üretebilir ve öncelikli triyaj olanağı sağlayabilir.

🎯 Sonuç

Bu projede, biyometrik veriler üzerinden hastalık riskinin sınıflandırılmasında Standart Ölçekleme adımı ve SVM (RBF Kernel) algoritmasının yüksek boyutlu tıbbi verilerdeki ayırma başarısı somut çıktılarla kanıtlanmıştır.

👤 Yazar Hakkında

Doruk Çelik | Dokuz Eylül Üniversitesi — İstatistik | Anadolu Üniversitesi — YBS

🔗 LinkedIn Profilim: www.linkedin.com/in/dorukcelik |

🐙 GitHub Profilim: https://github.com/cdoruk248-cmyk

📚 KAYNAKÇA

Scikit-Learn Documentation: K-Neighbors & Support Vector Machines Guide.

Türkiye Yapay Zeka Akademisi & HSD Bootcamp Ders Notları (2026).


메타데이터
post_id
88c4aa5dfbb7
slug
makine-öğrenmesi-ile-hastalık-riskinin-sınıflandırılması-knn-ve-svm-karşılaştırmalı-analizi-88c4aa5dfbb7
url
https://medium.com/@cdoruk248/makine-%C3%B6%C4%9Frenmesi-ile-hastal%C4%B1k-riskinin-s%C4%B1n%C4%B1fland%C4%B1r%C4%B1lmas%C4%B1-knn-ve-svm-kar%C5%9F%C4%B1la%C5%9Ft%C4%B1rmal%C4%B1-analizi-88c4aa5dfbb7
canonical_url
https://medium.com/@cdoruk248/makine-%C3%B6%C4%9Frenmesi-ile-hastal%C4%B1k-riskinin-s%C4%B1n%C4%B1fland%C4%B1r%C4%B1lmas%C4%B1-knn-ve-svm-kar%C5%9F%C4%B1la%C5%9Ft%C4%B1rmal%C4%B1-analizi-88c4aa5dfbb7
author_url
https://medium.com/@cdoruk248
status
ok
fetched_at
2026-08-09 05:12:45