← Back to list

MIG Açıkken NVLink Neden Çalışmaz? GPU’nun İçinde Yaşanan Kimlik Krizi

Geçen ay bir müşterimizin teknik ekibiyle toplantı yapıyordum. Masada ciddi bir sessizlik vardı. Sekiz adet H100 GPU’ya yatırım…

Xthe Solutions · 2026-03-29 09:48 · 0 claps · 2.7 min read
#nvlink #mig #nvidia #ai-infrastructure #mlops
Open on Medium ↗
Wiki topics: OPS · LLMOps & Inference

MIG Açıkken NVLink Neden Çalışmaz? GPU’nun İçinde Yaşanan Kimlik Krizi

Geçen ay bir müşterimizin teknik ekibiyle toplantı yapıyordum. Masada ciddi bir sessizlik vardı. Sekiz adet H100 GPU’ya yatırım yapmışlardı, kurulum tamamlanmıştı, ama sistem bekledikleri gibi çalışmıyordu.

Sorun şuydu: Hem MIG hem NVLink’i aynı anda aktif etmeye çalışıyorlardı.

Teknik ekip saatlerce uğraşmıştı. Driver güncellemesi, konfigürasyon değişikliği, yeniden başlatma… Hiçbiri işe yaramamıştı. Çünkü sorun bir hata değildi. Tasarım gereğiydi.

Önce Hızlıca Netleştirelim

NVLink nedir? GPU’lar arasındaki yüksek hızlı doğrudan bağlantı. CPU’yu atlayarak GPU A’dan GPU B’ye 900 GB/s hızında veri taşır. Büyük model eğitiminde sekiz GPU’nun tek bir bellek havuzu gibi davranmasını sağlar.

MIG nedir? (Multi-Instance GPU) Tek bir fiziksel GPU’yu yediye kadar izole parçaya bölme teknolojisi. Her parça bağımsız bir GPU gibi davranır. Farklı takımlar aynı GPU’yu birbirini görmeden kullanabilir.

İkisi de çok işe yarar. İkisi de pahalı donanımdan maksimum verim almanızı sağlar. Ama ikisi aynı anda açık olamaz.

Neden?

İki Teknoloji, İki Zıt Dünya Görüşü

Şöyle düşünün:

NVLink GPU’ya şunu söyler: “Sen tek bir bütünsün. Tüm belleğin, tüm çekirdeklerin dışarıya açık. Diğer GPU’lar seni bütün olarak görebilir ve seninle konuşabilir.”

MIG ise GPU’ya tam tersini söyler: “Sen artık yedi farklı kişisin. Her biri kendi belleğinde yaşıyor, birbirini göremez, birbirinin işine karışamaz.”

İkisi aynı anda doğru olamaz.

Teknik olarak açıklarsak: NVLink portu GPU’yu tek bir kimlikle dışarıya açar. Diğer GPU’lar bu port üzerinden GPU’nun tamamına ulaşır. MIG ise GPU’yu fiziksel olarak bölünmüş parçalara ayırır ve her parça kendi bellek sınırına sahip olur.

Peki hangi parçanın NVLink portuna sahip olacağı? Birinci parça mı? Hepsi mi? Hiçbiri mi?

NVIDIA bu soruyu tasarım aşamasında sordu ve cevap verdi: Hiçbiri. MIG açıkken NVLink portu tamamen devre dışı bırakılıyor. Ve NVSwitch de bu portun kapanmasıyla birlikte pasifleşiyor.

Somut Senaryo: Hangi Durumda Ne Seçmelisiniz?

Diyelim ki sekiz adet H100 GPU’lu bir sunucunuz var.

Senaryo 1: Büyük dil modeli eğitiyorsunuz

Llama 3 70B’yi fine-tune ediyorsunuz. Model 140 GB yer kaplıyor. Tek GPU’nun 80 GB belleği yetmiyor. Ne yaparsınız?

NVLink açık kalmalı. Sekiz GPU’nun 640 GB’lık belleği tek havuz gibi davranır. Model bölünmeden sığar, eğitim çalışır.

MIG burada anlamsız, hatta zararlı. Açarsanız GPU’lar izole olur, NVLink kapanır, 640 GB’lık havuz dağılır.

Senaryo 2: Beş farklı ekip aynı GPU sunucusunu kullanacak

Veri bilimi ekibi küçük modeller test ediyor. Backend ekibi embedding servisi çalıştırıyor. Başka bir ekip RAG pipeline’ı deniyor.

MIG açık olmalı. Her ekipe bir parça tahsis edersiniz. Birbirlerinin işini göremezler, birbirlerinin belleğine erişemezler. Güvenli paylaşım.

NVLink burada zaten gerekmiyor. Küçük modeller tek GPU parçasına sığıyor.

Senaryo 3: Hem büyük model eğitimi hem de inference aynı anda

İşte asıl tuzak burası.

“Dört GPU’da eğitim yapalım, dört GPU’yu MIG ile bölerek inference servisi çalıştıralım” mantıklı geliyor. Ama hayır.

MIG sunucu genelinde ya açık ya da kapalıdır. Bir GPU için MIG açarsanız, o GPU’nun NVLink bağlantısı gider. Eğitim yapan GPU’lar da bu kopukluktan etkilenebilir.

Doğru çözüm: GPU’ları fiziksel olarak ayırmak. Dört sunucu, ikisi eğitim (NVLink açık), ikisi inference (MIG açık). Ya da iki farklı sunucu.

“Bu Tasarım Hatası Değil Mi?” Sorusu

Değil.

İkisini aynı anda desteklemek teknik olarak çözülebilir bir problem. Ama NVLink portunu birden fazla izole parça arasında bölmek ciddi bir gecikme ve karmaşıklık getirir.

NVIDIA tercihini netlik yönünde kullandı: Ya tam bütün bir GPU var, ya da tam izole parçalar var. İkisi arasındaki muğlak bölge performans garantisi vermeyi imkânsız kılar.

Profesyonel dünyada bu tür “ya-ya da” tasarım kararları aslında sağlıklı bir mühendislik göstergesidir. Belirsizliği ortadan kaldırır.

Peki Hangi GPU’lar MIG’i Destekler?

Her GPU MIG’i desteklemez. Kısaca:

  • H100, H200, A100: Tam MIG desteği, yediye kadar bölünebilir
  • A30: MIG destekli ama dört parça
  • L40S: MIG desteği yok — bu önemli, çünkü L40S inference için popüler ama MIG yapamıyorsunuz
  • RTX 4090: MIG yok

Vendor görüşmelerinizde “MIG mi NVLink mi?” sorusu sormadan önce hangi GPU’yu aldığınızı kontrol edin. L40S alıyorsanız bu tartışma gereksiz — MIG yoktur zaten.

Son Söz

MIG ile NVLink’in birlikte çalışmaması bir bug değil, kasıtlı bir tercih. GPU’nun iki zıt kimliği aynı anda taşıması mümkün değil.

Bunu bilmeden on binlerce dolarlık GPU satın alıp yanlış konfigürasyon seçenekleriyle saatler harcayabilirsiniz. Ya da bunu bilerek doğru soruları sorabilir, doğru mimariyi kurabilirsiniz.

Fark bu kadar.


메타데이터
post_id
bb61048ea32c
slug
mig-açıkken-nvlink-neden-çalışmaz-gpunun-i̇çinde-yaşanan-kimlik-krizi-bb61048ea32c
url
https://medium.com/@xthesolutions/mig-a%C3%A7%C4%B1kken-nvlink-neden-%C3%A7al%C4%B1%C5%9Fmaz-gpunun-i%CC%87%C3%A7inde-ya%C5%9Fanan-kimlik-krizi-bb61048ea32c
canonical_url
https://medium.com/@xthesolutions/mig-a%C3%A7%C4%B1kken-nvlink-neden-%C3%A7al%C4%B1%C5%9Fmaz-gpunun-i%CC%87%C3%A7inde-ya%C5%9Fanan-kimlik-krizi-bb61048ea32c
author_url
https://medium.com/@xthesolutions
status
ok
fetched_at
2026-06-12 07:40:50