NVIDIA Mellanox MQM9790-NS2F Eylemde: Yapay zeka ve HPC kümeleri için düşük gecikme RDMA kumaşı oluşturmak
August 24, 2026
NVIDIA Mellanox MQM9790-NS2F Uygulamada: Yapay Zeka ve Yüksek Performanslı Hesaplama (HPC) Kümeleri İçin Düşük Gecikmeli RDMA Fabric Oluşturma
Arka Plan ve Zorluk: Ölçek Büyüdükçe Darboğaz Oluştuğunda
Büyük dil modelleri binlerce GPU'dan on binlerce GPU'ya ölçeklenirken ve hava durumu simülasyonları kilometre ölçekli çözünürlüğe doğru ilerlerken, geleneksel Ethernet fabric'lerinin sınırlamaları bariz bir şekilde ortaya çıkıyor. Bu ortamlarda, MPI toplu iletişim kalıpları (all-reduce ve all-to-all gibi) ağ gecikmesi ve tıkanıklık kontrolü üzerinde aşırı talepler oluşturur. Özel olarak tasarlanmış bir ara bağlantı olmadan, en güçlü hesaplama düğümleri bile döngülerinin önemli bir bölümünü veri bekleyerek geçirir ve pahalı GPU kaynaklarını boşa harcar.
Tam olarak bu zorluk, NVIDIA Mellanox MQM9790-NS2F tarafından ele alınmaktadır. 64 OSFP bağlantı noktasına sahip 400Gb/s NDR InfiniBand anahtarı olarak, binlerce uç noktada deterministik, mikrosaniye altı gecikme sağlamak üzere tasarlanmıştır ve dağıtılmış iş yükleri için gerçek doğrusal ölçeklendirmeyi mümkün kılar.
Çözüm ve Dağıtım: RDMA İçin Tasarlanmış Leaf-Spine Fabric
Büyük bir yapay zeka araştırma laboratuvarı için tipik bir dağıtım senaryosunda, MQM9790-NS2F InfiniBand anahtarı iki katmanlı bir leaf-spine topolojisinin çekirdeğini oluşturur. Leaf katmanında, her hesaplama rafı, OSFP-to-OSFP doğrudan bağlı bakır kablolar veya aktif optik kablolar aracılığıyla GPU sunucularına 64 adet 400Gb/s bağlantı noktası sağlayan bir veya iki MQM9790-NS2F birimi ile donatılmıştır. Spine katmanında, ek MQM9790-NS2F anahtarları yaprakları birbirine bağlayarak tam bisection bant genişliğine sahip engelsiz bir fat-tree fabric oluşturur.
Bu çözümü özellikle çekici kılan şey, anahtarın InfiniBand modunda çalışırken RDMA over Converged Ethernet (RoCE) için yerel desteğidir; ancak burada daha da düşük gecikme ve CPU boşaltma için InfiniBand'ın yerel RDMA yeteneklerinden yararlanır. MQM9790-NS2F 400Gb/s NDR 64-port OSFP NVIDIA'nın SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) teknolojisini entegre eder, bu da toplu işlemleri doğrudan anahtar fabric'ine boşaltır. Pratikte bu, normalde ağı birden çok kez dolaşacak bir all-reduce işleminin artık tek bir geçişte tamamlandığı, iletişim yoğun iş yükleri için iş tamamlama sürelerini %30'a kadar kısalttığı anlamına gelir.
Ağ mimarları MQM9790-NS2F InfiniBand anahtar çözümünü değerlendirirken, dağıtım süreci NVIDIA'nın Birleşik Fabric Yöneticisi (UFM) tarafından kolaylaştırılır. UFM, 2.000'den fazla bağlantı noktasına sahip fabric'leri yönetirken kritik öneme sahip olan fabric sağlığına merkezi görünürlük, otomatik topoloji keşfi ve proaktif tıkanıklık izleme sağlar. Erken benimseyenler, MQM9790-NS2F uyumlu ekosisteminin, geniş bir NVIDIA sertifikalı kablo ve alıcı-verici yelpazesini içeren, tedarik sürecini basitleştirdiğini ve dağıtım riskini azalttığını bildirmişlerdir.
Sonuçlar ve Ölçülebilir Kazançlar: Teoriden Üretim Gerçekliğine
Büyük ölçekli transformatör modeli eğitimi için ayrılmış 2.048 GPU'luk bir küme için yakın zamanda yapılan bir üretim dağıtımında, HDR (200Gb/s) 'den NDR (400Gb/s) altyapısına yükseltme - NVIDIA Mellanox MQM9790-NS2F merkezde yer alarak - birden çok boyutta ölçülebilir iyileştirmeler sağladı:
- İş tamamlama süresi azalması: 175B parametreli bir model için uçtan uca eğitim yinelemeleri %28 azaldı, bu büyük ölçüde SHARPv3 boşaltma ve azalan kuyruk gecikmesinden kaynaklanıyordu.
- Ağ kullanımı: Anahtarın gelişmiş uyarlanabilir yönlendirme ve tıkanıklık kontrol mekanizmaları sayesinde, tıkanıklık çökmesini tetiklemeden ortalama fabric kullanımı %62'den %89'a yükseldi.
- Operasyonel basitlik: Anahtar başına 64 bağlantı noktası ile, gereken spine anahtarlarının sayısı 32 bağlantı noktalı bir HDR tasarımına kıyasla yarıya indirildi, bu da raf başına kablolama karmaşıklığını ve güç tüketimini önemli ölçüde azalttı.
MQM9790-NS2F teknik özelliklerine göre, anahtar 100ns altı bağlantı noktadan bağlantı noktasına gecikme sağlar ve 51.2Tb/s'ye kadar toplam anahtarlama kapasitesini destekler - bu rakamlar bu dağıtımda gözlemlenen performansla yakından uyumludur. Ağ mühendisleri ayrıca MQM9790-NS2F veri sayfasının gerçek dünya performansını doğru bir şekilde yansıttığını ve doğrulama aşamasında herhangi bir sürpriz olmadığını belirtti.
Toplam sahip olma maliyeti (TCO) açısından bakıldığında, anahtar başına daha fazla uç noktayı birleştirme yeteneği sermaye harcamalarını doğrudan azalttı. İlk MQM9790-NS2F fiyatı eşdeğer 200Gb/s çözümlerinden daha yüksek olsa da, daha yüksek radix ve daha az anahtar katmanı sayısı nedeniyle GPU başına ağ maliyeti aslında azaldı. Bu ekonomik avantaj, performans artışlarıyla birleştiğinde, laboratuvarın yönlendirme komitesi için iş gerekçesini netleştirdi.
Özet ve Görünüm: Exascale Hesaplama İçin NDR Temeli
NVIDIA Mellanox MQM9790-NS2F sadece artımlı bir yükseltme değil; HPC ve yapay zeka kümelerinin nasıl tasarlandığında temel bir değişimi temsil ediyor. Tek bir 1U form faktöründe 400Gb/s NDR bant genişliği, 64 bağlantı noktası yoğunluğu ve ağ içi hesaplama hızlandırması sağlayarak, mimarların performanstan veya yönetilebilirlikten ödün vermeden on binlerce uç noktaya ölçeklenen fabric'ler oluşturmalarını sağlar.
Geleceğe bakıldığında, iş yükleri daha yüksek bant genişliği ve daha düşük gecikme talep etmeye devam ettikçe, MQM9790-NS2F InfiniBand anahtarı gelecek nesil exascale sistemleri için temel yapı taşı olarak hizmet edecektir. Mevcut NVIDIA Quantum-2 platformlarıyla uyumluluğu ve UFM ile sorunsuz entegrasyonu, HDR fabric'lerinden yükseltme yapan kuruluşlar için sorunsuz bir geçiş yolu sağlar. BT yöneticileri ve mimarları gelecek nesil ağ yatırımlarını değerlendirirken, MQM9790-NS2F, düşük gecikmeli RDMA ara bağlantı optimizasyonu vaadini yerine getiren, kanıtlanmış, üretim ortamına hazır bir çözüm sunar.

