NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch: RDMA/HPC/AI Klusterleri için Düşük Gecikme İlişkisini Optimize Etmek
August 21, 2026
NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch: RDMA/HPC/AI Klusterleri için Düşük Gecikme İlişkisini Optimize Etmek
Büyük ölçekli yapay zeka modeli eğitimi ve yüksek performanslı hesaplama (HPC) alanında, ağ gecikmesi sıklıkla kümelerin ölçeklenebilirliğini ve verimliliğini sınırlayan kritik bir sıkıntı haline gelir.Ulusal düzeydeki bir süper bilgisayar merkezi yakın zamanda büyük bir altyapı yükseltmesini tamamladı, 100Gb/s EDR InfiniBand kumaşından,NVIDIA Mellanox MQM8790-HS2FBu vaka çalışması, karşı karşıya kaldıkları zorlukları, dağıtım stratejisini ve bu yeni nesil bağlantı yoluyla elde edilen ölçülebilir performans kazanımlarını inceler.
Arkaplan ve Zorluklar: Gecikme Performans Tavanı Olduğunda
Süperbilgisayar merkezi, 2000'den fazla GPU düğümünden oluşan heterojen bir kümesi işletiyor.ve büyük dil modeli eğitimi. Önceki 100Gb/s EDR ağı ile,Operasyon ekibi, toplu iletişim işlemlerinin all-reduce ve all-gather gibi işlemlerin, düğüm sayısının artmasıyla birlikte, toplam iş çalışması süresinin giderek artan bir bölümünü tükettiğini gözlemledi.Bazı dağıtılmış eğitim işlerinde, ağla ilgili genel masraflar, GPU kullanımını ciddi şekilde sınırlayan ve model yakınlaşma döngülerini uzatan uçtan uca yürütme süresinin yaklaşık% 40'ını oluşturdu.
Ek zorluklar şunlardır:
- Trafik sıkışıklıkları:Yapay zekâ eğitimindeki trafik kalıpları genellikle patlayıcı ve öngörülemezdir, bu da iş planlamasını bozan çizgi başı engelleme ve kuyruk gecikme piklerine yol açar.
- Ağ içi yetersiz ivme:Eski kumaş, gelişmiş toplu boşaltma yetenekleri için desteğe sahip değildi ve tüm azaltma işlemlerini ana CPU ve bellek hiyerarşisini geçmeye zorladı.
- Yönetim karmaşıklığı:Performans sorunlarının giderilmesi, çoklu izleme araçlarının manuel analizini gerektirdi ve bu da büyük ölçekli dağıtımlarda kök nedenleri belirlemeyi zorlaştırdı.
Çoklu bağlantı seçeneklerini değerlendirdikten sonra, merkezMQM8790-HS2FYeni doku için temel olarak.MQM8790-HS2F veri sayfası, bu anahtar, 40 portu 200Gb / s HDR engelleme olmayan verimi, 130ns altındaki kesme gecikmesi ve SHARP v3 desteği sunar.0 toplu boşaltma yetenekleri doğrudan temel sorun noktalarını ele aldı.
Çözüm ve Uygulama: AI/HPC için düşük gecikme yapısı oluşturmak
Uygulama, iki katlı bir yağ ağacı topolojisini benimsemiş, 24MQM8790-HS2F 200Gb/s HDR 40 portlu QSFP56Yaprak düğümleri olarak dağıtılan anahtarlar ve omurilik düğümleri olarak 8 ünite.1 tüm kümede fazla abonelik mevcut iş yükü için yeterli ve gelecek genişleme için ön planlama alanı sağlar.
| Uygulama Katmanı | Değiştiricilerin sayısı | Kullanılan Limanlar | Bağlantı |
|---|---|---|---|
| Yaprak (rak başına) | 24 | Her biri 32 liman | ToR sunucuları + omurilik bağlantıları |
| Omurilik | 8 | Her biri 36 liman | Tüm yaprak anahtarlarına tam ağ |
Her yaprak anahtarı, NVIDIA ConnectX-6 HDR ana kanal adaptörleri aracılığıyla hesaplama düğümlerine bağlanır.MQM8790-HS2F uyumluoptik ve kablolama ekosistemi, ekibin mevcut QSFP56 kablolarını yeniden kullanmasını sağladı, dağıtımı hızlandırdı ve tedarik maliyetlerini düşürdü.NVIDIA'nın Otomatik Topoloji Keşfi ve Kararlandırma için Unified Fabric Manager'ı (UFM) kullanan kontrol düzlemi ile.
Değiştiricinin uyarlanabilir yönlendirme ve tıkanıklık kontrolü desteği, yapay zeka iş yüklerinin patlayıcı trafik özelliğini ele almak için kritik olduğunu kanıtladı.Akışları mevcut yollar arasında dinamik olarak yeniden dağıtarak,MQM8790-HS2F InfiniBand anahtarıHızlı nokta oluşumunu en aza indirdi ve yoğun iş zamanlaması dönemlerinde bile tutarlı bir performans korudu.
Sonuçlar ve Kazançlar: İş Peraketi ve GPU Kullanımında Ölçülebilir Gelişimler
Üretim operasyonunun üç ayından sonra, süper bilgisayar merkezi, birden fazla boyutta önemli performans kazançları bildirdi:
- Gecikme azaltımı:Ortalama MPI ping-pong gecikme süresi, önceki EDR kumaşında 680 ns'den 130 ns'in altına düştü.NVIDIA Mellanox MQM8790-HS2F, mesaj değişimi verimliliğinin 5 katını temsil ediyor.
- Toplu operasyonun hızlandırılması:1024 düğümlük işler için tüm azaltma gecikmesi, doğrudan anahtar dokusunda azaltma işlemleri gerçekleştiren SHARP v3.0 offload sayesinde% 62 oranında düştü.
- GPU kullanımı:Daha düşük gecikme ve daha yüksek bant genişliğinin birleşik etkisi, ortalama GPU kullanımını% 72'den% 91'e yükseltti ve bu da büyük dil modeli eğitim çalışması için çözüme geçme süresinde% 26'lık bir düşüşe yol açtı.
- İş zamanlaması verimliliği:Kısaltılmış kuyruk gecikme varyansı, SLURM planlayıcısının performans müdahalesi olmadan aynı düğüm setine daha fazla iş paketlemesine izin verdi ve genel kümelerden oluşan verimi yaklaşık% 18 arttırdı.
Takım daha sonraMQM8790-HS2F fiyatıDiğer satıcılardan gelen alternatif anahtarlara karşı, they found that the total cost per Gb/s delivered was highly competitive—especially when factoring in the reduced management overhead and the switch's ability to support both HDR and HDR100 link speeds, karışık hız ortamlarında yatırımları korur.
İşletim açısından, entegre UFM platformu kumaş sağlığını, trafik kalıplarını ve bağlantı düzeyinde hataları izlemek için tek bir cam paneli sağladı.Bu görünürlük, ekibin bozulmuş kabloları proaktif olarak tespit etmesini ve planlı bakım sırasında değiştirmesini sağladı, planlanmamış duraklamalardan kaçınmak.
Özet ve Perspektif: Sonraki Nesil Düşük Gecikme Kumaşları için Bir Plan
Bu vaka çalışması,MQM8790-HS2F InfiniBand anahtar çözümüBu, AI ve HPC altyapılarının tam performans potansiyelini açığa çıkarmak isteyen kuruluşlar için basit bir hız yükseltmesinden daha fazlasıdır.Yüksek liman yoğunluğunu birleştirerek, ultra düşük gecikme ve ağ içi işlem yetenekleri, anahtar doğrudan tarihsel olarak sınırlı kümelenmiş ölçeklenebilirliğe sahip iletişim sıkışıklıklarını ele alır.
İleriye bakıldığında, süper hesaplama merkezi, gelecek mali yıl içinde ağını 2.400 düğümüne genişletmeyi planlıyor.MQM8790-HS2FEk omurilik anahtarları ile mimari. Ekib ayrıca SHARP v3.0'nun geliştirilmiş azaltma algoritmaları için anahtarın desteğini araştırıyor.Grafik sinir ağları ve güçlendirme öğrenimi gibi ortaya çıkan iş yüklerini daha da hızlandırmayı vaat eden.
IT yöneticileri, ağ mimarları ve mühendisler için kendi kümeler için bağlantı seçeneklerini değerlendiren,NVIDIA Mellanox MQM8790-HS2FAlt-mikrosaniye gecikme, maksimum GPU kullanımı ve basitleştirilmiş kumaş yönetimi elde etmek için kanıtlanmış, saha doğrulanmış bir yol sunar.MQM8790-HS2F özelliklerive referans tasarımları NVIDIA'nın teknik dokümanasyon portalından mevcuttur ve anahtar artık yaygın olarak kullanılabilirSatılık MQM8790-HS2FBölgesel bir ortak bulmak için.

