NVIDIA Mellanox 920-9B210-00FN-0D0 Pratikte: Trillion-Parameter MoE Modelleri için NDR Düşük Gecikme Kumaşı Yapım

August 27, 2026

hakkında en son şirket haberleri NVIDIA Mellanox 920-9B210-00FN-0D0 Pratikte: Trillion-Parameter MoE Modelleri için NDR Düşük Gecikme Kumaşı Yapım

NVIDIA Mellanox 920-9B210-00FN-0D0 Pratikte: Trillion-Parameter MoE Modelleri için NDR Düşük Gecikme Kumaşı Yapım

Geçmişi ve Zorluk: Herkese Herşeyi Öğretmek Eğitim Boğazı Olduğunda

Önde gelen bir yapay zeka araştırma kurumu, yakın zamanda büyük dil modeli eğitim kümesini 1.024'ten 4.096'ya yükseltti.8 trilyonluk bir parametreye sahip olan MoE modeli (Ustaların Karışımı) aylardan iki haftaya kadarBununla birlikte, ilk onaylama sırasında, the team discovered that their existing 200Gb/s HDR network was experiencing severe congestion during the all-to-all communication phase—a characteristic pattern of MoE architectures—causing GPU utilization to plummet from an expected 85% to just 52%Eğitim sürelerini karşılamak için gerekli eşiğin çok altında.

Ağ analizi, herkesin toplu iletişiminin, MEA modelinin iletişim ayak izinin %40'ından fazlasını oluşturduğunu ortaya çıkardı.Trafik düzenleri giderek daha parçalanmış ve patlamış hale geldi.Mevcut HDR ağı, tıkanıklık kontrol mekanizmalarını tetikledikten sonra, kuyruğu gecikme hızında dramatik artışlar yaşadı ve GPU'ların önemli bir kısmını boş ve bekleyen bir durumda bıraktı.Organizasyon acilen, mikro saniyeden aşağı deterministik gecikme sağlayabilen bir ağ dokusuna ihtiyaç duyuyordu., kayıpsız nakliye, ve büyük engellemez ölçeklenebilirlik veNVIDIA Mellanox 920-9B210-00FN-0D0Tam da bu zorluk için tasarlanmıştı.

Çözüm ve dağıtım: MoE-Optimized NDR Leaf-Spine mimarisi

Organizasyon, çevresinde inşa edilen iki katlı yaprak omurilik kumaşını yerleştirdi.920-9B210-00FN-0D0 InfiniBand anahtarı OPNHer hesaplama rafında, iki920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRYaprak katmanında, OSFP-OSFP aktif optik kablolar üzerinden 64 çift portlu H100 sunucusuna 400Gb/s bağlantı sağlayan anahtarlar yerleştirildi.16 ek 920-9B210-00FN-0D0 anahtarı birbirine bağlanmış tüm yaprak anahtarları, toplu bölme bant genişliği 51.2 Tb/s ile tamamen engellemez bir yağ ağacı kumaşı oluşturur.

Bu çözümün merkezi anahtarın entegre SHARPv3 (ölçeklenebilir Hiyerarşik Toplama ve Azaltma Protokolü) teknolojisidir.Herkese iletişimi doğrudan anahtar dokusuna indirildi., anahtarların ağ içi veri azaltma ve yeniden dağıtımını gerçekleştirmesiyle.Daha önceki HDR dağıtımındaki iletişim masraflarını önemli ölçüde azalttı..920-9B210-00FN-0D0 veri sayfasıkavram kanıtlama aşamasında doğrulanmış ve MoE iş yükünün sıkı gecikme gereksinimleri için kritik olduğu kanıtlanmış olan 100ns altındaki kesme gecikmesini vurguluyor.

Bu920-9B210-00FN-0D0 özellikleri¢İkili redundant güç kaynakları ve sıcak değiştirilebilir fanlar dahil olmak üzere, ekibin 99.999% kullanılabilirlik hedefine ulaşma güvenini verdi.920-9B210-00FN-0D0 uyumluEkosistem, satın alma gecikmelerini ortadan kaldırarak ve dağıtım zaman çizelgesini basitleştirerek zaten nitelikli olan tüm OSFP optiklerini ve kablolarını içeriyordu.

Sonuçlar ve Ölçülebilir Kazançlar: Bottleneck'ten Enabler'a

NDR dokusu tam olarak dağıtıldıktan ve MOE eğitim işinin yeniden başlatılmasından sonra, organizasyon çoklu boyutlarda dönüştürücü iyileşmeleri ölçtü:

  • GPU kullanımı kurtarma:Ortalama GPU kullanım oranı %52'den %89'a yükseldi ve en yüksek kullanım oranı, ağ kaynaklı duraklamaların ortadan kaldırılmasının doğrudan bir sonucu olarak, hesaplama yoğunluklu aşamalarda %94'e ulaştı.
  • Hepsinden fazla gecikme azaltımı:4.096 GPU'da tam bir herşeyden herşeye değişim için gereken zaman 180ms'den 45ms'in altına düştü, bu da doğrudan daha hızlı eğitim tekrarlarına çevrilen% 75'lik bir iyileşme.
  • İşin tamamlanma süresi:1.8T MoE modeli için öngörülen eğitim zaman çizelgesi, hem piyasaya sürme hem de bulut bilişim maliyetlerini önemli ölçüde azaltan% 36 hızlandırma ile 14 günden sadece 9 güne düşürüldü.
  • Çalışma verimliliği:Bir anahtar başına 64 port ile, 40 portlu HDR tasarımına kıyasla gereken omurilik anahtarlarının sayısı% 37 oranında azalmış, kablolama basitleştirilmiş ve rak başına enerji tüketimini% 28 oranında azaltılmıştır.

Toplam mülkiyet maliyeti bakış açısından, organizasyonun finans ekibi,920-9B210-00FN-0D0 fiyatıBirim başına HDR alternatiflerinden daha yüksek olduğu için, GPU başına ağ maliyeti, daha yüksek radiks ve daha az anahtar katmanı sayısına bağlı olarak düştü.Bu, dramatik performans artışlarıyla birleşti., NDR'nin yükseltilmesini açık bir iş kazancı yaptı.920-9B210-00FN-0D0 InfiniBand anahtarı OPN çözümüAyrıca mevcut NVIDIA UFM dağıtımı ile sorunsuz bir şekilde entegre oldular. Merkezi görünürlük ve otomatik uyarı sağlayarak operasyonel genel masrafları% 40 oranında azaldılar.

Özet & Bakış Açısı: NDR Vakfı Next-Gen MoE İş Yükleri için

BuNVIDIA Mellanox 920-9B210-00FN-0D0Bu yapay zeka araştırma organizasyonunun 4096 GPU H100 kümesinin tüm potansiyelini açığa çıkarmak için ihtiyacı olan dönüştürücü çözüm olduğunu kanıtladı.ve SHARPv3 ağ içi hesaplama, geçiş, performans veya yönetilebilirliği tehlikeye atmadan 1.024'ten 4.096 GPU'ya ölçeklendirilmelerini sağladı.

Önümüze bakarak, kuruluş önümüzdeki 18 ay içinde 8.192 GPU'ya genişlemeyi planlıyor.920-9B210-00FN-0D0 satılıkYeni nesil AI ve HPC ağ yatırımlarını değerlendiren kuruluşlar için,920-9B210-00FN-0D0 kanıtlanmış bir, düşük gecikme RDMA bağlantı optimizasyonunu eksascale'de sağlayan üretime hazır bir çözümdür.