NVIDIA Mellanox MCX653105A-HDAT Uygulamada: RDMA/RoCE Düşük Gecikmeli İletim ve Sunucu Verim Optimizasyonu

July 29, 2026

hakkında en son şirket haberleri NVIDIA Mellanox MCX653105A-HDAT Uygulamada: RDMA/RoCE Düşük Gecikmeli İletim ve Sunucu Verim Optimizasyonu

NVIDIA Mellanox MCX653105A-HDAT Eylemde: RDMA / RoCE Düşük Gecikme Taşıma ve Sunucu Etkinliği Optimizasyonu

Arkaplan ve Zorluklar: Bir AI / HPC Klüstrindeki Ağ Boşluğunda

Büyük bir teknoloji şirketi yakın zamanda büyük dil modeli (LLM) eğitimi için 128 düğümlü GPU hızlandırılmış bir kümesi yerleştirdi.Her düğümde sekiz NVIDIA H100 GPU ve yüksek performanslı NVMe depolaması bulunurAncak, 32 düğümün ötesine ölçeklendikten sonra, kümenin performansında dramatik bir düşüş yaşandı.TCP/IP ağ yığını, düğüm başına CPU kaynaklarının% 45'inden fazlasını tüketirkenÇoklu 25GbE bağlantıları üzerine inşa edilen ağ, GPU kullanımını ciddi bir şekilde sınırlayan ve kabul edilebilir zaman çizelgilerinin çok ötesine eğitim döngülerini uzatan birincil sıkıntı haline gelmişti.Takım acilen hem ultra düşük gecikme hem de büyük bant genişliği sağlayabilen bir çözüme ihtiyaç duyuyordu..

Çözüm ve Uygulama: MCX653105A-HDAT ile kumaş dönüştürme

Kapsamlı bir teknik değerlendirme sonrasında ekip,NVIDIA Mellanox MCX653105A-HDATHer bir GPU düğümüne birMCX653105A-HDAT ConnectX adaptörü PCIe ağ kartı, sunucu başına toplam 200 Gb / s bant genişliği sağlamak için çift portlu 100GbE bağlantısı ile yapılandırılmıştır.

Uygulama dört yapılandırılmış aşamada gerçekleştirildi:

  • Aşama 1 ¢ Donanım kurulumları (128 düğüm):Her sunucuMCX653105A-HDAT Ethernet adaptör kartı, her iki QSFP28 portu da çift redundan NVIDIA Spectrum-4 yaprak anahtarlarına bağlanmıştır.
  • Aşama 2 RoCEv2 Yapılandırması:Ekip, tüm doku boyunca RoCEv2'yi etkinleştirdi, kayıpsız bir Ethernet ortamı oluşturmak için öncelik akış kontrolü (PFC) ve açık tıkanıklık bildirimi (ECN) parametrelerini dikkatlice ayarladı.Gelişmiş tıkanıklık yönetimi özellikleriMCX653105A-HDAT veri sayfasıBuferlerin en iyi şekilde tahsis edilmesine yardımcı oldular.
  • 3. aşama  NCCL Optimizasyonu:NVIDIA Toplu İletişim Kütüphanesi (NCCL), adaptörün RDMA yeteneklerini kullanmak için yeniden yapılandırıldı.Adaptörün yerleşik işleme motorlarına programlanmış özel trafik direksiyon kuralları ile LLM iş yükünün özel tüm azaltma ve tüm toplama kalıplarına optimize etmek için.
  • 4. aşama  Onay ve ince ayarlama:Telemetri verilerini kullanarakMCX653105A-HDAT özellikleri, ekip konfigürasyonu doğruladı, kesinti moderasyon ayarlarını ince ayarladı ve devam eden izleme için temel performans ölçümleri belirledi.

Özellikle, adaptörMCX653105A-HDAT uyumluMevcut kablolama altyapısı ile, QSFP28 portları hem 100GbE hem de 25GbE optiklerini desteklediği için, kablo değiştirilmeden zarif bir göç sağladı.Ekip aynı fiziksel bağlantı noktasında hem hesaplama hem de depolama işlevlerini desteklemek için adaptörün çoklu makine yeteneklerinden de yararlandı..

Sonuçlar ve faydalar: Eğitim performansında ölçülebilir kazançlar

İşe yarayan gelişmelerNVIDIA Mellanox MCX653105A-HDATYükseltmeden önceki ve sonrasındaki temel performans ölçümleri aşağıda özetlenmektedir:

Metrik Ön yükseltme (25GbE TCP/IP) Güncelleme sonrası (MCX653105A-HDAT RoCE ile) Geliştirme
Tüm-Kısaltma Gecikme (128 düğüm) 9.2 ms 0.28 ms 32.8x azaltma
Ağ CPU Kullanımı (bir düğüm başına) % 47 % 6 41 pp geri kazanılmış
GPU Kullanımı (eğitim aşaması) % 58 94% +36% artış
Grup Eğitimi Servisi 1.9x başlangıç seviyesi 5.7x başlangıç seviyesi 3 kat artış

Bu kantitatif başarıların ötesinde, ekip önemli operasyonel faydalar gözlemledi.Dramatik bir şekilde model iterasyon döngülerini hızlandırmakAdaptörün programlanabilir veri yolu, öncelikli akışlar için özel trafik şekillendirilmesini sağladı ve kritik toplu iletişim trafiğinin asla tartışma yaşamadığını sağladı.Yatırım getirisini değerlendiren kuruluşlar için,MCX653105A-HDAT fiyatı3x verim artışı ve ek GPU sunucu satın almalarını en az 12 ay erteleme yeteneği ile tamamen haklı çıktı.MCX653105A-HDAT satılıyor.NVIDIA Spectrum-4 anahtarlı paketler, tam kümelenmiş dağıtım için en uygun ekonomileri sunmuştur.

Özet & Bakış Açısı: Bir sonraki nesil yapay zeka altyapısı için bir temel

Bu üretim ölçeğinde uygulanma,NVIDIA Mellanox MCX653105A-HDATModern AI ve HPC kümeleri için dönüştürücü bir bileşen. 200 Gb/s toplu bant genişliği, 0.3 milisaniyenin altındaki toplu iletişim gecikmesi,ve kapsamlı donanım yükleri, kuruluşların GPU hızlandırılmış iş yükleri için neredeyse doğrusal ölçeklendirmeyi başarmasını sağlar.Sonundan sonuna kadarMCX653105A-HDAT Ethernet adaptör kart çözümü, tarihte dağıtılmış eğitim verimliliğini sınırlayan ağ sıkışıklığını ortadan kaldırır.

İleriye bakıldığında, işletme, iş yükü özel optimizasyonu için ek veri yolu programlanabilirliği uygulamak için NVIDIA DOCA ile entegrasyonu araştırıyor.Ayrıca adaptörün gelişmiş telemetriyi de kullanıyorlar.MCX653105A-HDAT veri sayfası¢ öngörüsel performans modelleri ve otomatik tıkanıklık azaltma stratejileri oluşturmak.NVIDIA Mellanox MCX653105A-HDATAI altyapısı yol haritasının temel taşı haline geldi ve yeni nesil temel model geliştirme ve dağıtım için sağlam, ölçeklenebilir bir temel sağladı.