NVIDIA Mellanox MCX623106AN-CDAT Sunucu Adaptörü Hareket Halinde.

July 22, 2026

hakkında en son şirket haberleri NVIDIA Mellanox MCX623106AN-CDAT Sunucu Adaptörü Hareket Halinde.

NVIDIA Mellanox MCX623106AN-CDAT Sunucu Adaptörü Uygulamada | RDMA/RoCE Düşük Gecikmeli İletim ve Sunucu Verimliliği Artışı

Arka Plan ve Zorluk: 200GbE Yapay Zeka Ölçeklendirme Duvarıyla Karşılaştığında

Hızla büyüyen bir yapay zeka araştırma organizasyonu — onlara "DeepCore Labs" diyelim — kritik bir ölçeklendirme darboğazıyla karşı karşıyaydı. 128 düğüme dağıtılmış 512 NVIDIA H100 GPU'dan oluşan amiral gemisi büyük dil modeli eğitim kümesi, 64 düğümün ötesine ölçeklendikçe ciddi performans düşüşleri yaşıyordu. Sorun hesaplama veya bellek değil, ağ yapısıydı. All-reduce senkronizasyon gradyanları iterasyon başına 15 saniyeden fazla sürüyordu ve ağ duraklamaları nedeniyle GPU kullanımı yalnızca %62'ye düşmüştü. Yazılım tabanlı TCP/IP'ye dayanan mevcut 100GbE altyapıları, dağıtılmış eğitimin ani, gecikmeye duyarlı iletişim modellerini kaldıramıyordu. Ekip, mikrosaniye düzeyinde deterministik gecikmeyle hat hızında 200GbE verimi sağlayabilen bir çözüme ihtiyaç duyuyordu.

Değerlendirmeleri onları şuraya yönlendirdi:NVIDIA Mellanox MCX623106AN-CDAT — en zorlu yapay zeka ve HPC iş yükleri için tasarlanmış 200GbE sunucu adaptörü. Araştırma ekibi şunları fark etti:MCX623106AN-CDAT ConnectX adaptörü PCIe ağ kartıağ darboğazını ortadan kaldırmak ve GPU kullanımını en üst düzeye çıkarmak için gereken gelişmiş boşaltmaları ve GPUDirect yeteneklerini sundu.

Çözüm: MCX623106AN-CDAT Ethernet Adaptör Kartının Dağıtılması

DeepCore Labs dağıttıMCX623106AN-CDAT Ethernet adaptör kartıher sunucuda NVIDIA Spectrum-4 anahtarlarına dayalı bir yaprak-omurga yapısına bağlı çift portlu bir QSFP112 adaptörü bulunan 128 eğitim düğümünün tamamına yayıldı. Dağıtım, ayrı bir InfiniBand yapısına olan ihtiyacı ortadan kaldırarak kayıpsız Ethernet iletimini etkinleştirmek için adaptörün yerel RoCE v2 desteğinden yararlandı. Çözümün anahtarı, adaptörün CPU müdahalesi olmadan GPU'lar arasında ağ üzerinden doğrudan veri hareketini sağlayan GPUDirect RDMA yeteneğiydi — senkronizasyon ek yükünü azaltmak için kritik bir özellik.

Ekip, toplu iletişim trafiği için öncelik 3'ü ve depolama G/Ç için öncelik 4'ü ayırarak anahtar düzeyinde PFC (Öncelik Akış Kontrolü) ve ECN (Açık Tıkanıklık Bildirimi) yapılandırdı. Ayrıca, noktaları en aza indirmek için trafiği birden çok yol boyunca dinamik olarak dağıtmak üzere NVIDIA'nın uyarlanabilir yönlendirme teknolojisini uyguladılar. Dört hafta içinde, tüm eğitim yapısı RDMA üzerinde çalışıyordu ve tüm 512 GPU, RoCE üzerinden sorunsuz bir şekilde iletişim kuruyordu. MCX623106AN-CDAT uyumlu ekosistemi sağlam çıktı — kartlar, H100 tabanlı sunucular ve NVIDIA'nın NCCL (NVIDIA Toplu İletişim Kütüphanesi) ile herhangi bir değişiklik yapmadan kusursuz bir şekilde entegre oldu.

Ekip şunlara başvurdu:MCX623106AN-CDAT veri sayfasındahem senkron eğitim (all-reduce ağırlıklı) hem de asenkron kontrol noktası oluşturma dahil olmak üzere karışık iş yükü ortamları için optimum performansı elde etmek üzere arabellek ayırma ve tıkanıklık kontrol parametrelerini ince ayarlamak için.

Ölçülebilir Sonuçlar: Ölçeklendirme Verimliliği, Verim ve GPU Kullanımı

Performans artışı dönüştürücüydü. NVIDIA Mellanox MCX623106AN-CDAT aracılığıyla etkinleştirilen RDMA over RoCE ile, all-reduce senkronizasyon gecikmesi ortalama 15,2 saniyeden iterasyon başına yalnızca 1,8 saniyeye düştü — 8,4 kat iyileşme. Bu, doğrudan daha hızlı model yakınsamasına dönüştü: 70B parametreli modelleri için toplam eğitim süresi 42 günden 19 güne düştü ve araştırma döngülerini %50'den fazla hızlandırdı.

Ağ duraklamaları nedeniyle %62'de kalan GPU kullanımı, yükseltmeden sonra %94'e sıçradı — etkili hesaplama kapasitesinde %52'lik bir iyileşme. Adaptörün gelişmiş sıra dışı veri yerleştirme ve paket hızlandırma özellikleri, kuyruk gecikmesi artışlarına neden olan mikro patlamaları ortadan kaldırarak tüm düğümlerde tutarlı performans sağladı.

Eğitim performansının ötesinde, sunucu verimliliği artışları da aynı derecede etkileyiciydi. Donanım boşaltma motoru — sağlama toplamı boşaltma, LSO/LRO ve RoCE hızlandırma dahil — ağ işleme için CPU kullanımını tüm düğümlerde %38'den %4'ün altına düşürdü. Bu, daha önce kısıtlanmış olan veri ön işleme, kontrol noktası sıkıştırma ve diğer yardımcı görevler için önemli CPU kapasitesi serbest bıraktı.

Metrik Önce (Eski 100GbE NIC) Sonra (MCX623106AN-CDAT) İyileşme
All-Reduce Gecikmesi (iterasyon başına) 15,2 s 1,8 s 8,4 kat daha hızlı
GPU Kullanımı %62 %94 %52 daha yüksek
Model Eğitim Süresi (70B parametre) 42 gün 19 gün %55 daha hızlı
CPU Ağ Ek Yükü %38 %4'ün altında %89 daha düşük
NVMe-oF Okuma Gecikmesi (depolama) 185 µs 12 µs 15 kat daha hızlı

Operasyonel Faydalar: TCO ve Altyapı Verimliliği

Performans artışları dramatik olsa da, operasyonel ve finansal faydalar da aynı derecede dikkat çekiciydi. MCX623106AN-CDAT Ethernet adaptör kartı çözümüayrı bir InfiniBand yapısına olan ihtiyacı ortadan kaldırarak toplam sahip olma maliyetini düşürdü — anahtar altyapı maliyetlerinde 500 bin doların üzerinde tasarruf sağladı. Adaptörün enerji açısından verimli tasarımı (kart başına 20W'ın altında) 128 düğümlü küme genelinde ölçülebilir güç tasarruflarına katkıda bulundu ve yıllık soğutma giderlerini tahmini olarak %18 azalttı.

IT yöneticileri değerlendirirkenMCX623106AN-CDAT fiyatıalternatif çözümlere karşı, DeepCore'un altyapı yöneticisi, geri ödeme süresinin altı aydan az olduğunu belirtti — öncelikle ürün geliştirme hattını doğrudan hızlandıran azalan eğitim süresinden kaynaklanıyordu. Ekip ayrıca adaptörün geleceğe dönüklüğünü de takdir etti: aynı satılık MCX623106AN-CDAT bugün 200GbE'yi destekliyor ancak hibrit hız ortamları ve aşamalı yükseltmeler için esneklik sağlayarak 100GbE ve 50GbE optiklerle de uyumludur.

GöreMCX623106AN-CDAT özellikleriadaptör, yerleşik ağ telemetrisi (INT) ve akış başına gecikme takibi dahil olmak üzere kapsamlı telemetri özellikleri içerir. DeepCore, bu metrikleri Prometheus/Grafana yığınlarına entegre ederek, eğitim performansını etkilemeden önce mikro tıkanıklığın proaktif olarak tespit edilmesini sağladı. Ekip ayrıca, kontrol noktası oluşturma işlemleri sırasında bile kayıpsız davranışı sürdürmek için adaptörün tıkanıklık kontrol algoritmalarından yararlanarak ECN eşiklerini dinamik olarak ayarladı.

Özet ve Görünüm: Yapay Zeka Ölçekli Ağ Oluşturma İçin Bir Plan

DeepCore Labs'ın NVIDIA Mellanox MCX623106AN-CDAT ile yolculuğu, yapay zeka altyapısı oluşturan veya ölçeklendiren kuruluşlar için net bir plan ortaya koyuyor. Çift portlu 200GbE verimi, PCIe 5.0 ana bilgisayar arayüzü ve GPUDirect özellikli RDMA'yı birleştirerek, MCX623106AN-CDAT Ethernet adaptör kartı ağı bir ölçeklendirme darboğazından bir performans çarpanına dönüştürür. Sonuçlar — 8,4 kat daha hızlı all-reduce, %94 GPU kullanımı ve %55 daha hızlı eğitim döngüleri — adaptörün en zorlu hesaplama ortamlarında somut iş sonuçları sunma yeteneğini gösteriyor.

İleriye bakıldığında, model boyutları her birkaç ayda bir ikiye katlanmaya devam ederken ve dağıtılmış eğitim kümeleri binlerce GPU'ya genişlerken, MCX623106AN-CDAT ConnectX adaptörü PCIe ağ kartı kayıpsız, ultra düşük gecikmeli yapılar için sağlam bir temel sağlar. Bir sonraki yapay zeka altyapı yatırımlarını planlayan mimarlar ve BT liderleri için bu adaptör, yalnızca bir bileşen değil, rekabetçi farklılaşma için stratejik bir kolaylaştırıcıdır. Ayrıntılı ince ayar parametreleri, dağıtım komut dosyaları ve performans kıyaslama raporları resmi MCX623106AN-CDAT veri sayfasında — herhangi bir büyük ölçekli yapay zeka dağıtımı için temel bir referans olarak mevcuttur.