NVIDIA Mellanox MCX653106A-HDAT Uygulamada: RDMA/RoCE Düşük Gecikmeli İletim ve Sunucu Verim Optimizasyonu
July 30, 2026
Dağıtık yapay zeka eğitimi ve gerçek zamanlı analizler için 256 düğümlü bir küme işleten büyük bir hiper ölçekli bulut sağlayıcısı, altyapısı ölçeklendikçe ciddi ağ performansı düşüşleri yaşamaya başladı. Mevcut 25GbE TCP/IP tabanlı ağ, 128 düğümde 6 milisaniyenin üzerinde All-Reduce gecikmeleri sergilerken, ağ işleme için CPU kullanımı her sunucunun işlem kapasitesinin %40'ından fazlasını tüketiyordu. Bu darboğaz, GPU kullanımını yalnızca %55 ile sınırlayarak eğitim döngülerini dramatik bir şekilde uzattı ve gelir getirici kapasiteyi azalttı. Ekip, hem mikrosaniye ölçekli gecikme hem de devasa bant genişliği sağlarken, iş yüküne özgü trafik optimizasyonu için gereken programlanabilirliği sunan bir çözüme ihtiyaç duyuyordu.
Kapsamlı bir teknik değerlendirmenin ardından sağlayıcı, ağ dönüşümünün temel taşı olarak NVIDIA Mellanox MCX653106A-HDAT seçti. Her sunucu düğümü, düğüm başına 200 Gb/s toplam bant genişliği sağlamak üzere çift portlu 100GbE bağlantısıyla yapılandırılmış bir MCX653106A-HDAT ConnectX adaptörü PCIe ağ kartı ile donatıldı.
- Aşama 1 — Pilot (8 düğüm):Ekip, RoCEv2'yi PFC ve ECN ile yapılandırarak kayıpsız bir Ethernet ağı oluşturmak üzere GPU sunucularının bir alt kümesine MCX653106A-HDAT Ethernet adaptör kartını yükledi. Adaptörler, uçtan uca tıkanıklık yönetimi için NVIDIA Spectrum-4 anahtarlarıyla eşleştirildi.
- Aşama 2 — Doğrulama ve Ayarlama: MCX653106A-HDAT veri sayfasındanda belgelenen telemetri verilerini kullanarak ekip, yapılandırmayı doğruladı, DCB parametrelerini ince ayar yaptı ve NCCL toplu iletişim ayarlarını optimize etti. Adaptörün gelişmiş programlanabilirlik özellikleri, iş yükünün belirli all-reduce desenleri için özel trafik yönlendirmeyi mümkün kıldı.
- Aşama 3 — Tam Üretim Dağıtımı (256 düğüm):Başarılı doğrulamanın ardından tüm küme yeni adaptöre geçirildi. Çözümün MCX653106A-HDAT uyumlu doğası, mevcut sunucular ve Linux dağıtımlarıyla sorunsuz entegrasyon sağladı.
- Aşama 4 — Sürekli Optimizasyon:Ekip, yapay zeka eğitim işleri için performansı daha da optimize etmek üzere iş yükü farkındalığına sahip yönlendirme politikaları uygulamak için adaptörün satır içi telemetri ve programlanabilir veri yolundan yararlandı.
Ekip, MCX653106A-HDAT Ethernet adaptör kartı çözümü QSFP56 portlarının hem 100GbE hem de 25GbE optikleri desteklemesi sayesinde mevcut bağlantıyı kesmeden nazik bir geçişe olanak tanıyan, basit bir geçiş yolu sağladığını belirtti.
| Metrik | Yükseltme Öncesi (25GbE TCP/IP) | Yükseltme Sonrası (MCX653106A-HDAT RoCE ile) | İyileşme |
|---|---|---|---|
| All-Reduce Gecikmesi (256 düğüm) | 6,8 ms | 0,22 ms | 30,9* azalma |
| Ağ CPU Kullanımı (düğüm başına) | %43 | %5 | 38 pp geri kazanıldı |
| GPU Kullanımı (eğitim aşaması) | %55 | %93 | +%38 artış |
| Küme Eğitim Verimi | 2,1x temel | 6,4x temel | 3,0* artış |
Bu nicel kazanımların ötesinde, sağlayıcı önemli operasyonel faydalar gözlemledi. Daha önce 14 gün süren eğitimler sadece 4,5 günde tamamlandı, bu da yeni yapay zeka hizmetleri için pazara sunma süresini önemli ölçüde hızlandırdı. Adaptörün programlanabilir veri yolu, kritik toplu iletişim trafiğinin asla rekabet yaşamamasını sağlayarak öncelikli akışlar için özel trafik şekillendirmeyi mümkün kıldı. Yatırımın geri dönüşünü değerlendiren kuruluşlar için, MCX653106A-HDAT fiyatı 3* verim artışı ve ek sunucu alımlarını 18 aydan fazla erteleme yeteneği ile tamamen haklı çıktı. Ekip ayrıca, satılık MCX653106A-HDAT paketlerinin NVIDIA Spectrum-4 anahtarlarıyla büyük ölçekli dağıtımlar için en uygun ekonomiyi sunduğunu belirtti.
Sağlayıcı ayrıca, tahmine dayalı performans modelleri ve otomatik tıkanıklık azaltma stratejileri oluşturmak için MCX653106A-HDAT spesifikasyonlarında ayrıntılı olarak belirtilen kapsamlı telemetri yeteneklerinden yararlanarak operasyonel verimliliği daha da artırdı.
Bu üretim ölçekli dağıtım, NVIDIA Mellanox MCX653106A-HDATnin modern yapay zeka ve bulut altyapısı için dönüştürücü bir bileşen olduğunu göstermektedir. 200 Gb/s toplam bant genişliği, 0,3 milisaniyenin altındaki toplu iletişim gecikmesi ve kapsamlı donanım boşaltmalarının birleşimi, GPU hızlandırmalı iş yükleri için neredeyse doğrusal ölçeklendirme sağlar. Uçtan uca bir MCX653106A-HDAT Ethernet adaptör kartı çözümü olarak, dağıtık eğitim verimliliğini ve bulut hizmeti sunumunu tarihsel olarak sınırlayan ağ darboğazını ortadan kaldırır.
İleriye dönük olarak, bulut sağlayıcısı, birden fazla kiracı ortamında iş yüküne özgü optimizasyon için ek veri yolu programlanabilirliği uygulamak üzere NVIDIA DOCA ile genişletilmiş entegrasyonu araştırıyor. Ayrıca, MCX653106A-HDAT veri sayfasında kapsamlı bir şekilde belgelenen adaptörün satır içi telemetrisinden yararlanarak yeni nesil otomatik performans yönetimi sistemleri geliştiriyorlar. NVIDIA Mellanox MCX653106A-HDAT yapay zeka altyapısı yol haritalarının temeli haline geldi ve yeni nesil temel model eğitimi ve gerçek zamanlı analiz hizmetleri için sağlam, ölçeklenebilir bir platform sağlıyor.

