NVIDIA Mellanox MCX623106AN-CDAT Sunucu Adaptörü Teknik Beyaz Kitap
July 24, 2026
NVIDIA Mellanox MCX623106AN-CDAT Sunucu Adaptörü Teknik Beyaz Kağıt
1Proje Arkaplanı ve Gereksinimler Analizi
Modern veri merkezleri yapay zekanın, büyük ölçekli makine öğrenmesinin ve gerçek zamanlı analizin patlayıcı büyümesiyle tahrik edilen bir paradigma değişikliğine maruz kalıyor.Bu iş yükleri daha önce görülmemiş bir ağ performansı gerektiriyor. Sadece ham bant genişliği değil., ancak belirleyici 5 μs'in altındaki gecikme, CPU verimli veri hareketi ve binlerce düğümde kesintisiz ölçeklenebilirlik.kritik bir sıkıntı haline geldiler., 200GbE hızlarında CPU çekirdeklerinin% 40'ına kadar tüketir ve uygulama performansını düşüren öngörülemeyen gecikme değişiklikleri getirir.Büyük ölçekli yapay zeka kümeleri (500+ GPU) veya hiper ölçekli bulut altyapısı inşa eden kuruluşlar için, bu verimsizlik doğrudan daha uzun eğitim sürelerine, daha yüksek altyapı maliyetlerine ve daha yavaş pazarlama sürelerine dönüşür.
Bu beyaz kitap,NVIDIA Mellanox MCX623106AN-CDAT200GbE yatırımlarını en üst düzeye çıkarmak isteyen kuruluşlar için tasarlanmıştır.MCX623106AN-CDAT Ethernet adaptör kartıHardware hızlandırılmış RDMA'yı Converged Ethernet (RoCE) üzerinden sunar, kaybı olmayan, ultra düşük gecikme taşımacılığını sağlar ve ağ I / O'nu ölçeklendirme sıkıntılarından rekabet avantajına dönüştürür.Çözüm, üç temel hedefi karşılamak için özel olarak tasarlanmıştır.: (1) AI kolektif iletişimleri için 5μs altındaki uçtan sona uygulama gecikme hızı elde etmek, (2) CPU ağ işleme genel masraflarını% 5'in altına düşürmek ve (3) ölçeklenebilir bir uygulama sağlamak,200GbE ve sonrası için geleceğe dayanıklı bir temel.
2Genel Ağ ve Sistem Mimarlığı Tasarımı
Önerilen mimari, 200GbE'yi sunucu erişim katmanı olarak ve 400GbE/800GbE'yi omurga katmanı olarak kullanan yüksek performanslı bir yaprak omurilik topolojisini benimser.MCX623106AN-CDAT ConnectX adaptörü PCIe ağ kartı, doku boyunca her hesaplama ve depolama düğümünde dağıtıldı.
- Kayıpsız Ethernet kumaşı:Paket düşmelerini ortadan kaldırmak ve RDMA trafiği için deterministik gecikme sağlamak için tüm anahtarlarda PFC (Öncelik Akış Kontrolü) ve ECN (Açık tıkanıklık bildirimi) ile RoCE v2'den yararlanmak.
- GPUDirect RDMA:CPU'nun katılımı olmadan ağ boyunca doğrudan GPU'dan GPU'ya iletişimi etkinleştirmek, gecikmeyi azaltmak ve işlem görevleri için CPU kaynaklarını serbest bırakmak.
- Her yerde donanım yüklenmesi:Uygulama mantığı için CPU döngülerini serbest bırakarak, taşıma, güvenlik (IPsec / MACsec) ve depolama protokollerini adaptöre indirmek.
- Aktif-Aktif Çıkarma:Her iki QSFP112 portunu da 400Gb/s toplu bant genişliği ve saniyenin altındaki kurtarma ile otomatik hata geçiş için bağlantı toplama (LACP) modunda kullanmak.
- Akıllı Trafik Mühendisliği:Uyumlu yönlendirme ve tıkanıklık sıcak noktalarını önlemek ve kumaş kullanımını en üst düzeye çıkarmak için sıra dışı paket dağıtımı.
- Tam Telemetri:Bant içi ağ telemetri (INT) ve proaktif tıkanıklık tespiti ve kapasite planlaması için akış başına izleme.
Çözüm tamamenMCX623106AN-CDAT uyumluNVIDIA GPU platformları (HGX, DGX) ve Dell, HPE, Supermicro ve Lenovo'nun önde gelen CPU sunucuları ile.Büyük ölçekli eğitim kümeleri için paylaşılan ayrıntılı depolama imkanı.
3NVIDIA Mellanox MCX623106AN-CDAT'ın Rolü ve Anahtar Özellikleri
Bu çözümün temel bileşeni olarak,NVIDIA Mellanox MCX623106AN-CDATmimaride dört kritik rolü yerine getirir:
| Görev | Uygulama Ayrıntıları | İşletme Faydaları |
|---|---|---|
| RDMA/RoCE Motoru | ECN/PFC ile donanım tabanlı RoCE v2, sub-0.6μs gecikme, GPUDirect desteği | Sıfıra yakın CPU katılım; 8 kat daha hızlı AI eğitimi için tüm azaltma |
| Çift Portlu 200GbE | İki bağımsız QSFP112 bağlantı noktası, 400Gb/s toplu işlem hızı | Bant genişliği için aktif-aktif bağlama; yedeklik için aktif bekleme |
| PCIe 5.0 Arayüzü | Gelişmiş DMA motoru ile PCIe 5.0 x16 (32 GT/s'ye kadar) | 200GbE trafiği için barındırma arayüzü sıkıntılarını ortadan kaldırır |
| Sanalleştirme ve Aşırma Yüklenmesi | Port başına en fazla 512 VF ile SR-IOV; VXLAN/NVGRE/IPsec/MACsec boşaltma | Güvenli ve hat oranı performansına sahip yüksek yoğunluklu çoklu kiralama |
Önemli teknik özelliklerMCX623106AN-CDAT veri sayfasıkapsamlı boşaltma yetenekleri (kontrol toplamı, LSO/LRO, VLAN çıkarma/ekleme, en fazla 128 kuyruğu olan RSS), gelişmiş tıkanıklık kontrol algoritmaları,ve NVIDIA'nın toplu iletişim kütüphaneleri (NCCL) için tam destek.MCX623106AN-CDAT özellikleriAyrıca 100GbE ve 50GbE uyumluluğu için desteği vurgulamak, karışık hız ortamları için dağıtım esnekliği sunmak.
4. Uygulama ve ölçeklendirme önerileri
Yeşil alan AI kümeleri için, 200GbE erişimi ve 800GbE omurilik yukarı bağlantıları ile iki katmanlı bir yaprak omurilik topolojisi öneririz.MCX623106AN-CDAT Ethernet adaptör kartıHer iki QSFP112 bağlantısı da yedeklik için ayrı yaprak anahtarlarına bağlanmıştır. RoCE kumaşı tüm anahtarlarda tutarlı QoS konfigürasyonunu gerektirir.PFC öncelik 3 (RDMA toplu trafiği için) ve öncelik 4 (depolama için), aynı trafik sınıflarında ECN işareti ile. RDMA, yönetim, depolama ve kiracı trafiği için ayrı VLAN'lar ayırmayı öneririz.
Mevcut 100GbE altyapısı olan kahverengi alan ortamları için,MCX623106AN-CDAT Ethernet adaptör kart çözümüAdaptör 100GbE QSFP56 optikleriyle geriye uyumlu olduğundan, mevcut kablolama 200GbE'ye aşamalı yükseltme sırasında tekrar kullanılabilir.Adaptör ayrıca zorunlu RoCE etkinleştirme olmadan standart Ethernet geçişini destekler, ekiplerin ilk olarak donanımı dağıtmalarına ve kumaş olgunlaştıkça ve iş yükleri geçişi haklı gösterdiğinde RDMA yeteneklerini aşama aşama etkinleştirmelerine izin verir.
Çözümün 500 düğümün ötesine ölçeklendirilmesi ek düşünceler gerektirir.Dahili telemetri ve dinamik ECN eşiği ayarlaması ile NVIDIA Spectrum-4 anahtarları kullanarak özel bir RoCE tıkanıklık yönetimi stratejisini uygulamayı öneririz. 1.000 düğümden fazla kümeler için, uçtan uca görünürlüğü ve otomatik yapılandırma tutarlılığını korumak için merkezi bir kumaş yönetimi denetleyicisi (örneğin, NVIDIA NetQ) dağıtmayı düşünün.MCX623106AN-CDAT satılıkNVIDIA'nın küresel kanal ortakları aracılığıyla kapsamlı garanti ve firmware güncelleme desteği içerir, ölçekte uzun vadeli güvenilirliği sağlar.
5İşlemler, İzleme, Sorun Çözme ve Optimizasyon
RoCE kumaşının etkili çalışması, çok katmanlı bir izleme ve sorun giderme stratejisi gerektirir:
- Adaptör düzeyinde telemetri:BuMCX623106AN-CDAT özellikleriPFC çerçeveleri, ECN işaretli paketler, düşürülen çerçeveler, bağlantı hataları ve tıkanıklık dönemleri için port başına sayaçlar içerir.
mlx5cmd,ettool, veya NVIDIA firmware araçları bu ölçümleri Prometheus / Grafana panolarına uygun uyarılarla aktarmak için. - Bant içi ağ telemetri (INT):Mikro tıkanıklık kaynaklarının kesin tanımlanmasını sağlayan kumaş boyunca akış gecikmeleri ve kuyruk derinliklerini takip etmek için adaptörün INT desteğini kullanın.
- Değiştirme seviyesi izleme:Bufer işgalini, duraklama kare sayısını, kuyruğun derinliğini ve ECN işaretleme oranlarını omurilik ve yaprak anahtarlarında izleyin.Duraklama çerçevelerinde ani artışlar, ECN eşiği ayarlamasını gerektirebilecek mikro tıkanıklığı gösterir..
- Uygulama seviyesi ölçümleri:RDMA uygulamaları için, WR (Work Request) tamamlama gecikmeleri, CQ (Completion Queue) taşınma olayları ve NVIDIA libibverbs ve rdma-core kitaplıklarını kullanarak QP (Queue Pair) hata sayımlarını izleyin.
Ortak sorun giderme senaryoları ve önerilen eylemler:
- RoCE performansının bozulması:PFC'nin tüm anahtar portlarında etkinleştirildiğini ve DSCP işaretinin anahtar konfigürasyonuna uyuştuğunu kontrol edin.MCX623106AN-CDAT veri sayfasıBufer tahsis ayarlarını iş yükü profili için önerilen değerlere karşı doğrulamak için.
- Bağlantı çarpması veya CRC hatası:QSFP112 kablo kalitesini kontrol edin (200G AOC veya DAC özelliklerine uygunluğunu garanti edin) ve adaptör yazılımının en son sürümüne güncellendiğini doğrulayın.
- GPU Direct performans sorunları:GPUDirect'in doğru şekilde başlatıldığını ve PCIe topolojisinin ara devre geçirme olmadan eşler arası DMA'yı desteklediğini doğrulayın.
- PFC çıkmaz veya duraklama fırtınası:Yanlış yapılandırılmış öncelikleri kontrol edin ve PFC'nin yalnızca RoCE trafik sınıflarında (yönetim veya depolama trafiğinde değil) etkinleştirildiğinden emin olun.
Optimizasyon için, kapsamlı laboratuvar onayına dayanan aşağıdaki ayarlama parametrelerini öneririz:
- Kesintili birleşme (temizleme):Yapay zeka eğitim iş yükleri için CPU verimliliğini korurken gecikmeyi en aza indirmek için 2 ¢ 4 μs olarak ayarlayın.
- RDMA MTU:Protokol masraflarını azaltmak ve verimliliği artırmak için tüm iletişimleri azaltmak için 4096 baytaya yükselt.
- RSS (Alış Yanı Ölçeklendirme):İşlemeyi dağıtmak ve tek çekirdekli doyumdan kaçınmak için RDMA dışı trafik için birden fazla CPU çekirdeği arasında yapılandırmak.
- ECN sınırları:Öncelik 3 trafiği için en düşük eşiği tamponun% 40'ına ve en yüksek eşiği% 75'e ayarlayın ve gözlemlenen tıkanıklık kalıplarına ve iş yükü özelliklerine göre ayarlayın.
6Özet & Değer Değerlendirme
BuNVIDIA Mellanox MCX623106AN-CDATçözüm, modern AI ölçeğinde veri merkezleri için dönüştürücü bir değer sunar. Yazılım tabanlı TCP/IP'yi donanım hızlandırılmış RDMA/RoCE ve GPUDirect ile değiştirerek,kuruluşlar uygulama düzeyinde 8 ¢ 10x gecikme azaltımları elde edebilir, CPU ağ genel masraflarını %85'ten fazla azaltır ve GPU kullanımını %70'in altından %95'in üzerine çıkarır.MCX623106AN-CDAT Ethernet adaptör kartı100GbE'ye geri uyumluluk ve gelişmekte olan iş yükleri için geleceğe hazır offload yetenekleri ile yatırım koruması ile 200GbE'ye erişmek için uygun maliyetli bir yol sağlar.
Toplam mülkiyet maliyetini değerlendirirken,MCX623106AN-CDAT fiyatıönemli operasyonel tasarruflarla dengelenir: daha kısa eğitim süresi (pazarlama süresi hızlandırılması), daha düşük sunucu sayısı (daha yüksek GPU kullanımı nedeniyle),Düşük soğutma maliyetleri (<20W güç tüketimi sayesinde), ve ayrı InfiniBand kumaşlarının ortadan kaldırılması.MCX623106AN-CDAT uyumluNVIDIA NCCL, PyTorch, TensorFlow ve MPI kütüphaneleri de dahil olmak üzere büyük AI ve HPC yazılım yığınları ile, kurumsal, bulut ve araştırma dağıtımlarında geniş uygulanabilirliği sağlar.
Ayrıntılı dağıtım komutları, yapılandırma şablonları ve performans referans raporları için lütfen resmiMCX623106AN-CDAT veri sayfasıve NVIDIA'nın kapsamlı ağ belgelendirme portalı. bu beyaz kitap bir temel olarak hizmet ederVe faydalar ölçülebilir..MCX623106AN-CDAT ConnectX adaptörü PCIe ağ kartıSadece bir adaptör değil; geleceğin AI hazır, ultra düşük gecikme verim merkezi için stratejik bir etkinleştirici.

