وقتی GPU سریع است، اما شبکه عقب می‌ماند

در زیرساخت‌های جدید AI، دیگر فقط این سؤال مهم نیست که «چه GPUای داریم؟»

یک سؤال مهم‌تر هم کنار آن قرار گرفته است:
داده با چه سرعتی بین GPUها جابه‌جا می‌شود؟

اگر شبکه و Fabric نتوانند هم‌پای پردازنده‌ها کار کنند، حتی قدرتمندترین GPUها هم بخشی از زمان خود را منتظر می‌مانند. این یعنی بخشی از سرمایه‌گذاری سخت‌افزاری عملاً بدون استفاده کامل باقی می‌ماند.

به نظرم همین موضوع، دلیل اصلی توجه NVIDIA به Interconnect در نسل Vera Rubin است. این شرکت فقط روی افزایش قدرت پردازش تمرکز نکرده؛ بلکه ارتباط داخل Rack و ارتباط بین Rackها را هم به بخش اصلی معماری تبدیل کرده است.

دو سطح مهم این تغییر:

  • Scale-Up: ارتباط سریع‌تر GPUهای داخل یک Rack تا بتوانند بیشتر شبیه یک سیستم یکپارچه کار کنند.
  • Scale-Out: ارتباط سریع‌تر بین Rackها و نودهای مختلف برای توسعه زیرساخت AI در مقیاس بزرگ‌تر.

در NVLink 6، NVIDIA پهنای‌باند ارتباطی داخل Rack را نسبت به نسل Blackwell افزایش داده و در سمت شبکه هم ConnectX-9 و Spectrum-X Photonics را برای مقیاس‌های بزرگ‌تر توسعه داده است.

اما نکته مهم برای سازمان‌ها، خودِ عدد پهنای‌باند نیست.

نکته مهم این است که معماری AI دارد از «چند GPU متصل به هم» به سمت «یک Fabric یکپارچه» حرکت می‌کند.

این تغییر برای پروژه‌های بزرگ AI اهمیت بیشتری دارد؛ چون مدل‌های توزیع‌شده، Mixture-of-Experts و Agentic AI حجم زیادی از تبادل داده بین GPUها ایجاد می‌کنند. در چنین شرایطی، سرعت ارتباط می‌تواند به اندازه قدرت پردازش تعیین‌کننده باشد.

برای تیم‌های زیرساخت، نتیجه روشن است: هنگام طراحی AI Infrastructure فقط مدل GPU را مقایسه نکنیم.

  • پهنای‌باند و تأخیر شبکه
  • ازدحام شبکه
  • Scale-Up Fabric و Scale-Out Network
  • برق و خنک‌کاری
  • قابلیت توسعه در آینده

همه این موارد امروز بخشی از تصمیم معماری هستند، نه جزئیات جانبی.

البته اعداد اعلام‌شده توسط سازنده را هم باید با احتیاط دید. نتیجه واقعی به Workload، توپولوژی، Software Stack و مقیاس استقرار بستگی دارد. به نظرم در نسل بعدی AI Factory، مزیت رقابتی فقط از «GPU قوی‌تر» نمی‌آید؛ از هماهنگی بهتر Compute، Network و Fabric به دست می‌آید.

به بالا بروید
Scroll to Top