در بسیاری از پروژههای هوش مصنوعی، اولین سؤال این است:
چه GPUای بخریم؟
اما بهنظر من، این سؤال فقط بخشی از مسئله را پوشش میدهد.
NVIDIA امروز دیگر فقط یک تولیدکننده GPU نیست. مجموعهای از فناوریهای پردازشی، شبکهای، ارتباطی و نرمافزاری را کنار هم قرار داده که عملاً روی معماری کامل زیرساخت AI تأثیر میگذارد.
فناوریهایی مثل NVLink و NVSwitch برای ارتباط بین GPUها، GPUDirect برای جابهجایی سریعتر داده، InfiniBand و Spectrum-X برای شبکه و BlueField برای مدیریت بخشی از پردازشهای زیرساخت، نشان میدهند که ماجرا خیلی فراتر از انتخاب یک کارت قدرتمند است.
مشکل زمانی شروع میشود که بخش زیادی از بودجه صرف GPU شود، اما بقیه زیرساخت متناسب با آن نباشد.
• اگر شبکه کند باشد،
• اگر Storage نتواند داده را با سرعت کافی تحویل دهد،
• اگر برق و خنکسازی مناسب نباشد،
• یا نرمافزار و مجازیسازی درست انتخاب نشده باشند،
حتی یک GPU بسیار قدرتمند هم لزوماً نتیجهای که انتظار داریم ایجاد نمیکند.
اینجاست که تفاوت بین خرید تجهیزات و طراحی زیرساخت مشخص میشود.
برای بسیاری از سازمانها شاید منطقیتر باشد که بهجای شروع با یک معماری بسیار بزرگ و پرهزینه، ابتدا با یک سرور GPUدار مناسب شروع کنند و سپس متناسب با نیاز واقعی، زیرساخت را توسعه دهند.
به نظرم بازار AI Infrastructure بهوضوح به این سمت حرکت میکند:
دیگر نمیتوان Compute، Network، Storage، Software، Power و Cooling را جدا از هم دید.
پس قبل از اینکه بپرسیم:
«کدام GPU قویتر است؟»
شاید بهتر باشد بپرسیم:
«آیا کل زیرساخت ما آماده استفاده واقعی از آن GPU هست؟»
