وقتی درباره زیرساخت هوش مصنوعی صحبت میکنیم، معمولاً اولین توجه به قدرت GPU است. اما یک محدودیت مهمتر گاهی دیر دیده میشود: حافظه.
اگر مدل در حافظه جا نشود یا داده با سرعت کافی به پردازنده نرسد، حتی GPU قدرتمند هم نمیتواند از تمام ظرفیت خود استفاده کند.
به نظرم مسیر چند نسل اخیر NVIDIA یک پیام روشن دارد:
در AI، «ظرفیت حافظه» و «سرعت رساندن داده به GPU» به اندازه خود قدرت پردازشی اهمیت پیدا کردهاند.
این روند را میشود در چند مرحله دید:
• در گذار A100 به H100، ظرفیت حافظه در برخی نسخههای SXM همان ۸۰ گیگابایت ماند، اما پهنای باند از حدود ۲ به ۳٫۳۵ ترابایتبرثانیه افزایش یافت؛ یعنی تمرکز اصلی روی سرعت دسترسی به داده بود.
• در H200، ظرفیت به ۱۴۱ گیگابایت و پهنای باند به ۴٫۸ ترابایتبرثانیه رسید؛ فضای بیشتر برای مدل و دادههای حین اجرا، همراه با سرعت بالاتر.
• در Blackwell، B200 تا ۱۸۰ گیگابایت حافظه و حداکثر ۸ ترابایتبرثانیه پهنای باند دارد؛ در B300 ظرفیت تا ۲۸۸ گیگابایت افزایش یافته است.
• در Rubin، طبق مشخصات اولیه NVIDIA، هر GPU تا ۲۸۸ گیگابایت HBM4 و تا ۲۲ ترابایتبرثانیه پهنای باند خواهد داشت؛ مشخصاتی که هنوز ممکن است تغییر کنند.
نکته جالب این است که این تغییرات فقط «عدد بزرگتر» نیستند.
حافظه بیشتر میتواند اجرای مدلهای بزرگتر، متنهای طولانیتر و تعداد بیشتری درخواست همزمان را ممکن کند. پهنای باند بیشتر هم در بارهای کاریای که منتظر انتقال داده هستند، زمان بیکاری GPU را کاهش میدهد.
و اینجا یک تغییر مهمتر دیده میشود:
NVIDIA مدیریت حافظه را از خود GPU فراتر برده و به سطح کل سیستم میبرد؛ از ارتباط هماهنگتر حافظه CPU و GPU تا استفاده از KV Cache برای جلوگیری از محاسبات تکراری.
پس هنگام انتخاب یک سرور AI، فقط این سؤال کافی نیست که «کدام GPU سریعتر است؟»
سه سؤال عملیتر باید پرسیده شود:
• مدل و بار کاری واقعاً چقدر حافظه نیاز دارند؟
• چه پهنای باندی برای رساندن داده به GPU لازم است؟
• داده بین چند GPU چگونه جابهجا میشود؟
در نهایت، شاید یکی از مهمترین تغییرات زیرساخت AI همین باشد: GPU قدرتمند بدون حافظه مناسب، الزاماً زیرساخت سریعتری نمیسازد.
