تحول حافظه در NVIDIA؛ چرا رقابت AI دیگر فقط روی قدرت GPU نیست؟

وقتی درباره زیرساخت هوش مصنوعی صحبت می‌کنیم، معمولاً اولین توجه به قدرت GPU است. اما یک محدودیت مهم‌تر گاهی دیر دیده می‌شود: حافظه.

اگر مدل در حافظه جا نشود یا داده با سرعت کافی به پردازنده نرسد، حتی GPU قدرتمند هم نمی‌تواند از تمام ظرفیت خود استفاده کند.

به نظرم مسیر چند نسل اخیر NVIDIA یک پیام روشن دارد:

در AI، «ظرفیت حافظه» و «سرعت رساندن داده به GPU» به اندازه خود قدرت پردازشی اهمیت پیدا کرده‌اند.

این روند را می‌شود در چند مرحله دید:

• در گذار A100 به H100، ظرفیت حافظه در برخی نسخه‌های SXM همان ۸۰ گیگابایت ماند، اما پهنای باند از حدود ۲ به ۳٫۳۵ ترابایت‌برثانیه افزایش یافت؛ یعنی تمرکز اصلی روی سرعت دسترسی به داده بود.

• در H200، ظرفیت به ۱۴۱ گیگابایت و پهنای باند به ۴٫۸ ترابایت‌برثانیه رسید؛ فضای بیشتر برای مدل و داده‌های حین اجرا، همراه با سرعت بالاتر.

• در Blackwell، B200 تا ۱۸۰ گیگابایت حافظه و حداکثر ۸ ترابایت‌برثانیه پهنای باند دارد؛ در B300 ظرفیت تا ۲۸۸ گیگابایت افزایش یافته است.

• در Rubin، طبق مشخصات اولیه NVIDIA، هر GPU تا ۲۸۸ گیگابایت HBM4 و تا ۲۲ ترابایت‌برثانیه پهنای باند خواهد داشت؛ مشخصاتی که هنوز ممکن است تغییر کنند.

نکته جالب این است که این تغییرات فقط «عدد بزرگ‌تر» نیستند.

حافظه بیشتر می‌تواند اجرای مدل‌های بزرگ‌تر، متن‌های طولانی‌تر و تعداد بیشتری درخواست هم‌زمان را ممکن کند. پهنای باند بیشتر هم در بارهای کاری‌ای که منتظر انتقال داده هستند، زمان بیکاری GPU را کاهش می‌دهد.

و اینجا یک تغییر مهم‌تر دیده می‌شود:

NVIDIA مدیریت حافظه را از خود GPU فراتر برده و به سطح کل سیستم می‌برد؛ از ارتباط هماهنگ‌تر حافظه CPU و GPU تا استفاده از KV Cache برای جلوگیری از محاسبات تکراری.

پس هنگام انتخاب یک سرور AI، فقط این سؤال کافی نیست که «کدام GPU سریع‌تر است؟»

سه سؤال عملی‌تر باید پرسیده شود:

• مدل و بار کاری واقعاً چقدر حافظه نیاز دارند؟

• چه پهنای باندی برای رساندن داده به GPU لازم است؟

• داده بین چند GPU چگونه جابه‌جا می‌شود؟

در نهایت، شاید یکی از مهم‌ترین تغییرات زیرساخت AI همین باشد: GPU قدرتمند بدون حافظه مناسب، الزاماً زیرساخت سریع‌تری نمی‌سازد.

به بالا بروید
Scroll to Top