ادعای VAST Data و AMD: سرعت ۹ برابری در تولید اولین توکن با تخلیه کش KV در شتابدهندههای Instinct
شرکت VAST Data همکاری خود را با AMD در زمینه توسعه زیرساختهای هوش مصنوعی برای ارائهدهندگان خدمات ابری و سازمانهای بزرگ گسترش داده است. این زیرساختها به صورت ویژه برای وظایف سنگینی مثل آموزش مدلهای زبانی، استنتاج، سیستمهای RAG (تولید محتوا بر پایه بازیابی اطلاعات) و هوش مصنوعی خودمختار طراحی شدهاند. این تلاش مشترک در واقع سیستمعامل قدرتمند VAST را با پردازندههای نسل ششم EPYC، شتابدهندههای گرافیکی Instinct، تجهیزات شبکه AMD و نرمافزار ROCm یکپارچه میکند.
این همکاری نشاندهنده یک تغییر مسیر اساسی در معماری سرورها است؛ گذار از کلاسترهایی که فقط روی آموزش مدلها تمرکز داشتند، به سمت محیطهایی که باید بتوانند اطلاعات و سوابق مکالمات را حفظ کنند، پردازشهای همزمانِ زیادی را مدیریت کنند و از پس جریانهای کاری چندمرحلهایِ هوش مصنوعی خودمختار بربیایند. در چنین شرایطی، سرعت جابهجایی دادهها، مدیریت بهینه حافظه پنهان یا همان کش KV، استفاده حداکثری از توان کارت گرافیک و ایجاد دسترسی بدون تاخیر به مدلهای زبانی بزرگ، از همیشه مهمتر شده است.
- پشتیبانی از استاندارد PCIe Gen6: دو برابر شدن پهنای باند ورودی و خروجی با استفاده از پردازندههای جدید EPYC 9006.
- مدیریت بهینه حافظه: انتقال دادههای کش KV به فضای ذخیرهسازی پرسرعت، برای جلوگیری از اشغال شدن حافظه گرانقیمت کارت گرافیک.
- عملکرد خیرهکننده: افزایش ۹ برابری سرعت در تولید اولین توکن و بهبود ۹.۷ برابری در توان پردازشی توکنها با کارت گرافیک Instinct MI355X.
- شبکهسازی پرسرعت: استفاده از کارت شبکه تخصصی Pensando Pollara 400 برای ارتباط مستقیم گرافیک با فضای ذخیرهسازی.
پلتفرمهای EPYC 9006 برای سیستمهای VAST CBox و EBox
شرکت VAST تصمیم گرفته برای پلتفرمهای نسل جدید خود، از پردازندههای نسل ششم AMD EPYC (با اسم رمز پیشین Venice) استفاده کند. این شرکت برنامهریزی کرده تا این پردازندهها را در سیستمهای نسل ششم CBox و نسل سوم EBox به کار بگیرد؛ تجهیزاتی که در واقع قلب تپنده سیستمعامل هوش مصنوعی VAST محسوب میشوند.
استفاده از پردازندههای EPYC 9006، استاندارد ارتباطی PCIe Gen6 را به پلتفرم سختافزاری VAST اضافه میکند. طبق اعلام این شرکت، رابط جدید باعث میشود پهنای باند ورودی و خروجی سیستم نسبت به نسل قبلی دو برابر شود. این ارتقا هم سرعت خواندن و نوشتن فایلها را بالا میبرد و هم تاخیر را در سرویسهای پایگاه داده و پردازشهای رویدادمحور کاهش میدهد.
در دنیای هوش مصنوعی، پهنای باندِ بالاتر میتواند گلوگاههای سرعت را در ارتباط بین پردازنده، شبکه و درایوهای NVMe از بین ببرد. این ویژگی مخصوصاً زمانِ بارگذاری مدلهای سنگین، جستجو در اطلاعات و مدیریت کش KV اهمیت حیاتی پیدا میکند؛ یعنی دقیقاً در مواقعی که حافظه خود کارت گرافیک به تنهایی جوابگوی حجم بالای اطلاعات نیست.
معماری مرجع؛ ترکیبی از Helios، VAST و DriveNets
در کنار این موارد، سه شرکت VAST، AMD و DriveNets در حال طراحی یک معماری استاندارد و مرجع برای زیرساختهای هوش مصنوعی هستند. این ساختار جدید بر پایه تجهیزات شبکهای AMD Helios، نرمافزار VAST و بستر ارتباطی DriveNets AI Fabric شکل گرفته است.
هدف از ارائه این معماری، راهنمایی مهندسان شبکه برای راهاندازی اصولیِ سیستمهای آموزش مدل، استنتاج و یادگیری ماشین است. این سند مرجع به سازمانهایی که در حال ساخت دیتاسنترهای تخصصی هوش مصنوعی هستند کمک میکند تا زیرساختهای شبکه و فضای ذخیرهسازی خود را به بهترین شکل در کنار کارتهای گرافیک هماهنگ کنند.
تخلیه کش KV با هدف بهبود پردازشهای همزمان و سنگین
یکی از مهمترین بخشهای این معرفی، توسعه پشتیبانی از قابلیت کش KV با استفاده از گرافیکهای AMD Instinct، فناوری Infinity Context و نرمافزار ROCm است.
در مدلهای زبانی هوش مصنوعی، حافظهای به نام کش KV وجود دارد که سوابق و جریان مکالمات را در خود ذخیره میکند. حفظ این اطلاعات باعث میشود چتباتها و دستیارهای هوشمند در مکالمات طولانی دچار فراموشی نشوند و پاسخهای دقیقتری بدهند. اما مشکل اینجاست که با طولانی شدن مکالمات، این دادهها بخش زیادی از حافظه ارزشمند کارت گرافیک را پر میکنند. راهکار جدید VAST این است که این اطلاعات اضافی را از حافظه گرافیک خارج کرده و به فضاهای ذخیرهسازی پرسرعت منتقل کند. با این کار، حافظه GPU برای پردازشهای اصلی و مهمتر آزاد میماند.
شرکت VAST به تازگی نتایج آزمایش این فناوری را روی پردازنده گرافیکی قدرتمند Instinct MI355X منتشر کرده است. نتایج نشان میدهد با استفاده از این روش برای مدیریت بارهای کاریِ هوش مصنوعی خودمختار، زمان لازم برای تولید اولین کلمه یا توکن تا ۹ برابر کاهش یافته و توان پردازشی کل سیستم ۹.۷ برابر بیشتر شده است.
اتصال کارتهای گرافیک به فضای ذخیرهسازی با Pensando Pollara 400
این معماری برای اینکه کارتهای گرافیک را با بالاترین سرعت به سرورهای ذخیرهسازی متصل کند، از یک کارت شبکه تخصصی به نام Pensando Pollara 400 کمک میگیرد. به گفته VAST، این سختافزار میتواند دادهها را به صورت مستقیم و بدون واسطه بین گرافیک و درایوهای NVMe جابهجا کند تا در پردازشهای سنگین هیچ افت سرعتی اتفاق نیفتد.
طراحی نهایی این سیستم به گونهای است که نیاز به ارتقای مداومِ ظرفیت حافظه گرافیکها را از بین میبرد. شرکت VAST به جای اینکه فضای ذخیرهسازی را فقط محلی برای انبار کردن فایلها ببیند، پلتفرم خود را به عنوان یک سیستم یکپارچه معرفی کرده که میتواند همزمان مدلها، پایگاههای داده و اطلاعات مربوط به جریان پردازش را در کل دیتاسنتر با بالاترین سرعت ممکن مدیریت کند.
تحلیل اختصاصی آلفاتک: اهمیت مدیریت دادهها در هوش مصنوعی مدرن
با پیشرفت هوش مصنوعی از چتباتهای ساده به سمت دستیارهای خودمختار و مستقلی که میتوانند کارهای چندمرحلهای انجام دهند، محدودیت حافظه VRAM در کارتهای گرافیک به یک چالش بزرگ برای دیتاسنترها تبدیل شده است.
راهکار مشترک VAST و AMD دقیقاً همین مشکل اساسی را حل میکند. با انتقال دادههای حجیم مکالمات (همان کش KV) از حافظه گرانقیمت کارت گرافیک به درایوهای فوقسریع NVMe، شرکتهای ارائهدهنده خدمات ابری میتوانند بدون نیاز به خرید گرافیکهای جدید و پرهزینه، توان پردازشی و کیفیت سرویسهای خود را به شکل چشمگیری افزایش دهند. این اتفاق به معنای بهرهوری بسیار بالاتر از سختافزارهای موجود و کاهش جدی هزینهها در صنعت هوش مصنوعی خواهد بود.


