صفحه اصلی > اخبار : ادعای VAST Data و AMD: سرعت ۹ برابری در تولید اولین توکن با تخلیه کش KV در شتاب‌دهنده‌های Instinct

ادعای VAST Data و AMD: سرعت ۹ برابری در تولید اولین توکن با تخلیه کش KV در شتاب‌دهنده‌های Instinct

ادعای VAST Data و AMD: سرعت ۹ برابری در تولید اولین توکن با تخلیه کش KV در شتاب‌دهنده‌های Instinct

شرکت VAST Data همکاری خود را با AMD در زمینه توسعه زیرساخت‌های هوش مصنوعی برای ارائه‌دهندگان خدمات ابری و سازمان‌های بزرگ گسترش داده است. این زیرساخت‌ها به صورت ویژه برای وظایف سنگینی مثل آموزش مدل‌های زبانی، استنتاج، سیستم‌های RAG (تولید محتوا بر پایه بازیابی اطلاعات) و هوش مصنوعی خودمختار طراحی شده‌اند. این تلاش مشترک در واقع سیستم‌عامل قدرتمند VAST را با پردازنده‌های نسل ششم EPYC، شتاب‌دهنده‌های گرافیکی Instinct، تجهیزات شبکه AMD و نرم‌افزار ROCm یکپارچه می‌کند.

این همکاری نشان‌دهنده یک تغییر مسیر اساسی در معماری سرورها است؛ گذار از کلاسترهایی که فقط روی آموزش مدل‌ها تمرکز داشتند، به سمت محیط‌هایی که باید بتوانند اطلاعات و سوابق مکالمات را حفظ کنند، پردازش‌های همزمانِ زیادی را مدیریت کنند و از پس جریان‌های کاری چندمرحله‌ایِ هوش مصنوعی خودمختار بربیایند. در چنین شرایطی، سرعت جابه‌جایی داده‌ها، مدیریت بهینه حافظه پنهان یا همان کش KV، استفاده حداکثری از توان کارت گرافیک و ایجاد دسترسی بدون تاخیر به مدل‌های زبانی بزرگ، از همیشه مهم‌تر شده است.

پلتفرم‌های EPYC 9006 برای سیستم‌های VAST CBox و EBox

شرکت VAST تصمیم گرفته برای پلتفرم‌های نسل جدید خود، از پردازنده‌های نسل ششم AMD EPYC (با اسم رمز پیشین Venice) استفاده کند. این شرکت برنامه‌ریزی کرده تا این پردازنده‌ها را در سیستم‌های نسل ششم CBox و نسل سوم EBox به کار بگیرد؛ تجهیزاتی که در واقع قلب تپنده سیستم‌عامل هوش مصنوعی VAST محسوب می‌شوند.

استفاده از پردازنده‌های EPYC 9006، استاندارد ارتباطی PCIe Gen6 را به پلتفرم سخت‌افزاری VAST اضافه می‌کند. طبق اعلام این شرکت، رابط جدید باعث می‌شود پهنای باند ورودی و خروجی سیستم نسبت به نسل قبلی دو برابر شود. این ارتقا هم سرعت خواندن و نوشتن فایل‌ها را بالا می‌برد و هم تاخیر را در سرویس‌های پایگاه داده و پردازش‌های رویدادمحور کاهش می‌دهد.

در دنیای هوش مصنوعی، پهنای باندِ بالاتر می‌تواند گلوگاه‌های سرعت را در ارتباط بین پردازنده، شبکه و درایوهای NVMe از بین ببرد. این ویژگی مخصوصاً زمانِ بارگذاری مدل‌های سنگین، جستجو در اطلاعات و مدیریت کش KV اهمیت حیاتی پیدا می‌کند؛ یعنی دقیقاً در مواقعی که حافظه خود کارت گرافیک به تنهایی جوابگوی حجم بالای اطلاعات نیست.

معماری مرجع؛ ترکیبی از Helios، VAST و DriveNets

زیرساخت هوش مصنوعی AMD Helios در کنار VAST Data

در کنار این موارد، سه شرکت VAST، AMD و DriveNets در حال طراحی یک معماری استاندارد و مرجع برای زیرساخت‌های هوش مصنوعی هستند. این ساختار جدید بر پایه تجهیزات شبکه‌ای AMD Helios، نرم‌افزار VAST و بستر ارتباطی DriveNets AI Fabric شکل گرفته است.

هدف از ارائه این معماری، راهنمایی مهندسان شبکه برای راه‌اندازی اصولیِ سیستم‌های آموزش مدل، استنتاج و یادگیری ماشین است. این سند مرجع به سازمان‌هایی که در حال ساخت دیتاسنترهای تخصصی هوش مصنوعی هستند کمک می‌کند تا زیرساخت‌های شبکه و فضای ذخیره‌سازی خود را به بهترین شکل در کنار کارت‌های گرافیک هماهنگ کنند.

تخلیه کش KV با هدف بهبود پردازش‌های همزمان و سنگین

شتاب دهنده های گرافیکی سری AMD Instinct MI350

یکی از مهم‌ترین بخش‌های این معرفی، توسعه پشتیبانی از قابلیت کش KV با استفاده از گرافیک‌های AMD Instinct، فناوری Infinity Context و نرم‌افزار ROCm است.

در مدل‌های زبانی هوش مصنوعی، حافظه‌ای به نام کش KV وجود دارد که سوابق و جریان مکالمات را در خود ذخیره می‌کند. حفظ این اطلاعات باعث می‌شود چت‌بات‌ها و دستیارهای هوشمند در مکالمات طولانی دچار فراموشی نشوند و پاسخ‌های دقیق‌تری بدهند. اما مشکل اینجاست که با طولانی شدن مکالمات، این داده‌ها بخش زیادی از حافظه ارزشمند کارت گرافیک را پر می‌کنند. راهکار جدید VAST این است که این اطلاعات اضافی را از حافظه گرافیک خارج کرده و به فضاهای ذخیره‌سازی پرسرعت منتقل کند. با این کار، حافظه GPU برای پردازش‌های اصلی و مهم‌تر آزاد می‌ماند.

شرکت VAST به تازگی نتایج آزمایش این فناوری را روی پردازنده گرافیکی قدرتمند Instinct MI355X منتشر کرده است. نتایج نشان می‌دهد با استفاده از این روش برای مدیریت بارهای کاریِ هوش مصنوعی خودمختار، زمان لازم برای تولید اولین کلمه یا توکن تا ۹ برابر کاهش یافته و توان پردازشی کل سیستم ۹.۷ برابر بیشتر شده است.

اتصال کارت‌های گرافیک به فضای ذخیره‌سازی با Pensando Pollara 400

کارت شبکه هوش مصنوعی AMD Pensando Pollara 400

این معماری برای اینکه کارت‌های گرافیک را با بالاترین سرعت به سرورهای ذخیره‌سازی متصل کند، از یک کارت شبکه تخصصی به نام Pensando Pollara 400 کمک می‌گیرد. به گفته VAST، این سخت‌افزار می‌تواند داده‌ها را به صورت مستقیم و بدون واسطه بین گرافیک و درایوهای NVMe جابه‌جا کند تا در پردازش‌های سنگین هیچ افت سرعتی اتفاق نیفتد.

طراحی نهایی این سیستم به گونه‌ای است که نیاز به ارتقای مداومِ ظرفیت حافظه گرافیک‌ها را از بین می‌برد. شرکت VAST به جای اینکه فضای ذخیره‌سازی را فقط محلی برای انبار کردن فایل‌ها ببیند، پلتفرم خود را به عنوان یک سیستم یکپارچه معرفی کرده که می‌تواند همزمان مدل‌ها، پایگاه‌های داده و اطلاعات مربوط به جریان پردازش را در کل دیتاسنتر با بالاترین سرعت ممکن مدیریت کند.

تحلیل اختصاصی آلفاتک: اهمیت مدیریت داده‌ها در هوش مصنوعی مدرن

با پیشرفت هوش مصنوعی از چت‌بات‌های ساده به سمت دستیارهای خودمختار و مستقلی که می‌توانند کارهای چندمرحله‌ای انجام دهند، محدودیت حافظه VRAM در کارت‌های گرافیک به یک چالش بزرگ برای دیتاسنترها تبدیل شده است.

راهکار مشترک VAST و AMD دقیقاً همین مشکل اساسی را حل می‌کند. با انتقال داده‌های حجیم مکالمات (همان کش KV) از حافظه گران‌قیمت کارت گرافیک به درایوهای فوق‌سریع NVMe، شرکت‌های ارائه‌دهنده خدمات ابری می‌توانند بدون نیاز به خرید گرافیک‌های جدید و پرهزینه، توان پردازشی و کیفیت سرویس‌های خود را به شکل چشمگیری افزایش دهند. این اتفاق به معنای بهره‌وری بسیار بالاتر از سخت‌افزارهای موجود و کاهش جدی هزینه‌ها در صنعت هوش مصنوعی خواهد بود.

سوالات متداول

منظور از تخلیه کش KV در سیستم‌های هوش مصنوعی چیست؟
هوش مصنوعی برای به خاطر سپردن مکالمات قبلی، اطلاعات را در بخشی به نام کش KV ذخیره می‌کند که به سرعت حافظه کارت گرافیک را پر می‌کند. فناوری تخلیه کش، این اطلاعات را به جای کارت گرافیک، روی حافظه‌های پرسرعت سرور نگهداری می‌کند تا ظرفیت پردازشی گرافیک آزاد بماند.
فناوری مشترک VAST و AMD چقدر در سرعت پردازش تاثیر دارد؟
بر اساس نتایج آزمایش‌های انجام شده روی گرافیک Instinct MI355X، استفاده از این راهکار باعث شده سرعت شروع پاسخ‌گویی هوش مصنوعی (زمان تولید اولین توکن) تا ۹ برابر سریع‌تر شود و توان کلی پردازش داده‌ها نیز نزدیک به ۱۰ برابر افزایش یابد.
کارت شبکه Pensando Pollara چه نقشی در این سیستم ایفا می‌کند؟
این کارت شبکه وظیفه دارد ارتباطی مستقیم، پایدار و بدون تاخیر بین کارت‌های گرافیک قدرتمند و سیستم ذخیره‌سازی برقرار کند تا جابه‌جایی اطلاعات سنگین به صورت آنی و بدون ایجاد گلوگاه انجام شود.
تولید محتوا برای من فقط نوشتن نیست؛ ترجمه دنیای پیچیده فناوری به زبانی روشن، دقیق و قابل فهم است. به‌عنوان کارشناس تولید محتوا در حوزه فناوری اطلاعات و تکنولوژی، تمرکزم بر خلق محتوایی است که هم از نظر فنی معتبر باشد و هم برای مخاطب ارزش واقعی ایجاد کند. از مفاهیم تخصصی IT و زیرساخت‌های شبکه گرفته تا هوش مصنوعی، امنیت سایبری و تحولات دیجیتال، تلاش می‌کنم هر موضوع را با نگاهی تحلیلی و ساختاریافته ارائه دهم.
مقالات مرتبط

افشای مشخصات Radeon RX 9050؛ بازگشت غیرمنتظره گرافیک‌های ۴ گیگابایتی در سال ۲۰۲۶

افشای مشخصات Radeon RX 9050؛ بازگشت غیرمنتظره گرافیک‌های ۴ گیگابایتی در سال…

مرداد 6, 1405

بازداشت کارمند Nvidia در تایوان؛ پرونده قاچاق تراشه‌های AI ابعاد تازه‌ای پیدا کرد

بازداشت کارمند Nvidia در تایوان؛ پرونده قاچاق تراشه‌های AI ابعاد تازه‌ای پیدا…

مرداد 6, 1405

چرا سم آلتمن معتقد است هوش مصنوعی هفته کاری را کوتاه نمی کند؟

چرا سم آلتمن معتقد است هوش مصنوعی هفته کاری کوتاه را محقق…

مرداد 5, 1405

دیدگاهتان را بنویسید