صفحه اصلی > اخبار : نصب گرافیک سروری Nvidia Tesla V100 روی سیستم خانگی؛ اجرای Local LLM با ۳۲ گیگابایت VRAM

نصب گرافیک سروری Nvidia Tesla V100 روی سیستم خانگی؛ اجرای Local LLM با ۳۲ گیگابایت VRAM

نصب گرافیک سروری Nvidia Tesla V100 روی سیستم خانگی؛ اجرای Local LLM با ۳۲ گیگابایت VRAM

یک علاقه‌مند به سخت‌افزار، کارت گرافیک قدیمی و پرسروصدای سروری را برای پردازش مدل‌های زبانی (Local LLM) روی سیستم خانگی خود نصب کرده است. او موفق شده با پرداخت تنها ۲۶۶ دلار، ظرفیت VRAM سیستم خود را به ۳۲ گیگابایت افزایش دهد. این یک دستاورد جذاب در بازار فعلی محسوب می‌شود که قیمت حافظه‌های ویدیویی به شدت بالاست.

نصب کارت گرافیک Nvidia Tesla V100 روی مادربرد خانگی

تهیه سخت‌افزار و چالش‌های نصب قطعات سروری

کاربری به نام Oscar Molnar توضیح می‌دهد که یک کارت گرافیک ارزان‌قیمت Tesla V100 SXM2 با ۱۶ گیگابایت حافظه HBM2 را خریداری کرده است. در حال حاضر این پردازنده‌های گرافیکی دست‌دوم در پلتفرم‌هایی مانند eBay با قیمت کمتر از ۱۴۰ دلار به فروش می‌رسند.

با این حال، شما نمی‌توانید یک کارت Tesla V100 با فرم‌فکتور SXM2 را به سادگی روی مادربرد کامپیوتر شخصی نصب کنید. برای این کار به یک آداپتور SXM2 به PCIe نیاز است که حدود ۶۶ دلار هزینه دارد و آن هم از طریق پلتفرم‌های فروش آنلاین تهیه شده است.

آداپتور و کابل PWM برای اتصال فن کارت گرافیک

مهار نویز آزاردهنده فن با کابل PWM

خرید قطعات و نصب آن‌ها تنها بخشی از مسیر بود. چالش اصلی، صدای وحشتناک فن خنک‌کننده سروری روی کارت Tesla V100 SXM2 بود. این خنک‌کننده نویزی معادل ۸۲ دسی‌بل تولید می‌کرد که Molnar آن را چیزی بین صدای ماشین چمن‌زنی و دستگاه زباله‌خردکن توصیف کرده است.

برای حل این مشکل، سیم‌های فن تغییر مسیر داده شد و به هدر فن PWM روی مادربرد متصل گردید. برای این کار می‌توان به سادگی از یک کابل مبدل (2.54mm male به PH2.0 female) استفاده کرد. با اعمال این تغییر، فن کارت گرافیک تنها با ۱۰ درصد توان خود کار می‌کند تا دمای Tesla V100 را در زیر بار پردازشی کامل، روی کمتر از ۵۰ درجه سانتی‌گراد نگه دارد.

عملکرد سیستم؛ پردازش ۳۲ توکن بر ثانیه

با انجام این اصلاحات، سیستم اکنون دارای ۳۲ گیگابایت VRAM است؛ ترکیبی از کارت گرافیک RTX 4080 با ۱۶ گیگابایت حافظه (معماری Ada) و کارت Tesla V100 با ۱۶ گیگابایت حافظه (معماری Volta). نسخه‌های ۳۲ گیگابایتی Tesla V100 نیز در بازار موجود هستند، اما قیمت آن‌ها دو برابر است.

به گفته این کاربر، پیکربندی سیستم برای استفاده از کل ۳۲ گیگابایت حافظه ویدیویی برای اجرای LLM کار دشواری نبود. او از سیستم‌عامل NixOS و یک نسخه قدیمی از درایور انویدیا استفاده کرد که از هر دو معماری Volta و Ada پشتیبانی می‌کند. در تست‌های انجام شده، این سیستم موفق شد یک مدل زبانی با ۲۷ میلیارد پارامتر را با سرعت ۳۲ توکن بر ثانیه اجرا کند. این سرعت برای استفاده تعاملی کاملاً مناسب است و از بسیاری از رابط‌های برنامه‌نویسی (API) سرویس‌های ابری سریع‌تر عمل می‌کند.

تحلیل اختصاصی آلفاتک: پردازش هوش مصنوعی با قطعات دست‌دوم

با افزایش محبوبیت Local LLM (اجرای مدل‌های زبانی روی سیستم‌های محلی)، نیاز به حافظه ویدیویی (VRAM) به شدت افزایش یافته است. خرید کارت‌ گرافیک‌های جدید با VRAM بالا برای بسیاری از کاربران خانگی توجیه اقتصادی ندارد.

اقداماتی شبیه به این پروژه نشان می‌دهد که چگونه سخت‌افزارهای قدیمی سروری مانند خانواده Tesla می‌توانند با استفاده از آداپتورهای PCIe دوباره به چرخه کاربری بازگردند. با این حال، کاربران باید در نظر داشته باشند که مدیریت حرارت، مصرف برق، فرم‌فکتور قطعات و پیدا کردن درایورهای نرم‌افزاری سازگار، چالش‌های اصلی استفاده از قطعات Enterprise در سیستم‌های دسکتاپ هستند.

سوالات متداول

فرم‌فکتور SXM2 چیست و چه تفاوتی با PCIe دارد؟
فرم‌فکتور SXM یک طراحی اختصاصی از سوی انویدیا برای سرورهای دیتاسنتر است که کارت گرافیک مستقیماً و به صورت افقی روی مادربرد سرور نصب می‌شود تا پهنای باند و تبادل حرارتی بهتری داشته باشد. این کارت‌ها پین‌های اتصال متفاوتی با اسلات‌های استاندارد PCIe روی مادربردهای خانگی دارند و به همین دلیل برای نصب به آداپتور نیاز است.
چرا کارت‌های قدیمی سروری برای مدل‌های زبانی (LLM) مناسب هستند؟
مهم‌ترین عامل در اجرای روان مدل‌های زبانی هوش مصنوعی، ظرفیت بالای VRAM است. کارت‌های گرافیک سروری حتی در نسل‌های گذشته، ظرفیت حافظه بالایی (مانند ۱۶ یا ۳۲ گیگابایت HBM) دارند که آن‌ها را با قیمت بسیار پایین‌تر، به گزینه‌ای عالی برای لود کردن پارامترهای LLM تبدیل می‌کند.
آیا استفاده همزمان از دو کارت گرافیک با معماری متفاوت امکان‌پذیر است؟
بله، در محیط‌های لینوکسی (مانند NixOS) و با استفاده از درایورهای مناسب، برنامه‌های پردازش هوش مصنوعی می‌توانند از حافظه و توان پردازشی هر دو کارت برای تقسیم بار کاری استفاده کنند، حتی اگر معماری پردازنده‌ها متفاوت باشد.
تولید محتوا برای من فقط نوشتن نیست؛ ترجمه دنیای پیچیده فناوری به زبانی روشن، دقیق و قابل فهم است. به‌عنوان کارشناس تولید محتوا در حوزه فناوری اطلاعات و تکنولوژی، تمرکزم بر خلق محتوایی است که هم از نظر فنی معتبر باشد و هم برای مخاطب ارزش واقعی ایجاد کند. از مفاهیم تخصصی IT و زیرساخت‌های شبکه گرفته تا هوش مصنوعی، امنیت سایبری و تحولات دیجیتال، تلاش می‌کنم هر موضوع را با نگاهی تحلیلی و ساختاریافته ارائه دهم.
مقالات مرتبط

عامل هوش مصنوعی OpenAI از کنترل خارج شد؛ نفوذ به Hugging Face و کشف نقشه‌های فرار در سرورها

عامل هوش مصنوعی OpenAI از کنترل خارج شد؛ نفوذ به Hugging Face…

مرداد 4, 1405

واکنش مدیر ارشد AMD به بنچمارک پردازنده Vera انویدیا: «ما جلوتر هستیم»

واکنش مدیر ارشد AMD به بنچمارک پردازنده Vera انویدیا: «ما جلوتر هستیم»…

مرداد 3, 1405

توافق‌های عظیم غول‌های حافظه کره جنوبی با شرکت‌های فناوری آمریکایی

توافق‌های عظیم غول‌های حافظه کره جنوبی با شرکت‌های فناوری آمریکایی بر اساس…

مرداد 3, 1405

دیدگاهتان را بنویسید