نصب گرافیک سروری Nvidia Tesla V100 روی سیستم خانگی؛ اجرای Local LLM با ۳۲ گیگابایت VRAM
یک علاقهمند به سختافزار، کارت گرافیک قدیمی و پرسروصدای سروری را برای پردازش مدلهای زبانی (Local LLM) روی سیستم خانگی خود نصب کرده است. او موفق شده با پرداخت تنها ۲۶۶ دلار، ظرفیت VRAM سیستم خود را به ۳۲ گیگابایت افزایش دهد. این یک دستاورد جذاب در بازار فعلی محسوب میشود که قیمت حافظههای ویدیویی به شدت بالاست.
- هزینه پایین: خرید گرافیک Tesla V100 SXM2 و آداپتور مربوطه با مجموع قیمت ۲۶۶ دلار.
- ترکیب سختافزاری: استفاده همزمان از RTX 4080 و Tesla V100 برای دستیابی به ۳۲ گیگابایت VRAM.
- مدیریت نویز: اتصال فن سروری به هدر PWM مادربرد برای کنترل صدا و دما.
- عملکرد پردازشی: اجرای مدل LLM با ۲۷ میلیارد پارامتر با سرعت ۳۲ توکن بر ثانیه.
تهیه سختافزار و چالشهای نصب قطعات سروری
کاربری به نام Oscar Molnar توضیح میدهد که یک کارت گرافیک ارزانقیمت Tesla V100 SXM2 با ۱۶ گیگابایت حافظه HBM2 را خریداری کرده است. در حال حاضر این پردازندههای گرافیکی دستدوم در پلتفرمهایی مانند eBay با قیمت کمتر از ۱۴۰ دلار به فروش میرسند.
با این حال، شما نمیتوانید یک کارت Tesla V100 با فرمفکتور SXM2 را به سادگی روی مادربرد کامپیوتر شخصی نصب کنید. برای این کار به یک آداپتور SXM2 به PCIe نیاز است که حدود ۶۶ دلار هزینه دارد و آن هم از طریق پلتفرمهای فروش آنلاین تهیه شده است.
مهار نویز آزاردهنده فن با کابل PWM
خرید قطعات و نصب آنها تنها بخشی از مسیر بود. چالش اصلی، صدای وحشتناک فن خنککننده سروری روی کارت Tesla V100 SXM2 بود. این خنککننده نویزی معادل ۸۲ دسیبل تولید میکرد که Molnar آن را چیزی بین صدای ماشین چمنزنی و دستگاه زبالهخردکن توصیف کرده است.
برای حل این مشکل، سیمهای فن تغییر مسیر داده شد و به هدر فن PWM روی مادربرد متصل گردید. برای این کار میتوان به سادگی از یک کابل مبدل (2.54mm male به PH2.0 female) استفاده کرد. با اعمال این تغییر، فن کارت گرافیک تنها با ۱۰ درصد توان خود کار میکند تا دمای Tesla V100 را در زیر بار پردازشی کامل، روی کمتر از ۵۰ درجه سانتیگراد نگه دارد.
عملکرد سیستم؛ پردازش ۳۲ توکن بر ثانیه
با انجام این اصلاحات، سیستم اکنون دارای ۳۲ گیگابایت VRAM است؛ ترکیبی از کارت گرافیک RTX 4080 با ۱۶ گیگابایت حافظه (معماری Ada) و کارت Tesla V100 با ۱۶ گیگابایت حافظه (معماری Volta). نسخههای ۳۲ گیگابایتی Tesla V100 نیز در بازار موجود هستند، اما قیمت آنها دو برابر است.
به گفته این کاربر، پیکربندی سیستم برای استفاده از کل ۳۲ گیگابایت حافظه ویدیویی برای اجرای LLM کار دشواری نبود. او از سیستمعامل NixOS و یک نسخه قدیمی از درایور انویدیا استفاده کرد که از هر دو معماری Volta و Ada پشتیبانی میکند. در تستهای انجام شده، این سیستم موفق شد یک مدل زبانی با ۲۷ میلیارد پارامتر را با سرعت ۳۲ توکن بر ثانیه اجرا کند. این سرعت برای استفاده تعاملی کاملاً مناسب است و از بسیاری از رابطهای برنامهنویسی (API) سرویسهای ابری سریعتر عمل میکند.
تحلیل اختصاصی آلفاتک: پردازش هوش مصنوعی با قطعات دستدوم
با افزایش محبوبیت Local LLM (اجرای مدلهای زبانی روی سیستمهای محلی)، نیاز به حافظه ویدیویی (VRAM) به شدت افزایش یافته است. خرید کارت گرافیکهای جدید با VRAM بالا برای بسیاری از کاربران خانگی توجیه اقتصادی ندارد.
اقداماتی شبیه به این پروژه نشان میدهد که چگونه سختافزارهای قدیمی سروری مانند خانواده Tesla میتوانند با استفاده از آداپتورهای PCIe دوباره به چرخه کاربری بازگردند. با این حال، کاربران باید در نظر داشته باشند که مدیریت حرارت، مصرف برق، فرمفکتور قطعات و پیدا کردن درایورهای نرمافزاری سازگار، چالشهای اصلی استفاده از قطعات Enterprise در سیستمهای دسکتاپ هستند.


