برای اجرای LLM به چه مقدار VRAM نیاز داریم؟

دو بخش اصلی حافظه GPU را پر می‌کنند: وزن مدل، و KV cache برای context و کاربران همزمان.

وزن مدل

تقریباً: پارامتر (میلیارد) × بایت هر پارامتر. در ۴-بیت حدود ۰.۵ بایت، در ۱۶-بیت ۲ بایت. مدل ۳۲B چهاربیتی حدود ۱۶GB فقط برای وزن است، به‌علاوه سربار.

Context و همزمانی

context ۱۶K با چند کاربر همزمان KV cache را سریع بالا می‌برد. به همین دلیل کارت ۲۴GB برای دمو کافی است و برای production نه.

تخمین عملی

به‌جای حفظ عدد، از ماشین‌حساب زیرساخت LLM استفاده کنید. خروجی تقریبی است و جایگزین طراحی معماری نیست.

بازگشت به دانشنامه