برای اجرای LLM به چه مقدار VRAM نیاز داریم؟
دو بخش اصلی حافظه GPU را پر میکنند: وزن مدل، و KV cache برای context و کاربران همزمان.
وزن مدل
تقریباً: پارامتر (میلیارد) × بایت هر پارامتر. در ۴-بیت حدود ۰.۵ بایت، در ۱۶-بیت ۲ بایت. مدل ۳۲B چهاربیتی حدود ۱۶GB فقط برای وزن است، بهعلاوه سربار.
Context و همزمانی
context ۱۶K با چند کاربر همزمان KV cache را سریع بالا میبرد. به همین دلیل کارت ۲۴GB برای دمو کافی است و برای production نه.
تخمین عملی
بهجای حفظ عدد، از ماشینحساب زیرساخت LLM استفاده کنید. خروجی تقریبی است و جایگزین طراحی معماری نیست.