حاسبة ذاكرة VRAM لاستدلال النماذج اللغوية الكبيرة
المدخلات
| المعاملات | 7 |
|---|---|
| دقة الأوزان | FP16 / BF16 (16 بت) |
| أعباء وقت التشغيل | 20 % |
حاسبة ذاكرة VRAM لاستدلال النماذج اللغوية الكبيرة
قدّر ذاكرة VRAM اللازمة في وحدة معالجة الرسوميات لخدمة نموذج لغوي كبير للاستدلال، انطلاقًا من عدد معاملاته ودقة الأوزان والأعباء الإضافية وقت التشغيل لذاكرة المفتاح-القيمة والتنشيطات والتجزئة.
المدخلات
النموذج
وقت التشغيل
النتائج
أدخل قيمة لعرض النتائج.
تفاصيل
ذاكرة VRAM لاستدلال النماذج اللغوية الكبيرة
تبدأ خدمة نموذج لغوي كبير بسؤال صريح: هل يتّسع لوحدة معالجة الرسوميات؟ تهيمن أوزان النموذج على الإجابة، لكن الأوزان وحدها تُقلِّل من تقدير المتطلَّب، لأن خادم الاستدلال يجب أن يحتفظ أيضًا بذاكرة المفتاح-القيمة وبالتنشيطات المارة عبر كل طبقة وببعض الذاكرة المفقودة في التجزئة. تقدّر هذه الحاسبة إجمالي ذاكرة VRAM من ثلاثة مدخلات — عدد المعاملات والدقة التي تُخزَّن بها الأوزان وأعباء وقت تشغيل تجمع البقية في رقم واحد قابل للضبط.
الأوزان تحدّد الحد الأدنى
أوزان النموذج هي تكلفته الثابتة الكبرى في الذاكرة. يُخزَّن كل معامل بدقة مختارة: تشغل أوزان الستة عشر بتًا الكاملة بايتين لكل معامل، ويشغل التكميم بثمانية بتات بايتًا واحدًا، ويشغل التكميم بأربعة بتات نصف بايت. لذا فإن عدد معاملات بالمليارات، مخزَّنًا عند بت، يشغل:
W=8N⋅b GBفالمليار معامل عند 16 بت يساوي 2 GB بالضبط، ولهذا يحتاج نموذج بحجم 7B إلى 14 GB لأوزانه وحدها. وتحوّل القسمة على ثمانية البتات إلى بايتات، ولأن المعاملات تُعدّ بالمليارات والذاكرة بالجيجابايت تتطابق الوحدات مباشرةً.
إضافة أعباء وقت التشغيل
الأوزان ليست سوى الحد الأدنى. فأثناء الاستدلال يحتفظ الخادم بذاكرة مفتاح-قيمة تحمل مفاتيح الانتباه وقيمه لكل رمز قيد المعالجة، ويخصّص تنشيطات مع مرور كل طلب عبر الطبقات، ويفقد قليلًا من الذاكرة في التجزئة. والإجمالي هو:
V=W⋅(1+o)حيث هو الأعباء معبَّرًا عنها كنسبة من حجم الأوزان. وذاكرة المفتاح-القيمة هي المكوّن الأكبر والأكثر تغيرًا — إذ تنمو مع طول السياق وعدد الطلبات المتزامنة — لذا تعتمد الأعباء الصحيحة اعتمادًا كبيرًا على حمل العمل. وتُعدّ نسبة عشرين بالمئة نقطة بداية معقولة للمطالبات القصيرة عند أحجام دفعات متواضعة؛ أما الخدمة ذات السياق الطويل والإنتاجية العالية فقد تدفعها إلى أعلى بكثير.
مثال محلول
لنأخذ نموذجًا بسبعة مليارات معامل يُخدَم بدقة 16 بت مع أعباء قدرها عشرون بالمئة:
WV=87×16=14 GB=14×(1+0.20)=16.8 GBيتّسع الإجمالي البالغ 16.8 GB بمريحٍ لبطاقة سعة 24 GB لكنه لا يترك مجالًا في بطاقة سعة 16 GB. ولتشغيل النموذج نفسه على وحدة معالجة رسوميات أصغر، يُنصّف الانتقال إلى الثمانية بتات الأوزانَ إلى 7 GB ويقرّب الإجمالي إلى 8.4 GB. وتُتناول العلاقة بين حجم النموذج والدقة بمزيد من التفصيل في حاسبة حجم النموذج من التكميم.
جعل النموذج يتّسع
لأن الذاكرة تتناسب طرديًا مع عدد البتات لكل وزن، فإن التكميم هو الرافعة الأكثر مباشرةً: فالانتقال من الستة عشر بتًا إلى الثمانية يُنصّف ذاكرة الأوزان، ومن الثمانية إلى الأربعة يُنصّفها ثانيةً، عادةً بخسارة متواضعة ومقبولة في جودة المخرجات. وحين يتجاوز النموذج المكمَّم حتى مُسرِّعًا واحدًا، تكون البدائل توزيعَ الأوزان على عدة وحدات معالجة رسوميات أو إلغاء تحميل جزء من النموذج إلى ذاكرة النظام بتكلفة باهظة في السرعة. ويُتناول تقدير عدد المُسرِّعات التي يحتاجها النموذج في حاسبة عدد وحدات معالجة الرسوميات للنموذج. عُدّ الرقم هنا تقديرًا تخطيطيًا وتحقّق منه إزاء تشغيل خدمة حقيقي، إذ يحرّك الإطار وطول السياق وحجم الدفعة الرقمَ الحقيقي جميعًا.
الأسئلة الشائعة (FAQ)
ماذا تغطي أعباء وقت التشغيل؟
إلى جانب الأوزان، يجب أن يحتفظ خادم الاستدلال بذاكرة المفتاح-القيمة التي تخزّن مفاتيح الانتباه وقيمه لكل رمز قيد المعالجة، وبالتنشيطات الناتجة مع مرور كل طلب عبر الطبقات، وببعض الهامش المفقود في تجزئة الذاكرة. وذاكرة المفتاح-القيمة هي الجزء الأكبر والأكثر تغيرًا: فهي تنمو مع طول السياق وعدد الطلبات المتزامنة، لذا قد يحتاج خادم يعالج مطالبات طويلة أو دفعات كبيرة إلى أكثر بكثير مما توحي به نسبة العشرين بالمئة الافتراضية.
تجمع نسبةُ الأعباء الواحدة كل ذلك في رقم واحد قابل للضبط.
كيف أعرف ما إذا كان النموذج يتّسع لوحدة معالجة رسوميات معيّنة؟
قارن تقدير إجمالي ذاكرة VRAM بذاكرة المُسرِّع المستهدف، مع ترك هامش لنظام التشغيل وبرنامج التشغيل. فالنموذج بحجم 7 مليارات معامل عند 16 بت يحتاج نحو 17 GB مع الأعباء، وهو ما يتّسع بمريحٍ لبطاقة سعة 24 GB لا لبطاقة سعة 16 GB.
وإذا تجاوز التقدير وحدة معالجة رسوميات واحدة، فلا بدّ من تكميم النموذج أو توزيعه على عدة وحدات أو إلغاء تحميل جزء منه إلى ذاكرة النظام بتكلفة كبيرة في السرعة.
ما مقدار الذاكرة التي يوفّرها التكميم؟
تتناسب الذاكرة طرديًا مع عدد البتات لكل وزن، فالانتقال من الستة عشر بتًا إلى الثمانية يُنصّف ذاكرة الأوزان والانتقال إلى الأربعة يُربّعها. فالنموذج بحجم 13 مليار معامل يحتاج نحو 26 GB من الأوزان عند 16 بت لكنه يحتاج 13 GB فقط عند 8 بت ونحو 6.5 GB عند 4 بت، قبل الأعباء.
وتتيح الدقة الأقل للنماذج الأكبر أن تتّسع لبطاقات أصغر بخسارة متواضعة، مقبولة عادةً، في جودة المخرجات عند الثمانية والأربعة بتات.
إخلاء المسؤولية
هذا تقدير من الدرجة الأولى. تعتمد ذاكرة VRAM الفعلية على إطار الخدمة وطول السياق وحجم الدفعة ودقة ذاكرة المفتاح-القيمة، وكلها مدمجة هنا في نسبة أعباء واحدة. اختر عتادًا بهامش زائد وتحقّق من النتيجة بحمل عمل حقيقي قبل الالتزام.