قدّر حجم نموذج لغوي كبير على القرص وفي الذاكرة انطلاقًا من عدد معاملاته وعرض بت التكميم، معبَّرًا عنه بالجيجابايت العشري والجيبيبايت الثنائي معًا.
المدخلات
النموذج
عدد معاملات النموذج بالمليارات. يتناسب حجم ملف الأوزان طرديًا مع هذا العدد، فالنموذج الذي يملك ضعف المعاملات يبلغ تقريبًا ضعف الحجم عند الدقة نفسها.
عدد البتات المستخدمة لتخزين كل وزن. الدقة الكاملة هي 32 بت، وتُنصِّف الصيغ الشائعة الحجم خطوة بخطوة، إذ يخزّن التكميم بأربعة بتات المعاملَ في ثُمن المساحة التي يحتاجها FP32.
النتائج
أدخل قيمة لعرض النتائج.
الحجم المقدَّر لملف الأوزان بالجيجابايت العشري: 7 مليار معامل مضروبًا في FP16 / BF16 (16 بت) بت، مقسومًا على ثمانية لتحويل البتات إلى بايتات، يعطي نحو ... GB.
تفاصيل
الحجم نفسه معبَّرًا عنه بالجيبيبايت الثنائي، وهي الوحدة التي تعرضها معظم أنظمة التشغيل وأدوات وحدات معالجة الرسوميات. ... GB تساوي نحو ... GiB.
حجم النموذج من التكميم
يتحدّد حجم النموذج اللغوي الكبير على القرص شبه كليًا بعدد معاملاته وعدد البتات التي يُخزَّن بها كل معامل. فالوزن ما هو إلا رقم، والنموذج قائمة طويلة من هذه الأرقام، لذا فإن ضرب العدد في عرض البت لكل وزن ثم التحويل إلى بايتات يعطي تقديرًا قريبًا لحجم الملف — ولمقدار الذاكرة اللازمة لتحميله. تُحوِّل هذه الحاسبة عدد المعاملات وصيغة التكميم إلى رقمين: أحدهما بالجيجابايت العشري والآخر بالجيبيبايت الثنائي.
الصيغة
بعدد معاملات بالمليارات وعرض بت لكل معامل، يكون حجم الأوزان بالجيجابايت العشري:
S=8N⋅b
تُحوِّل القسمة على ثمانية البتات إلى بايتات. ولأن مليار بايت يساوي بالضبط جيجابايت عشريًا واحدًا، فإن التعبير عن بالمليارات يجعل النتيجة تخرج مباشرة بالجيجابايت. والكمية نفسها بالجيبيبايت الثنائي — وهي الوحدة التي تعرضها معظم أنظمة التشغيل وأدوات وحدات معالجة الرسوميات — هي:
G=S⋅1073741824109
لأن الجيبيبايت الواحد يساوي بايت.
مثال محلول
لنأخذ نموذجًا بسبعة مليارات معامل مخزَّنًا عند 16 بت لكل وزن، وهي صيغة نصف الدقة المعيارية التي تُشحَن بها معظم النماذج:
S=87×16=14GB,G=14×1073741824109≈13.04GiB
فتشغل الأوزان نحو 14 GB على القرص، وهو ما تعرضه أداة الذاكرة بنحو 13 GiB. وتكميم النموذج نفسه إلى 4 بتات يخزّن كل وزن في رُبع المساحة، فينخفض الملف إلى نحو 3.5 GB.
اختيار الدقة
تُستخدم الدقة الكاملة بـ 32 بت أساسًا أثناء التدريب. أما للنشر فإن 16 بت هي المرجع المعتاد، بينما يقايض التكميم بثمانية وأربعة بتات بعض الدقة مقابل نصف البصمة أو رُبعها. وصيغ البت المنخفض مثل INT4 هي ما يتيح لنموذج بعشرات المليارات من المعاملات أن يَسَع في وحدة معالجة رسوميات استهلاكية واحدة. ويغطي تقدير الحجم هنا الأوزان فقط؛ فتشغيل النموذج يحتاج أيضًا إلى مساحة للتنشيطات ولذاكرة المفتاح-القيمة، وهو ما تأخذه حاسبة ذاكرة VRAM لاستدلال النماذج اللغوية الكبيرة في الحسبان. ولتحويل الحجم إلى زمن نقل عبر اتصال معيّن، انظر حاسبة زمن تنزيل النموذج.
الأسئلة الشائعة (FAQ)
أي عرض بت ينبغي أن يستخدمه النموذج؟
تُدرَّب معظم النماذج وتُنشَر بدقة 16 بت (FP16 أو BF16)، وهي الحجم المرجعي المعتاد. ولتشغيلها على عتاد أصغر، يقلّص التكميم بثمانية بتات وأربعة بتات البصمة إلى النصف والربع على التوالي، مقابل بعض الخسارة في الدقة.
يشيع استخدام INT4 لإدخال نماذج أكبر في وحدات معالجة الرسوميات الاستهلاكية، بينما يُستعمل FP32 أساسًا أثناء التدريب أو حين يلزم أقصى قدر من الأمانة العددية. ويعتمد الاختيار الأنسب على الذاكرة المتاحة ومدى احتمال خسارة الجودة.
ما الفرق بين GB و GiB؟
الجيجابايت (GB) يساوي مليار بايت، بينما الجيبيبايت (GiB) يساوي 2^30 أي 1,073,741,824 بايت — أكبر بنحو 7.4٪. تستخدم شركات التخزين وأحجام التنزيل عادةً الجيجابايت العشري، لكن أنظمة التشغيل وأدوات ذاكرة وحدات معالجة الرسوميات وكثيرًا من مُحمِّلات النماذج تعرض الجيبيبايت الثنائي.
لذلك يَظهر الملف نفسه برقم أصغر قليلًا بالجيبيبايت منه بالجيجابايت، وهذا سبب عرض القيمتين هنا.
هل يقلّل التكميم من جودة النموذج؟
يُسقط خفض الدقة بعض التفاصيل العددية، فقد يقلّل من الدقة، لكن الأثر غالبًا صغير. يكون التكميم الحديث بثمانية بتات قريبًا من انعدام الخسارة في الاستدلال عادةً، وتحافظ طرائق الأربعة بتات مثل GPTQ و AWQ على معظم الجودة في كثير من النماذج مع تقليص الذاكرة إلى الربع.
أما عروض البت المنخفضة جدًا والنماذج الصغيرة فتميل إلى تدهور أوضح. ويبقى تقدير الحجم هنا واحدًا بصرف النظر عن طريقة التكميم؛ ولا يختلف سوى المفاضلة في الدقة.
إخلاء المسؤولية
يحسب هذا التقدير تخزين الأوزان فقط. تشمل الملفات والذاكرة الفعلية أيضًا التضمينات وبيانات التكميم الوصفية وذواكر التنشيط المؤقتة وذاكرة المفتاح-القيمة أثناء الاستدلال، لذلك قد يكون استخدام القرص ووحدة معالجة الرسوميات الفعلي أعلى قليلًا من الأرقام المعروضة.