حاسبة عدد معاملات المحوّل
المدخلات
| الطبقات | 32 |
|---|---|
| الحجم المخفي | 4,096 |
| توسّع التغذية الأمامية | 4 |
| حجم المفردات | 32,000 |
حاسبة عدد معاملات المحوّل
قدّر إجمالي عدد معاملات محوّل من نوع فك-التشفير فقط انطلاقًا من عدد الطبقات والحجم المخفي وتوسّع التغذية الأمامية وحجم المفردات، بصيغة معمارية من الرتبة الأولى.
المدخلات
المعمارية
النتائج
أدخل قيمة لعرض النتائج.
تفاصيل
عدد معاملات المحوّل
يُذكَر حجم النموذج اللغوي الكبير عادةً كرقم رئيسي واحد — سبعة مليارات، سبعون مليارًا — لكن ذلك الرقم تحدّده كليًا حفنة من الخيارات المعمارية. فبمعرفة عدد الطبقات والحجم المخفي وتوسّع التغذية الأمامية والمفردات، يتبع إجمالي عدد المعاملات من صيغة قصيرة. تطبّق هذه الحاسبة تلك الصيغة لتعطي تقديرًا من الرتبة الأولى، وهو الاستدلال التقريبي نفسه المستخدَم لتحديد حجم نموذج قبل وجود أي أوزان.
أين تقيم المعاملات
كل وزن تقريبًا في محوّل من نوع فك-التشفير فقط يقع في واحد من ثلاثة مواضع. تحوي الطبقة الفرعية للانتباه في كل كتلة أربع مصفوفات أوزان مربّعة — إسقاطات الاستعلام والمفتاح والقيمة والخرج — كلٌّ منها بحجم مخفي × مخفي. وتحوي الطبقة الفرعية للتغذية الأمامية مصفوفتين توسّعان التيار المخفي إلى بُعد داخلي أعرض ثم تُسقطانه إلى الأصل. ومنفصلًا عن مكدّس الطبقات، يحفظ جدول تضمين الرموز متّجهًا واحدًا بحجم الحجم المخفي لكل مدخل في المفردات.
ويعطي عدّ هذه المواضع تقدير المعمارية. تسهم كتلة الانتباه بنحو من القيم لكل طبقة، حيث هو الحجم المخفي. وتسهم كتلة التغذية الأمامية، إذ تتوسّع إلى عرض داخلي قدره ، بنحو . ويسهم جدول التضمين بحجم المفردات مضروبًا في .
الصيغة
بعدد طبقات ، وحجم مخفي ، ومُضاعِف تغذية أمامية ، وحجم مفردات ، يكون إجمالي عدد المعاملات
N=L⋅d2⋅(4+2m)+V⋅dيجمع الحدّ الأول أوزان الانتباه والتغذية الأمامية لكل طبقة عبر جميع الطبقات؛ والثاني هو جدول التضمين. ولأن حدّ كل طبقة يتناسب مع مربّع الحجم المخفي، فإن عرض النموذج يهمّ أكثر بكثير من عمقه: فمضاعفة الحجم المخفي تُربِّع العدد تقريبًا، بينما لا تؤدي مضاعفة الطبقات إلا إلى مضاعفته.
مثال محلول
لنأخذ نموذجًا بـ 32 طبقة، وحجم مخفي 4096، وتوسّع تغذية أمامية قدره أربعة، ومفردات من 32,000 رمز. عامل كل طبقة هو ، إذن
N=32×40962×12+32000×4096=6,442,450,944+131,072,000≈6.57 ملياريستأثر مكدّس الطبقات بكل ذلك تقريبًا؛ ولا يضيف جدول التضمين سوى نحو 131 مليونًا، أي ما يزيد قليلًا على اثنين بالمئة. ومع التوسّع الشائع وقدره أربعة، يقع نحو ثُلثي كل طبقة في أوزان التغذية الأمامية وثُلثها في الانتباه.
ما الذي يُغفله التقدير
هذا عدّ من الرتبة الأولى. يلتقط المصفوفات المهيمنة على الإجمالي لكنه يُغفل الحدود الصغيرة: الانحيازات وقيم القياس والإزاحة في تسوية الطبقة وأي تضمينات موضعية متعلَّمة. وهي مجتمعةً عادةً أقل من واحد بالمئة بكثير من نموذج كبير، فلا تحرّك الرقم الرئيسي. كما يفترض التقدير أن تضمين الدخل وإسقاط الخرج يتشاركان مصفوفة واحدة — التضمينات المربوطة — فيُعَدّ الجدول مرة واحدة؛ أما نموذج بتضمينات غير مربوطة فيحمل ذلك الجدول مرتين.
ومتى عُرف العدد، فإنه يقود الأسئلة العملية للنشر. تعتمد الذاكرة اللازمة لحفظ الأوزان على العدد والدقة العددية، وتستكشفها حاسبة حجم النموذج من التكميم. أما الذاكرة المطلوبة لتدريب النموذج نفسه، التي تضيف حالة المُحسِّن والتنشيطات فوق الأوزان، فتغطّيها حاسبة ذاكرة VRAM لتدريب النماذج اللغوية الكبيرة.
الأسئلة الشائعة (FAQ)
ما الذي يُعَدّ معاملًا؟
المعامل قيمة وزن أو انحياز مفردة متعلَّمة ومخزَّنة في النموذج. والإسهامات المهيمنة هي مصفوفات أوزان إسقاطات الانتباه وطبقات التغذية الأمامية، إضافةً إلى جدول تضمين الرموز.
يَعُدّ هذا التقدير تلك المصفوفات وجدول التضمين، ويُغفل الحدود الصغيرة — الانحيازات وقيم القياس والإزاحة في تسوية الطبقة وأي تضمينات موضعية متعلَّمة — وهي مجتمعةً تبلغ عادةً أقل من واحد بالمئة بكثير من نموذج كبير.
كم يسهم جدول التضمين؟
يحفظ جدول تضمين الرموز متّجهًا واحدًا بحجم الحجم المخفي لكل مدخل في المفردات، فيحوي حجم المفردات مضروبًا في الحجم المخفي من القيم. وفي نموذج صغير ذي مفردات كبيرة قد يكون ذلك حصة معتبَرة من الإجمالي، أما في نموذج كبير فتهيمن أوزان الانتباه والتغذية الأمامية لكل طبقة ويصبح التضمين كسرًا ضئيلًا.
وحين يتشارك تضمين الدخل وإسقاط الخرج المصفوفة نفسها — التضمينات المربوطة — يُعَدّ الجدول مرة واحدة لا مرتين.
أيُّهما يحوي أوزانًا أكثر: طبقات الانتباه أم التغذية الأمامية؟
في كل طبقة تحوي كتلة الانتباه نحو أربع قيم بمربّع الحجم المخفي من إسقاطات الاستعلام والمفتاح والقيمة والخرج، بينما تحوي كتلة التغذية الأمامية نحو ضِعف مُضاعِف التوسّع مضروبًا في مربّع الحجم المخفي.
ومع التوسّع الشائع وقدره أربعة، تحوي كتلة التغذية الأمامية نحو ثماني قيم بمربّع الحجم المخفي مقابل أربع لكتلة الانتباه، فيكون نحو ثُلثي كل طبقة في أوزان التغذية الأمامية.
إخلاء المسؤولية
هذا تقدير من الرتبة الأولى. يلتقط إسقاطات الانتباه وأوزان التغذية الأمامية وجدول التضمين، لكنه يُغفل الانحيازات ومعاملات تسوية الطبقة والتضمينات الموضعية، ويفترض ربط تضمينات الدخل والخرج. وقد تختلف الأعداد المنشورة لنموذج بعينه بهامش صغير.