إيجاد العدد الأمثل لرموز التدريب من حيث الحوسبة لنموذج ما باستخدام قاعدة شينشيلا، أي نحو عشرين رمزًا لكل معامل، مع حوسبة التدريب الناتجة بوحدة FLOPs.
المدخلات
النموذج
عدد معاملات النموذج بالمليارات. يتناسب عدد الرموز الأمثل طرديًا مع هذا الرقم.
عدد رموز التدريب لكل معامل. تضع نتيجة شينشيلا النسبة المثلى من حيث الحوسبة قرب عشرين؛ وكثيرًا ما تُدرَّب النماذج الموجَّهة للنشر إلى ما يتجاوزها بكثير.
النتائج
أدخل قيمة لعرض النتائج.
العدد الموصى به لرموز التدريب بالمليارات — 70 مليار معامل مضروبًا في 20 رمز لكل معامل، أي نحو ... مليار.
عدد الرموز الموصى به نفسه معبَّرًا عنه بالتريليونات لسهولة القراءة، نحو ....
تفاصيل
الحوسبة اللازمة للتدريب عند هذا العدد من الرموز وفق قاعدة 6ND — ست عمليات لكل معامل ولكل رمز — نحو ... عملية فاصلة عائمة.
عدد رموز شينشيلا المثلى
أعادت نتيجة توسع شينشيلا تشكيل طريقة تحديد أحجام النماذج اللغوية. فقد أظهرت أن أفضل دقة، مقابل ميزانية حوسبة ثابتة، لا تأتي من تكبير النموذج قدر الإمكان، بل من توسيع المعاملات ورموز التدريب معًا — بقرن كل معامل بنحو عشرين رمزًا من بيانات التدريب. تطبّق هذه الحاسبة تلك النسبة، فتأخذ عدد المعاملات وتُعيد عدد الرموز الأمثل من حيث الحوسبة إلى جانب حوسبة التدريب التي يستلزمها.
النسبة المثلى من حيث الحوسبة
قبل شينشيلا، كانت الممارسة السائدة تنفق معظم ميزانية الحوسبة على المعاملات وقدرًا ضئيلًا نسبيًا على البيانات، فتُنتج نماذج ناقصة التدريب قياسًا بحجمها. لاءمت دراسة ديب مايند عام 2022 قوانين التوسع عبر مئات الجولات، ووجدت أن الخسارة تبلغ أدنى قيمة، عند ميزانية معطاة، حين ينمو حجم النموذج وحجم البيانات بالتوازي. وتضع نقطة التوازن التجريبية مجموعة البيانات المثلى عند نحو عشرين رمز تدريب لكل معامل. فالنموذج ذو معامل ينبغي أن يُدرَّب على نحو رمز.
الصيغة
عند وجود عدد المعاملات بالمليارات ونسبة من الرموز لكل معامل، يكون عدد الرموز الأمثل وحوسبة التدريب المرتبطة به
DC=N⋅r=6⋅N⋅D⋅1018
حيث عدد رموز التدريب الأمثل بالمليارات و حوسبة التدريب بعمليات الفاصلة العائمة. تتبع الحوسبة قاعدة التي تحمّل نحو ست عمليات لكل معامل ولكل رمز، ويعيد المعامل المليارات في و إلى أعداد مطلقة.
مثال محلول
لنأخذ نموذجًا بـ 70 مليار معامل والنسبة المركزية البالغة عشرين رمزًا لكل معامل:
مجموعة البيانات المثلى من حيث الحوسبة نحو 1.4 تريليون رمز، والتدريب عليها يكلّف ما يقارب عملية. ورفع النسبة — إلى مئة رمز لكل معامل مثلًا — يزيد عدد الرموز والحوسبة بتناسب طردي.
الحدود
تُقلّل نسبة العشرين إلى واحد خسارة التدريب مقابل ميزانية تدريب ثابتة، لكنها تتجاهل عمدًا تكلفة خدمة النموذج النهائي. فالنموذج الذي سيجيب طلبات كثيرة كثيرًا ما يُدرَّب على رموز أكثر بكثير من المثلى وفق شينشيلا، لأن نموذجًا أصغر مدرَّبًا لمدة أطول أرخص في التشغيل للجودة نفسها. كما تتحول النسبة المثلى الدقيقة بتحول مجموعة البيانات والمُرمِّز والمعمارية، فعشرون تقدير مركزي لا ثابت. ويُعالَج المسألة المكمِّلة لتحجيم نموذج وفق ميزانية حوسبة ثابتة في حاسبة حجم النموذج الأمثل من حيث الحوسبة، وتُعالَج الحوسبة الخام لأي تهيئة مختارة في حاسبة عمليات تدريب النموذج (FLOPs).
الأسئلة الشائعة (FAQ)
ما هي نتيجة توسع شينشيلا؟
نتيجة شينشيلا، التي نشرتها ديب مايند عام 2022، وجدت أن النماذج الكبيرة السابقة كانت ناقصة التدريب: فمقابل ميزانية حوسبة ثابتة، تتحسن الدقة أكثر عند توسيع حجم النموذج وعدد رموز التدريب معًا بدلًا من إنفاق الميزانية على المعاملات في الغالب.
وقد لاءمت الدراسة قوانين التوسع عبر مئات جولات التدريب، وخلصت إلى أن التوزيع الأمثل من حيث الحوسبة يقرن كل معامل بنحو عشرين رمز تدريب، وهو انحراف حاد عن النماذج السابقة المدرَّبة عند نسب أدنى بكثير.
لماذا نحو عشرين رمزًا لكل معامل؟
تنبثق النسبة من قوانين التوسع المُلاءَمة لبيانات التدريب. فعند ميزانية حوسبة ثابتة، تبلغ الخسارة أدنى قيمة حين يتساوى النفع الحدي لإضافة معاملات مع النفع الحدي لإضافة رموز، وتضع الأسس التجريبية في دراسة شينشيلا هذا التوازن قرب عشرين رمزًا لكل معامل.
يتوقف الرقم الدقيق على مجموعة البيانات والمعمارية، فعشرون تقدير مركزي مُقرَّب لا ثابت دقيق.
هل ما زال عشرون رمزًا لكل معامل هو الهدف الصحيح؟
عشرون هي النسبة المثلى من حيث الحوسبة لتقليل خسارة التدريب عند ميزانية تدريب ثابتة، لكنها تتجاهل تكلفة الاستدلال. فالنموذج الذي سيخدم طلبات كثيرة كثيرًا ما يُدرَّب على رموز أكثر بكثير من المثلى وفق شينشيلا، لأن نموذجًا أصغر مدرَّبًا لمدة أطول أرخص في التشغيل حتى وإن لم يكن تدريبه أمثل من حيث الحوسبة.
وتُدرَّب عدة نماذج واسعة الاستخدام عند نسب تبلغ مئة أو أكثر لهذا السبب، فعشرون خط أساس لا سقف.
إخلاء المسؤولية
نسبة العشرين رمزًا لكل معامل تقدير مركزي مستمد من قوانين توسع شينشيلا، وتتغير بتغير مجموعة البيانات والمعمارية. وهي تُحسِّن حوسبة التدريب وحدها ولا تأخذ في الحسبان تكلفة الاستدلال التي تبرر غالبًا تدريب نماذج أصغر على رموز أكثر بكثير. تُستخدم النتيجة كنقطة انطلاق لا كقاعدة ثابتة.