حاسبة عدد رموز مجموعة البيانات
المدخلات
| الكلمات | 100 |
|---|---|
| الرموز لكل كلمة | 1.3 |
| الحقب | 1 |
حاسبة عدد رموز مجموعة البيانات
تقدير عدد الرموز التي تحويها مدوّنة نصية انطلاقًا من عدد كلماتها ونسبة رموز لكل كلمة، ثم التحجيم بعدد حقب التدريب لإيجاد إجمالي الرموز التي سيراها النموذج.
المدخلات
المدوّنة
النتائج
أدخل قيمة لعرض النتائج.
تفاصيل
عدد رموز مجموعة البيانات
يبدأ تدريب نموذج لغوي ووضع ميزانيته من كمية واحدة: عدد الرموز التي تحويها مجموعة البيانات. غير أن المدوّنات تُوصَف عادةً بالكلمات أو الوثائق أو الغيغابايتات لا بالرموز، والنموذج لا يقرأ سوى الرموز. تردم هذه الحاسبة تلك الفجوة بتحويل عدد الكلمات إلى عدد مقدَّر من الرموز بنسبة رموز لكل كلمة، ثم التحجيم بعدد حقب التدريب لإعطاء الإجمالي الذي سيعالجه النموذج.
رموز لا كلمات
الرمز هو الوحدة الذرية التي ينتجها المُرمِّز حين يقسّم النص إلى أجزاء فرعية. وكثيرًا ما تصبح الكلمات المتكررة رمزًا واحدًا، بينما تُقسَّم الكلمات الأندر أو الأطول إلى عدة رموز، فيحوي المقطع دائمًا تقريبًا رموزًا أكثر من كلماته. وبما أن الربط يتعلّمه المُرمِّز، فإن النسبة بين الرموز والكلمات خاصية للمُرمِّز والنص لا ثابت كوني. ومعاملة الكلمات والرموز كأنها متبادلة يقلّل من العدد الحقيقي، ومعه الحوسبة التي تحتاجها الجولة.
كيف يعمل التقدير
يدخل حجم المدوّنة بملايين الكلمات، . والضرب في نسبة الرموز لكل كلمة يعطي رموز مرور واحد على البيانات. وتكرار المدوّنة لـ حقبة يضاعف العمل الذي ينفّذه النموذج، فتكون رموز التدريب الفعلية إجمالي المرور الواحد مضروبًا في عدد الحقب. ويُشتَق رقم بالمليارات من إجمالي الملايين لأن أحجام مجموعات التدريب تُعرض غالبًا بمليارات الرموز.
الصيغة
عند وجود بملايين الكلمات ونسبة و حقبة، يكون إجمالي المرور الواحد (ملايين)، وصيغته بالمليارات، وإجمالي التدريب المحجَّم بالحقب (ملايين)
TE=W⋅r=T⋅eوالرقم بالمليارات هو ببساطة .
مثال محلول
لنأخذ مدوّنة من 100 مليون كلمة مُرمَّزة عند 1.3 رمز لكل كلمة ومدرَّبة لمدة ثلاث حقب:
TE=100×1.3=130 million tokens=130×3=390 million tokensمرور واحد على البيانات نحو 130 مليون رمز، أي 0.13 مليار. والتدريب لمدة ثلاث حقب يعني أن النموذج ينفّذ مرورات أمامية وعكسية على ما يعادل 390 مليون رمز، وإن كان 130 مليونًا فقط فريدًا. الإجمالي الفريد يصف المعلومات المتاحة؛ والإجمالي المحجَّم بالحقب يصف العمل ومن ثم الحوسبة.
اختيار النسبة
بالنسبة للنثر الإنجليزي بمُرمِّز حديث قائم على أزواج البايتات، تُعد نحو 1.3 رمز لكل كلمة قيمة افتراضية معقولة، ونحو أربعة محارف لكل رمز تقريب مرتبط. وتميل الأكواد والرياضيات والخطوط غير اللاتينية إلى التفتّت إلى رموز أكثر، فترفع النسبة. والنهج الموثوق هو تشغيل المُرمِّز المقصود على عيّنة ممثِّلة وقسمة ناتجها من الرموز على عدد كلمات تلك العيّنة، ثم استخدام النسبة المقيسة هنا. ويُعالَج التحويل العكسي من ميزانية رموز إلى طول مقروء في حاسبة التوكنات إلى الكلمات.
الحدود
النتيجة تقدير. فالعدد الدقيق للرموز يتوقف على المُرمِّز المحدد وعلى التنسيق والفراغات وكيفية ربط الوثائق، ولا تلتقط نسبة واحدة شيئًا من ذلك التقاطًا تامًا. وعدّ الحقب رموزًا إضافية صحيح للحوسبة والتوسع، لكن الرموز المتكررة لا تحمل معلومات جديدة وتقدّم عوائد متناقصة بعد بضعة مرورات. وللتحقق مما إذا كانت مجموعة البيانات كبيرة بما يكفي لحجم نموذج معطى، يُقارَن إجمالي المرور الواحد بالهدف الأمثل من حيث الحوسبة في حاسبة عدد رموز شينشيلا المثلى.
الأسئلة الشائعة (FAQ)
كيف تختلف الرموز عن الكلمات؟
الرمز هو الوحدة التي يقرؤها النموذج فعلًا، وينتجها مُرمِّز يقسّم النص إلى أجزاء فرعية. وكثيرًا ما تُربَط الكلمات الشائعة برمز واحد، بينما تُقسَّم الكلمات الأندر أو الأطول إلى عدة رموز، فيكون عدد رموز النص أعلى عادةً من عدد كلماته.
وتتوقف النسبة بينهما على المُرمِّز واللغة، ولهذا يحجّم هذا التقدير عدد الكلمات بمعامل صريح للرموز لكل كلمة بدلًا من افتراض تساويهما.
ما نسبة الرموز لكل كلمة المعقولة؟
بالنسبة للنثر الإنجليزي المُرمَّز بمُرمِّز حديث قائم على أزواج البايتات أو على الوحدات الأحادية، تُعد نحو 1.3 رمز لكل كلمة قاعدة عامة شائعة، ونحو أربعة محارف لكل رمز تقدير مرتبط. أما الأكواد والرياضيات واللغات الغنية صرفيًا أو غير اللاتينية الخط فتنتج عادةً رموزًا أكثر لكل كلمة.
ويأتي الرقم الأوثق من تشغيل المُرمِّز المستهدف على عيّنة ممثِّلة من المدوّنة الفعلية وقسمة عدد الرموز الناتج على عدد الكلمات.
هل ينبغي عدّ الحقب المتكررة رموزًا إضافية؟
لتقديرات الحوسبة والتوسع، نعم: تنفّذ كل حقبة مجموعة كاملة أخرى من المرورات الأمامية والعكسية على البيانات، فتكون رموز التدريب الفعلية هي عدد المرور الواحد مضروبًا في عدد الحقب.
أما لأسئلة تفرّد البيانات فيهم الفرق، لأن الرموز المتكررة ليست معلومات جديدة وتقدّم عوائد متناقصة بعد بضعة مرورات. وتعرض هذه الحاسبة كلًّا من إجمالي المرور الواحد الفريد وإجمالي التدريب المحجَّم بالحقب فيتوفّر المنظوران.
إخلاء المسؤولية
أعداد الرموز تقديرات مبنية على متوسط نسبة الرموز لكل كلمة؛ ويتوقف الإجمالي الدقيق على المُرمِّز المحدد وعلى النص نفسه. يُشغَّل المُرمِّز المقصود على عيّنة للحصول على رقم دقيق قبل تخصيص ميزانيات الحوسبة.