حاسبة pass@k
المدخلات
| معدّل النجاح لكل عيّنة | 40 % |
|---|---|
| عدد العيّنات | 10 |
حاسبة pass@k
حساب pass@k لتقييمات الشيفرة والاستدلال: احتمال أن تحلّ عيّنة واحدة على الأقل من بين k عيّنة مستقلة من النموذج مسألةً ما، انطلاقًا من معدّل النجاح لكل عيّنة.
المدخلات
المعاينة
النتائج
أدخل قيمة لعرض النتائج.
تفاصيل
pass@k
pass@k هو الطريقة القياسية لتسجيل النماذج اللغوية على المهام التي يمكن فحص جوابها المرشَّح آليًا — وأشهرها توليد الشيفرة، حيث تجتاز كل محاولة حزمة اختبارات أو لا تجتازها. وبدلًا من السؤال عمّا إذا كان جواب واحد صحيحًا، يسأل pass@k عمّا إذا كانت أي محاولة من k محاولة صحيحة. تحوّل هذه الحاسبة معدّل النجاح لكل عيّنة لنموذج إلى pass@k، فيمكن إسقاط دقة مقيسة واحدة على أي عدد من المحاولات.
ماذا يقيس pass@k
لكل مسألة في معيار يولّد النموذج k حلًا مرشَّحًا مستقلًا، وتُعَدّ المسألة محلولةً إذا اجتاز مرشَّح واحد على الأقل. وpass@k هو نسبة المسائل المحلولة بهذه القاعدة. وpass@1 هو الدقة العادية من محاولة واحدة؛ ويقيس pass@10 وpass@100 كم مرة يستطيع النموذج بلوغ جواب صحيح بإتاحة عدة محاولات. ويهمّ المقياس كلما استطاع مُتحقِّق خارجي — حزمة اختبارات، أو مُترجِم، أو مُدقِّق برهان — تمييز جواب صحيح بين مرشّحين كثيرين، إذ تُترجَم المحاولات الإضافية حينئذٍ مباشرةً إلى مسائل محلولة أكثر.
الصيغة
إذا نجحت كل عيّنة باستقلال بالاحتمال ، فإن عيّنة واحدة تفشل باحتمال واحد ناقص ، وتفشل كل العيّنات الـ باحتمال . وpass@k هو المُتمِّم:
Pkqk=1−(1−p)k=(1−p)kحيث هو pass@k، و احتمال أن تفشل كل محاولة. ويتقلّص احتمال فشل الجميع هندسيًا مع ، ولهذا يتسلّق حتى معدّل لكل عيّنة متواضع نحو اليقين بعددٍ كافٍ من المحاولات.
مثال محلول
لنفترض أن نموذجًا يحلّ مسألة برمجية في 40% من المحاولات الواحدة، وأن التقييم يتيح 10 عيّنات:
q10P10=(1−0.4)10=0.610≈0.0060=1−0.0060≈0.994=99.4%يصير معدّل لكل عيّنة قدره 40% إلى pass@10 قدره نحو 99%. وتُظهر القفزة لماذا ترتفع قيم pass@k بهذه السرعة مع k، ولماذا تذكر جداول المعايير عدة قيم لـ k جنبًا إلى جنب — فشكل ذلك المنحنى يقول عن النموذج أكثر مما تقوله أي نقطة مفردة.
كيف يُقاس
تقدير pass@k بسحب k عيّنة بالضبط مُشوَّش. وتسحب المعايير مثل HumanEval بدلًا من ذلك مجموعة أكبر من عيّنة، وتَعدّ العدد الناجح، وتستعمل المُقدِّر غير المتحيّز ، آخذةً المتوسط على كل طريقة لاختيار من العيّنات الـ . وتطابق صيغة الاستقلال المستعملة هنا ذلك المُقدِّر حين يُؤخَذ بوصفه ، وهي الأداة الصحيحة لإسقاط معدّل نجاح معلوم على ميزانية محاولات مختارة. وتفترض الصيغة نجاحًا متساويًا ومستقلًا عبر العيّنات؛ وعند درجة حرارة منخفضة جدًا تصير العيّنات متطابقة تقريبًا فلا يفيد إضافة المزيد إلا قليلًا. ولتخطيط عدد المسائل الذي يحتاجه تقييم للحصول على تقدير مستقر، انظر حاسبة حجم عيّنة تقييم النموذج اللغوي.
الأسئلة الشائعة (FAQ)
ما pass@k؟
pass@k هو المقياس القياسي لتقييمات توليد الشيفرة وسائر تقييمات المعاينة والتحقق. ولكل مسألة يولّد النموذج k حلًا مرشَّحًا، وتُعَدّ المسألة محلولةً إذا اجتاز مرشَّح واحد على الأقل الاختبارات. وpass@k هو نسبة المسائل المحلولة بهذه القاعدة.
ويعكس pass@1 الدقة من محاولة واحدة، بينما يقيس pass@10 أو pass@100 كم مرة يستطيع النموذج حلّ مسألة بإتاحة عدة محاولات — وهو مهمّ حين يستطيع مُدقِّق خارجي، كحزمة اختبارات أو مُتحقِّق، انتقاء جواب صحيح من بين كثير.
هل تفترض الصيغة أن العيّنات مستقلة؟
نعم. يفترض التعبير واحد ناقص (واحد ناقص p) أُسّ k أن كل عيّنة من العيّنات الـ k تنجح باستقلال بالاحتمال p نفسه. وهذا يصدُق جيدًا حين تُسحَب العيّنات عند درجة حرارة غير صفرية فتتباين.
وينهار عند درجة حرارة منخفضة جدًا، حيث تكون العيّنات متطابقة تقريبًا فلا يضيف سحب المزيد إلا قليلًا، وحين تتفاوت صعوبة المسائل بحيث يُخفي متوسط p واحد مزيجًا من الحالات السهلة والصعبة. ولإسقاط معدّل مقيس على k مختلف، تكون صيغة الاستقلال تقريبًا أوّليًا جيدًا.
كيف يُقاس pass@k عمليًا؟
تقدير pass@k بسحب k عيّنة حرفيًا مُشوَّش. وتسحب المعايير مثل HumanEval بدلًا من ذلك عددًا أكبر n من العيّنات، وتَعدّ العدد c الناجح، وتستعمل المُقدِّر غير المتحيّز pass@k = 1 − C(n−c, k) / C(n, k)، حيث C معامل ذي الحدّين. وهذا يأخذ المتوسط على كل طرق اختيار k من العيّنات الـ n ويعطي قيمة أكثر استقرارًا بكثير.
وتستعمل هذه الحاسبة صيغة الاستقلال الأبسط، التي تطابق المُقدِّر حين يُؤخَذ p بوصفه c/n وهي مثالية لإسقاط معدّل نجاح معلوم على ميزانية محاولات مختارة.
إخلاء المسؤولية
تفترض صيغة الاستقلال احتمال نجاح متساويًا ومستقلًا لكل عيّنة. والعيّنات الواقعية مترابطة عند درجة الحرارة المنخفضة وتتفاوت الصعوبة عبر المسائل، فقد يختلف pass@k المقيس. استعمل مجموعة عيّنات كبيرة والمُقدِّر غير المتحيّز عند نشر نتائج المعايير.