مدونة فكرة
· 3 د

٥٢ في الـ leaderboard ما بتقول ليك كتير عن شغلك

Qwen3.8 27B جاب 52، والرقم ده بيقول ليك حاجة حقيقية، بس أقل بكتير من شكلو. والفجوة بين رقم الـ benchmark والقدرة الشغالة هي البتجيب أغلب الخيبات لمن تنزّل الموديل للشغل.

موديل Qwen3.8 27B جاب 52 في Artificial Analysis هذا الأسبوع. لموديل بالحجم ده الرقم قوي، والقصة الواضحة الناس حتكتبها هي المقارنة مع موديلات أكبر منو بأضعاف.

النتيجة حقيقية. بس هي كمان رقم واحد قاعد مقام سلة كاملة من حاجات مختلفة تماماً، ومن هنا بتبدأ تكلف الناس فلوس.

نفس الدرجة، وقرار معاكس

الدرجة المركبة بتجمع الأداء عبر مجموعة مهام. موديلين بنفس المجموع ممكن يكونوا مختلفين في كل حاجة تهمك إنت.

موديلين، ودرجة مركبة واحدة
مثال توضيحي. المتوسط 52 للاتنين. واحد بس منهم كويس في الشغلة البتعملها إنت.

لو منتجك بيلخص مستندات من مية صفحة، موديل B هو المرشح الوحيد في الرسمة ديه، وترتيب الـ leaderboard ما حيقول ليك كده أبداً. ولو شغلك كود، العكس صحيح. نفس الرقم بيقود لقرارين معاكسين، والرقم ده هو البيمشي في عرض مجلس الإدارة.

المتوسط حقيقي، وما بيقول ليك حاجة عن شغلك إنت.

ديه أقدم مشكلة في القياس

ما في حاجة جديدة هنا، والموضوع أوسع من الموديلات.

الرقم الواحد بتلقاهو اتبنى لأنو بيسمح بالترتيب، والترتيب هو الحاجة البتحتاجها اللجان، لأنو بيحول الحكم لإجراء. الإجراء ممكن تدافع عنو في اجتماع. الحكم لازم تتناقش فيهو.

وبعدين الرقم بهدوء بيعيد تعريف الحاجة الكان مفروض يقيسها. الناس بتحسّن باتجاه المؤشر، والمؤشر بيفقد المعلومة الكان شايلها من الأول، والكل بيواصل يرفعو برضو، لأنو البديل انك تعترف انو سنتين من التقارير كانت أقل معنى من شكلها.

ونفس الشكل بالظبط بتلقاهو في برامج التعلم. "الإكمال" ده كمان درجة مركبة: حضور، وكبسات، ووقت في الصفحة. أول ما يبقى هو الرقم المرفوع، البرنامج بيعيد ترتيب نفسو عشان ينتج إكمالات. وحيفضل يحقق الهدف والحاجة الكنت عاوزها واقفة في مكانها ما اتحركت.

التقييم المفيد شكلو كيف

الحل مؤشر أصغر وأوحش وأكثر تحديداً، وإنت مالكو.

درجة الـ leaderboard

تقييمك إنت

خليط مهام عام وثابت

عينة من شغلك الحقيقي

رقم واحد، مرتب

نسب نجاح لكل مهمة، بدون ترتيب

بيتحدث لما المزود ينزل نسخة

بيتحدث لما منتجك يتغير

بيجاوب "أي موديل الأحسن؟"

بيجاوب "ده كفاية لينا ولا لأ؟"

ما ممكن تتلاعب فيهو

ممكن تتلاعب فيهو، فما تعمل كده

مية مثال حقيقي من الـ logs بتاعتك، مصححة من زول عارف الإجابة الصاح شكلها شنو، بتغلب أي benchmark عام في الغرض المحدد ده: انك تقرر تنزل شنو. بتاخد بعد ضهر واحد. ومعظم الفرق ما بتصرفو البعد ضهر ده أبداً.

فاستخدم الـ leaderboard في الحاجة البيعملها كويس

الـ benchmarks المجمعة كويسة في الاستبعاد. بتقول ليك انو الموديل ده خارج المنافسة، وفي مجال بينزل فيهو حاجة كل أسبوع، الاستبعاد الرخيص ده قيمة حقيقية.

وضعيفة في الاختيار، لأنو الاختيار معتمد على توزيع مهام الـ benchmark ما عارفو.

استخدم الـ leaderboard تبني بيهو القائمة القصيرة. وبعد داك قرر بأرقامك إنت. الجهات البتطلع قيمة حقيقية من الموديلات الصغيرة هي، تقريباً بدون استثناء، الجهات القاست على شغلها هي، ولقت انو موديل الـ frontier قاعد يحل ليها مشكلة ما عندها.

أرقام Qwen هنا. اقراها كفلتر للقائمة القصيرة.

0
المشاهدات: 130
benchmarksmeasurementllm
MA
Mosab Alrasheed
استلم المقال التالي في بريدك

رسالة واحدة مع كل مقال جديد، فيها أبحاث وقرارات منتج وما تبلغنا به الفرق.