موديل Qwen3.8 27B جاب 52 في Artificial Analysis هذا الأسبوع. لموديل بالحجم ده الرقم قوي، والقصة الواضحة الناس حتكتبها هي المقارنة مع موديلات أكبر منو بأضعاف.
النتيجة حقيقية. بس هي كمان رقم واحد قاعد مقام سلة كاملة من حاجات مختلفة تماماً، ومن هنا بتبدأ تكلف الناس فلوس.
نفس الدرجة، وقرار معاكس
الدرجة المركبة بتجمع الأداء عبر مجموعة مهام. موديلين بنفس المجموع ممكن يكونوا مختلفين في كل حاجة تهمك إنت.
لو منتجك بيلخص مستندات من مية صفحة، موديل B هو المرشح الوحيد في الرسمة ديه، وترتيب الـ leaderboard ما حيقول ليك كده أبداً. ولو شغلك كود، العكس صحيح. نفس الرقم بيقود لقرارين معاكسين، والرقم ده هو البيمشي في عرض مجلس الإدارة.
المتوسط حقيقي، وما بيقول ليك حاجة عن شغلك إنت.
ديه أقدم مشكلة في القياس
ما في حاجة جديدة هنا، والموضوع أوسع من الموديلات.
الرقم الواحد بتلقاهو اتبنى لأنو بيسمح بالترتيب، والترتيب هو الحاجة البتحتاجها اللجان، لأنو بيحول الحكم لإجراء. الإجراء ممكن تدافع عنو في اجتماع. الحكم لازم تتناقش فيهو.
وبعدين الرقم بهدوء بيعيد تعريف الحاجة الكان مفروض يقيسها. الناس بتحسّن باتجاه المؤشر، والمؤشر بيفقد المعلومة الكان شايلها من الأول، والكل بيواصل يرفعو برضو، لأنو البديل انك تعترف انو سنتين من التقارير كانت أقل معنى من شكلها.
ونفس الشكل بالظبط بتلقاهو في برامج التعلم. "الإكمال" ده كمان درجة مركبة: حضور، وكبسات، ووقت في الصفحة. أول ما يبقى هو الرقم المرفوع، البرنامج بيعيد ترتيب نفسو عشان ينتج إكمالات. وحيفضل يحقق الهدف والحاجة الكنت عاوزها واقفة في مكانها ما اتحركت.
التقييم المفيد شكلو كيف
الحل مؤشر أصغر وأوحش وأكثر تحديداً، وإنت مالكو.
درجة الـ leaderboard | تقييمك إنت |
|---|---|
خليط مهام عام وثابت | عينة من شغلك الحقيقي |
رقم واحد، مرتب | نسب نجاح لكل مهمة، بدون ترتيب |
بيتحدث لما المزود ينزل نسخة | بيتحدث لما منتجك يتغير |
بيجاوب "أي موديل الأحسن؟" | بيجاوب "ده كفاية لينا ولا لأ؟" |
ما ممكن تتلاعب فيهو | ممكن تتلاعب فيهو، فما تعمل كده |
مية مثال حقيقي من الـ logs بتاعتك، مصححة من زول عارف الإجابة الصاح شكلها شنو، بتغلب أي benchmark عام في الغرض المحدد ده: انك تقرر تنزل شنو. بتاخد بعد ضهر واحد. ومعظم الفرق ما بتصرفو البعد ضهر ده أبداً.
فاستخدم الـ leaderboard في الحاجة البيعملها كويس
الـ benchmarks المجمعة كويسة في الاستبعاد. بتقول ليك انو الموديل ده خارج المنافسة، وفي مجال بينزل فيهو حاجة كل أسبوع، الاستبعاد الرخيص ده قيمة حقيقية.
وضعيفة في الاختيار، لأنو الاختيار معتمد على توزيع مهام الـ benchmark ما عارفو.
استخدم الـ leaderboard تبني بيهو القائمة القصيرة. وبعد داك قرر بأرقامك إنت. الجهات البتطلع قيمة حقيقية من الموديلات الصغيرة هي، تقريباً بدون استثناء، الجهات القاست على شغلها هي، ولقت انو موديل الـ frontier قاعد يحل ليها مشكلة ما عندها.
أرقام Qwen هنا. اقراها كفلتر للقائمة القصيرة.
رسالة واحدة مع كل مقال جديد، فيها أبحاث وقرارات منتج وما تبلغنا به الفرق.







