مدونة فكرة
· 3 د

الموديل الأحسن ما حينقذك من معيار سيء

تقرير Roboflow عن أداء GPT-5.6 في الرؤية نتيجة كويسة، وكمان بيوريك إنو كلمة «الأحسن» ليها معنى بس قصاد مهمة إنت حددتها.

Roboflow نشرت هذا الأسبوع مقال بتقول فيهو إنو GPT-5.6 Sol أقوى نموذج بصري أطلقتو OpenAI. أدلتهم محددة، ومجموعة اختبارهم معلنة، وده براهو بيقدّم الدعوى على أغلب الي بينكتب عن جودة النماذج.

نتيجة كويسة. وهي كمان، لو قريتها بسرعة، قرار شراء ماشي في طريقو للمشكلة.

والكلمة الي شايلة كل الحمل في الجملة ديك هي «أقوى».

الرؤية مهام كتيرة

الرؤية بتشمل قراءة جدول مكتظ، وعدّ أجسام في إطار مزدحم، وتحديد عيب صغير على سطح واسع، ووصف مشهد.

ديه أربع مهام بأربع أنماط إخفاق مختلفة، وكلمة واحدة بتغطيهم كلهم. والنموذج ممكن يتقدم بحسم في تلاتة ويثبت في الرابعة، وكل تلخيص للوضع ده هو اختيار للمهمة الي صدف إنو الملخِّص كان مهتم بيها.

والاختيار ده غالباً ما بيبان، حتى للزول الي بيعملو.

والمشكلة ديه قديمة، وبتنطبق على البشر زي ما بتنطبق على النماذج. «محلّل قوي» كمان ضغط لعدة أحكام مقابل معيار ضمني، وفي المعيار يسكن الخلاف كلو. بس ما بننتبه، لأنو مع البشر على الأقل بنتناقش في المعيار بصوت عالي.

اكتب المعيار الأول

والانضباط الي بينفع هنا غير برّاق ومزعج شوية. عرّف شكل الإجابة الكويسة قبل ما تشوف أي إجابة.

المعايير المكتوبة بعد ما المخرجات تجي بتوصف المخرجات، بسبب الميل البشري العادي إنك تلقى الشروط الي الحاجة المبهرة بتستوفيها. وما محتاج زول يكون سيء النية عشان ده يحصل. انت حتعملها، وأنا حأعملها، وما حد فينا حينتبه.

والمعيار المكتوب سلفاً بيبقى صالح لما النموذج يتغير من تحتك، وترتيب لوحة الصدارة بيعيش لحدي الإصدار الجاي بس.

الدرجة مقابل كلفة العيّنة
أرقام توضيحية. المحور اللوغاريتمي بيمتد تلات مراتب قدرية من الأرخص للأغلى، والدرجات بتتحرك أقل من كدا بكتير.

الرسم الفوق ده مخترع، وشكلو هو الحجة. الفرق في الكلفة هائل، والفرق في الدرجة لمهمة واحدة بعينها غالباً صغير. عشان كده السؤال المفيد هو «أي واحد كافي هنا، والفرق بيكلفني كم في الألف نداء».

وين المعيار العام بيستاهل تعبو

المعايير المجمَّعة ممتازة في الاستبعاد. بتقول ليك إنو نموذج خارج المنافسة، وفي مجال بيصدر أسبوعياً، الاستبعاد الرخيص بيساوي فلوس حقيقية.

وضعيفة في الاختيار، لأن الاختيار بيعتمد على توزيع مهام المعيار ما شافو أبداً. تقريباً كده:

السؤال

المعيار العام

أمثلتك الخمسين

هل النموذج ده في المنافسة؟

كويس

مبالغة

حيتعامل مع وثائقي أنا؟

ما في إشارة

بتجاوب عليهو مباشرة

حيفضل صح بعد ستة شهور؟

بينتهي

قابل لإعادة التشغيل

أقدر أدافع عن الاختيار؟

احتكام لسلطة

دليل

خمسين مثال

ف استخدم لوحة الصدارة تبني قائمة مختصرة، وبعدين احسم بتقييمك انت.

اجمع خمسين مثال من عبء شغلك الحقيقي، وضمنها الأمثلة الي عمليتك الحالية بتغلط فيها. وقيّمها مقابل التعريف الي كتبتو الأول.

الخمسين رقم صغير يكفي تبنيه في بعد ظهر، وكبير يكفي يحرج افتراض واثق. والمجموعة ديه حتعمّر أجيال من النماذج، وده أكتر من الي بتحققو أغلب المعايير، وبتحول سؤال «أي نموذج أفضل» لي سؤال تقدر تجاوب عليهو بنفسك.

مقال Roboflow يستاهل القراءة. وبعدها شغّل الخمسين بتاعينك وقرّر منهم.

0
المشاهدات: 108
evaluationrubricsbenchmarks
MA
Mosab Alrasheed
استلم المقال التالي في بريدك

رسالة واحدة مع كل مقال جديد، فيها أبحاث وقرارات منتج وما تبلغنا به الفرق.