مدونة فكرة
· 15 د

Jev بيجاوب في نص ثانية وما بيقدر يكتب جملة

أول موديل System One من TypeSafe بيبدّل النص بإجابات محددة النوع معاها احتمالات.

أغلب الكود البيطلع structured output ماشي في نفس اللفّة. تطلب JSON من موديل frontier، تعمل deserialization تفك الرد، تتأكد إنو مطابق للـ schema، تعيد الطلب وترسلو لي LLM تاني لو في حقل ناقص، وتدفع حق كل token تفكير في النص. ده قصه اي تطبيق شغال بالذكاء الاصطناعي التوليدي الايام ده، الموديل الجديد من TypeSafe، اسمو Jev، بيشيل النص من اللفّة دي كلها. بيقرا البيانات مرة واحدة، بيجاوب على قائمة أسئلة مجمعه في نفس الطلب وليها أنواع محددة في نفس اللحظة (نسبيه ،ثنائيه او خيارات بالتحديد)، ويرجّع ليك قيم راجعه الكود بتاعك يقدر بيتصرف بيها، وكل قيمة معاها احتمال. ده كلو لي انواع اسئله كتيره وبي سرعه فائقة وبعد ده كلو ما بيقدر يكتب جملة.

TypeSafe نزّلتو يوم ١٥ سبتمبر ٢٠٢٦ كأول موديل من نوعو سمّوهو System One. قريت بوست الإطلاق، والـ docs، والـ evals المنشورة، وقائمة المشاكل الاوليه اللي جات معاهو، وبعدين قارنتو بالـ LLMs الكلنا أصلاً شغّالين بيها، وبأدوات الـ open source البتعمل نفس الشغل.

بترسل شنو وبيرجع ليك شنو

طلب Jev فيهو جزئين. الـ state هو الحاجة الداير تحكم عليها: حاجه زي تذكرة دعم عاوز تصنفها، فاتورة عاوز تعرف اتدفعت ولا لا، أو فريم من فيديو اولعبة موصوف كـ JSON. والـ questions هي الحاجات الانت داير تعرفها، وكل سؤال بيكون ليهو نوع. دا المثال من الـ quick start بتاعهم زي ما هو:

{
  "state": "Hi, I've been trying to connect my Stripe account for 3 days and the integration keeps failing. I'm losing sales. Please help ASAP.",
  "model": "jev-latest",
  "questions": {
    "department": {
      "type": "choice",
      "instructions": "Which team should handle this",
      "criteria": {
        "billing": "Payment or subscription issues",
        "technical": "Bugs or integration problems",
        "sales": "Pricing or account questions"
      }
    },
    "frustration": {
      "type": "score",
      "instructions": "How frustrated the customer appears",
      "criteria": [
        "Calm, just stating facts",
        "Frustrated but civil",
        "Very angry, strong language"
      ]
    },
    "is_urgent": {
      "type": "noul",
      "instructions": "The message conveys urgency or time-sensitivity"
    }
  }
}

والرد:

{
  "model": "jev-1.13.0",
  "answers": {
    "department": {
      "type": "choice",
      "choice": "technical",
      "confidence": 0.78,
      "probabilities": { "technical": 0.85, "sales": 0.0, "billing": 0.15 }
    },
    "frustration": {
      "type": "score",
      "score": 1.0,
      "confidence": 1.0,
      "legend": {
        "0": "Calm, just stating facts",
        "1": "Frustrated but civil",
        "2": "Very angry, strong language"
      },
      "probabilities": { "0": 0.0, "1": 1.0, "2": 0.0 }
    },
    "is_urgent": { "type": "noul", "noul": 1.0 }
  },
  "usage": { "input_tokens": 392, "output_tokens": 65 }
}

تلاتة أسئلة مشت في طلب واحد، Jev قرا التذكرة مرة واحدة بس. القسم رجع technical باحتمال 0.85، وbilling بـ 0.15. القيمة دايماً واحدة من المفاتيح الإنت كتبتها، يعني ما في JSON تفتش عليهو جوّه فقرة م فاهم ليه رجعت اصلا من OpenAI، وما في إعادة طلب عشان الموديل اخترع ليك قسم رابع. TypeSafe بتقول طلب زي دا بياخد من 70 لـ 500 ملّي ثانية من الأول للآخر.

في تلاتة أنواع أسئلة:

النوع

بيسأل عن شنو

بيرجّع شنو

مثال

Choice

اختار خيار واحد من مجموعة إنت بتحددها (لحدي 255 خيار)

المفتاح المختار، احتمال لكل خيار، ودرجة ثقة

ياتو فريق يمسك التذكرة دي؟

Score

خت الـ state على مقياس مرتّب

درجة، احتمال لكل مستوى، ودرجة ثقة

الزبون متضايق لأي درجة، من هادي لزعلان شديد؟

Noul

الكلام دا صاح؟

رقم واحد من 0 لـ 1

الرسالة فيها استعجال؟

الـ docs بتصر وتشدد على قاعدة تصميم واحدة. كل سؤال بيسأل عن حاجة واحدة معينه ومحدده. بدل ما تسأل "نعمل شنو في الفاتورة دي"، بتسأل هل المجاميع متطابقة؟، هل المورّد مسجّل عندنا؟، وهل إيصال الاستلام بيغطي كل بند؟، والكود بتاعك هو البيجمع الإجابات بعدين ويتخذ القرار المحتاجو.

طب السوال! بيفرق في شنو من الـ LLM العندك

TypeSafe درّبت Jev بطريقة سمّوها Reinforcement Learning for Calibrated Decisions، واختصارها RLCD. الـ LLM المتدرّب بـ RLHF بيتعلم يطلّع إجابات الناس بيفضّلوها، يعني بعد التدريب بتكون في فتره بجو خبراء بشر يدو رايهم علي اسئله او يدو رايهم علي اجابات ال LLM او يدو اجاباتهم هم وتتقارن مع ال LLM او كل ده مع بعض. RLCD بتكافئ الاحتمال لمّن يطابق عدد المرات اللي الإجابة بتطلع فيها صاح، يعني الـ 0.8 المفروض تكون صاح في حوالي 80% من الحالات. وJev بيطلّع كل الإجابات في نفس الوقت بدل ما يكتب token ورا token، ودا مصدر السرعة.

LLM frontier (GPT-5.6 Terra، Claude، Gemini(Not sure if frontier))

Jev 1.13

المخرجات

نص، token ورا token

قيمة محددة النوع لكل سؤال، كلها مع بعض

متدرّب على

إجابات الناس بيفضّلوها (RLHF) ومكافآت قابلة للتحقق (RLVR)

احتمالات مضبوطة (RLCD)

زمن الرد

من 3 لـ 329 ثانية في مقارنة TypeSafe

من 70 لـ 500 ملّي ثانية

السعر

Terra بـ $2 للمليون token دخل و$12 للمليون خرج

$0.042 للمليون token دخل، والخرج مجاني

الثقة

البيكتبو الموديل عن نفسو

احتمال لكل خيار

الدخل

نص، وصور أو صوت في أغلبها

نص بس. 64 ألف token للطلب، و32 ألف للـ state مع أطول سؤال

اللغات

واسعة

الإنجليزي أولاً. TypeSafe بتقول جرّب أي لغة تانية قبل ما تعتمد عليها

التخصيص

Fine-tuning، أو أوزان مفتوحة لبعض الموديلات

نفس الأوزان لكل الحسابات، ما في fine-tuning. بتشكّلو بالـ state والتعليمات والمعايير

بيشتغل وين

APIs المزوّدين، أو الـ GPUs بتاعتك للموديلات المفتوحة

API حق TypeSafe بس

شاطر في

الكتابة، الدردشة، الكود، التفكير المتعدد الخطوات

التصنيف، التوجيه، التقييم، الاختيار من مجموعة مقفولة، والتحقق من ادعاء

الأسماء مستلفة. System One مصطلح دانيال كانيمان للتفكير السريع البديهي، قصاد System Two البطيء المتأنّي البتقلّدو موديلات الـ reasoning. وJev اسمو جاي من William Stanley Jevons، اللاحظ سنة 1865 إنو محركات البخار لمّن بقت أكفأ، بريطانيا بقت تحرق فحم أكتر. TypeSafe بتراهن إنو القرار لمّن يبقى رخيص كدا، الناس حيطلبوهو أكتر بكتير من ما بيطلبوا الـ LLM هسي.

مؤسس TypeSafe هو Diogo Almeida، كان باحث في OpenAI واشتغل على طرق اتّباع التعليمات الوراء ChatGPT. The Register بتقول الشركة جمعت 40 مليون دولار. الدخول لسه مبكر، عن طريق قائمة انتظار.

قراءة الـ evals

TypeSafe ناشرة أربعة workflows للتقييم في evals.typesafe.ai: فرز تنبيه أمني، مراجعة شغل agent دعم، قرار دفع فاتورة، واختيار الخطوة الجاية في محادثة خدمة عملاء. في اختباراتهم، كل LLM بيشغّل كل مهمة مرتين، مرة كـ prompt واحد، ومرة كـ workflow من أسئلة محدده. Jev بيشغّل نسخة الـ workflow بس.

قبل الأرقام الطالعه، شوف "الدقة" معناها شنو في الموقع دا. الإجابة المرجعية لكل حالة هي متوسط رد GPT-6 Astra وClaude Fable 5.1، الاتنين في وضع التفكير العالي. يعني الرقم اللي بيقيس الموديل بيتفق مع موديلين frontier لأي درجة، وما في موديل في الجدول يقدر يتفوق عليهم بحكم التصميم. دي طريقة كويسة تسأل بيها "موديل رخيص يقدر يقوم مقام موديل غالي؟"، وطريقة ضعيفة تسأل بيها "القرار دا صاح؟".

الدقة قصاد تكلفة القرار، متوسط الأربعة workflows
المصدر: evals.typesafe.ai، في وضع الـ workflow. الدقة هنا معناها الاتفاق مع متوسط إجابات GPT-6 Astra وClaude Fable 5.1 في وضع التفكير العالي. محور التكلفة لوغاريتمي.

في متوسط الأربعة workflows، Jev بيتفق مع المرجع في 67.8% من الحالات. Sonnet 5 جاب 67.8% Terra جاب 67.9%، يعني Jev في نفس مستواهم. Sol في المقدمة بـ 74.1% ووراهو Opus 5 بـ 73.0%. بيبعد عنهم في التكلفة، بـ $0.0004 للقرار قصاد $0.0304 لـ Terra و$0.0836 لـ Sol.

ثواني لكل قرار
متوسط زمن الرد الكامل في وضع الـ workflow عبر الأربعة workflows، بإعدادات المزوّد الافتراضية. المصدر: evals.typesafe.ai.

Jev متوسطو 0.4 ثانية للقرار. أسرع LLM في الجدول، Terra، متوسطو 10.1.DeepSeek V4 Pro بياخد 86.5.

Jev بيقع ورا في معالجة الفواتير، بـ 61.8% قصاد 79.1% لـ Sol و78.4% لـ Opus 5. دفع الفاتورة معناهو تطابق المبالغ والكميات والتواريخ بين الفاتورة وأمر الشراء وإيصال الاستلام. والـ docs حقت TypeSafe نفسها بتقول Jev ضعيف في الحساب ومقارنة التواريخ، وبتنصحك تعملهم في الكود، فالنتيجة دي ماشة مع تحذيرهم. في خدمة العملاء جاب 76.0%، قريب نقطتين من الأول.

بوست الإطلاق كمان بيقول "أسرع 193.6 مرة وأرخص 444.6 مرة" في مثال صفحتهم الرئيسية (طبعا بيختو الكسور عشان تعرف انو الرقم علمي)*، و TypeSafe نفسها بتقول الأرقام دي "هي اساس المكاسب الحقيقية".

جدول: حوادث أمنية

الموديل

دقة الـ workflow

دقة الـ prompt

التكلفة للقرار

زمن الرد

Haiku 4.5

58.8%

17.1%

$0.0047

3.4 s

Opus 5

66.2%

62.9%

$0.0574

15.1 s

Sonnet 5

60.8%

51.7%

$0.0271

18.9 s

DS v4 Flash

37.9%

44.6%

$0.0032

37.4 s

DS v4 Pro

41.7%

37.1%

$0.0234

60.0 s

Luna

52.1%

29.6%

$0.0013

7.0 s

Sol

62.5%

45.8%

$0.0295

8.5 s

Terra

51.2%

45.4%

$0.0119

5.7 s

Jev

61.7%

-

$0.0001

0.3 s

جدول: مراجعة traces الـ agents

الموديل

دقة الـ workflow

دقة الـ prompt

التكلفة للقرار

زمن الرد

Haiku 4.5

57.2%

29.3%

$0.0100

7.1 s

Opus 5

75.2%

63.5%

$0.1033

27.4 s

Sonnet 5

68.0%

65.8%

$0.0545

38.0 s

DS v4 Flash

73.0%

68.5%

$0.0043

51.7 s

DS v4 Pro

71.6%

72.1%

$0.0357

90.1 s

Luna

76.1%

66.2%

$0.0025

14.5 s

Sol

76.6%

73.9%

$0.0575

40.3 s

Terra

73.0%

72.5%

$0.0209

11.4 s

Jev

71.6%

-

$0.0003

0.5 s

جدول: معالجة الفواتير

الموديل

دقة الـ workflow

دقة الـ prompt

التكلفة للقرار

زمن الرد

Haiku 4.5

42.9%

6.0%

$0.0558

30.8 s

Opus 5

78.4%

66.9%

$0.4856

92.1 s

Sonnet 5

72.9%

62.4%

$0.3616

241.3 s

DS v4 Flash

69.8%

58.2%

$0.0133

84.1 s

DS v4 Pro

72.7%

63.8%

$0.0830

137.4 s

Luna

67.8%

55.1%

$0.0081

21.4 s

Sol

79.1%

65.1%

$0.2152

34.3 s

Terra

74.7%

64.0%

$0.0778

17.3 s

Jev

61.8%

-

$0.0011

0.5 s

جدول: خدمة العملاء

الموديل

دقة الـ workflow

دقة الـ prompt

التكلفة للقرار

زمن الرد

Haiku 4.5

55.4%

19.9%

$0.0074

8.8 s

Opus 5

72.4%

66.0%

$0.0579

16.6 s

Sonnet 5

69.3%

61.6%

$0.0264

14.3 s

DS v4 Flash

76.8%

65.8%

$0.0029

34.6 s

DS v4 Pro

76.1%

65.8%

$0.0232

58.6 s

Luna

71.4%

56.9%

$0.0013

8.8 s

Sol

78.3%

69.0%

$0.0323

10.1 s

Terra

72.7%

64.4%

$0.0111

6.0 s

Jev

76.0%

-

$0.0001

0.4 s

نفس البيانات فيها نتيجة ما عندها علاقة بـ Jev. كل LLM في الجدول بيجيب درجة أعلى لمّن المهمة تتقسم لأسئلة ضيقة، من لمّن تدّيهو prompt واحد كبير:

prompt واحد كبير قصاد workflow من أسئلة صغيرة
متوسط الدقة في الأربعة workflows، نفس الموديل ونفس السياسة. Jev بشتغل كـ workflow بس، عشان كدا ما داخل هنا. المصدر: evals.typesafe.ai.

Haiku 4.5 طلع من 18.1% لـ 53.6% في المتوسط، ومن 6.0% لـ 42.9% في الفواتير براها. Luna زاد قريب 15 نقطة وبقى أرخص في نفس الوقت. الدرس دا تقدر تطبّقو على أي موديل شغّال بيهو الان.

حكايه "ما بيهلوس" بتغطي شنو

بوست الإطلاق بيقول Jev ما بيقدر يهلوس، وإنو أخطاء الـ types مستحيلة رياضياً. لو قريت الكلام بدقة، الادعاء أضيق من كدا. Jev بيرجّع قيمة من المجموعة الإنت حددتها وبس. لو خياراتك billing وtechnical وsales، عمرك ما حتلقى "refunds". دا بيقفل باب كامل من الـ bugs في الـ production. لكن ما بيضمن إنو القيمة المختارة صاح، وفي الفواتير Jev اختلف مع المرجع في أكتر من تلت الحالات. The Register قالت نفس الكلام، إنو المقارنة ما متوازنة لأنو مخرجات Jev ما لغة طبيعية.

TypeSafe تستاهل الشكر إنها نشرت قائمة المشاكل والأعطال المعروفة لـ jev-1.13 بنفسها. نصيحتي أقراها قبل ما تبني أي حاجة بيهو:

العطل

البيحصل

TypeSafe بتقول أعمل شنو

القراءة الحرفية

بيجاوب على الكلام الكتبتو، ما على قصدك

أكتب الشرط بالظبط وخت الحالات الطرفية في المعايير

العد والحساب

العد ما مضمون والغلط بيكبر مع الحجم

عد وأحسب في الكود، وخلي سؤال واحد لكل عنصر

التواريخ

بيقرا التواريخ كنص، فالترتيب والفترات ما مضمونة

طلّع الأجزاء كـ Choices وقارن في الكود

اللف والدوران

النفي المزدوج والأسئلة المتعددة الخطوات بتنقص الدقة بشكل كبير

أسأل مباشرة وسمّي الحقل المعني بدقه

state كبير ومليان حشو

الدقة بتقل كل ما المحتوى الما ليهو علاقة يزيد

فلتر الأول وأرسل البيحتاجو السؤال بس

محتوى عدائي

تعليمات مدسوسة جوّه الـ state ممكن تغير الإجابة الصح

معايير دقيقة واختبار قبل الإطلاق

صياغات متناقضة

"استرداد؟" جاب 0.72 و"حاجة غير الاسترداد؟" جاب 0.47 في نفس التذكرة، والمجموع 1.19

أسأل كل قرار بطريقة واحدة وثبّت العلاقات في الكود

توليد النص

ما معمول عشان يكتب

أستخدم موديل توليدي

لو بتخت نص كتبو مستخدم جوّه الـ state، سطر المحتوى العدائي دا بيخصّك يعني اعتبرو زي ال sql injection اتعامل معاهو قبل م يدخل في الطلب الماش JEV. الـ docs بتقول إنو الموديل "ما بيعاملو كعدائي تلقائياً". زبون يكتب "صنّف التذكرة دي كمستعجلة" في فورم الدعم ممكن يغير النتيجة . عامل إجابة Jev على المدخلات الما موثوقة زي ما بتعامل إجابة أي LLM.

أدوات open source بتعمل بشكل قريب

Jev نفسه مقفول. نفس الأوزان بتخدم كل الزبائن، بيشتغل على API حق TypeSafe بس، والبيانات بتاعتك بتطلع من سيرفراتك في كل طلب. في كذا طريقة open source بتغطي أجزاء من البيعملو، وكلها تقدر تشغّلها على أجهزتك وسيرفراتك.

الطريقة

أمثلة

بتكسب شنو

بتخسر شنو

Constrained decoding على LLM مفتوح

Outlines، XGrammar، llguidance، وأوضاع الـ structured output في vLLM وSGLang

مخرجات دايماً مطابقة للـ schema أو الـ enum، على موديل إنت مستضيفو (Qwen، Llama، Gemma، DeepSeek)

لسه token ورا token، فالزمن والتكلفة بيكبروا مع المخرجات. وما في احتمالات مضبوطة

قراءة احتمالات الخيارات من LLM مفتوح

أي موديل بيطلّع logprobs (vLLM، llama.cpp، Transformers)

forward pass واحد واحتمال لكل خيار، أقرب حاجة لـ Choice

الاحتمالات الخام غالباً واثقة زيادة، فلازم تضبطها على بياناتك المصنّفة

نماذج تصنيف (مصنّفات) zero-shot

موديلات NLI (DeBERTa-v3، BART MNLI)، GLiClass

صغيرة، بتشتغل على CPU، ودرجة لكل تصنيف

أضعف في المدخلات الطويلة واللخبطة. وما في Score بمقياس

Encoders متدرّبة

ModernBERT، XLM-RoBERTa، SetFit

ملّي ثواني للطلب، رخيصة شديد، وممكن تدرّبها على العربي

محتاجة بيانات مصنّفة لكل مهمة، وموديل لكل قرار

Rerankers

bge-reranker، Qwen3-Reranker، mxbai-rerank

درجة صلة لكل زوج سؤال ومقطع، قريبة من Noul على نتائج البحث

بتجاوب على "دا ليهو علاقة؟" بس

مصنّفات الأمان

Llama Guard، ShieldGemma، Granite Guardian

أيوه أو لا قصاد سياسات الأمان

بتغطي فئات الأمان بس

ما في مشروع مفتوح بيدّيك موديل zero-shot واحد ياخد أي مقياس، يقرا state فيهو 30 ألف token مرة واحدة، ويجاوب على خمسين سؤال مختلف باحتمالات مضبوطة في أقل من نص ثانية. الطريقة التانية في الجدول هي الأقرب. تقدر تعمل Choice من أي موديل instruct مفتوح لو قريت احتمالات حروف الخيارات بدل ما تخليهو يولّد ليك نص:

جرّبها: Choice من موديل مفتوح في forward pass واحد
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

MODEL = "Qwen/Qwen3-4B-Instruct-2507"
tok = AutoTokenizer.from_pretrained(MODEL)
model = AutoModelForCausalLM.from_pretrained(MODEL, torch_dtype="auto", device_map="auto")

ticket = "Hi, I've been trying to connect my Stripe account for 3 days ..."
options = {"A": "billing", "B": "technical", "C": "sales"}
prompt = (
    "Which team should handle this ticket?\n"
    "A) billing: payment or subscription issues\n"
    "B) technical: bugs or integration problems\n"
    "C) sales: pricing or account questions\n\n"
    f"Ticket: {ticket}\n"
    "Answer with one letter."
)
ids = tok.apply_chat_template(
    [{"role": "user", "content": prompt}],
    add_generation_prompt=True, return_tensors="pt",
).to(model.device)

# One forward pass, no generation: read the next-token scores for A, B and C.
with torch.no_grad():
    logits = model(ids).logits[0, -1]

letter_ids = [tok.encode(k, add_special_tokens=False)[0] for k in options]
probs = torch.softmax(logits[letter_ids].float(), dim=0)
print({options[k]: round(p.item(), 3) for k, p in zip(options, probs)})

دا بيشتغل عندك محلياً وبيرجّع احتمال لكل فريق من غير ما يولّد ولا token. عشان تثق في الأرقام دي، صنّف كم مية تذكرة حقيقية، شوف الـ 0.8 بتطلع صاح كم مرة، واضبط temperature على الـ logits لحدي ما تتطابق. خطوة الضبط دي هي أغلب البتبيعو TypeSafe، وإنت بتعملها مرة واحدة لكل مهمة.

المقابل للشغل الزيادة دا إنو بياناتك بتقعد في سيرفراتك، وعندك موديل تقدر تدرّبو على العربي، وما معتمد على سعة شركة ناشئة واحدة. صفحة الموديلات حقت TypeSafe بتقول حدود الاستخدام "ممكن تتغير من غير إشعار" لحدي ما صفقات الـ GPUs تكتمل. ولو شغلك منظّم في الخليج او اوروبا ، وقوانين البيانات الشخصية هي البتحدد التذكرة تتعالج وين، ممكن الاستضافة الذاتية تكون الطريق الوحيد المتاح.

حالات الاستخدام الشائعة

الاستخدام

الأسئلة

ليه Jev مناسب

أنتبه لـ

فرز تذاكر الدعم

Choice للفريق المسؤول، Score مدى ضيق المتسخدم، Noul لدرجة لاستعجال

طلب واحد للتذكرة، والثقة بتحدد توجيه تلقائي ولا زول

زبائن بيكتبوا تعليمات جوّه التذكرة

حراسة ردود الـ LLM

Nouls زي "بيوعد باسترداد" أو "بيذكر منافس ليك" كانها Judge

بيزيد أقل من نص ثانية بدل طلب LLM تاني

القراءة الحرفية، فأكتب كل قاعدة بدقة

فلترة وترتيب الـ RAG

Noul أو Score لكل مقطع مسترجع

الـ cookbook القانوني حق TypeSafe رفع دقة أول 10 في أسئلة CLERC من 38% لـ 62% فوق BM25

أرسل المقطع، ما المكتبة كلها

فرز التنبيهات الأمنية

Choice بين إقفال ومحلل وعزل

61.7% في الـ eval بـ $0.0001، قصاد 66.2% لـ Opus 5 بـ $0.057

خلي شخص يراجع قرار "العزل"

تصنيف بيانات ضخمة

كم Choice لكل صف

مليون صف بحوالي 1,000 token للصف يعني مليار token، يعني $42

راجع عيّنة قصاد تصنيفات حقيقية الأول

حلقات لحظية

Choice للحركة الجاية

بوت Doom حق TypeSafe بيعمل حوالي 10 طلبات في الثانية بحوالي $7 في الساعة

الـ state لازم يكون نص، فأوصف المشهد بـ JSON

منصات التعليم

Score لإجابة قصيرة على مقياس، Noul للأسئلة الخارج الموضوع، Choice للدرس الجاي

تغذية راجعة فورية، والإجابات الثقتها ضعيفة بتمشي للمدرّس

دقة العربي ما مجرّبة، فأقيسها الأول

مثال : توجيه على حسب الثقة

خذ التذكرة الفوق. Jev اختار technical باحتمال 0.85 وثقة 0.78. لو الحد 0.7، التذكرة بتمشي طوالي لطابور الـ technical. لو الحد 0.8، بتمشي لزول، ومعاها "technical" جاهزة والاحتمالين، فالزول بيأكّد بدل ما يبدأ من الصفر. تحريك الحد بيبدّل الأتمتة بالدقة، وإنت بتضبطو على تذاكرك المصنّفة.

from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()  # reads TYPESAFE_API_KEY, defaults to jev-latest

response = client.system_one(
    state=ticket,
    questions={
        "department": Choice(
            instructions="Which team should handle this",
            criteria={
                "billing": "Payment or subscription issues",
                "technical": "Bugs or integration problems",
                "sales": "Pricing or account questions",
            },
        ),
        "is_urgent": Noul(
            instructions="The message conveys urgency or time-sensitivity",
        ),
    },
)

department = response.answers["department"]
if department.confidence >= 0.8:
    route_to(department.choice)
else:
    send_to_human(ticket, suggestion=department.choice,
                  probabilities=department.probabilities)

ما حأستخدمو في أي حاجة فيها حساب، أو تواريخ، أو نص حر، أو محادثة. الـ docs حقت TypeSafe بتقول صراحة إنو Jev ما بديل للموديل الورا coding agents زي Claude Code أو Cursor. مكانو المناسب نظام فيهو LLM أو زول بيعمل التفكير، وJev بيعمل المية قرار الصغير الحواليهو.

مثال : 100 ألف تذكرة في اليوم بتكلّف كم

أفترض 1,000 token دخل للتذكرة، و150 token خرج للـ LLM عشان إجابة الـ JSON. دا 100 مليون token دخل في اليوم.

  • Jev: 100 مليون × $0.042 للمليون = $4.20 في اليوم.

  • GPT-5.6 Terra بالسعر المعلن: 100 مليون × $2 = $200 للدخل، زائد 15 مليون × $12 = $180 للخرج، يعني $380 في اليوم قبل أي tokens تفكير.

tokens التفكير بتتحسب كخرج، فالموديل البيفكّر بيكلّف أكتر من كدا. وأرقام الـ eval ماشة في نفس الاتجاه: متوسط تكلفة القرار لـ Terra $0.030 قصاد $0.0004 لـ Jev.

جرّب

الدخول عن طريق قائمة انتظار(وقت الكتباه). لمّن تدخل، الـ playground بيخليك تلصق state وتضيف أسئلة من غير كود. وموقع الـ evals بوريك كل حالة Jev اختلف فيها مع المرجع، مع الطلب كامل، ودي أسرع طريقة تشوف بيها بيغلط كيف. الـ SDKs بتتنزّل بـ pip install typesafe-sdk وpnpm install @typesafe-ai/sdk، وفي plugin لـ Claude Code بيعلّم الـ coding agent الـ API.

قبل ما يقرّب من الـ production:

  • صنّف 200 مثال حقيقي من الترافيك بتاعك وأقيس الاتفاق بنفسك

  • ثبّت jev-1.13.0 بدل jev-latest بعد ما تضبط الحدود، لأنو الاسم المستعار بيتحرّك مع كل إصدار

  • خلي كل جمع وعد ومقارنة تواريخ في الكود

  • عامل النص الكتبو المستخدم جوّه الـ state كحاجة ما موثوقة

  • جرّب المحتوى العربي براهو بعيد عن الإنجليزي

  • سجّل حقل model في كل رد عشان تعرف ياتو إصدار عمل كل قرار

واستمتع.

تحياتي

46
المشاهدات: 107
ذكاء اصطناعيLLMsJevTypeSafeمخرجات منظّمةمصادر مفتوحة
MA
Mosab Alrasheed
استلم المقال التالي في بريدك

رسالة واحدة مع كل مقال جديد، فيها أبحاث وقرارات منتج وما تبلغنا به الفرق.