Google أعلنت Gemini 4 Argon يوم 30 سبتمبر 2026، بعد يوم واحد من DevDay بتاع OpenAI. دا أول جيل رئيسي جديد من Google من Gemini 3 في نوفمبر الفات، وجا في محل Gemini 3.5 Pro الوعدت بيهو Google في مايو وما نزل خالص، ولحدي يوم الإطلاق أغلب التغطية كانت بتسميهو Gemini 4 Pro، الاسم الكان ماشي في التسريبات. صفحات Google نفسها ما قالت "Pro" ولا مرة. ومتحدث باسم Google قال لـ Reuters إنو الموديل "أكبر في الحجم من خط موديلات 'Pro' الرئيسية السابقة لـ Google".
هسه ما بتقدر تستخدمو. Argon ماشي أول لجزء من شركاء الدفاع السيبراني في برنامج Fairwind بتاع Google، وGoogle بتقول إنو العملاء البيدفعو للـ API ومشتركين Google AI Ultra هم الجايين بعدهم، من غير أي تاريخ. ويوم 1 أكتوبر صفحة الموديل في docs الـ Gemini API كانت لسه بترجّع 404.
قريت الإعلان، وصفحة الموديل في DeepMind مع جدول الـ benchmarks، ومنهجية التقييم في خمسة صفحات، وشروط Fairwind، والأرقام المستقلة من Artificial Analysis وArena، وبعدين قارنتها بالموديلات الـ Argon متسعّر قصادها.
Google نزّلت شنو، ولمين
Gemini 4 Argon | |
|---|---|
الإعلان | 30 سبتمبر 2026، من Koray Kavukcuoglu، الاستلم تطوير Gemini في Google DeepMind في أغسطس |
منو عندو هسه | فرق جوّه Google، ومجموعة من شركاء Fairwind، بياخدوهو "من غير حواجز الأمان السيبراني" |
الجايين بعدهم | العملاء البيدفعو للـ API ومشتركين Google AI Ultra. من غير تواريخ |
السعر | $2 للمليون token دخل و$10 للمليون خرج كسعر افتتاحي، وبعدين $4 و$20. الدخل المخزّن في الـ cache بخصم 95% |
حد الخرج | مليون token، بعد ما كان 64 ألف |
نافذة الدخل | Google ما قالتها. Artificial Analysis وArena كاتبين مليون |
الما اتنشر | model card، وتاريخ نهاية المعرفة، والسرعة، ومستويات الـ Frontier Safety Framework الوصلها، ومتين السعر الافتتاحي بيخلص |
Fairwind بدا يوم 2 سبتمبر مع Gemini 3.8 Flash Cyber وفيهو أكتر من 650 شريك، وبس جزء منهم بياخدو Argon. الشروط صارمة: MFA ضد التصيّد، والوصول محصور في فرق الأمن الداخلي والاستجابة للحوادث واختبار الاختراق، وتسجيل استخدام كل موظف، وفحص خلفية للمتقدمين، وممنوع البيع لطرف تالت. الحكومات ومشغّلين البنية التحتية الحساسة ومنصات التقنية الأساسية هم الأوائل في الصف. وGoogle بتقول إنها برضو مشاركة في المسار الطوعي بتاع الحكومة الأمريكية للوصول قبل الإطلاق.
Google ادّت مثال واحد ملموس للبياخدو المدافع. Wiz، الاشترتها Google بـ 32 مليار دولار في مارس، استخدمت Argon ولقت "ثغرة حرجة بتكشف معلومات شخصية حساسة في برمجيات صحية مستخدمة في مستشفيات حول العالم". Ars Technica لاحظت إنو Google ما ادّت أي تفاصيل، وأنا ما لقيت تفاصيل في أي مكان تاني.
الجدول النشرتو Google
Google بتقارن Argon مع GPT-6 Astra وClaude Fable 5.1 وClaude Opus 5.5 في 18 اختبار. Argon بيكسب 12 بشكل واضح، وبيتعادل في واحد، وبيخسر خمسة.
مرتّبة حسب فرق Argon عن أحسن واحد من المنافسين التلاتة في كل اختبار. نتائج المنافسين هي الأرقام المعلنة من الشركات نفسها، والفروقات حسبتها أنا من جدول Google.
الاختبار | Gemini 4 Argon | أحسن منافس | المنافس | الفرق، بالنقاط |
|---|---|---|---|---|
Harvey's Legal Agent Benchmark | 19.6% | 6.7% | Fable 5.1 | +12.9 |
GraphWalks 256k to 1M (F1) | 84.2 | 71.8 | Astra | +12.4 |
AutomationBench | 51.3% | 42.5% | Opus 5.5 | +8.8 |
Vals Finance Agent v2 | 65.4% | 58.9% | Fable 5.1 | +6.5 |
LVBench | 91.7% | 87.5% | Astra | +4.2 |
RiemannBench | 76.0% | 72.0% | Astra | +4.0 |
DeepSWE v1.1 | 77.9% | 74.2% | Opus 5.5 | +3.7 |
LABBench 2 | 88.8% | 85.4% | Astra | +3.4 |
Vals Index | 68.9% | 67.0% | Opus 5.5 | +1.9 |
Vibe Code Bench | 91.9% | 90.3% | Fable 5.1, Opus 5.5 | +1.6 |
Agent's Last Exam | 39.5% | 38.2% | Opus 5.5 | +1.3 |
GraphWalks up to 128k (F1) | 99.7 | 98.7 | Astra | +1.0 |
Chartography | 71.6% | 71.0% | Astra | +0.6 |
CWE-bench v1 | 68.0% | 68.0% | Astra | 0 |
OSWorld-2.0 (offline subset) | 69.2% | 72.6% | Astra | −3.4 |
PostTrainBench | 45.3% | 49.3% | Opus 5.5 | −4.0 |
Terminal-bench 4.0 | 57.4% | 66.4% | Opus 5.5 | −9.0 |
Terminal-Bench Science 0.1 | 57.6% | 68.1% | Astra | −10.5 |
FrontierSWE v2 | 55.0% | 65.5% | Astra | −10.5 |
الفروقات الكبيرة في شغل المعرفة والسياق الطويل. Argon جاب 19.6% في benchmark الـ legal agent بتاع Harvey قصاد 6.7% للموديل الوراهو، و84.2 F1 في التنقّل في الـ graphs على نطاق من 256 ألف لمليون token قصاد 71.8، و51.3% في AutomationBench قصاد 42.5. وخمسة من المكاسب التانية أقل من نقطتين، ودا جوّه الضجيج العادي بين تشغيلة وتانية في أغلب الاختبارات دي.
الخسارات في الـ agentic coding والعلوم. Argon جا الأخير بين الأربعة في FrontierSWE v2، ورا Astra بـ 10.5 نقطة، والأخير في Terminal-bench 4.0، ورا Opus 5.5 بـ 9 نقاط. ودي أقرب اختبارين ليوم شغل الـ coding agent: repository، ومهمة، وterminal، وما في زول بيكمّل ليك الشغل. The New Stack برضو نبّهت إنو 19.6% في Harvey معناها إنو Argon بيكمّل حوالي مهمة قانونية واحدة من كل خمسة بالكامل. دا تقريباً تلاتة أضعاف الموديل الوراهو، ولسه رقم ضعيف.
ملف المنهجية فيهو تحفظات بتغيّر قدر ما تقدر تعتمد على بعض الصفوف:
Google حسبت نتائج Argon في DeepSWE وTerminal-bench بنفسها. نتائج المنافسين جاية من الـ leaderboards والـ system cards.
في LVBench، وهو اختبار فيديوهات طويلة، Argon شاف الفيديو بفريم واحد في الثانية، وGPT-6 Astra اتادّى 800 فريم، وFable 5.1 اتادّى 300، وOpus 5.5 اتادّى 600، "بسبب قيود الـ API".
إلا لو في ملاحظة، كل نتيجة منافس هي الرقم المعلن من الشركة نفسها على أعلى إعداد تفكير.
صف الـ CWE-bench محتاج ملاحظة تانية. الـ leaderboard دا بيشغّل كل موديل مع الـ harness بتاعو، فـ Argon اشتغل في Antigravity بتاع Google، وAstra في Codex، وClaude في Claude Code. يعني الصف دا بيقيس الموديل وأدواتو مع بعض، وGrok 4.7 في opencode برضو اتعادل على 68%.
جدول Google كامل، 18 اختبار
الـ Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% |
Harvey's Legal Agent Benchmark | 19.6% | 5.4% | 6.7% | 3.8% |
DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% |
Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% |
RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% |
GraphWalks لحدي 128k، BFS (F1) | 99.7% | 98.7% | 91.4% | 90.6% |
GraphWalks من 256k لمليون، BFS (F1) | 84.2% | 71.8% | 65.0% | 66.8% |
Agent's Last Exam | 39.5% | 34.2% | - | 38.2% |
OSWorld-2.0 (جزء offline) | 69.2% | 72.6% | - | - |
Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
الأرقام المستقلة بتقول شنو
Artificial Analysis شغّلت Argon على المؤشر بتاعها المكوّن من عشرة تقييمات. جاب 53، زي GPT-6 Astra بالظبط وقدّام GPT-6.1 Sol بنقطة، وورا Claude Opus 5.5 البجيب 57.6 وClaude Sonnet 5.5 البجيب 56. ودا 23 نقطة فوق Gemini 3.1 Pro Preview، آخر موديل من Google فوق فئة الـ Flash، وArtificial Analysis ختمت بإنو Google "رجعت واحدة من أعلى تلاتة معامل في مستوى الذكاء المحقّق".
في قياسين من قياساتها ماشين في اتجاهين عكس بعض. نسبة الهلوسة بتاعة Argon في AA-Omniscience هي 15%، الأقل بين كل الموديلات الجابت 45 أو أكتر في المؤشر، قصاد 51% لـ Astra و59% لـ Opus 5.5. لكن الدقة بتاعتو في نفس الاختبار 50%، يعني أقل من Astra البجيب 63% بـ 13 نقطة. قرايتي أنا إنو Argon بيرفض يجاوب أكتر لمّن ما يكون عارف. وفي شغل القانون والمالية، الإجابة الغلط الواثقة فيها أكلف من الإجابة الفاضية، فأنا بفضّل المقايضة دي.
Arena ختّتو الأول في leaderboard النصوص بـ 1525، قدّام الوراهو بـ 20 نقطة، ومكتوب عليهو preliminary على 4,942 صوت. وفي leaderboard الـ WebDev هو التامن، ورا Claude Opus 5.5 بـ 139 نقطة. يعني الـ leaderboards المستقلة الاتنين وجدول Google نفسها متفقين في موضوع الكود.
Bloomberg نشرت إنو في موظفين في Google بيقولو الموديل "أداؤه أقل لمّن الموظفين يشغّلوهو فعلاً" و"بيتعب مع بعض مهام الكود". Google قالت الكلام دا ما دقيق. المقال وراهو اشتراك، والاقتباسات دي وصلتني من بوستات بتنقل منو.
مليون token خرج
كل موديلات Gemini الأخيرة، من 2.5 Pro لحدي 3.8 Flash، بتقيف عند 65,536 token خرج. Argon بيقدر يكتب مليون. حجة Google إنو "لمّن الموديل يكون عندو مساحة يفكّر بعمق ويطلّع مئات الآلاف من الـ tokens في مسار واحد، دا بيضيف مستوى جديد من العمق في التفكير عشان يحل المشاكل الصعبة مرة واحدة". وArtificial Analysis شغّلتو بميزة جديدة في الـ API اسمها Long Decode Continuation، بتوقّف الرد الطويل وتواصلو في طلبات بعدو، عشان الإجابة الواحدة تقدر تعدّي الـ timeout بتاع الطلب.
الأمثلة الداخلية الادّتها Google من نوع الشغل البيحتاج المساحة دي. agents شغّالين بـ Argon بدّلو 32 ألف سطر من كود الـ SIMD في libgav1، والنتيجة أسرع بـ 2.7 مرة من نسخة Rust الموجودة ومخرجات الفيديو نفسها بالظبط. وفي نقل لـ Rust شغّال على كود لحدي kernel الـ Zircon في Fuchsia البي 800 ألف سطر، ولسه تحت المراجعة قبل ما أي حاجة توصل الـ production.
والموديل بيستخدم المساحة دي فعلاً. في مؤشر Artificial Analysis كلو، Argon طلّع في المتوسط حوالي 62 ألف token خرج للمهمة، قصاد 27 ألف لـ GPT-6 Astra. ومع كدا تكلفتو للمهمة أقل، $1.99 قصاد $3.26، لأنو سعر الـ token عندو أرخص، وArtificial Analysis قالتها واضحة: الميزة دي "جاية من أسعار الـ tokens الأقل، ما من استهلاك tokens أقل". ولمّن السعر الافتتاحي يخلص، نفس المهمة بتكلّف $3.98، يعني حوالي 1.2 مرة Astra.
مثال: تغيير السعر بيعمل شنو في شغل حقيقي
خلينا نقول عندك مهمة agent بتقرا 200 ألف token وبتكتب 60 ألف، قريب من متوسط خرج Argon في المؤشر.
بالسعر الافتتاحي: 0.2 مليون × $2 = $0.40 للدخل، زائد 0.06 مليون × $10 = $0.60 للخرج، يعني $1.00 للمهمة.
بالسعر العادي: $0.80 زائد $1.20، يعني $2.00 للمهمة.
لو عندك ألف مهمة في اليوم، دا $1,000 قصاد $2,000. الخرج 60% من الفاتورة في الحالتين، فالرقم التراقبو في الـ logs هو عدد tokens الخرج في كل طلب، والموديل الكتير الكلام بيغلى أسرع من سعر الـ token بتاعو.
ليه ناس الأمن السيبراني بياخدوهو أول
سبب Google في الإطلاق المتدرّج هو قدرات الأمن السيبراني نفسها. لمّن أطلقت Fairwind قالت إنو الوصول المبكر بيدّي المدافعين "نافذة تأقلم مهمة عشان يقوّو أنظمتهم قبل ما الجهات السيئة تلقى فرصة تستغل القدرات الجديدة". وأرقام الأمن السيبراني هي أكبر قفزة في الإعلان قصاد موديل Google القبلو: 85.8% قصاد 71.0% لـ 3.8 Flash Cyber في اكتشاف الثغرات في الكود المصدري في 20 لغة برمجة، و70.9% قصاد 58.2% في اختبار الاختراق بتاع Wiz، البيشتغل من غير كود مصدري.
وGoogle نشرت برضو أقوى نتيجة أمان عندها. في اختبار Gray Swan للـ indirect prompt injection، المهاجمين نجحو مع Argon في 0.7% من المرات على 15 محاولة، الأقل بين 13 موديل في الرسم. Claude Opus 5.5 وFable 5.1 عند 1.0%، وGPT-6 Astra عند 8.5%.
الموديل | نسبة نجاح الهجوم في Gray Swan، k=15 (الأقل أحسن) |
|---|---|
Gemini 4 Argon | 0.7% |
Claude Opus 5.5 | 1.0% |
Claude Fable 5.1 | 1.0% |
Claude Opus 5 | 4.6% |
Gemini 3.8 Flash | 5.5% |
GPT-6 Astra | 8.5% |
GPT-6 Sol | 10.1% |
Google ما نشرت المستندين البيخلّو أي زول برّه يراجع قرار التدرّج دا: model card، ومستويات الـ Frontier Safety Framework بتاعتها الوصلها Argon. رابط الـ model card كان بيرجّع 404 يوم 1 أكتوبر. الإعلان بيوصف أربعة مجالات حماية بالكلام بس: رفض الاستخدام السيء مع مراقبة التفعيلات الداخلية للموديل، ومقاومة الـ prompt injection، ومراقبة الـ chain-of-thought والأفعال مع إمكانية إنو يوقّف التنفيذ، وبيئات sandbox مقفولة لتشغيلات التدريب العالية المخاطر. وطلبت من باقي الصناعة إنها "تحافظ على شفافية التفكير".
الإطلاق جا بعد يوم من إعلان Sundar Pichai إنو Google وقّعت White House Accord on Super Intelligence، وفي نفس الأسبوع OpenAI قالت إنها ما حتطلّع GPT-6.1 Astra الكانت مخططة ليهو بسبب مخاوف أمان. الإطلاق المتدرّج قرار معقول لموديل شاطر كدا في اكتشاف الثغرات. لكن لحدي ما الـ card يطلع، ما في زول برّه Google بيقدر يراجع الجدول ولا ادعاءات الأمان.
السنة الأخدها
في I/O يوم 19 مايو، Google قالت إنو Gemini 3.5 Pro مستخدم داخلياً وحينزل "الشهر الجاي". ما نزل خالص. Business Insider نشرت إنو اتأجّل كذا مرة داخلياً بسبب أداء ضعيف، والـ Financial Times نشرت إنو فات تلاتة مواعيد. Google نفسها ما قالت إنو اتلغى. البنزل في محلو كان أربعة إصدارات Flash في أقل من أربعة شهور، كل واحد أحسن من القبلو بكم نقطة، وتغيير في القيادة يوم 5 أغسطس ختّ Kavukcuoglu مسؤول عن تطوير Gemini وخلّى Demis Hassabis رئيس لـ Google DeepMind.
تطبيق Gemini عدّى مليار مستخدم شهري يوم 11 أغسطس، في نص الشهور الما كان عند Google فيها موديل في القمة. وقفزة Argon البي 11.7 نقطة فوق 3.8 Flash أكبر من قفزات الـ Flash التلاتة القبلها مجموعة.
لو إنت بتبني بالعربي
Google ما نشرت أي حاجة عن لغات Argon. ما في benchmark متعدد اللغات في الجدول ولا في المنهجية، وما في قائمة باللغات المدعومة، وما في أي كلام عن التوفر في المناطق. الإعلان موجود بالإنجليزي والفرنسي الكندي بس. وما في ولا شريك من شركاء Fairwind السمّتهم Google في منطقتنا.
يعني ولا حاجة من الفوق دي بتوريك Argon بيتعامل مع العربي كيف. لمّن يوصل الـ API حنشغّلو على مجموعة التوليد العربي بتاعتنا قبل ما نصدّق أي صف في الجدول داك، نفس قاعدة الخمسين مثال الـ journal دا بيرجع ليها كل مرة.
رأيي
في الشغل الـ Google اختارت تقيسو، Argon بيرجّع Google للقمة: المستندات الطويلة، وagents القانون والمالية، والبحث في مليون token، واكتشاف الثغرات. وفي الشغل الأغلب المطورين حيجرّبوهو أول، الكود في terminal على repository حقيقي، جدول Google نفسها والـ leaderboards المستقلة الاتنين ختّوهو ورا Anthropic وOpenAI. السعر هو أقوى حاجة في الإطلاق، وهو سعر افتتاحي، وما في زول قال متين بيخلص.
هسه Argon موديل اتعلن للناس كلها واتسلّم لكم مية فريق أمن. أنا ما حأخطط لأي حاجة عليهو لحدي ما يكون عندو صفحة API، وmodel card، وتاريخ. لمّن يكون عندو الحاجات دي، اعمل ميزانيتك على $4 و$20، وقيسو على شغلك إنت.
لمّن يوصل الـ API
اعمل الميزانية على السعر العادي $4 و$20، ما الافتتاحي $2 و$10
سجّل عدد tokens الخرج في كل طلب، لأنو Argon بيكتب كتير والخرج هو الجانب الغالي
جرّب الـ coding agent على الـ repository بتاعك قبل ما تحوّلو
شغّل مجموعة العربي بتاعتك، لأنو Google ما نشرت أي أرقام متعددة اللغات
ثبّت إصدار الموديل بعد ما تضبط الحدود
اقرا الـ model card لمّن يطلع، ومعاها مستويات إطار الأمان
رسالة واحدة مع كل مقال جديد، فيها أبحاث وقرارات منتج وما تبلغنا به الفرق.







