بحسب إعلان DeepSeek الرسمي، يحافظ النموذج الجديد على أداء V4-Flash في المهام النصية، لكنه يحقق تقدمًا ملحوظًا في تقييمات الوكلاء متعددي الوسائط: وكلاء قادرون على تفسير شاشة، أو صورة، أو رسم بياني، أو مستند بصري، ثم اتخاذ قرار بشأن الإجراءات التي ينبغي تنفيذها باستخدام أدواتهم. وقبل ظهور هذا النوع من النماذج الموحّدة، كان سير العمل الوكيل يتطلب غالبًا الجمع بين نموذج رؤية منفصل لقراءة لقطة الشاشة أو الجدول أو الواجهة، ونموذج نصي/وكيل للاستدلال، وأدوات للتصفح والبرمجة وملء النماذج أو استجواب قاعدة بيانات. أما مع V4-Flash-Vision-Exp، فيمكن نظريًا لحلقة واحدة أن تؤدي الوظائف الثلاث: الرؤية، ثم التفسير، ثم التصرف.
وبحسب الأرقام التي نشرتها DeepSeek نفسها، وأكّدتها عدة مصادر مستقلة، فإن النموذج يقترب من أداء Claude Opus 4.8 التابع لأنثروبيك، مع نتائج متفاوتة عبر أربعة مقاييس مرئية:
• Agents' Last Exam: تفوّق DeepSeek بفارق ضئيل، 27.3 مقابل 25.7 لصالح Opus 4.8.
• ZeroBench (Pass@5): تفوّق DeepSeek أيضًا، 35.0 مقابل 34.0.
• ApexBench (Pass@1): تراجع DeepSeek خلف Opus 4.8، 36.5 مقابل 39.4.
• Chartography (قراءة الرسوم البيانية): تراجع DeepSeek بفارق ضئيل، 64.3 مقابل 65.0.
على مستوى الجدول الكامل الذي نشرته DeepSeek والمكوّن من 11 مقياسًا، تتفوّق DeepSeek في 3 مقاييس فقط، بينما يتقدّم Opus 4.8 في الثمانية الباقية، مع فجوات كبيرة في بعضها مثل NL2Repo (57.7 مقابل 69.7) وDSBench-Hard (63.6 مقابل 71.7).
مثال تحريري على الاستخدام: يمكن لوكيل مزوَّد بهذه القدرة أن يحلّل لقطة شاشة من Google Search Console أو جدول بيانات Analytics، فيرصد انخفاضًا في النقرات على استعلامات بحث معيّنة، ويقارن ذلك بالصفحات المعنية، ثم يولّد قائمة إجراءات مرتّبة حسب الأولوية لتحسين محركات البحث (SEO). وفي حالة أخرى، يمكنه قراءة صفحة ويب أو نموذج تصميم لتطبيق جوّال، فيشير إلى عيوب الواجهة ويقترح تصحيحات بلغتي HTML وCSS.
وصف "الاقتراب" من Opus 4.8 أدقّ من القول إن النموذج "يساوي" أو "يتفوّق على" Opus بشكل عام؛ فالنتائج المتاحة تُظهر تنافسية في عدة اختبارات، لا هيمنة شاملة: فعلى سبيل المثال، يحافظ Opus على تقدّم ملحوظ في مهام مثل NL2Repo، حيث يسجّل DeepSeek 57.7 مقابل 69.7. ويجدر التذكير أيضًا بلاحقة "Exp" في اسم النموذج، إذ تُقدّمه DeepSeek بوصفه تجريبيًا، كما أن التقييمات أُجريت باستخدام إطار عمل داخلي تابع للشركة نفسها (DeepSeek Harness Minimal Mode)، ما يعني أن الأرقام لم تخضع بعد لتحقق مستقل. وقبل اعتماد النموذج في إنتاج تحريري أو وكيل مستقل، يُستحسن اختبار عناصر مثل: دقة قراءة لقطات الشاشة والرسوم البيانية، وجودة التعرف الضوئي على الحروف (OCR) في النصوص العربية والفرنسية والمستندات المختلطة، والقدرة على تسلسل الرؤية والاستدلال واستدعاء الأدوات بشكل صحيح، والأخطاء الصامتة في التعامل مع البيانات المرئية، واستقرار واجهة برمجة التطبيقات وحدود عدد الصور والسياق.
المصدر : https://intelligences.articlophile.net/articles/i/...