Introduction

قبل بضعة أيام، ظهرت أرقام benchmarks من مشروع OpenDesign عبر خلاصات المطورين. عند تشغيل نموذج DeepSeek V4.1 Flash المعروض حديثاً مقابل مجموعة تقييم UI التلقائية الخاصة بهم، سجل النموذج 81.2 من أصل 100 في توليد واجهات المستخدم اليومية. هذا يطابق 98 بالمائة من النتيجة التي حققها GPT-6 Astra (82.7) ويتفوق قليلاً على Claude Fable 5.1 (80.3).

يكمن التباين العملي في الفاتورة. استغرق تشغيل DeepSeek 5.3 دقائق وحرق 0.023 دولاراً من توكنات الـ API. تطلب Astra 11.1 دقيقة وكلف 1.61 دولاراً. استغرق Fable 12.8 دقيقة وكلف 3.66 دولارات. من بين 13 نموذجاً تم تقييمها، سجل 11 نموذجاً أدنى من DeepSeek بينما تقاضت ما يصل إلى 150 ضعفاً لكل مهمة مكتملة.

بالنسبة لأي شخص يؤسس أدوات مطورين بميزانية شهرية ضيقة، تتطلب هذه الأرقام الاهتمام. احتفظت نماذج الـ frontier المغلقة باحتكار شبه كامل لتوليد الواجهات الأمامية للعام الماضي. عندما ينتج نموذج open-weight يعمل على شرائح رخيصة وعادية HTML وCSS وحالة مكون جاهزة للإنتاج بسنتين اثنين، تتغير الرياضيات الأساسية لشحن البرمجيات فوراً.

الأرقام الكامنة وراء benchmark لـ OpenDesign Arena

اختبر تقييم OpenDesign Arena 13 نموذجًا على prompts مطابقة لبناء الواجهات. بدلاً من اختبار المنطق المجرد أو ألغاز البرمجة التنافسية، استخرج الفريق الـ prompts من جلسات المستخدمين الفعلية داخل مساحة عمل التصميم open-source الخاصة بهم. قام القائمون على الصيانة خلف nexu-io/open-design بإعداد أداة اختبار بدون واجهة رسومية (headless test harness) تقوم بتشغيل كل نموذج مقابل خمسة سيناريوهات تطبيقية محددة: تطبيقات الويب، تطبيقات الهواتف، برمجيات سطح المكتب، لوحات البيانات (dashboards)، ومواقع التسويق.

يضع الترتيب العام DeepSeek V4.1 Flash في المركز الثاني من حيث الجودة، خلف GPT-6 Astra بـ 1.5 نقطة فقط. عند موازنة الجودة، التكلفة، والـ latency، يصنف خوارزم الـ arena نموذج V4.1 Flash كخيار أول إجماليًا بمؤشر مجمع يبلغ 78.8. يأتي DeepSeek V4 Flash في المرتبة 68.6، ويصل GPT-5.6 Sol إلى 65.7، ويأخذ Gemini 3.8 Flash 64.7، بينما ينخفض Claude Fable 5.1 إلى 52.1 بسبب تكلفته العالية وlatancy الـ generation.

تُظهر صفحة هبوط OpenDesign Arena بطاقة تقييم أداء لـ DeepSeek V4.1 Flash تقارن جودة تصميمه مقابل نقاط النهاية التجارية المنافسة:

بطاقة تقييم أداء صفحة هبوط OpenDesign Arena
بطاقة تقييم أداء صفحة هبوط OpenDesign Arena

يصبح الفرق بين الأجيال واضحًا عند مراجعة المخرجات الخام. حقق DeepSeek V4.1 Flash متوسط نقاط تلبية متطلبات بلغ 28.4 من أصل 30، متفوقًا على كل من GPT-6 Astra بـ 26.5 وClaude Fable 5.1 بـ 27.1. وفيما يتعلق بالصقل البصري الخام وجودة التصميم، يحتفظ Astra بتقدم طفيف عند 56.2 من أصل 70 مقارنة بـ 52.8 لـ DeepSeek. من خلال مطابقة ما يقرب من 98 بالمائة من نقاط الـ Astra البصرية الخام مع العمل بنحو 1.4 بالمائة فقط من الإنفاق المالي، يرسخ النموذج واقعًا اقتصاديًا معدلاً جذريًا لمهام generation الواجهات الأمامية المفهرسة على منصة OpenDesign الرسمية.

يحكي الاستثمار الزمني قصة أقوى لخطوات العمل اليومية. أكمل DeepSeek متوسط تشغيله في 5.3 دقائق. وتطلب Astra 11.1 دقيقة، بينما استغرق Claude Fable 5.1 نحو 12.8 دقيقة. عندما يجلس مهندس في terminal منتظراً agent لصياغة prototype، فإن فرق الست دقائق يحدد ما إذا كنت ستتحافظ على تركيزك أو تتشتت نحو منصات التواصل الاجتماعي.

لخص فريق OpenDesign هذه المقاييس الرئيسية في إفصاحهم العام الأول:

Loading tweet...

ردد أعضاء المجتمع الذين اختبروا مساحة العمل صدى مكاسب السرعة. في مؤشر تقييم نشط على Reddit's r/SideProject، لاحظ المستخدمون الأوائل مدى سرعة النماذج خفيفة الوزن في إرجاع تخطيطات عملية مقارنة بالخيارات الثقيلة والمغلقة. بالنسبة للفرق التي تقوم بعمل prototypes لعشرة اختلافات في الصباح، فإن توفير ست دقائق لكل حلقة generation يتراكم عبر sprint بأكمله. بدلاً من حرق ساعات في انتظار نقاط نهاية frontier لحل الـ tokens الخاصة بالتخطيط، يمكن للمطورين تشغيل فروع واجهات متعددة بالتوازي، والتكرار عبر الاختلافات الهيكلية في الوقت الفعلي دون تكبد throttling كارثي للـ API أو مقاطعات في سير العمل.

كيف يقيس الـ benchmark جودة واجهة المستخدم بدون محكمين بشريين

عادةً ما تفشل الـ benchmarks التلقائية لواجهات المستخدم لأن الجودة البصرية تبدو ذاتية (subjective). لتجنب الاعتماد على التصويت البشري التعسفي أو عدد وسوم HTML السطحية، يقسم إطار عمل اختبار OpenDesign التقييم إلى مراحل ميكانيكية صارمة. أولاً، يقوم الـ harness بتنفيذ فحص وقت التشغيل (runtime check). يتم تحميل الكود المُولَّد مباشرة في مثيل Chromium بدون واجهة رسومية (headless). إذا أظهر الـ artifact منفذ عرض فارغًا، أو عمليات استيراد معطلة، أو كتل markdown غير معروضة، أو استثناءات JavaScript غير معالجة في الـ console، يتلقى التشغيل صفرًا تلقائياً. لا يمنح الـ suite إعادة المحاولة أو إصلاح الـ syntax المفقود.

تُواجه الـ artifacts التي تنجو من التنفيذ معيارًا من 100 نقطة. تشكل تلبية المتطلبات 30 نقطة. يفحص النظام أشجار الـ DOM للتحقق من المكونات المحددة المطلوبة في الموجز: حالات الـ modal التفاعلية، ارتباطات التحقق من النماذج، فرز أعمدة الجداول، وأغلفة التخطيط المتجاوبة (responsive). تقيس الـ 70 نقطة المتبقية هيكل التصميم عبر خمس فئات تشمل التسلسل الهرمي للتخطيط، تناغم الألوان، نسب التباين المتوافقة مع إمكانية الوصول، الامتثال للمكونات، والتكيف المتجاوب عبر نقاط توقف الهواتف وأجهزة سطح المكتب. تحسوبة الفحوصات التلقائية فروق إضاءة الألوان لفرض معايير تباين WCAG AA الصارمة، وتحديد العناصر المطلقة المتداخلة، وتقييم سلوك التخطيط عبر عروض منفذ عرض 375px و768px و1440px.

تناول فريق OpenDesign أسئلة المجتمع المتعلقة بفلسفة الاختبار هذه في تحديث رسمي على إعلان X الخاص بـ OpenDesign:

Loading tweet...

تؤهل النتيجة التي تبلغ 80 أو أعلى الـ artifact ليكون قابلاً للتسليم. عبر كتالوج الاختبار بأكمله، حافظ DeepSeek V4.1 Flash على معدل تسليم بنسبة 57.7 بالمائة. بلغ GPT-6 Astra نسبة 60.0 بالمائة، بينما سجل Claude Fable 5.1 نسبة 56.7 بالمائة. أنتج نموذج الـ open-weight انحدارات كارثية أقل من النماذج التجارية الراسخة التي تتقاضى 50 ضعفًا لكل token.

يتتبع الإطار أيضاً التوافق الهيكلي باستخدام معايير الـ agents مثل Claude Code Skills Convention، مما يضمن اتباع الـ artifacts المُولَّدة لفصل الملفات النظيفة حدود المكونات المعيارية.

لتصور كيفية توازن هذه الأبعاد عبر الطبقة العليا، نشرت OpenDesign مقارنة رادار خماسية الأبعاد:

مقارنة رادار لـ DeepSeek V4.1 Flash و GPT-6 Astra و Claude Fable 5.1 عبر خمسة أبعاد للتقييم
مقارنة رادار لـ DeepSeek V4.1 Flash و GPT-6 Astra و Claude Fable 5.1 عبر خمسة أبعاد للتقييم

من خلال التركيز على الصلاحية الميكانيكية والنزاهة الهيكلية، يوفر الـ benchmark مساراً قابلاً للاستنساخ للمطورين لتقييم الـ agents الخاصة بالتصميم التلقائي دون تخمين. بدلاً من الاعتماد على الانطباعات البصرية النوعية، يمكن لفرق الهندسة التحقق مما إذا كان نموذج الذكاء الاصطناعي ينتج وسوم دلالية صالحة، وآلات حالة متجاوبة قابلة للتنبؤ، وتسلسلات هرمية مستقرة للمكونات لن تنهار تحت أحمال بيانات الإنتاج الديناميكية.

اقتصاديات الـ tokens وفجوة السعر التي تبلغ 70 ضعفاً

تشكل اقتصاديات وحدات نماذج الـ frontier الذكية عائقاً حقيقياً أمام الشركات الناشئة ذات التمويل الذاتي (bootstrapped). يمكن أن يؤدي تشغيل فريق من خمسة مطورين على أدوات برمجة agentic باستخدام نماذج frontier غير المحدودة إلى تجاوز ألف وخمسمائة دولار كل شهر. عندما تقوم agents المطور بالتكرار على واجهة ما، فإن الأداة تدور عبر دورات متعددة، تقرأ الملفات، تنفذ أوامر البناء، تفحص أشجار DOM للمتصفح، وتعيد كتابة ملفات كاملة.

وفقاً لبيانات الـ benchmark، فإن توليد prototype تطبيق ويب كامل واحد عبر Claude Fable 5.1 يتراوح في المتوسط بين 3.66 و5.55 دولار. وتكلف نفس المهمة بين 1.61 و1.87 دولار على GPT-6 Astra، و0.537 دولار على GPT-5.6 Sol، وما بين 0.023 و0.030 دولار على DeepSeek V4.1 Flash. تمتد فجوة التسعير عبر مرتبتي مانغنيتود (orders of magnitude)، وهو تباين تسلط الضوء عليه المقارنات المنشورة على بوابة وثائق OpenDesign.

يوضح مخطط مبعثر (scatter plot) يقارن متوسط درجات الجودة مباشرة بالتكلفة مدى اختلاف النماذج بشكل صارخ:

مخطط مبعثر لجودة النموذج مقابل التكلفة لكل artifact يظهر نماذج الـ frontier مجتمعة عند نقاط أسعار عالية
مخطط مبعثر لجودة النموذج مقابل التكلفة لكل artifact يظهر نماذج الـ frontier مجتمعة عند نقاط أسعار عالية

يحقق DeepSeek هذه الأرقام من خلال ربط معدلات إصابة الـ cache العالية بسرعة generation السريعة. في الاختبار، حافظ V4.1 Flash على معدل إصابة الـ prefix cache بنسبة 89.0 بالمائة. لقد عالج 1.5 مليون token إدخال أثناء توليد 29,000 token إخراج. تُدرج وثائق DeepSeek الخاصة بـ DeepSeek agent harness إصابات الـ input cache خارج أوقات الذروة بـ 0.003 دولار لكل مليون token، والمدخلات غير المؤقتة بـ 0.15 دولار لكل مليون، وتوكنات الإخراج بـ 0.60 دولار لكل مليون.

نظرًا لأن الـ prompt caching يمنع الحساب المتكرر عبر محادثات الـ agent متعددة الأدوار (multi-turn)، فإن الحفاظ على سياق الـ context window دافئاً يكلف جزءاً من المنت. سجلت التشغيلات المستقلة إنتاجية فك تشفير تتراوح بين 350 و427 token في الثانية في عمليات الـ generation الخام.

قام القائمون على صيانة OpenDesign بتحليل ميزة التكلفة هذه عبر تشغيلات النماذج:

Loading tweet...

بالنسبة لمؤسس فردي يختبر عشرة أفكار لواجهات المستخدم في فترة ما بعد الظهر، فإن إنفاق خمسة وعشرين سنتاً إجمالاً على DeepSeek يتفوق على إنفاق خمسة وثلاثين دولاراً على Claude Fable. يحرر هذا الهامش رأس المال للبنية التحتية، أو اكتساب العملاء، أو أسماء النطاقات. على مدار سبرينت هندسي يمتد لأسابيع يتضمن مئات تكرارات المكونات، يمكن لفريق منتج رشيق تقليل فاتورة التصميم الاصطناعي الخاصة به من مئات الدولارات إلى مصاريف جيب رمزية، مما يحول بشكل دائم كيف تتعامل الفرق في المراحل المبكرة مع عمل نماذج أولية تفاعلية وتجارب أبحاث المستخدمين.

توزيع المهام بين صفحات الهبوط، وتطبيقات الويب، ولوحات البيانات

يمكن للدرجات الإجمالية إخفاء عيوب حرجة. قد تواجه النماذج القادرة على توليد صفحات هبوط نظيفة صعوبة عند بناء جداول إدارية كثيفة البيانات. عزل فريق OpenDesign أداء النموذج عبر خمسة تنسيق واجهات محددة، كاشفاً عن ملفات تعريف سلوكية متميزة عبر كل فئة generation.

في صفحات الهبوط ومواقع التسويق، حجز DeepSeek V4.1 Flash المركز الرابع برصيد 79.3، ليضع نفسه مباشرة قبل GPT-6 Astra. تعامل النموذج مع طباعة الهيرو (hero typography)، ومحاذاة الـ flexbox، وأقسام الـ call-to-action المتجاوبة، ووضع أيقونات SVG بدون انجراف بصري. في نماذج برمجيات سطح المكتب، تعادل في المركز الثالث برصيد 84.4. وفي واجهات الهواتف المحمولة، احتل المركز الخامس برصيد 82.5، مدمراً بدقة أهداف اللمس، وأدراج الشاشات، وشريط التنقل الصديق للإبهام.

يتغير التحليل عندما تنظر إلى لوحات البيانات المعقدة (dashboards) واللوحات الإدارية. انخفض DeepSeek إلى المركز العاشر برصيد 76.1. لقد واجه صعوبة في محاذاة شبكات البيانات المعقدة، وأشرطة جانبية لاستعلامات التفلتر المتعددة، وويجتس تصور البيانات المتداخلة. أدت نماذج مثل GPT-6 Astra بشكل أفضل بكثير على الجداول الكثيفة الغنية بالمعلومات حيث يكون التفكير المكاني أهم من براعة التصميم.

سلط القائمون على الصيانة الضوء على هذا الانقسام الفئوي في تحليلهم لتوزيع المهام:

Loading tweet...

تكشف نظرة مقارنة لترتيبات صفحات الهبوط وترتيبات لوحات البيانات عن الاختلاف بوضوح:

لوحة بيانات تعرض الترتيبات المقارنة لصفحات الهبوط وواجهات الإدارة
لوحة بيانات تعرض الترتيبات المقارنة لصفحات الهبوط وواجهات الإدارة

تُظهر مراجعة معرض prototypes الاستوديو الخاص بالمشروع مدى جودة تعامل النموذج مع تدفقات المستهلكين. وعلى العكس من ذلك، فإن فحص لوحات البيانات المعقدة (dashboards) يوضح سبب احتياج المنطق المكاني إلى إشراف دقيق. عند بناء المواد التسويقية ورحلات تسجيل المستخدمين على OpenDesign Arena، تتفوق هندسات الـ flash خفيفة الوزن لأن التصميم البصري يتبع أنماط مكونات يمكن التنبؤ بها. في المقابل، تتطلب لوحات البيانات المؤسسية المعقدة محاذاة جداول علائقية، ومقاييس حالات متداخلة، وفلاتر استجابة معقدة حيث تحتفظ هندسات الـ frontier الثقيلة من حيث التفكير بميزة. معرفة أين يواجه النموذج صعوبة يخبرك كيف توجّه المهام في الـ pipeline الخاص بك. استخدم DeepSeek V4.1 Flash لاجتياز شاشات تطبيقات المستهلكين، وقنوات التسويق، وعروض الهواتف المحمولة. عندما تحتاج إلى واجهة تحليلات مؤسسية بها عشرون حالة رسم بياني، وجه المهمة إلى نموذج ذي بنية مكانية أقوى.

الواقع الهندسي لتشغيل open weights في حزمة محلية

تتعامل معظم المناقشات مع النماذج كبدائل مجردة وقابلة للتبديل الفوري. في الإنتاج، يهم عميل التنسيق (orchestrating client) الخاص بك بقدر ما تهتم أوزان النموذج. تجاوز OpenDesign GitHub Repository 90,000 نجمة على GitHub في غضون 116 يوماً، كما هو ملاحظ في إفصاحهم العام الأول، مما يدل على طلب قوي على أدوات المطور المحلية والقابلة للتحكم والتي تتجنب قفل بائعي السحابة المغلقين.

يعمل OpenDesign كـ desktop application محلي أولاً مع خلفية Node مدمجة، متصلاً مباشرة بـ CLIs الخاصة بـ coding agents المحلية. يتطلب تشغيل DeepSeek V4.1 Flash تكوين عميل دقيق. إذا أساء الـ harness التعامل مع بادئات الـ prompt caching أو ترك جهد التفكير (reasoning effort) مقفلاً على مستوى مرتفع للعمليات الأساسية، فستنخفض سرعة الـ generation وتتضاعف التكاليف. توسع النظام البيئي بشكل أكبر مع تكامل دليل إضافات Codex الرسمي، مما جلّب لوحة رسم بصرية في الوقت الفعلي مباشرة إلى بيئات المطورين الشائعة.

تحدد وثائق OpenDesign توافقاً واسعاً عبر أدوات سطر الأوامر الخاصة بالـ agent المحلي:

وثائق مستودع OpenDesign التي تُظهر CLIs لـ coding agents المحلية المدعومة
وثائق مستودع OpenDesign التي تُظهر CLIs لـ coding agents المحلية المدعومة

عامل حاسم آخر هو نظافة الـ cache. إذا قام الـ agent الخاص بك بحقن الطوابع الزمنية الديناميكية أو معرفات الطلبات العشوائية في بادئة الـ prompt، فسوف تقضي على التخزين المؤقت للمفتاح والقيمة (key-value caching) من جانب المزود. عندما يعمل الـ caching، تكلف توكنات الإدخال جزءاً من السنت. عندما يفشل الـ caching، يرتفع هذا السعر بخمسين ضعفا. الحفاظ على الـ system prompts، وإرشادات العلامة التجارية، وتعريفات الأدوات المشتركة مثبتة في رأس مخزن السياق (context buffer) هو ما يحافظ على تشغيلاتك بالقروش المعدنية.

استعرض المراجع التقني WorldofAI عملية الإعداد وعرض مولد المكونات الحي قيد العمل:

تسمح أدوات التنفيذ المحلية للمطورين بتجنب اشتراكات الـ frontier غير المحدودة التي تتجاوز بانتظام 200 دولار لكل مقعد شهرياً. من خلال ربط أدوات التنسيق open-source بنقاط نهاية الـ inference منخفضة التكلفة، يمكن للمطورين المستقلين بناء برمجيات إنتاجية دون تكبد نفقات مؤسسية زائدة. علاوة على ذلك، يضمن الحفاظ على الحالة المحلية (local state) أن أصول العلامة التجارية الخاصة، وwireframes العملاء غير المنشورة، وtokens التصميم الداخلية تظل بالكامل على الجهاز المادي للمطور بدلاً من التدفق إلى أنظمة تخزين خارجية مغلقة ومملوكة للغير.