Introduction
Birkaç gün önce, OpenDesign projesinden benchmark numaraları geliştirici akışlarında yüzeye çıktı. Yeni önizlenen DeepSeek V4.1 Flash, otomatik UI değerlendirme paketine karşı çalıştırıldığında model, günlük arayüz oluşturmada 100 üzerinden 81,2 puan aldı. Bu, GPT-6 Astra'nın belirlediği puanın (82,7) yüzde 98'ine denk geliyor ve Claude Fable 5.1'i (80,3) çok az farkla geçiyor.
Pratik eşitsizlik faturada yatıyor. DeepSeek çalıştırması 5,3 dakika sürdü ve API token'larında 0,023 dolar harcadı. Astra 11,1 dakika gerektirdi ve 1,61 dolara mal oldu. Fable 12,8 dakika sürdü ve 3,66 dolara mal oldu. Değerlendirilen 13 modelden 11'i, tamamlanan görev başına 150 kata kadar daha fazla ücret alırken DeepSeek'ten daha düşük puan aldı.
Sıkı bir aylık bütçeyle geliştirici araçları oluşturan herkes için bu rakamlar dikkat gerektiriyor. Frontier kapalı modeller, geçtiğimiz yıl boyunca frontend generation üzerinde neredeyse bir tekele sahipti. Ucuz emtia çiplerinde çalışan open-weight bir model, üretime hazır HTML, CSS ve bileşen durumunu iki sente ürettiğinde, yazılım sevk etmek için temel matematik anında değişir.
OpenDesign Arena benchmark'ının arkasındaki sayılar
OpenDesign Arena değerlendirmesi, 13 modeli aynı arayüz oluşturma prompt'ları üzerinde test etti. Ekip, soyut mantık veya rekabetçi programlama bulmacaları test etmek yerine, açık kaynaklı tasarım çalışma alanlarındaki gerçek kullanıcı oturumlarından prompt'lar seçti. nexu-io/open-design arkasındaki geliştiriciler, her modeli web uygulamaları, mobil uygulamalar, masaüstü yazılımlar, paneller ve pazarlama web siteleri olmak üzere beş spesifik uygulama senaryosuna karşı çalıştıran headless bir test ortamı kurdu.
Genel sıralamada DeepSeek V4.1 Flash, kalitede yalnızca GPT-6 Astra'nın 1,5 puan gerisinde kalarak ikinci sıraya yerleşiyor. Kalite, maliyet ve latency dengelendiğinde, arena algoritması V4.1 Flash'i 78,8'lik toplam indeksle genel olarak en iyi seçenek olarak konumlandırıyor. DeepSeek V4 Flash 68,6'da, GPT-5.6 Sol 65,7'ye ulaşıyor, Gemini 3.8 Flash 64,7 alıyor ve Claude Fable 5.1 yüksek maliyeti ve generation latency'si nedeniyle 52,1'e geriliyor.
OpenDesign Arena açılış sayfası, DeepSeek V4.1 Flash'in tasarım kalitesini rakip ticari endpoint'lerle karşılaştıran bir performans değerlendirme kartı gösteriyor:

Ham çıktıları incelediğinizde nesiller arasındaki fark açıkça görülüyor. DeepSeek V4.1 Flash, 30 üzerinden ortalama 28,4 gereksinim karşılama puanı elde ederek hem 26,5 alan GPT-6 Astra'yı hem de 27,1 alan Claude Fable 5.1'i geride bıraktı. Ham görsel cila ve tasarım kalitesinde Astra, DeepSeek'in 52,8'ine kıyasla 70 üzerinden 56,2 ile hafif bir liderliği koruyor. Astra'nın ham görsel puanının yaklaşık yüzde 98'ini yakalarken finansal harcamanın yalnızca yüzde 1,4'ü ile çalışan model, resmi OpenDesign platformunda kataloglanan frontend generation görevleri için kökten değişmiş bir ekonomik gerçeklik ortaya koyuyor.
Zaman yatırımı, günlük iş akışı için çok daha güçlü bir hikaye anlatıyor. DeepSeek ortalama çalışmasını 5,3 dakikada tamamladı. Astra 11,1 dakika gerektirdi ve Claude Fable 5.1 12,8 dakikaya uzadı. Bir mühendis bir ajanın prototip tasarlamasını bekleyerek terminalde oturduğunda, altı dakikalık bir fark odaklanıp odaklanamayacağınızı veya sosyal medyaya dalıp dalmayacağınızı belirler.
OpenDesign ekibi bu başlık metriklerini ilk resmi açıklamalarında özetledi:
Çalışma alanını test eden topluluk üyeleri de hız kazançlarını doğruladı. Reddit'in r/SideProject üzerindeki aktif bir değerlendirme thread'inde erken benimseyenler, hafif modellerin ağır tescilli seçeneklere kıyasla çalışan düzenleri ne kadar hızlı döndürdüğünü belirtti. Bir sabah içinde on varyasyonun prototipini oluşturan ekipler için, her generation döngüsü başına altı dakika tasarruf etmek tüm sprint boyunca birikir. Geliştiriciler, layout token'larını çözmek için frontier endpoint'leri bekleyerek saatler harcamak yerine, felaket niteliğinde API throttling veya iş akışı kesintileriyle karşılaşmadan aynı anda birden fazla arayüz dalı oluşturabilir ve yapısal varyasyonlar üzerinde gerçek zamanlı olarak iterate edebilirler.
Benchmark, insan jüriler olmadan arayüz kalitesini nasıl ölçüyor?
Otomatik UI benchmark'ları genellikle başarısız olur çünkü görsel kalite öznel hissettirir. Keyfi insan oylamasına veya yüzeysel HTML etiketi sayılarına güvenmekten kaçınmak için OpenDesign test çerçevesi, değerlendirmeyi katı mekanik aşamalara böler. İlk olarak, test ortamı bir çalışma zamanı (runtime) kontrolü gerçekleştirir. Oluşturulan kod, headless bir Chromium örneğinde doğrudan yüklenir. Eğer yapıt boş bir viewport, bozuk import'lar, render edilmemiş markdown blokları veya konsolda yakalanmamış JavaScript istisnaları gösterirse, çalışma otomatik olarak sıfır alır. Süit, yeniden denemelere izin vermez veya eksik syntax'ı düzeltmez.
Yürütmeden sağ çıkan yapıtlar 100 puanlık bir rubrik ile karşı karşıya kalır. Gereksinim karşılama 30 puan oluşturur. Sistem, brütte talep edilen belirli bileşenleri doğrulamak için DOM ağaçlarını inceler: interaktif modal durumları, form doğrulama bağlamaları, tablo sütun sıralaması ve duyarlı (responsive) yerleşim sarmalayıcıları. Kalan 70 puan, layout hiyerarşisi, renk uyumu, erişilebilir kontrast oranları, bileşen uyumluluğu ve mobil ile masaüstü kırılma noktalarındaki responsive adaptasyon dahil olmak üzere beş kategoride tasarım yapısını ölçer. Otomatik kontroller, katı WCAG AA kontrast standartlarını uygulamak için renk luminance farklılıklarını hesaplar, üst üste binen mutlak elementleri işaretler ve 375px, 768px ile 1440px viewport genişliklerinde layout davranışını değerlendirir.
OpenDesign ekibi, bu test felsefesine ilişkin topluluk sorularını OpenDesign'ın X duyurusundaki resmi bir güncellemeyle ele aldı:
80 veya üzeri bir puan, bir yapıtı teslim edilebilir olarak nitelendirir. Tüm test kataloğu boyunca DeepSeek V4.1 Flash, yüzde 57,7'lik bir teslim oranı korudu. GPT-6 Astra yüzde 60,0'a ulaştı, Claude Fable 5.1 ise yüzde 56,7 puan aldı. Açık ağırlıklı model, token başına 50 kat daha fazla ücret alan köklü ticari modellere kıyasla daha az felaket niteliğinde regresyon üretti.
Çerçeve ayrıca Claude Code Skills Convention gibi agent standartlarını kullanarak yapısal uyumu takip eder ve oluşturulan yapıtların temiz dosya ayrıntılarını ve modüler bileşen sınırlarını takip etmesini sağlar.
Bu boyutların en üst düzeyde nasıl dengelendiğini görselleştirmek için OpenDesign beş boyutlu bir radar karşılaştırması yayınladı:

Benchmark, mekanik geçerliliğe ve yapısal bütünlüğe odaklanarak geliştiricilerin otomatik tasarım agent'larını tahmin yürütmeden değerlendirmeleri için tekrarlanabilir bir yol sağlar. Mühendislik ekipleri, nitel görsel izlenimlere güvenmek yerine, yapay zeka modelinin dinamik üretim veri yükleri altında çökmeyecek geçerli semantik etiketler, öngörülebilir responsive state machine'ler ve kararlı bileşen hiyerarşileri üretip üretmediğini doğrulayabilir.
Token ekonomisi ve 70 kat fiyat eşitsizliği
Frontier AI modellerinin birim ekonomisi, öz kaynaklarıyla büyüyen (bootstrapped) girişimler için gerçek bir engel teşkil eder. Sınırsız frontier modelleri kullanan agentic coding araçlarıyla beş geliştiriciden oluşan bir ekibi çalıştırmak her ay bin beş yüz doları aşabilir. Geliştirici agent'ları bir arayüz üzerinde iterate ederken, araç birden fazla tur döner; dosyaları okur, derleme komutlarını yürütür, tarayıcı DOM ağaçlarını inceler ve tüm dosyaları yeniden yazar.
Benchmark verilerine göre, Claude Fable 5.1 aracılığıyla tek bir tam web uygulama prototipi oluşturmak ortalama 3,66 ila 5,55 dolar tutuyor. Aynı görev GPT-6 Astra'da 1,61 ila 1,87 dolara, GPT-5.6 Sol'de 0,537 dolara ve DeepSeek V4.1 Flash'te 0,023 ile 0,030 dolar arasında mal oluyor. Fiyat farkı iki büyüklük derecesine yayılıyor; bu eşitsizlik OpenDesign dokümantasyon portalında yayınlanan karşılaştırmalarda da vurgulanıyor.
Ortalama kalite puanlarını doğrudan maliyete karşı karşılaştıran bir dağılım grafiği, modellerin ne kadar keskin bir şekilde ayrıştığını gösteriyor:

DeepSeek bu rakamlara yüksek önbellek isabet oranlarını (cache hit rates) hızlı generation hızıyla eşleştirerek ulaşıyor. Testlerde V4.1 Flash, yüzde 89,0'lık bir prefix cache isabet oranı korudu. 29.000 çıktı token'ı üretirken 1,5 milyon girdi token'ı işledi. Agent harness'ları için DeepSeek dokümantasyonu, yoğun olmayan saatlerdeki girdi önbellek isabetlerini milyon token başına 0,003 dolar, önbelleklenmemiş girdileri milyon token başına 0,15 dolar ve çıktı token'larını milyon token başına 0,60 dolar olarak listeliyor.
Prompt caching, çok turlu agent konuşmalarında tekrarlanan hesaplamaları önlediği için, context window'u sıcak tutmak sentin kesirlerine mal olur. Bağımsız testler, ham generation pass'lerinde decoding throughput'un saniyede 350 ila 427 token arasında olduğunu kaydetti.
OpenDesign sürdürücüleri bu maliyet avantajını model çalıştırmalarına göre ayırdı:
Öğleden sonra on arayüz fikrini test eden tek başına bir kurucu için, DeepSeek'e toplamda yirmi beş cent harcamak, Claude Fable'a otuz beş dolar harcamaktan daha iyidir. Bu marj; altyapı, müşteri kazanımı veya alan adları için sermaye açığa çıkarır. Yüzlerce bileşen iterasyonunu içeren birkaç haftalık bir mühendislik sprinti sürecinde, çevik bir ürün ekibi sentetik tasarım faturalandırmasını yüzlerce daldan cep harçlığına indirebilir ve erken aşamadaki ekiplerin interaktif prototipleme ve kullanıcı araştırması deneyimlerine yaklaşımını kalıcı olarak dönüştürebilir.
Açılış sayfaları, web uygulamaları ve paneller arasında görev dökümleri
Toplam puanlar kritik kusurları maskeleyebilir. Temiz açılış sayfaları oluşturabilen bir model, veri ağırlıklı idari tablolar oluştururken zorlanabilir. OpenDesign ekibi, model performansını beş spesifik arayüz formatında izole ederek her generation kategorisinde farklı davranış profilleri ortaya çıkardı.
Açılış sayfalarında ve pazarlama web sitelerinde DeepSeek V4.1 Flash, 79,3 puanla dördüncü sırayı alarak doğrudan GPT-6 Astra'nın önüne yerleşti. Model, hero tipografisini, flexbox hizalamalarını, duyarlı call-to-action bölümlerini ve SVG ikon yerleşimini görsel kayma olmadan ele aldı. Masaüstü yazılım prototiplerinde 84,4 puanla üçüncülüğü paylaştı. Mobil arayüzlerde ise dokunma hedeflerini, sayfa çekmecelerini (sheet drawers) ve başparmak dostu navigasyon çubuklarını temiz bir şekilde yöneterek 82,5 ile beşinci sırada yer aldı.
Karmaşık veri panellerine ve admin panellerine baktığınızda dağılım değişiyor. DeepSeek, 76,1 puanla onuncu sıraya geriledi. Karmaşık veri tablosu hizalamalarında, çoklu filtre sorgu kenar çubuklarında ve iç içe geçmiş veri görselleştirme widget'larında zorlandı. GPT-6 Astra gibi modeller, mekansal mantığın stil yeteneğinden daha önemli olduğu yoğun, bilgi ağırlıklı tablolarda çok daha iyi performans gösterdi.
Sürdürücüler, görev dökümü analizlerinde bu kategorik ayrımı vurguladı:
Açılış sayfası sıralamalarının ve panel sıralamalarının karşılaştırmalı görünümü ayrışmayı net bir şekilde ortaya koyuyor:

Projenin studio prototype galerisini incelemek, modelin tüketici akışlarını ne kadar iyi ele aldığını gösterir. Buna karşılık, karmaşık canlı panel örneklerini incelemek, mekansal mantığın neden hâlâ dikkatli bir gözetim gerektirdiğini ortaya koyar. OpenDesign uygulamasında pazarlama materyalleri ve kullanıcı kayıt yolculukları oluştururken, görsel stil öngörülebilir bileşen kalıplarını takip ettiği için hafif flash mimarileri üstündür. Buna karşılık, karmaşık kurumsal paneller; ilişkisel tablo hizalamaları, iç içe durum metrikleri ve mantık ağırlıklı frontier mimarilerin avantajını koruduğu karmaşık responsive filtreler gerektirir. Bir modelin nerede zorlandığını bilmek, görevleri pipeline'ınızda nasıl yönlendirmeniz gerektiğini söyler. Tüketici uygulama ekranları, pazarlama hunileri ve mobil görünümler için DeepSeek V4.1 Flash kullanın. Yirmi grafik durumuna sahip kurumsal bir analitik arayüze ihtiyacınız olduğunda, işi daha güçlü mekansal yapıya sahip bir modele yönlendirin.
Yerel bir test ortamında open-weight çalıştırmanın mühendislik gerçekliği
Çoğu tartışma modelleri soyut, doğrudan değiştirilebilir (drop-in) alternatifler olarak ele alır. Üretimde, orkestrasyonu yapan istemciniz (client) model ağırlıkları kadar önemlidir. Resmi nexu-io/open-design deposu, milon duyurularında belirtildiği üzere 116 gün içinde 90.000 GitHub yıldızını aştı; bu da tescilli bulut satıcı bağımlılığından kaçınan yerel, kontrol edilebilir geliştirici araçlarına yönelik güçlü bir talebi gösteriyor.
OpenDesign, entegre bir Node daemon'ına sahip yerel öncelikli (local-first) bir masaüstü uygulaması olarak çalışır ve doğrudan yerel kodlama agent CLI'larına bağlanır. DeepSeek V4.1 Flash'i çalıştırmak kesin istemci yapılandırması gerektirir. Test ortamınız prompt caching prefix'lerini yanlış yönetirse veya temel işlemler için reasoning çabasını yüksekte kilitli bırakırsa, generation hızınız düşer ve maliyetler katlanır. Ekosistem, resmi Codex Plugin Directory entegrasyonuyla daha da genişleyerek gerçek zamanlı bir görsel tuvali doğrudan popüler geliştirici ortamlarına getirdi.
OpenDesign dokümantasyonu, yerel agent komut satırı araçları arasında geniş uyumluluk özetlemektedir:

Bir diğer kritik faktör de önbellek hijyenidir. Agent'ınız prompt prefix'ine dinamik zaman damgaları veya rastgele istek ID'leri enjekte ederse, sağlayıcı tarafındaki anahtar-değer önbelleğe almayı sıfırlarsınız. Önbelleğe alma çalıştığında, girdi token'ları bir centin kesirine mal olur. Önbellek kaçırdığında (miss), bu fiyat elli kat fırlar. Sistem prompt'larını, marka yönergelerini ve paylaşılan araç tanımlarını context buffer'ın başında sabitlemek, çalıştırmalarınızı sentler seviyesinde tutmanızı sağlar.
Teknoloji incelemecisi WorldofAI, kurulum sürecini adım adım anlattı ve canlı bileşen oluşturucuyu çalışırken sergiledi:
Yerel yürütme ortamları, geliştiricilerin koltuk başına aylık 200 doları düzenli olarak aşan sınırsız frontier aboneliklerinden kaçınmalarını sağlar. Açık kaynaklı orkestratörleri düşük maliyetli inference endpoint'leriyle eşleştirerek, bağımsız geliştiriciler kurumsal maliyet (overhead) yükü altına girmeden üretim yazılımı oluşturabilir. Dahası, yerel durumu korumak; tescilli marka varlıklarını, yayınlanmamış müşteri tel kafeslerini (wireframe) ve dahili tasarım token'larını, tescilli harici depolama sistemlerine akış yapmak yerine tamamen geliştiricinin fiziksel makinesinde tutmasını sağlar.

