Introduction

Prije nekoliko dana, benchmark brojke iz OpenDesign projekta isplivale su na programerskim feedovima. Pokrećući novonajavljeni DeepSeek V4.1 Flash protiv njihovog automatiziranog UI evaluacijskog paketa, model je ostvario 81,2 od 100 bodova na svakodnevnom generiranju sučelja. To odgovara 98 posto rezultata koji je postavio GPT-6 Astra (82.7) i lagano nadmašuje Claude Fable 5.1 (80.3).

Praktična diskrepancija leži u računu. Izvođenje DeepSeeka trajalo je 5,3 minute i potrošilo 0,023 USD u API tokenima. Astra je zahtijevala 11,1 minutu i koštala 1,61 USD. Fable je uzeo 12,8 minuta i koštao 3,66 USD. Od 13 ocijenjenih modela, 11 ih je ostvarilo niži rezultat od DeepSeeka dok su naplaćivali do 150 puta više po dovršenom zadatku.

Za sve koji pokreću programerske alate s ograničenim mjesečnim budžetom, ove brojke zahtijevaju pozornost. Frontier zatvoreni modeli držali su gotovo monopol na generiranje frontenda u protekloj godini. Kada model otvorenih težina koji radi na jeftinim čipovima opće namjene proizvodi produkcijski spreman HTML, CSS i stanje komponenti za dva centa, osnovna matematika isporuke softvera odmah se mijenja.

Brojke iza benchmarka OpenDesign Arena

Evaluacija u OpenDesign Areni testirala je 13 modela na identičnim promptovima za izradu sučelja. Umjesto testiranja apstraktne logike ili natjecateljskih programskih zagonetki, tim je izvukao promptove iz stvarnih korisničkih sesija unutar svog open-source dizajnerskog radnog prostora. Održavatelji iza projekta nexu-io/open-design postavili su headless testni okviri koji pokreće svaki model na pet specifičnih scenarija primjene: web aplikacije, mobilne aplikacije, stolni softver, kontrolne ploče (dashboards) i marketinške web stranice.

Ukupni poredak stavlja DeepSeek V4.1 Flash na drugo mjesto po kvaliteti, zaostajući samo za GPT-6 Astra za 1,5 bodova. Prilikom balansiranja kvalitete, cijene i latencije, algoritam arene rangira V4.1 Flash kao najbolju opciju ukupno s agregatnim indeksom od 78,8. DeepSeek V4 Flash nalazi se na 68,6, GPT-5.6 Sol doseže 65,7, Gemini 3.8 Flash uzima 64,7, dok Claude Fable 5.1 pada na 52,1 zbog visoke cijene i latencije generiranja.

Početna stranica OpenDesign Arene prikazuje karticu evaluacije performansi za DeepSeek V4.1 Flash uspoređujući njegovu kvalitetu dizajna s konkurentskim komercijalnim endpointovima:

Kartica evaluacije performansi na početnoj stranici OpenDesign Arene
Kartica evaluacije performansi na početnoj stranici OpenDesign Arene

Razlika između generacija postaje očita kada pregledate sirove outpute. DeepSeek V4.1 Flash ostvario je prosječan rezultat ispunjenja zahtjeva od 28,4 od 30, nadmašivši i GPT-6 Astra s 26,5 i Claude Fable 5.1 s 27,1. Što se tiče sirove vizualne dotjeranosti i kvalitete dizajna, Astra zadržava blagu prednost s 56,2 od 70 u usporedbi s DeepSeekovih 52,8. Usklađivanjem s gotovo 98 posto Astra-inog sirovog vizualnog rezultata dok radi na otprilike 1,4 posto financijskih troškova, model uspostavlja radikalno izmijenjenu ekonomsku stvarnost za zadatke generiranja frontenda katalogizirane na službenoj OpenDesign platformi.

Vremensko ulaganje priča još snažniju priču za svakodnevni radni tijek. DeepSeek je dovršio svoje prosječno izvođenje za 5,3 minute. Astra je zahtijevala 11,1 minutu, dok se Claude Fable 5.1 protegnuo na 12,8 minuta. Kada inženjer sjedi u terminalu i čeka da agent izradi prototip, razlika od šest minuta određuje hoćete li zadržati fokus ili odlutati na društvene mreže.

OpenDesign tim sažet je ove glavne metrike u svom početnom javnom priopćenju:

Loading tweet...

Članovi zajednice koji su testirali radni prostor podržali su dobitke u brzini. U aktivnoj dretvi za evaluaciju na Redditovom r/SideProject, rani korisnici primijetili su koliko brzo lagani modeli vraćaju funkcionalne rasporede u usporedbi s teškim vlasničkim opcijama. Za timove koji izrađuju prototipove deset varijacija ujutro, ušteda šest minuta po petlji generiranja zbraja se kroz cijeli sprint. Umjesto trošenja sati čekajući da frontier endpointi razriješe layout tokene, programeri mogu pokrenuti više grana sučelja istovremeno, iterirajući kroz strukturalne varijacije u stvarnom vremenu bez izazivanja katastrofalnog API throttlinga ili prekida radnog tijeka.

Kako benchmark mjeri kvalitetu sučelja bez ljudskih sudaca

Automatizirani UI benchmarki obično propadaju jer se vizualna kvaliteta čini subjektivnom. Kako bi se izbjeglo oslanjanje na proizvoljno ljudsko glasovanje ili površno brojanje HTML oznaka, OpenDesign testni okvir dijeli evaluaciju na stroge mehaničke faze. Prvo, okviri izvršavaju provjeru izvođenja (runtime check). Generirani kod se učitava izravno u headless Chromium instancu. Ako artefakt prikazuje prazan viewport, pokvarene importe, nerenderirane markdown blokove ili neuhvaćene JavaScript iznimke u konzoli, izvođenje dobiva automatsku nulu. Paket ne odobrava ponovna pokretanja niti popravlja nedostajuću sintaksu.

Artefakti koji prežive izvršavanje suočavaju se s rubrikom od 100 bodova. Ispunjenje zahtjeva čini 30 bodova. Sustav pregledava DOM stabla kako bi potvrdio specifične komponente zatražene u briefu: stanja interaktivnih modala, poveznice za validaciju formi, sortiranje stupaca u tablicama i responzivne omotače rasporeda. Preostalih 70 bodova mjeri strukturu dizajna kroz pet kategorija, uključujući hijerarhiju rasporeda, harmoniju boja, pristupačne omjere kontrasta, usklađenost komponenti i responzivnu prilagodbu na mobilnim i desktop breakpointima. Automatizirane provjere izračunavaju razlike u luminanciji boja kako bi nametnule stroge WCAG AA standarde kontrasta, označavaju preklapajuće apsolutne elemente i ocjenjuju ponašanje rasporeda preko širina viewporta od 375px, 768px i 1440px.

OpenDesign tim odgovorio je na pitanja zajednice u vezi s ovom filozofijom testiranja u službenom ažuriranju na OpenDesign X objavi:

Loading tweet...

Rezultat od 80 ili više kvalificira artefakt kao isporučiv. Kroz cijeli testni katalog, DeepSeek V4.1 Flash održao je stopu isporuke od 57,7 posto. GPT-6 Astra dosegla je 60,0 posto, dok je Claude Fable 5.1 ostvario 56,7 posto. Model otvorenih težina (open-weight) proizveo je manje katastrofalnih regresija nego utvrđeni komercijalni modeli koji naplaćuju 50 puta više po tokenu.

Okvir također prati strukturalnu usklađenost koristeći standarde agenata kao što je konvencija vještina Anthropic Claude Code, osiguravajući da generirani artefakti slijede čista odvajanja datoteka i modularne granice komponenti.

Kako bi vizualizirali kako se ove dimenzije uravnotežuju u vrhu, OpenDesign je objavio usporedbu radara u pet dimenzija:

Radarska usporedba modela DeepSeek V4.1 Flash, GPT-6 Astra i Claude Fable 5.1 kroz pet dimenzija evaluacije
Radarska usporedba modela DeepSeek V4.1 Flash, GPT-6 Astra i Claude Fable 5.1 kroz pet dimenzija evaluacije

Fokusirajući se na mehaničku valjanost i strukturalni integritet, benchmark pruža reproducibilan put za programere da procjenjuju automatizirane agente dizajna bez nagađanja. Umjesto oslanjanja na kvalitativne vizualne dojmove, inženjerski timovi mogu provjeriti proizvodi li model umjetne inteligencije valjane semantičke oznake, predvidljive responzivne state machine-ove i stabilne hijerarhije komponenti koje neće se srušiti pod dinamičkim opterećenjima produkcijskih podataka.

Token ekonomija i 70x cjenovna diskrepancija

Jedinična ekonomija frontier AI modela predstavlja stvarnu prepreku za startupe bez investitora (bootstrapped). Vođenje tima od pet programera na alatima za kodiranje s agentima i neograničenim frontier modelima može premašiti tisuću i petsto dolara svaki mjesec. Kada programerski agenti iteriraju na sučelju, alat prolazi kroz više koraka, čitajući datoteke, izvršavajući naredbe za izgradnju (build), pregledavajući DOM stabla preglednika i prepisujući cijele datoteke.

Prema podacima benchmarka, generiranje jednog jedinog punog prototipa web aplikacije putem Claude Fable 5.1 u prosjeku košta od 3,66 do 5,55 USD. Isti taj zadatak košta od 1,61 do 1,87 USD na GPT-6 Astra, 0,537 USD na GPT-5.6 Sol, te između 0,023 i 0,030 USD na DeepSeek V4.1 Flash. Jaz u cijenama obuhvaća dva reda veličine, diskrepanciju naglašenu usporedbama objavljenim na OpenDesign dokumentacijskom portalu.

Raspršeni dijagram (scatter plot) koji uspoređuje prosječne rezultate kvalitete izravno s cijenom ilustrira koliko se oštro modeli razlikuju:

Raspršeni dijagram kvalitete modela u odnosu na cijenu po artefaktu koji prikazuje frontier modele grupirane na visokim cjenovnim razinama
Raspršeni dijagram kvalitete modela u odnosu na cijenu po artefaktu koji prikazuje frontier modele grupirane na visokim cjenovnim razinama

DeepSeek postiže ove brojke uparivanjem visokih stopa pogađanja predmemorije s brzinom generiranja. U testiranju, V4.1 Flash održao je stopu pogađanja predmemorije prefiksa od 89,0 posto. Obradio je 1,5 milijuna input tokena dok je generirao 29.000 output tokena. DeepSeekova dokumentacija za njihov okvir agenata navodi pogodke predmemorije inputa izvan vršnog opterećenja po 0,003 USD po milijunu tokena, nepredmemorirani input po 0,15 USD po milijunu, te output tokene po 0,60 USD po milijunu.

Budući da prompt caching sprječava ponovljeno računanje kroz višekorne razgovore s agentima, održavanje kontekstnog prozora toplim košta djelić centa. Neovisna izvođenja zabilježila su throughput dekodiranja između 350 i 427 tokena u sekundi na prolazima sirovog generiranja.

Održavatelji OpenDesigna raščlanili su ovu cjenovnu prednost kroz izvođenja modela:

Loading tweet...

Za solo osnivača koji testira deset ideja sučelja u jednom popodnevu, trošenje dvadeset i pet centi ukupno na DeepSeek nadmašuje trošenje trideset i pet dolara na Claude Fable. Ta marža oslobađa kapital za infrastrukturu, akviziciju kupaca ili nazive domena. Tijekom višetjednog inženjerskog sprinta koji uključuje stotine iteracija komponenti, agilni proizvodni odred može smanjiti troškove svog sintetičkog dizajna s stotina dolara na sitniš, trajno transformirajući način na koji rane ekipe pristupaju interaktivnom prototipiranju i eksperimentima s korisničkim istraživanjem.

Raščlamba zadataka između landing stranica, web aplikacija i kontrolnih ploča

Agregatni rezultati mogu sakriti kritične nedostatke. Model sposoban za generiranje čistih landing stranica mogao bi imati poteškoća pri izgradnji administrativnih tablica bogatih podacima. OpenDesign tim izolirao je performanse modela kroz pet specifičnih formata sučelja, otkrivajući različite profile ponašanja u svakoj kategoriji generiranja.

Na landing stranicama i marketinškim web stranicama, DeepSeek V4.1 Flash osigurao je četvrto mjesto s rezultatom 79,3, stavljajući ga izravno ispred GPT-6 Astra. Model se nosio s hero tipografijom, flexbox poravnanjima, responzivnim call-to-action sekcijama i postavljanjem SVG ikona bez vizualnog pomaka. Na prototipovima stolnog softvera, podijelio je treće mjesto s rezultatom 84,4. Na mobilnim sučeljima držao je peto mjesto s 82,5, uredno upravljajući dodirnim ciljevima, ladicama i navigacijskim trakama prilagođenim palcu.

Raščlamba se mijenja kada pogledate složene podatkovne kontrolne ploče i administrativne panele. DeepSeek je pao na deseto mjesto s rezultatom 76,1. Mučio se s poravnanjima složenih podatkovnih mreža, bočnim trakama za upite s višestrukim filterima i ugniježđenim widgetima za vizualizaciju podataka. Modeli poput GPT-6 Astra radili su puno bolje na gustim tablicama bogatim informacijama gdje je prostorno razmišljanje važnije od stilskog šarma.

Održavatelji su istaknuli ovu kategoričku podjelu u svojoj analizi raščlambe zadataka:

Loading tweet...

Komparativni prikaz rangiranja landing stranica i kontrolnih ploča jasno otkriva divergenciju:

Kontrolna ploča koja prikazuje komparativna rangiranja za landing stranice i administrativna sučelja
Kontrolna ploča koja prikazuje komparativna rangiranja za landing stranice i administrativna sučelja

Pregled galerije studijskih prototipova projekta pokazuje koliko dobro model rukuje tokovima potrošača. S druge strane, ispitivanje složenih primjera kontrolnih ploča uživo otkriva zašto prostorna logika još uvijek zahtijeva pažljiv nadzor. Prilikom izgradnje marketinškog materijala i korisničkih putovanja za prijavu na OpenDesign aplikaciji, lagane flash arhitekture ističu se jer vizualno stiliziranje slijedi predvidljive uzorke komponenti. Suprotno tome, složene enterprise kontrolne ploče zahtijevaju usklađivanje relacijskih tablica, ugniježđene metrike statusa i složene responzivne filtere gdje frontier arhitekture s naglaskom na reasoning održavaju prednost. Poznavanje mjesta gdje se model muči govori vam kako usmjeravati zadatke u vašem pipelineu. Koristite DeepSeek V4.1 Flash za probijanje kroz ekrane potrošačkih aplikacija, marketinške tokove i mobilne prikaze. Kada trebate sučelje enterprise analitike s dvadeset stanja grafikona, usmjerite posao na model s jačom prostornom strukturom.

Inženjerska stvarnost pokretanja otvorenih težina u lokalnom okruženju

Većina rasprava tretira modele kao apstraktne zamjenske dijelove. U produkciji, vaš klijent za orkestraciju jednako je važan kao i težine modela. Službeno nexu-io/open-design spremište premašilo je 90.000 GitHub zvjezdica unutar 116 dana, kao što je zabilježeno u njihovoj objavi prekretnice, što pokazuje snažnu potražnju za lokalnim, kontroliranim programerskim alatima koji izbjegavaju vezivanje uz vlasničkog računalnog oblaka (vendor lock-in).

OpenDesign radi kao lokalno usmjerena (local-first) desktop aplikacija s integriranim Node daemonom, povezujući se izravno s lokalnim CLI-jevima programerskih agenata. Pokretanje DeepSeek V4.1 Flash zahtijeva preciznu konfiguraciju klijenta. Ako vaš okviri pogrešno rukuju prefiksima predmemoriranja promptova ili ostave napor reasoninga zaključanim na visokoj razini za osnovne operacije, brzina generiranja pada, a troškovi se multipliciraju. Ekosustav se dalje proširio s službenom integracijom imenika dodataka za Codex, donoseći vizualno platno u stvarnom vremenu izravno u popularna programerska okruženja.

OpenDesign dokumentacija naglašava široku kompatibilnost s alatima naredbenog retka lokalnih agenata:

Dokumentacija spremišta OpenDesign koja prikazuje podržane CLI-jeve lokalnih programerskih agenata
Dokumentacija spremišta OpenDesign koja prikazuje podržane CLI-jeve lokalnih programerskih agenata

Još jedan kritičan faktor je higijena predmemorije. Ako vaš agent ubacuje dinamičke vremenske oznake (timestamps) ili slučajne ID-eve zahtjeva u prefiks prompta, poništavate predmemoriranje ključ-vrijednost na strani pružatelja usluga. Kada predmemoriranje radi, input tokeni koštaju djelić centa. Kada predmemoriranje promaši, ta cijena skače pedeseterostruko. Držanje sistemskih promptova, smjernica brenda i dijeljenih definicija alata zakačenih na vrhu kontekstnog spremnika je ono što održava vaša izvođenja na razini centi.

Tech recenzent WorldofAI prošao je kroz proces postavljanja i prikazao generator komponenti uživo u akciji:

Okviri za lokalno izvođenje omogućuju programerima da izbjegnu neograničene frontier pretplate koje redovito premašuju 200 USD po sjedalu mjesečno. Uparivanjem open-source orkestratora s niskobudžetnim inference endpointima, indie programeri mogu graditi produkcijski softver bez nastajanja enterprise overhead-a. Štoviše, održavanje lokalnog stanja osigurava da vlasnička sredstva brenda, neobjavljeni žičani kosturi (wireframes) klijenata i interni dizajnerski tokeni ostanu u potpunosti na fizičkom stroju programera umjesto da se streamaju u vlasničke sustave za vanjsku pohranu.