Introduction
Pre nekoliko dana, benchmark brojevi iz OpenDesign projekta pojavili su se na feedovima za programere. Pokretanjem novog modela DeepSeek V4.1 Flash u preview verziji protiv njihovog automatizovanog paketa za evaluaciju UI-ja, model je ostvario 81,2 od 100 poena na svakodnevnom generisanju interfejsa. To se poklapa sa 98 procenata rezultata koji je postavio GPT-6 Astra (82,7) i blago nadmašuje Claude Fable 5.1 (80,3).
Praktična razlika leži u računu. DeepSeek-ovo izvršavanje trajalo je 5,3 minuta i potrošilo 0,023 dolara u API tokenima. Astra je zahtevala 11,1 minut i koštala 1,61 dolar. Fable je uzeo 12,8 minuta i koštao 3,66 dolara. Od 13 procenjenih modela, 11 je ostvarilo niži rezultat od DeepSeek-a uz naplatu do 150 puta veću po završenom zadatku.
Za sve koji pokreću alate za programere sa uskim mesečnim budžetom, ove brojke zahtevaju pažnju. Zatvoreni frontier modeli imali su skoro monopol na generisanje frontenda tokom protekle godine. Kada model sa otvorenim težinama koji radi na jeftinim čipovima opšte namene proizvodi HTML, CSS i stanje komponenti spremne za produkciju za dva centa, osnovna matematika za isporuku softvera se odmah menja.
Brojke iza OpenDesign Arena benchmark-a
Evaluacija u OpenDesign Areni testirala je 13 modela na identičnim promptovima za konstrukciju interfejsa. Umesto testiranja apstraktne logike ili zagonetki iz kompetitivnog programiranja, tim je preuzeo promptove iz stvarnih korisničkih sesija unutar svog open-source radnog okruženja za dizajn. Održavaoci projekta nexu-io/open-design postavili su headless testno okruženje koje izvršava svaki model kroz pet specifičnih scenarija primene: veb aplikacije, mobilne aplikacije, desktop softver, kontrolne table i marketinške veb-sajdove.
Ukupno rangiranje stavlja DeepSeek V4.1 Flash na drugo mesto po kvalitetu, iza modela GPT-6 Astra za samo 1,5 bodova. Kada se uravnoteže kvalitet, cena i latencija, algoritam arene svrstava V4.1 Flash na prvu ukupnu opciju sa zbirnim indeksom od 78,8. DeepSeek V4 Flash je na 68,6, GPT-5.6 Sol dostiže 65,7, Gemini 3.8 Flash zauzima 64,7, dok Claude Fable 5.1 pada na 52,1 zbog visoke cene i latencije generisanja.
Početna stranica OpenDesign Arene prikazuje karticu evaluacije performansi za DeepSeek V4.1 Flash koja upoređuje njegov kvalitet dizajna sa konkurentskim komercijalnim endpoint-ovima:

Razlika između generacija postaje očigledna kada pregledate sirove rezultate. DeepSeek V4.1 Flash je ostvario prosečan rezultat ispunjenja zahteva od 28,4 od 30, nadmašivši i GPT-6 Astra sa 26,5 i Claude Fable 5.1 sa 27,1. Što se tiče sirovog vizuelnog sjaja i kvaliteta dizajna, Astra zadržava blagu prednost sa 56,2 od 70 u poređenju sa DeepSeek-ovih 52,8. Poklapanjem sa skoro 98 procenata Astra-inog sirovog vizuelnog rezultata uz rad na približno 1,4 procenta finansijskih troškova, model uspostavlja radikalno izmenjenu ekonomsku stvarnost za zadatke generisanja frontenda katalogizovane na zvaničnoj OpenDesign platformi.
Vremenska investicija priča još snažniju priču za svakodnevni radni tok. DeepSeek je završio svoje prosečno izvršavanje za 5,3 minuta. Astra je zahtevala 11,1 minut, dok je Claude Fable 5.1 otegnut na 12,8 minuta. Kada inženjer sedi u terminalu i čeka da agent nacrta prototip, razlika od šest minuta određuje da li ćete zadržati fokus ili preći na društvene mreže.
OpenDesign tim je sumirao ove glavne metrike u svom početnom javnom saopštenju:
Članovi zajednice koji su testirali radno okruženje potvrdili su dobitke u brzini. U aktivnoj niti evaluacije na Reddit-ovom r/SideProject, rani korisnici su primetili koliko brzo lagani modeli vraćaju radne rasporede u poređenju sa teškim vlasničkim opcijama. Za timove koji prave prototipove sa deset varijacija svakog jutra, ušteda od šest minuta po petlji generisanja se nagomilava tokom celog sprinta. Umesto da troše sate čekajući da frontier endpoint-ovi reše token za raspored, programeri mogu istovremeno pokrenuti više grana interfejsa, iterirajući kroz strukturalne varijacije u realnom vremenu bez izazivanja katastrofalnog API throttling-a ili prekida radnog toka.
Kako benchmark meri kvalitet interfejsa bez ljudskih sudija
Automatizovani UI benchmark-i obično propadaju zato što vizuelni kvalitet deluje subjektivno. Kako bi se izbeglo oslanjanje na proizvoljno glasanje ljudi ili površno brojanje HTML tagova, OpenDesign testni okvir deli evaluaciju na stroge mehaničke faze. Prvo, okruženje vrši proveru u realnom vremenu. Generisani kod se učitava direktno u headless Chromium instancu. Ako artefakt prikazuje prazan prozor, pokvarene importe, neuređene markdown blokove ili neuhvaćene JavaScript izuzetke u konzoli, izvršavanje dobija automatsku nulu. Paket ne daje ponovne pokušaje niti popravlja nedostajuću sintaksu.
Artefakti koji prežive izvršavanje suočavaju se sa rubrikom od 100 poena. Ispunjenje zahteva nosi 30 poena. Sistem pregledava DOM stabla kako bi verifikovao specifične komponente zatražene u brief-u: interaktivna stanja modala, povezivanja za validaciju formi, sortiranje kolona u tabelama i omotače za responsivan raspored. Preostalih 70 poena meri strukturu dizajna kroz pet kategorija, uključujući hijerarhiju rasporeda, harmoniju boja, pristupačne kontrastne odnose, usklađenost komponenti i responsivnu adaptaciju preko breakpoint-ova za mobilne uređaje i desktop. Automatske provere izračunavaju razlike u luminansi boja kako bi se primenili strogi WCAG AA standardi kontrasta, označavaju preklapajuće apsolutne elemente i procenjuju ponašanje rasporeda na širinama ekrana od 375px, 768px i 1440px.
OpenDesign tim je odgovorio na pitanja zajednice u vezi sa ovom filozofijom testiranja u zvaničnom ažuriranju na početnom javnom saopštenju:
Rezultat od 80 ili više kvalifikuje artefakt kao spreman za isporuku. Kroz čitav katalog testova, DeepSeek V4.1 Flash je održao stopu isporuke od 57,7 procenata. GPT-6 Astra je dostigao 60,0 procenata, dok je Claude Fable 5.1 ostvario 56,7 procenata. Model sa otvorenim težinama (open-weight) proizveo je manje katastrofalnih regresija od utvrđenih komercijalnih modela koji naplaćuju 50 puta više po tokenu.
Okvir takođe prati strukturalno usklađivanje koristeći standarde agenata kao što je Claude Code Skills Convention, obezbeđujući da generisani artefakti prate čista odvajanja fajlova i modularne granice komponenti.
Da bi vizuelizovao kako se ove dimenzije uravnotežuju u vrhu, OpenDesign je objavio poređenje na radaru sa pet dimenzija:

Fokusiranjem na mehaničku validnost i strukturalni integritet, benchmark pruža ponovljiv put programerima da procene automatizovane agente za dizajn bez nagađanja. Umesto oslanjanja na kvalitativne vizuelne utiske, inženjerski timovi mogu da potvrde da li model veštačke inteligencije proizvodi važeće semantičke tagove, predvidljive mašine sa responsivnim stanjima i stabilne hijerarhije komponenti koje se neće srušiti pod opterećenjima dinamičkih produkcijskih podataka.
Ekonomika tokena i cenovna razlika od 70x
Jedinična ekonomija frontier AI modela predstavlja pravu barijeru za startape koji se sami finansiraju (bootstrapped). Vođenje tima od pet inženjera na agentskim alatima za kodiranje sa neograničenim frontier modelima može preći petsto dolara svakog meseca. Kada inženjerski agenti iteriraju na interfejsu, alat prolazi kroz više koraka, čitajući fajlove, izvršavajući komande za bildovanje, pregledajući DOM stabla pretraživača i prepisujući cele fajlove.
Prema podacima iz benchmark-a, generisanje jednog kompletnog prototipa veb aplikacije preko Claude Fable 5.1 u proseku košta od 3,66 do 5,55 dolara. Isti zadatak košta od 1,61 do 1,87 dolara na GPT-6 Astra, 0,537 dolara na GPT-5.6 Sol, i između 0,023 i 0,030 dolara na DeepSeek V4.1 Flash. Jaz u cenama obuhvata dva reda veličine, što je nesrazmera naglašena u poređenjima objavljenim na OpenDesign GitHub Repository.
Dijagram raspršenja (scatter plot) koji upoređuje prosečne ocene kvaliteta direktno sa cenom ilustruje koliko drastično se modeli razilaze:

DeepSeek postiže ove brojke uparivanjem visokih stopa pogodaka keša sa velikom brzinom generisanja. U testiranju, V4.1 Flash je održao stopu pogodaka keša prefiksa od 89,0 procenata. Obradio je 1,5 miliona input tokena dok je generisao 29.000 output tokena. DeepSeek dokumentacija za njihovu agent navodi da su pogodci keša inputa van špica 0,003 dolara po milion tokena, nekeširani input 0,15 dolara po milion, a output tokeni 0,60 dolara po milion.
Budući da keširanje promptova sprečava ponovljeno računanje u višekoraknim razgovorima agenata, održavanje kontekstnog prozora toplim košta deliće centa. Nezavisna testiranja su zabeležila propusni opseg dekodiranja između 350 i 427 tokena u sekundi tokom sirovih prolaza generisanja.
Održavaoci OpenDesign-a su razbili ovu troškovnu prednost kroz izvršavanja modela:
Za solo osnivača koji testira deset ideja za interfejs tokom popodneva, trošenje dvadeset pet centi ukupno na DeepSeek je bolje od trošenja trideset pet dolara na Claude Fable. Ta margina oslobađa kapital za infrastrukturu, akviziciju korisnika ili domene. Tokom višenedeljnog inženjerskog sprinta koji uključuje stotine iteracija komponenti, agilan tim proizvoda može da smanji svoje račune za sintetički dizajn sa stotina dolara na sitniš, trajno transformišući način na koji timovi u ranoj fazi pristupaju interaktivnom pravljenju prototipa i eksperimentima sa korisničkim istraživanjem.
Raščlanjivanje zadataka između landing stranica, veb aplikacija i kontrolnih tabli
Zbirne ocene mogu da prikriju kritične mane. Model sposoban da generiše čiste landing stranice može imati problema pri pravljenju administrativnih tabela sa mnogo podataka. OpenDesign tim je izolovao performanse modela kroz pet specifičnih formata interfejsa, otkrivajući prepoznatljive profile ponašanja u svakoj kategoriji generisanja.
Na landing stranicama i marketinškim sajtovima, DeepSeek V4.1 Flash je osigurao četvrto mesto sa rezultatom 79,3, stavljajući ga direktno ispred GPT-6 Astra. Model je obradio hero tipografiju, flexbox poravnanja, responsivne sekcije za poziv na akciju (CTA) i postavljanje SVG ikona bez vizuelnog pomeranja. Na prototipovima desktop softvera, podelio je treće mesto sa rezultatom 84,4. Na mobilnim interfejsima, zadržao je peto mesto sa 82,5, uredno upravljajući dodirnim tačkama, fiokama (drawers) i navigacionim trakama prilagođenim palčevima.
Analiza se menja kada pogledate kompleksne kontrolne table i administrativne panele. DeepSeek je pao na deseto mesto sa rezultatom 76,1. Mučio se sa složenim poravnanjima mreža podataka, bočnim trakama za upite sa više filtera i ugnježdenim vidžetima za vizuelizaciju podataka. Modeli poput GPT-6 Astra su radili daleko bolje na gustim tabelama prepunim informacija gde je prostorno zaključivanje važnije od dizajnerskog ukusa.
Održavaoci su istakli ovu kategoričku podelu u svojoj analizi raščlanjivanja zadataka:
Uporedni prikaz rangiranja landing stranica i kontrolnih tabli jasno otkriva divergenciju:

Pregled projekta galerija studijskih prototipova pokazuje koliko dobro model rukuje tokovima potrošača. Sa druge strane, ispitivanje složenih primera kontrolnih tabli uživo otkriva zašto prostorna logika i dalje zahteva pažljiv nadzor. Prilikom kreiranja marketinškog materijala i putovanja za prijavu korisnika na OpenDesign aplikaciji, lagane flash arhitekture se ističu jer vizuelno stilizovanje prati predvidljive šablone komponenti. Suprotno tome, složene korporativne kontrolne table zahtevaju poravnanja relacionih tabela, ugnježđene metrike statusa i složene responsivne filtere gde arhitekture sa teškim zaključivanjem održavaju prednost. Poznavanje oblasti u kojima se model muči govori vam kako da usmeravate zadatke u svom cevovodu. Koristite DeepSeek V4.1 Flash za brzi rad kroz ekrane potrošačkih aplikacija, marketinške levke i mobilne prikaze. Kada vam je potreban interfejs za korporativnu analitiku sa dvadeset stanja grafikona, usmerite posao na model sa jačom prostornom strukturom.
Inženjerska stvarnost pokretanja otvorenih težina u lokalnom okruženju
Većina diskusija tretira modele kao apstraktne zamene. U produkciji, vaš klijent za orkestraciju je podjednako važan kao i težine modela. Zvanični nexu-io/open-design premašio je 90.000 GitHub zvezdica u roku od 116 dana, kao što je navedeno u njihovoj početnom javnom saopštenju, što pokazuje snažnu potražnju za lokalnim, kontrolisanim alatima za programere koji izbegavaju vezivanje za vlasničke cloud provajdere.
OpenDesign radi kao desktop aplikacija sa lokalnim prioritetom i integrisanim Node daemon-om, povezujući se direktno sa lokalnim CLI alatima agenata za kodiranje. Pokretanje DeepSeek V4.1 Flash-a zahteva preciznu konfiguraciju klijenta. Ako vaše okruženje loše upravlja prefiksima keširanja promptova ili ostavi napor zaključivanja na visokom nivou za osnovne operacije, brzina generisanja opada i troškovi se množe. Ekosistem se dodatno proširio uz zvaničnu integraciju direktorijuma Codex dodataka, donoseći vizuelno platno u realnom vremenu direktno u popularna okruženja za programere.
OpenDesign dokumentacija opisuje široku kompatibilnost sa lokalnim alatima komandne linije za agente:

Još jedan kritičan faktor je higijena keša. Ako vaš agent ubacuje dinamičke vremenske oznake (timestamps) ili nasumične ID-eve zahteva u prefiks prompta, poništavate keširanje ključ-vrednost na strani provajdera. Kada keširanje radi, input tokeni koštaju delić centa. Kada keširanje omane, ta cena skočila pedeset puta. Održavanje sistemskih promptova, smernica brenda i deljenih definicija alata zakačenih na početku kontekstnog bafera je ono što drži vaša izvršavanja na nivou centi.
Tehnički recenzent WorldofAI prošao je kroz proces podešavanja i prikazao generator komponenti uživo u akciji:
Lokalna okruženja za izvršavanje omogućavaju programerima da izbegnu neograničene pretplate na frontier modele koje redovno premašuju 200 dolara po korisniku mesečno. Uparivanjem open-source orkestratora sa jeftinim endpoint-ovima za inference, indi programeri mogu da grade produkcioni softver bez stvaranja korporativnih troškova. Štaviše, održavanje lokalnog stanja osigurava da vlasnička sredstva brenda, neobjavljeni žičani dijagrami (wireframes) klijenata i interni dizajnerski tokeni ostaju u potpunosti na fizičkoj mašini programera umesto da se strimuju u vlasničke eksterne sisteme za skladištenje.

