Introduction

Một vài ngày trước, các con số benchmark từ dự án OpenDesign đã xuất hiện trên các feed của developer. Chạy model DeepSeek V4.1 Flash vừa ra mắt bản preview đối với bộ đánh giá UI tự động của họ, model này đạt 81,2 trên 100 điểm về việc sinh giao diện hàng ngày. Con số đó bắt kịp 98% số điểm do GPT-6 Astra thiết lập (82,7) và vượt qua Claude Fable 5.1 (80,3).

Sự khác biệt thực tế nằm ở hóa đơn. Lượt chạy của DeepSeek mất 5,3 phút và ngốn $0,023 tiền API token. Astra yêu cầu 11,1 phút và có giá $1,61. Fable mất 12,8 phút và có giá $3,66. Trong số 13 model được đánh giá, 11 model đạt điểm thấp hơn DeepSeek trong khi tính phí cao hơn tới 150 lần cho mỗi tác vụ hoàn thành.

Đối với bất kỳ ai tự khởi nghiệp công cụ developer với ngân sách hàng tháng eo hẹp, những con số này đòi hỏi sự chú ý. Các model closed frontier đã nắm giữ vị thế gần như độc quyền đối với việc sinh frontend trong suốt năm qua. Khi một open-weight model chạy trên các chip thương mại giá rẻ sản xuất HTML, CSS và component state sẵn sàng cho production với giá hai xu, toán học cơ bản để xuất xưởng phần mềm sẽ thay đổi ngay lập tức.

Các con số đằng sau benchmark OpenDesign Arena

Đánh giá từ OpenDesign Arena đã thử nghiệm 13 model trên các prompt xây dựng giao diện giống hệt nhau. Thay vì kiểm tra logic trừu tượng hay các câu đố lập trình cạnh tranh, nhóm nghiên cứu đã lấy các prompt từ các phiên người dùng thực tế bên trong workspace thiết kế open-source của họ. Các nhà phát triển đứng sau nexu-io/open-design đã thiết lập một test harness chạy ngầm (headless), thực thi từng model dựa trên năm kịch bản ứng dụng cụ thể: web apps, mobile apps, phần mềm desktop, dashboard và website marketing.

Bảng xếp hạng tổng thể đưa DeepSeek V4.1 Flash lên vị trí thứ hai về chất lượng, chỉ đứng sau GPT-6 Astra 1,5 điểm. Khi cân bằng giữa chất lượng, chi phí và latency, thuật toán của arena xếp hạng V4.1 Flash là lựa chọn hàng đầu nói chung với chỉ số tổng hợp là 78,8. DeepSeek V4 Flash đứng ở mức 68,6, GPT-5.6 Sol đạt 65,7, Gemini 3.8 Flash đạt 64,7 và Claude Fable 5.1 giảm xuống 52,1 do chi phí cao và latency sinh token.

Trang chủ OpenDesign Arena hiển thị một thẻ đánh giá hiệu suất cho DeepSeek V4.1 Flash, so sánh chất lượng thiết kế của nó với các endpoint thương mại cạnh tranh:

Thẻ đánh giá hiệu suất trên trang chủ OpenDesign Arena
Thẻ đánh giá hiệu suất trên trang chủ OpenDesign Arena

Sự khác biệt giữa các thế hệ trở nên rõ ràng khi bạn xem lại các raw output. DeepSeek V4.1 Flash đạt điểm số đáp ứng yêu cầu trung bình là 28,4 trên 30, vượt trội hơn cả GPT-6 Astra với 26,5 và Claude Fable 5.1 với 27,1. Về độ bóng bẩy trực quan thô và chất lượng thiết kế, Astra vẫn giữ một lợi thế nhỏ với 56,2 trên 70 so với 52,8 của DeepSeek. Bằng cách đạt gần 98% điểm số trực quan thô của Astra trong khi chỉ tiêu tốn khoảng 1,4% chi phí tài chính, model này thiết lập một thực tế kinh tế hoàn toàn mới cho các tác vụ sinh frontend được liệt kê trên nền tảng OpenDesign chính thức.

Khoản đầu tư thời gian thậm chí còn kể một câu chuyện ấn tượng hơn cho workflow hàng ngày. DeepSeek hoàn thành lượt chạy trung bình trong 5,3 phút. Astra mất 11,1 phút và Claude Fable 5.1 kéo dài đến 12,8 phút. Khi một kỹ sư ngồi trước terminal chờ agent phác thảo một bản prototype, sự chênh lệch sáu phút quyết định việc bạn giữ được sự tập trung hay bị xao nhãng sang mạng xã hội.

Nhóm OpenDesign đã tóm tắt các số liệu tiêu điểm này trong thông cáo công khai ban đầu của họ:

Loading tweet...

Các thành viên cộng đồng thử nghiệm workspace đã hưởng ứng mạnh mẽ về tốc độ cải thiện. Trong một chuỗi đánh giá tích cực trên r/SideProject của Reddit, những người dùng đầu tiên lưu ý các model nhẹ trả về layout hoạt động nhanh như thế nào so với các tùy chọn proprietary nặng nề. Đối với các team dựng prototype mười biến thể mỗi buổi sáng, việc tiết kiệm sáu phút cho mỗi vòng lặp sinh sẽ cộng dồn qua toàn bộ một sprint. Thay vì lãng phí hàng giờ chờ các endpoint frontier giải quyết các layout token, các developer có thể khởi chạy đồng thời nhiều nhánh giao diện, lặp qua các biến thể cấu trúc trong thời gian thực mà không gặp phải tình trạng throttling API thảm khốc hoặc gián đoạn workflow.

Cách benchmark đo lường chất lượng giao diện không cần giám khảo con người

Các UI benchmark tự động thường thất bại vì chất lượng trực quan mang tính chủ quan. Để tránh phụ thuộc vào việc bình chọn tùy ý của con người hoặc số lượng thẻ HTML bề ngoài, framework kiểm thử của OpenDesign chia việc đánh giá thành các pha cơ học nghiêm ngặt. Đầu tiên, harness thực hiện kiểm tra runtime. Code được sinh ra sẽ tải trực tiếp trong một instance Chromium headless. Nếu artifact hiển thị một viewport trống, import bị lỗi, các block markdown chưa được render, hoặc các ngoại lệ JavaScript chưa được bắt trong console, lượt chạy đó sẽ nhận điểm không tự động. Bộ công cụ không cấp quyền thử lại hoặc sửa chữa cú pháp bị thiếu.

Các artifact vượt qua được quá trình thực thi sẽ đối mặt với thang điểm 100. Việc đáp ứng yêu cầu chiếm 30 điểm. Hệ thống kiểm tra cây DOM để xác minh các component cụ thể được yêu cầu trong bản tóm tắt: trạng thái modal tương tác, các liên kết xác thực form, sắp xếp cột bảng và các wrapper layout responsive. 70 điểm còn lại đo đạc cấu trúc thiết kế qua năm danh mục bao gồm phân cấp layout, độ hài hòa màu sắc, tỷ lệ tương phản dễ tiếp cận, độ tuân thủ component và khả năng thích ứng responsive trên các breakpoint di động và desktop. Các kiểm tra tự động tính toán độ chênh lệch độ chói màu để thực thi các tiêu chuẩn tương phản WCAG AA nghiêm ngặt, gắn cờ các phần tử tuyệt đối chồng chéo và đánh giá hành vi layout trên chiều rộng viewport 375px, 768px và 1440px.

Nhóm OpenDesign đã giải quyết các câu hỏi của cộng đồng về triết lý kiểm thử này trong một bản cập nhật chính thức trên thông báo X của OpenDesign:

Loading tweet...

Điểm số từ 80 trở lên đủ điều kiện coi một artifact là có thể bàn giao. Trên toàn bộ danh mục kiểm thử, DeepSeek V4.1 Flash duy trì tỷ lệ bàn giao 57,7%. GPT-6 Astra đạt 60,0%, trong khi Claude Fable 5.1 đạt 56,7%. Model open-weight này tạo ra ít sự suy giảm thảm khốc hơn so với các model thương mại lâu đời vốn tính phí cao hơn 50 lần cho mỗi token.

Framework này cũng theo dõi sự liên kết cấu trúc bằng cách sử dụng các tiêu chuẩn agent như quy ước kỹ năng Claude Code của Anthropic, đảm bảo các artifact được sinh ra tuân theo việc phân tách file sạch sẽ và ranh giới component dạng module.

Để hình dung cách các chiều này cân bằng giữa phân khúc top đầu, OpenDesign đã công bố biểu đồ radar so sánh năm chiều:

Biểu đồ radar so sánh giữa DeepSeek V4.1 Flash, GPT-6 Astra và Claude Fable 5.1 qua năm chiều đánh giá
Biểu đồ radar so sánh giữa DeepSeek V4.1 Flash, GPT-6 Astra và Claude Fable 5.1 qua năm chiều đánh giá

Bằng cách tập trung vào tính hợp lệ cơ học và tính toàn vẹn cấu trúc, benchmark cung cấp một con đường có thể tái tạo cho các developer để đánh giá các agent thiết kế tự động mà không cần đoán mò. Thay vì dựa vào cảm nhận trực quan định tính, các team kỹ thuật có thể xác minh xem một AI model có tạo ra các thẻ ngữ nghĩa hợp lệ, các state machine responsive có thể dự đoán và các phân cấp component ổn định không bị sụp đổ dưới tải dữ liệu production động hay không.

Token economics và sự chênh lệch giá 70 lần

Unit economics của các frontier model đặt ra một rào cản thực sự cho các startup tự túc kinh phí (bootstrapped). Việc vận hành một team năm developer sử dụng các công cụ coding agent với các frontier model không giới hạn có thể ngốn hơn một nghìn rưỡi đô la mỗi tháng. Khi các developer agent lặp lại trên một giao diện, công cụ sẽ thực hiện nhiều vòng, đọc file, thực thi câu lệnh build, kiểm tra cây DOM trình duyệt và viết lại toàn bộ file.

Dựa trên dữ liệu benchmark, việc sinh một prototype ứng dụng web hoàn chỉnh duy nhất thông qua Claude Fable 5.1 có giá trung bình từ $3,66 đến $5,55. Tác vụ tương tự tốn từ $1,61 đến $1,87 trên GPT-6 Astra, $0,537 trên GPT-5.6 Sol và từ $0,023 đến $0,030 trên DeepSeek V4.1 Flash. Khoảng cách giá này kéo dài hai bậc độ lớn, một sự chênh lệch được nhấn mạnh qua các bản so sánh được công bố trên cổng tài liệu OpenDesign.

Biểu đồ phân tán so sánh điểm chất lượng trung bình trực tiếp với chi phí minh họa sự khác biệt rõ rệt giữa các model:

Biểu đồ phân tán chất lượng model so với chi phí cho mỗi artifact cho thấy các frontier model tập trung ở mức giá cao
Biểu đồ phân tán chất lượng model so với chi phí cho mỗi artifact cho thấy các frontier model tập trung ở mức giá cao

DeepSeek đạt được những con số này bằng cách kết hợp tỷ lệ cache hit cao với tốc độ sinh nhanh. Trong quá trình kiểm thử, V4.1 Flash duy trì tỷ lệ prefix cache hit là 89,0%. Nó đã xử lý 1,5 triệu input token trong khi sinh ra 29.000 output token. Tài liệu của DeepSeek cho agent harness của họ liệt kê input cache hit giờ thấp điểm ở mức $0,003 trên một triệu token, input chưa cache ở mức $0,15 trên một triệu token và output token ở mức $0,60 trên một triệu token.

Bởi vì prompt caching ngăn chặn việc tính toán lặp lại xuyên suốt các cuộc trò chuyện agent nhiều vòng (multi-turn), việc giữ cho context window luôn ấm chỉ tốn một phần nhỏ của xu. Các lượt chạy độc lập ghi nhận throughput giải mã (decoding) đạt từ 350 đến 427 token mỗi giây trong các lượt sinh thô.

Các nhà phát triển OpenDesign đã phân tích lợi thế chi phí này qua các lượt chạy model:

Loading tweet...

Đối với một nhà sáng lập solo thử nghiệm mười ý tưởng giao diện trong một buổi chiều, việc chi tổng cộng hai mươi lăm xu cho DeepSeek tốt hơn nhiều so với việc chi ba mươi lăm đô la cho Claude Fable. Khoảng chênh lệch đó giải phóng vốn cho hạ tầng, thu hút khách hàng hoặc tên miền. Trong một sprint kỹ thuật kéo dài nhiều tuần liên quan đến hàng trăm vòng lặp component, một product squad linh hoạt có thể giảm chi phí thiết kế tổng hợp của họ từ hàng trăm đô la xuống chỉ còn tiền lẻ, làm thay đổi vĩnh viễn cách các team giai đoạn đầu tiếp cận quá trình tạo prototype tương tác và các thử nghiệm nghiên cứu người dùng.

Phân tích tác vụ giữa landing page, web app và dashboard

Điểm số tổng hợp có thể che giấu các lỗi nghiêm trọng. Một model có khả năng tạo ra các trang landing page sạch sẽ có thể gặp khó khăn khi xây dựng các bảng quản trị nặng về dữ liệu. Nhóm OpenDesign đã cô lập hiệu suất của model trên năm định dạng giao diện cụ thể, hé lộ các cấu hình hành vi rõ rệt qua từng danh mục sinh.

Trên các trang landing page và website marketing, DeepSeek V4.1 Flash giành vị trí thứ tư với số điểm 79,3, xếp ngay trước GPT-6 Astra. Model xử lý kiểu chữ hero, căn chỉnh flexbox, các section kêu gọi hành động (CTA) responsive và vị trí icon SVG mà không bị lệch hình ảnh. Trên các prototype phần mềm desktop, nó đồng hạng ba với số điểm 84,4. Trên các giao diện di động, nó giữ vị trí thứ năm ở mức 82,5, quản lý gọn gàng các vùng chạm, các thanh trượt sheet drawer và thanh điều hướng thân thiện với ngón cái.

Sự phân tách thay đổi khi bạn nhìn vào các dashboard dữ liệu phức tạp và bảng quản trị (admin panel). DeepSeek tụt xuống vị trí thứ mười với số điểm 76,1. Nó gặp khó khăn với việc căn chỉnh lưới dữ liệu phức tạp, các thanh sidebar truy vấn nhiều bộ lọc và các widget trực quan hóa dữ liệu lồng nhau. Các model như GPT-6 Astra hoạt động tốt hơn nhiều trên các bảng dày đặc, nặng về thông tin nơi tư duy không gian quan trọng hơn phong cách thiết kế.

Các nhà phát triển đã làm nổi bật sự phân chia theo danh mục này trong phân tích phân rã tác vụ của họ:

Loading tweet...

Góc nhìn so sánh giữa các bảng xếp hạng landing page và dashboard cho thấy rõ sự phân kỳ:

Dashboard hiển thị bảng xếp hạng so sánh cho các landing page và giao diện quản trị
Dashboard hiển thị bảng xếp hạng so sánh cho các landing page và giao diện quản trị

Xem lại thư viện prototype studio của dự án cho thấy model xử lý các luồng người tiêu dùng tốt như thế nào. Ngược lại, việc kiểm tra các ví dụ dashboard trực tiếp phức tạp hé lộ lý do tại sao logic không gian vẫn đòi hỏi sự giám sát cẩn thận. Khi xây dựng các tài liệu marketing và hành trình đăng ký của khách hàng trên ứng dụng OpenDesign, các kiến trúc flash nhẹ nổi trội vì kiểu dáng trực quan tuân theo các mẫu component có thể dự đoán. Ngược lại, các enterprise dashboard phức tạp đòi hỏi sự căn chỉnh bảng quan hệ, các số liệu trạng thái lồng nhau và các bộ lọc responsive phức tạp nơi các kiến trúc frontier nặng về lý luận duy trì lợi thế. Biết được điểm yếu của một model sẽ cho bạn biết cách định tuyến các tác vụ trong pipeline của mình. Sử dụng DeepSeek V4.1 Flash để xử lý nhanh các màn hình app người tiêu dùng, phễu marketing và giao diện di động. Khi bạn cần một giao diện analytics doanh nghiệp với hai mươi trạng thái biểu đồ, hãy định tuyến công việc đó sang một model có cấu trúc không gian mạnh mẽ hơn.

Thực tế kỹ thuật khi chạy open-weight trong một local harness

Hầu hết các cuộc thảo luận đều coi các model là các bản thay thế trừu tượng có thể cắm-và-chạy (drop-in). Trong production, client điều phối của bạn quan trọng không kém trọng số của model. Repository chính thức nexu-io/open-design đã vượt mốc 90.000 GitHub star trong vòng 116 ngày, như được lưu ý trong thông báo mốc quan trọng của họ, cho thấy nhu cầu mạnh mẽ đối với các công cụ lập trình cục bộ, có thể kiểm soát nhằm tránh việc bị khóa chân vào một nhà cung cấp đám mây proprietary.

OpenDesign hoạt động như một ứng dụng desktop ưu tiên cục bộ (local-first) với một daemon Node tích hợp, kết nối trực tiếp với các CLI coding agent cục bộ. Việc chạy DeepSeek V4.1 Flash đòi hỏi cấu hình client chính xác. Nếu harness của bạn xử lý sai các prefix prompt caching hoặc để mức độ lý luận (reasoning effort) ở mức cao cho các thao tác cơ bản, tốc độ sinh của bạn sẽ giảm và chi phí sẽ nhân lên. Hệ sinh thái càng được mở rộng hơn với tích hợp Thư mục Plugin Codex chính thức, mang một canvas trực quan thời gian thực trực tiếp vào các môi trường developer phổ biến.

Tài liệu của OpenDesign phác thảo khả năng tương thích rộng rãi trên các công cụ dòng lệnh (CLI) của agent cục bộ:

Tài liệu repository OpenDesign hiển thị các CLI coding agent cục bộ được hỗ trợ
Tài liệu repository OpenDesign hiển thị các CLI coding agent cục bộ được hỗ trợ

Một yếu tố quan trọng khác là vệ sinh cache. Nếu agent của bạn chèn các timestamp động hoặc ID yêu cầu ngẫu nhiên vào phần prefix của prompt, bạn sẽ xóa sạch bộ nhớ cache key-value phía nhà cung cấp. Khi caching hoạt động, các input token chỉ tốn một phần nhỏ của xu. Khi cache bị miss, mức giá đó sẽ tăng vọt gấp năm mươi lần. Việc giữ các system prompt, hướng dẫn thương hiệu và định nghĩa công cụ được ghim ở phần đầu của context buffer chính là yếu tố giúp các lượt chạy của bạn chỉ tốn vài xu.

Reviewer công nghệ WorldofAI đã đi qua quá trình thiết lập và trình diễn trình tạo component trực tiếp đang hoạt động:

Các harness thực thi cục bộ cho phép các developer tránh các gói đăng ký frontier không giới hạn thường vượt quá $200 cho mỗi seat mỗi tháng. Bằng cách ghép nối các bộ điều phối open-source với các endpoint inference giá rẻ, các lập trình viên độc lập (indie developer) có thể xây dựng phần mềm production mà không phát sinh chi phí chung của doanh nghiệp. Hơn nữa, việc duy trì trạng thái cục bộ đảm bảo rằng các tài sản thương hiệu độc quyền, wireframe khách hàng chưa được công bố và các thiết kế token nội bộ nằm hoàn toàn trên máy vật lý của developer thay vì được truyền vào các hệ thống lưu trữ ngoài proprietary.