deepseek

DeepSeek-V4-Flash

DeepSeek-V4-Flash là model AI open weight với context 1M, đạt 54,4% trên SWE-bench với giá 0,14 USD/1M token, được tối ưu hóa cho lập trình agentic và...

Open WeightsAgentic CodingMoE Architecture1M Context WindowLow Cost
deepseek logodeepseekDeepSeek V42026-07-31
Ngu canh
1.0Mtoken
Dau ra toi da
8Ktoken
Gia dau vao
$0.14/ 1M
Gia dau ra
$0.28/ 1M
Phuong thuc:TextImage
Kha nang:Thi giacCong cuTruyen truc tiepSuy luan
Diem chuan
GPQA
53.6%
GPQA: Cau hoi khoa hoc cap sau dai hoc. Benchmark nghiem ngat voi 448 cau hoi ve sinh hoc, vat ly va hoa hoc. Chuyen gia PhD chi dat 65-74% do chinh xac. DeepSeek-V4-Flash dat 53.6% trong benchmark nay.
HLE
25.2%
HLE: Suy luan cap chuyen gia. Kiem tra kha nang mo hinh the hien suy luan cap chuyen gia trong cac linh vuc chuyen mon. DeepSeek-V4-Flash dat 25.2% trong benchmark nay.
MMLU
88.7%
MMLU: Hieu ngon ngu da nhiem voc lon. Benchmark toan dien voi 16.000 cau hoi tren 57 mon hoc. DeepSeek-V4-Flash dat 88.7% trong benchmark nay.
MMLU Pro
72.6%
MMLU Pro: MMLU Phien ban chuyen nghiep. Phien ban nang cap cua MMLU voi 12.032 cau hoi va dinh dang 10 lua chon kho hon. DeepSeek-V4-Flash dat 72.6% trong benchmark nay.
SimpleQA
38.2%
SimpleQA: Benchmark do chinh xac thuc te. Kiem tra kha nang mo hinh cung cap cau tra loi chinh xac, thuc te. DeepSeek-V4-Flash dat 38.2% trong benchmark nay.
IFEval
88%
IFEval: Danh gia tuan theo huong dan. Do luong mo hinh tuan theo huong dan va rang buoc cu the tot nhu the nao. DeepSeek-V4-Flash dat 88% trong benchmark nay.
AIME 2025
93.1%
AIME 2025: Ky thi toan hoc moi My. Bai toan toan hoc cap do thi dau tu ky thi AIME uy tin. DeepSeek-V4-Flash dat 93.1% trong benchmark nay.
MATH
76.6%
MATH: Giai quyet van de toan hoc. Benchmark toan hoc toan dien kiem tra giai quyet van de trong dai so, hinh hoc, giai tich. DeepSeek-V4-Flash dat 76.6% trong benchmark nay.
GSM8k
96%
GSM8k: Toan tieu hoc 8K. 8.500 bai toan dang van ban cap tieu hoc. DeepSeek-V4-Flash dat 96% trong benchmark nay.
MGSM
90.5%
MGSM: Toan tieu hoc da ngon ngu. Benchmark GSM8k duoc dich sang 10 ngon ngu. DeepSeek-V4-Flash dat 90.5% trong benchmark nay.
MathVista
63.8%
MathVista: Suy luan thi giac toan hoc. Kiem tra kha nang giai quyet bai toan toan hoc voi cac yeu to thi giac. DeepSeek-V4-Flash dat 63.8% trong benchmark nay.
SWE-Bench
54.4%
SWE-Bench: Benchmark ky thuat phan mem. Cac mo hinh AI co gang giai quyet van de GitHub thuc trong cac du an Python. DeepSeek-V4-Flash dat 54.4% trong benchmark nay.
HumanEval
90.2%
HumanEval: Bai tap lap trinh Python. 164 bai tap lap trinh yeu cau mo hinh tao ra cac trien khai ham Python dung. DeepSeek-V4-Flash dat 90.2% trong benchmark nay.
LiveCodeBench
33%
LiveCodeBench: Benchmark lap trinh truc tiep. Kiem tra kha nang lap trinh tren cac thach thuc lap trinh thuc te cap nhat lien tuc. DeepSeek-V4-Flash dat 33% trong benchmark nay.
MMMU
69.1%
MMMU: Hieu da phuong thuc. Benchmark hieu da phuong thuc tren 30 mon hoc dai hoc. DeepSeek-V4-Flash dat 69.1% trong benchmark nay.
MMMU Pro
54%
MMMU Pro: MMMU Phien ban chuyen nghiep. Phien ban nang cap cua MMMU voi cac cau hoi kho hon. DeepSeek-V4-Flash dat 54% trong benchmark nay.
ChartQA
85.7%
ChartQA: Hoi dap bieu do. Kiem tra kha nang hieu va phan tich thong tin tu bieu do va do thi. DeepSeek-V4-Flash dat 85.7% trong benchmark nay.
DocVQA
92.8%
DocVQA: Hoi dap thi giac tai lieu. Kiem tra kha nang trich xuat thong tin tu hinh anh tai lieu. DeepSeek-V4-Flash dat 92.8% trong benchmark nay.
Terminal-Bench
82.7%
Terminal-Bench: Tac vu terminal/CLI. Kiem tra kha nang thuc hien cac thao tac dong lenh. DeepSeek-V4-Flash dat 82.7% trong benchmark nay.
ARC-AGI
7%
ARC-AGI: Truu tuong va suy luan. Kiem tra tri thong minh linh hoat thong qua cac cau do nhan dang mau moi. DeepSeek-V4-Flash dat 7% trong benchmark nay.

Ve DeepSeek-V4-Flash

Tim hieu ve kha nang cua DeepSeek-V4-Flash, tinh nang va cach no co the giup ban dat ket qua tot hon.

DeepSeek-V4-Flash là một language model dạng Mixture of Experts (MoE) open weight được thiết kế cho các tác vụ kỹ thuật phần mềm và reasoning nhiều bước. Nó chứa tổng cộng 284 tỷ tham số với 13 tỷ tham số hoạt động (active parameters) trên mỗi token trong quá trình inference. Model sử dụng context window gốc 1.048.576 token, cho phép các lập trình viên xử lý toàn bộ kho lưu trữ code hoặc tài liệu kỹ thuật dài trong một request duy nhất.

Bản cập nhật ngày 31 tháng 7 năm 2026 duy trì kiến trúc của model xem xét ban đầu đồng thời áp dụng quá trình hậu huấn luyện tập trung vào hành vi agentic. Quá trình hậu huấn luyện này đã cải thiện điểm số của nó trên Terminal-Bench 2.1 từ 61,8 lên 82,7 và tăng kết quả SWE-bench lên 54,4%. Model hỗ trợ các mức reasoning effort có thể thay đổi và tích hợp native responses API để stream các bình luận trung gian cùng với output cuối cùng.

Các lập trình viên có thể truy cập model thông qua API tương thích với OpenAI của DeepSeek hoặc chạy open weights cục bộ trên các cấu hình phần cứng có từ 128GB đến 192GB bộ nhớ hợp nhất. Giá API tiêu chuẩn là 0,14 USD cho mỗi 1 triệu input token và 0,28 USD cho mỗi 1 triệu output token, với các lượt cache input giảm xuống còn 0,03 USD cho mỗi triệu token.

DeepSeek-V4-Flash

Truong hop su dung cho DeepSeek-V4-Flash

Kham pha cac cach khac nhau ban co the su dung DeepSeek-V4-Flash de dat ket qua tuyet voi.

Lập trình Agentic tự động

Chạy các lệnh terminal nhiều bước và sửa đổi file bằng cách sử dụng Codex CLI hoặc Cline harness để khắc phục các sự cố trên GitHub và tự động hóa việc tạo test.

Triển khai AI cục bộ

Lưu trữ toàn bộ model trên các máy trạm được trang bị bộ nhớ hợp nhất 128GB hoặc bốn GPU sử dụng lượng tử hóa 4-bit.

Refactoring kho lưu trữ quy mô lớn

Nạp tới 1 triệu token ngữ cảnh codebase để lập bản đồ các phụ thuộc và thực hiện cập nhật kiến trúc trên nhiều module.

Tạo Web 3D và Front-End tương tác

Xây dựng các ứng dụng web đơn file, môi trường 3D Three.js và sơ đồ SVG phức tạp trực tiếp từ các thông số kỹ thuật trong prompt.

Xử lý dữ liệu khối lượng lớn

Xử lý các bản nhật ký văn bản mở rộng và tài liệu có cấu trúc bằng cách sử dụng context caching để giảm chi phí API xuống 0,03 USD cho mỗi triệu token.

Tự động hóa Terminal nhiều bước

Thực thi các lệnh shell và pipeline script trong đó model sử dụng reasoning nội bộ để xử lý các lỗi lệnh bất ngờ.

Diem manh

Han che

Hiệu suất SWE-Bench cao: Đạt 54,4% trên SWE-bench Verified, vượt trội hơn nhiều model closed-source lớn hơn trong việc giải quyết các sự cố GitHub thực tế.
Phụ phí giá thay đổi: Chi phí token API tăng gấp đôi trong giờ sử dụng cao điểm, làm tăng chi phí cho các ứng dụng thời gian thực.
Hiệu quả chi phí API: Có giá 0,14 USD cho mỗi 1M input token và 0,28 USD cho mỗi 1M output token, mang lại chi phí trên mỗi tác vụ thấp hơn so với các model cạnh tranh.
Yêu cầu bộ nhớ lớn để chạy cục bộ: Việc lưu trữ cục bộ yêu cầu ít nhất 128GB VRAM hoặc bộ nhớ hệ thống để đạt mức lượng tử hóa có thể sử dụng được.
Context Window 1M Token: Nạp tới 1.048.576 token trong một request duy nhất, cho phép phân tích sự phụ thuộc trên toàn bộ codebase và refactoring.
Suy nghĩ quá mức cho các tác vụ đơn giản: Mức độ reasoning sâu có thể gây ra độ trễ output dài đối với các truy vấn ngắn nếu các tham số reasoning không được giới hạn.
Khả năng lưu trữ trên phần cứng cục bộ: Sử dụng cấu trúc MoE với 13B active parameters cho phép chạy trên các thiết lập bộ nhớ hợp nhất 128GB với lượng tử hóa 4-bit.
Sự thiếu nhất quán trong các lượt tương tác tiếp theo: Chất lượng có thể thay đổi trên các chuỗi chat dài so với các lượt tạo prompt đơn (single-shot) ban đầu.

Bat dau nhanh API

deepseek/deepseek-v4-flash-0731

Xem tai lieu
deepseek SDK
import OpenAI from 'openai';

const openai = new OpenAI({
  baseURL: 'https://api.deepseek.com',
  apiKey: process.env.DEEPSEEK_API_KEY,
});

async function main() {
  const completion = await openai.chat.completions.create({
    model: 'deepseek-v4-flash',
    messages: [{ role: 'user', content: 'Write a TypeScript function to balance a binary search tree.' }],
    temperature: 1.0,
    top_p: 0.95,
  });

  console.log(completion.choices[0].message.content);
}

main();

Cai dat SDK va bat dau thuc hien cac cuoc goi API trong vai phut.

Moi nguoi dang noi gi ve DeepSeek-V4-Flash

Xem cong dong nghi gi ve DeepSeek-V4-Flash

DeepSeek V4 Flash 0731 là dẫn đầu không thể bàn cãi về hiệu năng trên giá thành: ~158.000 request/tháng trong giới hạn 60 USD, điểm thông minh 49,9 và điểm agentic 45,7.
u/WegoW
reddit
Chúng tôi đang cung cấp bản cập nhật DeepSeek V4-Flash 0731 miễn phí trong Cline. Đây là flash model đầu tiên mà chúng tôi thấy đạt hiệu suất mức SOTA cho việc lập trình tự động.
@cline
twitter
Cài đặt 'reasoning effort' thực sự tuyệt vời. Tôi sử dụng mức thấp cho các bài test và mức tối đa cho logic thực tế. Tiết kiệm rất nhiều thời gian trong các pipeline hàng ngày.
BinaryBuilder
hackernews
DeepSeek V4 Flash 0731 có lẽ nên là ứng cử viên số một ngay bây giờ nếu bạn thích AI chạy cục bộ.
Digital Spaceport
youtube
Các model bạn có thể chạy cục bộ bây giờ có điểm số thông minh của các frontier model hàng đầu từ 5 tháng trước. Điều này thực sự điên rồ đối với open weights.
u/joorklee
reddit
DeepSeek V4 Flash rẻ hơn khoảng 150 lần so với các tùy chọn độc quyền trong khi vẫn mang lại UX và kết quả tác vụ thiết kế cực kỳ cạnh tranh.
@CommandCodeAI
twitter

Video ve DeepSeek-V4-Flash

Xem huong dan, danh gia va thao luan ve DeepSeek-V4-Flash

Trên SWE-bench, một thước đo uy tín về khả năng kỹ thuật phần mềm, điểm số của model đã tăng từ 7,3 lên 54,4.

DeepSeek V4 Flash là một Mixture of Experts model với tổng số 284 tỷ tham số, nhưng chỉ có 13 tỷ tham số hoạt động (active parameters).

Kích thước tham số hoạt động này giúp model có thể chạy thực tế trên phần cứng của người dùng cá nhân với 128GB bộ nhớ hợp nhất.

Các bản cập nhật sau huấn luyện tập trung chủ yếu vào quy trình làm việc dạng agentic và thực thi lệnh tự động.

Với mức giá 14 xu cho mỗi triệu input token, tỷ lệ hiệu suất hiện tại là chưa từng có.

Nên thiết lập kích thước context ít nhất 384.000 token, với context window tối đa là 1 triệu cho model này.

Nếu bạn đang làm việc dạng agentic, bạn nên điều chỉnh top P thành 0.95 thay vì 1.0.

Nó suy nghĩ rất nhiều và thực hiện việc kiểm tra kép, kiểm tra ba và kiểm tra bốn trong quá trình reasoning.

DeepSeek V4 Flash 0731 có lẽ nên là ứng cử viên số một ngay bây giờ nếu bạn thích AI chạy cục bộ.

Chạy phiên bản lượng tử hóa cục bộ yêu cầu tối thiểu 128GB đến 138GB VRAM hoặc bộ nhớ hệ thống.

Những cải tiến không đến từ việc mở rộng kích thước model, mà đến từ quá trình hậu huấn luyện tập trung vào việc cải thiện hành vi agentic.

Trên Terminal Bench 2.1, nó đạt 82,7 điểm, một mức tăng khổng lồ so với điểm số xem trước 61,8 trước đó.

Nó cung cấp khả năng thông minh gần bằng Luna với chi phí trên mỗi tác vụ thấp hơn khoảng 60%, biến nó thành một trong những model có hiệu suất trên chi phí tốt nhất.

Tích hợp API native responses cho phép các lập trình viên xử lý luồng output của tool mà không cần định dạng tùy chỉnh.

Nó xử lý việc chỉnh sửa kho lưu trữ nhiều file với độ chính xác đáng kinh ngạc xét đến dung lượng hoạt động nhẹ của nó.

Hon ca prompt

Tang cuong quy trinh lam viec cua ban voi Tu dong hoa AI

Automatio ket hop suc manh cua cac AI agent, tu dong hoa web va tich hop thong minh de giup ban lam duoc nhieu hon trong thoi gian ngan hon.

AI Agent
Tu dong hoa web
Quy trinh thong minh

Meo chuyen nghiep cho DeepSeek-V4-Flash

Meo chuyen gia giup ban tan dung toi da DeepSeek-V4-Flash va dat ket qua tot hon.

Hiệu chỉnh Top-P cho quy trình làm việc của Agent

Đặt top_p thành 0.95 và temperature thành 1.0 khi triển khai model trong các coding harness để cải thiện độ ổn định khi thực thi tool.

Đặt kích thước context tối thiểu cho Reasoning tối đa

Cấu hình bộ đệm context ít nhất 384.000 token khi sử dụng mức reasoning effort tối đa để đảm bảo không gian cho việc xử lý chain-of-thought sâu.

Sử dụng Context Caching

Cấu trúc lại các system prompt lặp đi lặp lại và ngữ cảnh codebase để tận dụng các lớp cache của API, giúp giảm chi phí input từ 0,14 USD xuống còn 0,03 USD cho mỗi triệu token.

Sử dụng khung giờ xử lý ngoài giờ cao điểm

Lên lịch cho các tác vụ API batch số lượng lớn vào thời gian ngoài giờ cao điểm, vì giá API sẽ tăng gấp đôi trong các khung giờ có lưu lượng truy cập cao.

Danh gia

Nguoi dung cua chung toi noi gi

Tham gia cung hang nghin nguoi dung hai long da thay doi quy trinh lam viec cua ho

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Lien quan AI Models

other

MiMo V2.5 Pro

Other

MiMo V2.5 Pro is Xiaomi's open-source 1.02T parameter MoE model featuring a 1M context window, native multimodality, and elite agentic coding performance.

1M context
$1.00/$3.00/1M
deepseek

DeepSeek-V3.2-Speciale

DeepSeek

DeepSeek-V3.2-Speciale is a reasoning-first LLM featuring gold-medal math performance, DeepSeek Sparse Attention, and a 131K context window. Rivaling GPT-5...

131K context
$0.28/$0.42/1M
minimax

MiniMax M2.5

minimax

MiniMax M2.5 is a SOTA MoE model featuring a 1M context window and elite agentic coding capabilities at disruptive pricing for autonomous agents.

1M context
$0.15/$1.20/1M
google

Gemini 3.6 Flash

Google

Gemini 3.6 Flash is Google's high-speed model featuring a 17% reduction in token consumption, $1.50/M input pricing, and advanced 3D visualization.

1M context
$1.50/$7.50/1M
zhipu

GLM-4.7

Zhipu (GLM)

GLM-4.7 by Zhipu AI is a flagship 358B MoE model featuring a 200K context window, elite 73.8% SWE-bench performance, and native Deep Thinking for agentic...

200K context
$0.60/$2.20/1M
moonshot

Kimi K2.7 Code

Moonshot

Kimi K2.7 Code is a 1T parameter MoE model from Moonshot AI. It features a 262k context window and 30% more efficient reasoning for software engineering.

262K context
$0.95/$4.00/1M
alibaba

Qwen3-Coder-Next

alibaba

Qwen3-Coder-Next is Alibaba Cloud's elite Apache 2.0 coding model, featuring an 80B MoE architecture and 256k context window for advanced local development.

262K context
$0.12/$0.75/1M
openai

GPT-4o mini

OpenAI

OpenAI's most cost-efficient small model, GPT-4o mini offers multimodal intelligence and high-speed performance at a significantly lower price point.

128K context
$0.15/$0.60/1M

Cau hoi thuong gap ve DeepSeek-V4-Flash

Tim cau tra loi cho cac cau hoi thuong gap ve DeepSeek-V4-Flash