deepseek

DeepSeek-V4-Flash

DeepSeek-V4-Flash je open-weight 1M kontekstni AI model sa rezultatom od 54.4% na SWE-bench po ceni od $0.14 po 1M token-a, optimizovan za agentic kodiranje i...

Open WeightsAgentic CodingMoE Arhitektura1M Context WindowNiski troškovi
deepseek logodeepseekDeepSeek V42026-07-31
Контекст
1.0Mтокена
Макс. излаз
8Kтокена
Улазна цена
$0.14/ 1M
Излазна цена
$0.28/ 1M
Модалитет:TextImage
Могућности:ВидАлатиСтримингЗакључивање
Бенчмаркови
GPQA
53.6%
GPQA: Научна питања на нивоу докторантуре. Ригорозан бенчмарк са 448 питања вишеструког избора из биологије, физике и хемије које су креирали стручњаци. Докторанти постижу само 65-74% тачности, док нестручњаци постижу само 34% чак и са неограниченим приступом интернету (отуда назив 'отпоран на Google'). DeepSeek-V4-Flash је постигао 53.6% на овом бенчмарку.
HLE
25.2%
HLE: Резоновање високог нивоа експертизе. Тестира способност модела да демонстрира резоновање на нивоу експерта у специјализованим доменима. Процењује дубоко разумевање сложених тема које захтевају знање на професионалном нивоу. DeepSeek-V4-Flash је постигао 25.2% на овом бенчмарку.
MMLU
88.7%
MMLU: Масовно вишезадатко језичко разумевање. Свеобухватан бенчмарк са 16.000 питања вишеструког избора из 57 академских предмета укључујући математику, филозофију, право и медицину. Тестира широко знање и способности резоновања. DeepSeek-V4-Flash је постигао 88.7% на овом бенчмарку.
MMLU Pro
72.6%
MMLU Pro: MMLU професионална верзија. Побољшана верзија MMLU са 12.032 питања користећи тежи формат са 10 опција. Покрива математику, физику, хемију, право, инжењерство, економију, здравство, психологију, бизнис, биологију, филозофију и информатику. DeepSeek-V4-Flash је постигао 72.6% на овом бенчмарку.
SimpleQA
38.2%
SimpleQA: Бенчмарк чињеничне тачности. Тестира способност модела да пружи тачне, чињеничне одговоре на директна питања. Мери поузданост и смањује халуцинације у задацима проналажења знања. DeepSeek-V4-Flash је постигао 38.2% на овом бенчмарку.
IFEval
88%
IFEval: Евалуација праћења инструкција. Мери колико добро модел следи специфичне инструкције и ограничења. Тестира способност придржавања правила форматирања, ограничења дужине и других експлицитних захтева. DeepSeek-V4-Flash је постигао 88% на овом бенчмарку.
AIME 2025
93.1%
AIME 2025: Амерички позивни математички испит. Математички проблеми такмичарског нивоа са престижног AIME испита дизајнираног за талентоване средњошколце. Тестира напредно математичко решавање проблема које захтева апстрактно резоновање, а не само препознавање образаца. DeepSeek-V4-Flash је постигао 93.1% на овом бенчмарку.
MATH
76.6%
MATH: Решавање математичких проблема. Свеобухватан математички бенчмарк који тестира решавање проблема из алгебре, геометрије, рачуна и других математичких домена. Захтева резоновање у више корака и формално математичко знање. DeepSeek-V4-Flash је постигао 76.6% на овом бенчмарку.
GSM8k
96%
GSM8k: Математика основне школе 8K. 8.500 математичких задатака нивоа основне школе који захтевају резоновање у више корака. Тестира основну аритметику и логичко размишљање кроз сценарије из стварног живота попут куповине или рачунања времена. DeepSeek-V4-Flash је постигао 96% на овом бенчмарку.
MGSM
90.5%
MGSM: Вишејезична математика основне школе. GSM8k бенчмарк преведен на 10 језика укључујући шпански, француски, немачки, руски, кинески и јапански. Тестира математичко резоновање на различитим језицима. DeepSeek-V4-Flash је постигао 90.5% на овом бенчмарку.
MathVista
63.8%
MathVista: Математичко визуелно резоновање. Тестира способност решавања математичких проблема који укључују визуелне елементе попут графикона, геометријских дијаграма и научних фигура. Комбинује визуелно разумевање са математичким резоновањем. DeepSeek-V4-Flash је постигао 63.8% на овом бенчмарку.
SWE-Bench
54.4%
SWE-Bench: Бенчмарк софтверског инжењеринга. АИ модели покушавају да реше стварне GitHub проблеме у Python пројектима отвореног кода са људском верификацијом. Тестира практичне вештине софтверског инжењеринга на продукцијским базама кода. Најбољи модели су напредовали са 4,4% у 2023. на преко 70% у 2024. DeepSeek-V4-Flash је постигао 54.4% на овом бенчмарку.
HumanEval
90.2%
HumanEval: Python програмерски проблеми. 164 ручно написана програмерска проблема где модели морају да генеришу исправне имплементације Python функција. Свако решење се верификује јединичним тестовима. Најбољи модели сада постижу преко 90% тачности. DeepSeek-V4-Flash је постигао 90.2% на овом бенчмарку.
LiveCodeBench
33%
LiveCodeBench: Бенчмарк живог кодирања. Тестира способности кодирања на континуирано ажурираним изазовима програмирања из стварног света. За разлику од статичних бенчмаркова, користи свеже проблеме за спречавање контаминације података и мерење правих вештина кодирања. DeepSeek-V4-Flash је постигао 33% на овом бенчмарку.
MMMU
69.1%
MMMU: Мултимодално разумевање. Масиван вишедисциплинарни мултимодални бенчмарк разумевања који тестира моделе вида и језика на проблемима универзитетског нивоа из 30 предмета који захтевају разумевање слика и стручно знање. DeepSeek-V4-Flash је постигао 69.1% на овом бенчмарку.
MMMU Pro
54%
MMMU Pro: MMMU професионална верзија. Побољшана верзија MMMU са тежим питањима и строжом евалуацијом. Тестира напредно мултимодално резоновање на професионалном и експертском нивоу. DeepSeek-V4-Flash је постигао 54% на овом бенчмарку.
ChartQA
85.7%
ChartQA: Питања и одговори о графиконима. Тестира способност разумевања и резоновања о информацијама приказаним у графиконима и дијаграмима. Захтева екстракцију података, поређење вредности и извођење рачунања из визуелних приказа података. DeepSeek-V4-Flash је постигао 85.7% на овом бенчмарку.
DocVQA
92.8%
DocVQA: Визуелна Q&A о документима. Бенчмарк визуелних питања и одговора о документима који тестира способност екстракције и резоновања о информацијама из слика докумената укључујући обрасце, извештаје и скениран текст. DeepSeek-V4-Flash је постигао 92.8% на овом бенчмарку.
Terminal-Bench
82.7%
Terminal-Bench: Terminal/CLI задаци. Тестира способност извођења операција командне линије, писања shell скрипти и навигације у терминалским окружењима. Мери практичне вештине администрације система и развојних токова рада. DeepSeek-V4-Flash је постигао 82.7% на овом бенчмарку.
ARC-AGI
7%
ARC-AGI: Апстракција и резоновање. Корпус апстракције и резоновања за AGI - тестира флуидну интелигенцију кроз нове загонетке препознавања образаца. Сваки задатак захтева откривање основног правила из примера, мерећи општу способност резоновања уместо меморисања. DeepSeek-V4-Flash је постигао 7% на овом бенчмарку.

О моделу DeepSeek-V4-Flash

Сазнајте о могућностима, функцијама и начинима коришћења модела DeepSeek-V4-Flash.

DeepSeek-V4-Flash je open-weight Mixture of Experts (MoE) jezički model dizajniran za softverski inženjering i višekoračne reasoning zadatke. Sadrži ukupno 284 milijarde parametara sa 13 milijardi aktivnih parametara po token-u tokom inferenca. Model koristi izvorni context window od 1.048.576 token-a, omogućavajući programerima da obrade cele baze koda ili duge tehničke dokumente u jednom zahtevu.

Ažuriranje od 31. jula 2026. godine zadržava arhitekturu inicijalnog preview modela uz primenu post-treninga fokusiranog na agentic ponašanje. Ovaj naknadni trening poboljšao je njegov rezultat na Terminal-Bench 2.1 sa 61.8 na 82.7 i povećao njegov SWE-bench rezultat na 54.4%. Model podržava varijabilne nivoe reasoning effort-a i nativnu integraciju responses API-ja za strimovanje srednjih komentara uz finalne izlaze.

Programeri mogu pristupiti modelu preko DeepSeek-ovog OpenAI-kompatibilnog API-ja ili pokrenuti open weights lokalno na hardverskim konfiguracijama sa 128GB do 192GB unificirane memorije. Standardna API cena je $0.14 po 1 milion input token-a i $0.28 po 1 milion output token-a, pri čemu keširani input-i padaju na $0.03 po milion token-a.

DeepSeek-V4-Flash

Случајеви употребе за DeepSeek-V4-Flash

Откријте различите начине коришћења модела DeepSeek-V4-Flash за постизање одличних резултата.

Autonomno agentic kodiranje

Izvršavanje višekoračnih modifikacija terminala i fajlova korišćenjem Codex CLI ili Cline okruženja za rešavanje GitHub problema i automatizaciju kreiranja testova.

Lokalna AI primena

Hostovanje celog modela na radnim stanicama opremljenim sa 128GB unificirane memorije ili četiri GPU-a korišćenjem 4-bit kvantizacija.

Refaktorisanje repozitorijuma velikih razmera

Učitavanje do 1 milion token-a konteksta baze koda za mapiranje zavisnosti i izvršavanje arhitektonskih ažuriranja preko više modula.

Generisanje interaktivnih 3D i front-end veb aplikacija

Izrada jednofajlskih veb aplikacija, Three.js 3D okruženja i kompleksnih SVG dijagrama direktno iz specifikacija u prompt-u.

Obrada podataka velikog obima

Obrada opsežnih tekstualnih logova i strukturiranih dokumenata korišćenjem keširanja konteksta radi smanjenja API troškova na $0.03 po milion token-a.

Višekoračna automatizacija terminala

Izvršavanje shell komandi i pipelines skripti gde model koristi interno reasoning za upravljanje neočekivanim greškama komandi.

Предности

Ограничења

Visoke performanse na SWE-bench: Ostvaruje 54.4% na SWE-bench Verified, nadmašujući mnoge veće closed-source modele u rešavanju stvarnih GitHub problema.
Varijabilne doplate na cene: Troškovi API token-a se udvostručuju tokom sati vršnog korišćenja, što povećava troškove za aplikacije u realnom vremenu.
API troškovna efikasnost: Cena je $0.14 po 1M input token-a i $0.28 po 1M output token-a, nudeći nižu cenu po zadatku u poređenju sa konkurentskim modelima.
Visoki memorijski zahtevi za lokalno izvršavanje: Lokalno hostovanje zahteva najmanje 128GB VRAM-a ili sistemske memorije za upotrebljive nivoe kvantizacije.
1M Token Context Window: Učitava do 1.048.576 token-a u jednom zahtevu, omogućavajući analizu zavisnosti i refaktorisanje na nivou cele baze koda.
Preterano razmišljanje (overthinking) na jednostavnim zadacima: Duboki reasoning effort može prouzrokovati duga kašnjenja izlaza na kratkim upitima ako parametri razmišljanja nisu ograničeni.
Mogućnost hostovanja na lokalnom hardveru: Koristi 13B aktivnih parametara MoE strukturu koja omogućava izvršavanje na postavkama sa 128GB unificirane memorije uz 4-bit kvantizaciju.
Nedoslednost u naknadnim iteracijama: Kvalitet može varirati kroz duge niti razgovora u poređenju sa početnim generisanjem iz jednog prompt-a.

АПИ брзи старт

deepseek/deepseek-v4-flash-0731

Погледај документацију
deepseek SDK
import OpenAI from 'openai';

const openai = new OpenAI({
  baseURL: 'https://api.deepseek.com',
  apiKey: process.env.DEEPSEEK_API_KEY,
});

async function main() {
  const completion = await openai.chat.completions.create({
    model: 'deepseek-v4-flash',
    messages: [{ role: 'user', content: 'Write a TypeScript function to balance a binary search tree.' }],
    temperature: 1.0,
    top_p: 0.95,
  });

  console.log(completion.choices[0].message.content);
}

main();

Инсталирајте SDK и почните са АПИ позивима за неколико минута.

Шта људи кажу о моделу DeepSeek-V4-Flash

Погледајте шта заједница мисли о моделу DeepSeek-V4-Flash

DeepSeek V4 Flash 0731 je neprikosnoveni lider u odnosu cene i performansi: ~158.000 zahteva mesečno u okviru granice od $60, inteligencija 49.9 i agentic rezultat 45.7.
u/WegoW
reddit
Činimo ažurirani DeepSeek V4-Flash 0731 besplatnim u Cline-u. Ovo je prvi flash model za koji smo otkrili da radi na SOTA nivoima za autonomno kodiranje.
@cline
twitter
Podešavanje 'reasoning effort' je briljantno. Koristim nisko za testove i maksimume za stvarnu logiku. Štedi toliko vremena u svakodnevnim pipeline-ovima.
BinaryBuilder
hackernews
DeepSeek V4 Flash 0731 bi verovatno trebalo da bude kandidat broj jedan trenutno ako se bavite lokalnom AI.
Digital Spaceport
youtube
Modeli koje sada možete pokrenuti lokalno imaju rezultat inteligencije vrhunskih frontier modela od pre 5 meseci. Ovo je apsolutno ludo za open weights.
u/joorklee
reddit
DeepSeek V4 Flash je ~150x jeftiniji od vlasničkih opcija dok pruža visoko konkurentan UX i izlaze za dizajnerske zadatke.
@CommandCodeAI
twitter

Видео снимци о моделу DeepSeek-V4-Flash

Гледајте туторијале, рецензије и дискусије о моделу DeepSeek-V4-Flash

Na SWE-bench-u, cenjenoj meri sposobnosti softverskog inženjeringa, rezultat modela je skočio sa 7.3 na 54.4.

DeepSeek V4 Flash je Mixture of Experts model sa ukupno 284 milijarde parametara, ali samo 13 milijardi aktivnih parametara.

Ova veličina aktivnih parametara čini model realno izvodljivim za pokretanje na lokalnom hobi hardveru sa 128GB unificirane memorije.

Ažuriranja nakon treninga prvenstveno se fokusiraju na agentic radne procese i automatizovano izvršavanje komandi.

Za cenu od 14 centi po milion input token-a, odnos performansi je trenutno bez premca.

Preporučuje se postavljanje konteksta od najmanje 384.000 token-a, sa maksimalnim context window-om od 1 milion za ovaj model.

Ako radite agentic poslove, poželećete da podesite svoj top P na 0.95 umesto na 1.0.

Veoma je promišljen i obavlja mnogo dvostrukih, trostrukih i četvorostrukih provera tokom reasoning-a.

DeepSeek V4 Flash 0731 bi verovatno trebalo da bude kandidat broj jedan trenutno ako se bavite lokalnom AI.

Pokretanje kvantizovane verzije lokalno zahteva minimum 128GB do 138GB VRAM-a ili sistemske memorije.

Dobici ne dolaze od skaliranja veličine modela, već od post-treninga fokusiranog na poboljšanje agentic ponašanja.

Na Terminal Bench 2.1, ostvaruje rezultat 82.7, što je ogroman skok u odnosu na prethodni preview rezultat od 61.8.

Nudi inteligenciju blisku Luna nivou uz otprilike 60% nižu cenu po zadatku, čineći ga jednim od modela sa najboljim performansama po dolaru.

Nativna integracija responses API-ja omogućava programerima da obrađuju tokove izlaza alata bez prilagođenog formatiranja.

Obrađuje uređivanja repozitorijuma sa više fajlova sa izuzetnom tačnošću s obzirom na svoj lagani aktivni otisak.

Vise od samo promptova

Побољшајте свој радни ток са AI Automatizacijom

Automatio kombinuje moc AI agenata, web automatizacije i pametnih integracija kako bi vam pomogao da postignete vise za manje vremena.

АИ Агенти
Веб Аутоматизација
Паметни Токови

Pro Saveti za DeepSeek-V4-Flash

Stručni saveti za maksimalno iskorišćenje DeepSeek-V4-Flash.

Kalibrišite Top-P za radne procese agenata

Podesite top_p na 0.95 i temperaturu na 1.0 kada primenjujete model u okruženjima za kodiranje kako biste poboljšali stabilnost izvršavanja alata.

Podesite minimalnu veličinu konteksta za maksimalno reasoning

Konfigurišite bafer konteksta od najmanje 384.000 token-a kada koristite maksimalni reasoning effort kako biste obezbedili prostor za obradu dubokog chain-of-thought.

Iskoristite keširanje konteksta

Strukturirajte ponovljene system prompt-ove i kontekst baze koda da pogodite API slojeve za keširanje, smanjujući troškove input-a sa $0.14 na $0.03 po milion token-a.

Koristite prozore za obradu van vršnog opterećenja

Zakazujte masovne API batch poslove tokom sati van vršnog opterećenja, pošto se API cene udvostručuju tokom perioda sa velikim saobraćajem.

Сведочанства

Sta Kazu Nasi Korisnici

Pridruzite se hiljadama zadovoljnih korisnika koji su transformisali svoj radni tok

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Povezani AI Models

other

MiMo V2.5 Pro

Other

MiMo V2.5 Pro is Xiaomi's open-source 1.02T parameter MoE model featuring a 1M context window, native multimodality, and elite agentic coding performance.

1M context
$1.00/$3.00/1M
deepseek

DeepSeek-V3.2-Speciale

DeepSeek

DeepSeek-V3.2-Speciale is a reasoning-first LLM featuring gold-medal math performance, DeepSeek Sparse Attention, and a 131K context window. Rivaling GPT-5...

131K context
$0.28/$0.42/1M
minimax

MiniMax M2.5

minimax

MiniMax M2.5 is a SOTA MoE model featuring a 1M context window and elite agentic coding capabilities at disruptive pricing for autonomous agents.

1M context
$0.15/$1.20/1M
google

Gemini 3.6 Flash

Google

Gemini 3.6 Flash is Google's high-speed model featuring a 17% reduction in token consumption, $1.50/M input pricing, and advanced 3D visualization.

1M context
$1.50/$7.50/1M
zhipu

GLM-4.7

Zhipu (GLM)

GLM-4.7 by Zhipu AI is a flagship 358B MoE model featuring a 200K context window, elite 73.8% SWE-bench performance, and native Deep Thinking for agentic...

200K context
$0.60/$2.20/1M
moonshot

Kimi K2.7 Code

Moonshot

Kimi K2.7 Code is a 1T parameter MoE model from Moonshot AI. It features a 262k context window and 30% more efficient reasoning for software engineering.

262K context
$0.95/$4.00/1M
alibaba

Qwen3-Coder-Next

alibaba

Qwen3-Coder-Next is Alibaba Cloud's elite Apache 2.0 coding model, featuring an 80B MoE architecture and 256k context window for advanced local development.

262K context
$0.12/$0.75/1M
openai

GPT-4o mini

OpenAI

OpenAI's most cost-efficient small model, GPT-4o mini offers multimodal intelligence and high-speed performance at a significantly lower price point.

128K context
$0.15/$0.60/1M

Често Постављана Питања о DeepSeek-V4-Flash

Пронађите одговоре на честа питања о DeepSeek-V4-Flash