deepseek

DeepSeek-V4-Flash

DeepSeek-V4-Flash è un model AI open-weight con contesto da 1M che ottiene il 54,4% su SWE-bench a $0,14 per 1M di token, ottimizzato per agentic coding e...

Open WeightsAgentic CodingMoE Architecture1M Context WindowLow Cost
deepseek logodeepseekDeepSeek V42026-07-31
Contesto
1.0Mtoken
Output max
8Ktoken
Prezzo input
$0.14/ 1M
Prezzo output
$0.28/ 1M
Modalita:TextImage
Capacita:VisioneStrumentiStreamingRagionamento
Benchmark
GPQA
53.6%
GPQA: Domande scientifiche livello laurea. Un benchmark rigoroso con 448 domande su biologia, fisica e chimica. Gli esperti PhD raggiungono solo il 65-74% di accuratezza. DeepSeek-V4-Flash ha ottenuto 53.6% in questo benchmark.
HLE
25.2%
HLE: Ragionamento esperto di alto livello. Testa la capacita di un modello di dimostrare ragionamento a livello esperto in domini specializzati. DeepSeek-V4-Flash ha ottenuto 25.2% in questo benchmark.
MMLU
88.7%
MMLU: Comprensione linguistica multitask massiva. Un benchmark completo con 16.000 domande su 57 materie accademiche. DeepSeek-V4-Flash ha ottenuto 88.7% in questo benchmark.
MMLU Pro
72.6%
MMLU Pro: MMLU Edizione Professionale. Una versione migliorata di MMLU con 12.032 domande e un formato piu difficile a 10 opzioni. DeepSeek-V4-Flash ha ottenuto 72.6% in questo benchmark.
SimpleQA
38.2%
SimpleQA: Benchmark di accuratezza fattuale. Testa la capacita di un modello di fornire risposte accurate e fattuali. DeepSeek-V4-Flash ha ottenuto 38.2% in questo benchmark.
IFEval
88%
IFEval: Valutazione del seguire istruzioni. Misura quanto bene un modello segue istruzioni e vincoli specifici. DeepSeek-V4-Flash ha ottenuto 88% in questo benchmark.
AIME 2025
93.1%
AIME 2025: Esame di matematica invitazionale americano. Problemi matematici a livello competitivo dal prestigioso esame AIME. DeepSeek-V4-Flash ha ottenuto 93.1% in questo benchmark.
MATH
76.6%
MATH: Risoluzione di problemi matematici. Un benchmark matematico completo che testa la risoluzione di problemi in algebra, geometria, calcolo. DeepSeek-V4-Flash ha ottenuto 76.6% in questo benchmark.
GSM8k
96%
GSM8k: Matematica scuola elementare 8K. 8.500 problemi matematici a parole di livello scuola elementare. DeepSeek-V4-Flash ha ottenuto 96% in questo benchmark.
MGSM
90.5%
MGSM: Matematica multilingue scuola elementare. Il benchmark GSM8k tradotto in 10 lingue. DeepSeek-V4-Flash ha ottenuto 90.5% in questo benchmark.
MathVista
63.8%
MathVista: Ragionamento visivo matematico. Testa la capacita di risolvere problemi matematici con elementi visivi. DeepSeek-V4-Flash ha ottenuto 63.8% in questo benchmark.
SWE-Bench
54.4%
SWE-Bench: Benchmark ingegneria software. I modelli AI tentano di risolvere veri problemi GitHub in progetti Python. DeepSeek-V4-Flash ha ottenuto 54.4% in questo benchmark.
HumanEval
90.2%
HumanEval: Problemi di programmazione Python. 164 problemi di programmazione dove i modelli devono generare implementazioni corrette di funzioni Python. DeepSeek-V4-Flash ha ottenuto 90.2% in questo benchmark.
LiveCodeBench
33%
LiveCodeBench: Benchmark di codifica live. Testa le capacita di codifica su sfide di programmazione reali continuamente aggiornate. DeepSeek-V4-Flash ha ottenuto 33% in questo benchmark.
MMMU
69.1%
MMMU: Comprensione multimodale. Benchmark di comprensione multimodale su 30 materie universitarie. DeepSeek-V4-Flash ha ottenuto 69.1% in questo benchmark.
MMMU Pro
54%
MMMU Pro: MMMU Edizione Professionale. Versione migliorata di MMMU con domande piu impegnative. DeepSeek-V4-Flash ha ottenuto 54% in questo benchmark.
ChartQA
85.7%
ChartQA: Domande e risposte su grafici. Testa la capacita di comprendere e analizzare informazioni da grafici e diagrammi. DeepSeek-V4-Flash ha ottenuto 85.7% in questo benchmark.
DocVQA
92.8%
DocVQA: Domande visive su documenti. Testa la capacita di estrarre informazioni da immagini di documenti. DeepSeek-V4-Flash ha ottenuto 92.8% in questo benchmark.
Terminal-Bench
82.7%
Terminal-Bench: Attivita terminale/CLI. Testa la capacita di eseguire operazioni da linea di comando. DeepSeek-V4-Flash ha ottenuto 82.7% in questo benchmark.
ARC-AGI
7%
ARC-AGI: Astrazione e ragionamento. Testa l'intelligenza fluida attraverso nuovi puzzle di riconoscimento di pattern. DeepSeek-V4-Flash ha ottenuto 7% in questo benchmark.

Informazioni su DeepSeek-V4-Flash

Scopri le capacita di DeepSeek-V4-Flash, le funzionalita e come puo aiutarti a ottenere risultati migliori.

DeepSeek-V4-Flash è un language model open-weight Mixture of Experts (MoE) progettato per l'ingegneria del software e attività di reasoning in più passaggi. Contiene 284 miliardi di parametri totali con 13 miliardi di parametri attivi per token durante l'inference. Il model utilizza un context window nativo di 1.048.576 token, consentendo agli sviluppatori di elaborare intere codebase o lunghi documenti tecnici in un'unica richiesta.

L'aggiornamento del 31 luglio 2026 mantiene l'architettura del model di anteprima iniziale applicando al contempo un post-training focalizzato sul comportamento agentic. Questo ulteriore post-training ha migliorato il suo punteggio su Terminal-Bench 2.1 da 61,8 a 82,7 e ha aumentato il suo risultato su SWE-bench al 54,4%. Il model supporta livelli variabili di effort di reasoning e l'integrazione nativa delle API responses per lo streaming di commenti intermedi insieme agli output finali.

Gli sviluppatori possono accedere al model tramite le API compatibili con OpenAI di DeepSeek o eseguire open weight localmente su configurazioni hardware con 128GB a 192GB di memoria unificata. Il prezzo standard delle API è di $0,14 per 1 milione di input token e $0,28 per 1 milione di output token, con i riscontri di input cachati che scendono a $0,03 per milione di token.

DeepSeek-V4-Flash

Casi d'uso per DeepSeek-V4-Flash

Scopri i diversi modi in cui puoi usare DeepSeek-V4-Flash per ottenere ottimi risultati.

Agentic Coding Autonomo

Esecuzione di modifiche a file e terminale in più passaggi utilizzando i framework Codex CLI o Cline per correggere problemi di GitHub e automatizzare la creazione di test.

Distribuzione AI Locale

Hosting dell'intero model su workstation dotate di memoria unificata da 128GB o quattro GPU utilizzando quantizzazioni a 4-bit.

Refactoring di repository su larga scala

Ingestione fino a 1 milione di token di contesto della codebase per mappare le dipendenze ed eseguire aggiornamenti architetturali su più moduli.

Generazione Web 3D e Front-End interattiva

Creazione di applicazioni web a file singolo, ambienti 3D Three.js e diagrammi SVG complessi direttamente dalle specifiche dei prompt.

Elaborazione di dati ad alto volume

Elaborazione di log di testo estesi e documenti strutturati utilizzando il context caching per ridurre i costi API a $0,03 per milione di token.

Automazione da terminale in più passaggi

Esecuzione di comandi shell e pipeline di script in cui il model utilizza il reasoning interno per gestire errori di comando imprevisti.

Punti di forza

Limitazioni

Alte prestazioni su SWE-bench: Ottiene il 54,4% su SWE-bench Verified, superando molti model closed più grandi nella risoluzione di problemi reali di GitHub.
Sovrapprezzi variabili: I costi dei token API raddoppiano durante le ore di massimo utilizzo, il che aumenta le spese per le applicazioni in tempo reale.
Efficienza dei costi API: Prezzato a $0,14 per 1M di input token e $0,28 per 1M di output token, offrendo un costo inferiore per attività rispetto ai model concorrenti.
Elevato overhead di memoria per l'esecuzione locale: L'hosting locale richiede almeno 128GB di VRAM o memoria di sistema per livelli di quantizzazione utilizzabili.
Context Window di 1M di token: Ingerisce fino a 1.048.576 token in una singola richiesta, consentendo l'analisi delle dipendenze a livello di intera codebase e il refactoring.
Overthinking su attività semplici: Un effort di reasoning elevato può causare lunghi ritardi di output su query brevi se i parametri di reasoning non vengono limitati.
Ospitabilità su hardware locale: Utilizza una struttura MoE a 13B parametri attivi che consente l'esecuzione su configurazioni di memoria unificata da 128GB con quant a 4-bit.
Incoerenza nelle iterazioni di follow-up: La qualità può variare su thread di chat lunghi rispetto alle generazioni iniziali di prompt single-shot.

Avvio rapido API

deepseek/deepseek-v4-flash-0731

Visualizza documentazione
deepseek SDK
import OpenAI from 'openai';

const openai = new OpenAI({
  baseURL: 'https://api.deepseek.com',
  apiKey: process.env.DEEPSEEK_API_KEY,
});

async function main() {
  const completion = await openai.chat.completions.create({
    model: 'deepseek-v4-flash',
    messages: [{ role: 'user', content: 'Write a TypeScript function to balance a binary search tree.' }],
    temperature: 1.0,
    top_p: 0.95,
  });

  console.log(completion.choices[0].message.content);
}

main();

Installa l'SDK e inizia a fare chiamate API in pochi minuti.

Cosa dice la gente su DeepSeek-V4-Flash

Guarda cosa pensa la community di DeepSeek-V4-Flash

DeepSeek V4 Flash 0731 è l'indiscusso leader nel rapporto prezzo-prestazioni: ~158.000 richieste/mese entro il limite di $60, intelligenza 49,9 e punteggio agentic 45,7.
u/WegoW
reddit
Stiamo rendendo l'aggiornato DeepSeek V4-Flash 0731 gratuito in Cline. Questo è il primo model flash che abbiamo riscontrato esibirsi a livelli SOTA per il coding autonomo.
@cline
twitter
L'impostazione 'reasoning effort' è geniale. Uso basso per i test e massimo per la logica effettiva. Fa risparmiare così tanto tempo nelle pipeline quotidiane.
BinaryBuilder
hackernews
DeepSeek V4 Flash 0731 dovrebbe probabilmente essere il principale contendente in questo momento se ti interessi di AI locale.
Digital Spaceport
youtube
I model che puoi eseguire localmente ora hanno il punteggio di intelligenza dei top frontier model di 5 mesi fa. Questo è assolutamente pazzesco per gli open weights.
u/joorklee
reddit
DeepSeek V4 Flash è circa 150 volte più economico delle opzioni proprietarie offrendo al contempo output di UX e task di design altamente competitivi.
@CommandCodeAI
twitter

Video su DeepSeek-V4-Flash

Guarda tutorial, recensioni e discussioni su DeepSeek-V4-Flash

Su SWE-bench, una misura rispettata delle capacità di ingegneria del software, il punteggio del model è balzato dal 7,3 al 54,4.

DeepSeek V4 Flash è un model Mixture of Experts con 284 miliardi di parametri totali, ma solo 13 miliardi di parametri attivi.

Queste dimensioni di parametri attivi rendono il model realisticamente fattibile da eseguire su hardware locale per hobbisti con 128GB di memoria unificata.

Gli aggiornamenti di post-training si concentrano principalmente sui flussi di lavoro agentic e sull'esecuzione automatizzata dei comandi.

Per il prezzo di 14 centesimi per milione di input token, il rapporto di performance è ineguagliabile in questo momento.

Si consiglia di impostare almeno 384.000 token di dimensione del contesto, con un context window massimo di 1 milione per questo model.

Se stai svolgendo attività di tipo agentic, ti conviene regolare il tuo top P a 0,95 invece di 1,0.

È molto 'pensante' e fa molti doppi, tripli e quadrupli controlli durante il reasoning.

DeepSeek V4 Flash 0731 dovrebbe probabilmente essere il principale contendente in questo momento se ti interessi di AI locale.

L'esecuzione della versione quantizzata localmente richiede un minimo da 128GB a 138GB di VRAM o memoria di sistema.

I miglioramenti non derivano dall'aumento delle dimensioni del model, ma dal post-training incentrato sul miglioramento del comportamento agentic.

Su Terminal Bench 2.1, ottiene un 82,7, che rappresenta un enorme salto rispetto al precedente punteggio di anteprima di 61,8.

Offre un'intelligenza vicina al livello di Luna a un costo per attività inferiore di circa il 60%, rendendolo uno dei migliori model per rapporto qualità-prezzo.

L'integrazione nativa delle API responses consente agli sviluppatori di elaborare flussi di output dei tool senza formattazione personalizzata.

Gestisce modifiche a repository multi-file con notevole accuratezza data la sua leggerezza in termini di footprint attivo.

Piu di semplici prompt

Potenzia il tuo workflow con l'automazione AI

Automatio combina la potenza degli agenti AI, dell'automazione web e delle integrazioni intelligenti per aiutarti a fare di piu in meno tempo.

Agenti AI
Automazione web
Workflow intelligenti

Consigli Pro per DeepSeek-V4-Flash

Consigli esperti per aiutarti a ottenere il massimo da DeepSeek-V4-Flash e raggiungere risultati migliori.

Calibra Top-P per i flussi di lavoro degli agent

Imposta top_p a 0,95 e temperature a 1,0 quando distribuisci il model nei framework di coding per migliorare la stabilità di esecuzione dei tool.

Imposta la dimensione minima del contesto per il massimo reasoning

Configura un buffer di contesto di almeno 384.000 token quando usi il massimo effort di reasoning per garantire spazio per l'elaborazione approfondita del chain-of-thought.

Utilizza il Context Caching

Struttura system prompt ripetuti e contesto della codebase per colpire i layer di cache delle API, riducendo i costi di input da $0,14 a $0,03 per milione di token.

Usa finestre di elaborazione fuori ora di punta

Pianifica i job batch API in blocco durante le ore non di punta, poiché i prezzi delle API raddoppiano durante i periodi di traffico intenso.

Testimonianze

Cosa dicono i nostri utenti

Unisciti a migliaia di utenti soddisfatti che hanno trasformato il loro workflow

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Correlati AI Models

other

MiMo V2.5 Pro

Other

MiMo V2.5 Pro is Xiaomi's open-source 1.02T parameter MoE model featuring a 1M context window, native multimodality, and elite agentic coding performance.

1M context
$1.00/$3.00/1M
deepseek

DeepSeek-V3.2-Speciale

DeepSeek

DeepSeek-V3.2-Speciale is a reasoning-first LLM featuring gold-medal math performance, DeepSeek Sparse Attention, and a 131K context window. Rivaling GPT-5...

131K context
$0.28/$0.42/1M
minimax

MiniMax M2.5

minimax

MiniMax M2.5 is a SOTA MoE model featuring a 1M context window and elite agentic coding capabilities at disruptive pricing for autonomous agents.

1M context
$0.15/$1.20/1M
google

Gemini 3.6 Flash

Google

Gemini 3.6 Flash is Google's high-speed model featuring a 17% reduction in token consumption, $1.50/M input pricing, and advanced 3D visualization.

1M context
$1.50/$7.50/1M
zhipu

GLM-4.7

Zhipu (GLM)

GLM-4.7 by Zhipu AI is a flagship 358B MoE model featuring a 200K context window, elite 73.8% SWE-bench performance, and native Deep Thinking for agentic...

200K context
$0.60/$2.20/1M
moonshot

Kimi K2.7 Code

Moonshot

Kimi K2.7 Code is a 1T parameter MoE model from Moonshot AI. It features a 262k context window and 30% more efficient reasoning for software engineering.

262K context
$0.95/$4.00/1M
alibaba

Qwen3-Coder-Next

alibaba

Qwen3-Coder-Next is Alibaba Cloud's elite Apache 2.0 coding model, featuring an 80B MoE architecture and 256k context window for advanced local development.

262K context
$0.12/$0.75/1M
openai

GPT-4o mini

OpenAI

OpenAI's most cost-efficient small model, GPT-4o mini offers multimodal intelligence and high-speed performance at a significantly lower price point.

128K context
$0.15/$0.60/1M

Domande frequenti su DeepSeek-V4-Flash

Trova risposte alle domande comuni su DeepSeek-V4-Flash