deepseek

DeepSeek-V4-Flash

O DeepSeek-V4-Flash é um modelo de IA open-weight com contexto de 1M que pontua 54,4% no SWE-bench por $0,14 por 1M de tokens, otimizado para codificação...

Open WeightsAgentic CodingMoE Architecture1M Context WindowBaixo Custo
deepseek logodeepseekDeepSeek V42026-07-31
Contexto
1.0Mtokens
Saida Max
8Ktokens
Preco Entrada
$0.14/ 1M
Preco Saida
$0.28/ 1M
Modalidade:TextImage
Capacidades:VisaoFerramentasStreamingRaciocinio
Benchmarks
GPQA
53.6%
GPQA: Q&A de Ciencias Avancadas. Um benchmark rigoroso com 448 questoes de multipla escolha em biologia, fisica e quimica criadas por especialistas. Especialistas com PhD alcancam apenas 65-74% de precisao. DeepSeek-V4-Flash pontuou 53.6% neste benchmark.
HLE
25.2%
HLE: Raciocinio de Alto Nivel. Testa a capacidade de um modelo de demonstrar raciocinio de nivel especialista em dominios especializados. DeepSeek-V4-Flash pontuou 25.2% neste benchmark.
MMLU
88.7%
MMLU: Compreensao de Linguagem Multitarefa. Um benchmark abrangente com 16.000 questoes de multipla escolha em 57 disciplinas academicas. DeepSeek-V4-Flash pontuou 88.7% neste benchmark.
MMLU Pro
72.6%
MMLU Pro: MMLU Edicao Profissional. Uma versao aprimorada do MMLU com 12.032 questoes usando um formato mais dificil de multipla escolha com 10 opcoes. DeepSeek-V4-Flash pontuou 72.6% neste benchmark.
SimpleQA
38.2%
SimpleQA: Benchmark de Precisao Factual. Testa a capacidade de um modelo de fornecer respostas precisas e factuais a perguntas diretas. DeepSeek-V4-Flash pontuou 38.2% neste benchmark.
IFEval
88%
IFEval: Avaliacao de Seguimento de Instrucoes. Mede quao bem um modelo segue instrucoes e restricoes especificas. DeepSeek-V4-Flash pontuou 88% neste benchmark.
AIME 2025
93.1%
AIME 2025: Exame de Matematica Invitacional Americano. Problemas de matematica de nivel competitivo do prestigiado exame AIME. DeepSeek-V4-Flash pontuou 93.1% neste benchmark.
MATH
76.6%
MATH: Resolucao de Problemas Matematicos. Um benchmark abrangente de matematica testando resolucao de problemas em algebra, geometria, calculo e outros dominios. DeepSeek-V4-Flash pontuou 76.6% neste benchmark.
GSM8k
96%
GSM8k: Matematica do Ensino Fundamental 8K. 8.500 problemas de matematica de nivel escolar fundamental que requerem raciocinio em multiplas etapas. DeepSeek-V4-Flash pontuou 96% neste benchmark.
MGSM
90.5%
MGSM: Matematica Escolar Multilingue. O benchmark GSM8k traduzido para 10 idiomas. DeepSeek-V4-Flash pontuou 90.5% neste benchmark.
MathVista
63.8%
MathVista: Raciocinio Visual Matematico. Testa a capacidade de resolver problemas de matematica que envolvem elementos visuais como graficos e diagramas. DeepSeek-V4-Flash pontuou 63.8% neste benchmark.
SWE-Bench
54.4%
SWE-Bench: Benchmark de Engenharia de Software. Modelos de IA tentam resolver issues reais do GitHub em projetos Python de codigo aberto. DeepSeek-V4-Flash pontuou 54.4% neste benchmark.
HumanEval
90.2%
HumanEval: Problemas de Programacao Python. 164 problemas de programacao escritos a mao onde modelos devem gerar implementacoes corretas de funcoes Python. DeepSeek-V4-Flash pontuou 90.2% neste benchmark.
LiveCodeBench
33%
LiveCodeBench: Benchmark de Codificacao Ao Vivo. Testa habilidades de codificacao em desafios de programacao do mundo real continuamente atualizados. DeepSeek-V4-Flash pontuou 33% neste benchmark.
MMMU
69.1%
MMMU: Compreensao Multimodal. Benchmark de Compreensao Multimodal Multidisciplinar testando modelos de visao-linguagem em problemas de nivel universitario. DeepSeek-V4-Flash pontuou 69.1% neste benchmark.
MMMU Pro
54%
MMMU Pro: MMMU Edicao Profissional. Versao aprimorada do MMMU com questoes mais desafiadoras e avaliacao mais rigorosa. DeepSeek-V4-Flash pontuou 54% neste benchmark.
ChartQA
85.7%
ChartQA: Resposta a Perguntas sobre Graficos. Testa a capacidade de entender e raciocinar sobre informacoes apresentadas em graficos. DeepSeek-V4-Flash pontuou 85.7% neste benchmark.
DocVQA
92.8%
DocVQA: Q&A Visual de Documentos. Benchmark de Resposta a Perguntas Visuais de Documentos testando a capacidade de extrair informacoes de imagens de documentos. DeepSeek-V4-Flash pontuou 92.8% neste benchmark.
Terminal-Bench
82.7%
Terminal-Bench: Tarefas de Terminal/CLI. Testa a capacidade de realizar operacoes de linha de comando e escrever scripts de shell. DeepSeek-V4-Flash pontuou 82.7% neste benchmark.
ARC-AGI
7%
ARC-AGI: Abstracao e Raciocinio. Corpus de Abstracao e Raciocinio para AGI - testa inteligencia fluida atraves de quebra-cabecas de reconhecimento de padroes. DeepSeek-V4-Flash pontuou 7% neste benchmark.

Sobre DeepSeek-V4-Flash

Aprenda sobre as capacidades do DeepSeek-V4-Flash, recursos e como ele pode ajuda-lo a obter melhores resultados.

O DeepSeek-V4-Flash é um language model open-weight do tipo Mixture of Experts (MoE) projetado para engenharia de software e tarefas de reasoning em várias etapas. Ele contém 284 bilhões de parâmetros no total, com 13 bilhões de parâmetros ativos por token durante a inference. O modelo utiliza um context window nativo de 1.048.576 tokens, permitindo que desenvolvedores processem repositórios de código inteiros ou longos documentos técnicos em uma única requisição.

A atualização de 31 de julho de 2026 mantém a arquitetura do modelo de visualização inicial enquanto aplica um pós-treinamento focado no comportamento de agentes. Esse re-pós-treinamento melhorou sua pontuação no Terminal-Bench 2.1 de 61,8 para 82,7 e aumentou seu resultado no SWE-bench para 54.4%. O modelo suporta níveis de esforço de reasoning variáveis e integração nativa com a API de responses para streaming de comentários intermediários junto com os outputs finais.

Os desenvolvedores podem acessar o modelo por meio da API compatível com OpenAI da DeepSeek ou executar open weights localmente em configurações de hardware com 128GB a 192GB de memória unificada. O preço padrão da API é de $0,14 por 1 milhão de input tokens e $0,28 por 1 milhão de output tokens, com acessos de input em cache caindo para $0,03 por milhão de tokens.

DeepSeek-V4-Flash

Casos de Uso para DeepSeek-V4-Flash

Descubra as diferentes maneiras de usar DeepSeek-V4-Flash para obter otimos resultados.

Codificação Autônoma de Agentes

Executando modificações de arquivos e terminal em várias etapas usando o Codex CLI ou harnesses do Cline para corrigir issues do GitHub e automatizar a criação de testes.

Implantação de IA Local

Hospedagem do modelo completo em estações de trabalho equipadas com 128GB de memória unificada ou quatro GPUs usando quantizações de 4-bit.

Refatoração de Repositórios em Grande Escala

Ingerindo até 1 milhão de tokens de contexto da base de código para mapear dependências e executar atualizações arquiteturais em vários módulos.

Geração Web Interativa 3D e Front-End

Construção de aplicações web de arquivo único, ambientes 3D Three.js e diagramas SVG complexos diretamente a partir de especificações de prompt.

Processamento de Dados de Alto Volume

Processamento de logs de texto extensos e documentos estruturados usando context caching para reduzir os custos da API para $0,03 por milhão de tokens.

Automação de Terminal em Várias Etapas

Execução de comandos de shell e pipelines de script onde o modelo usa reasoning interno para lidar com erros de comando inesperados.

Pontos Fortes

Limitacoes

Alto Desempenho no SWE-Bench: Pontua 54,4% no SWE-bench Verified, superando muitos modelos fechados maiores na resolução de issues reais do GitHub.
Sobretaxas de Preços Variáveis: Os custos de tokens da API dobram durante as horas de pico de uso, o que aumenta as despesas para aplicações em tempo real.
Eficiência de Custo da API: Precificado a $0,14 por 1M de input tokens e $0,28 por 1M de output tokens, oferecendo um custo menor por tarefa do que modelos concorrentes.
Alto Overhead de Memória para Execução Local: A hospedagem local requer pelo menos 128GB de VRAM ou memória do sistema para níveis de quantização utilizáveis.
Context Window de 1M de Tokens: Ingere até 1.048.576 tokens em uma única requisição, permitindo análise de dependência e refatoração em toda a base de código.
Excesso de Análise em Tarefas Simples: O esforço de reasoning profundo pode causar longos atrasos de output em consultas curtas se os parâmetros de reasoning não forem limitados.
Hospedagem em Hardware Local: Usa uma estrutura MoE de 13B de parâmetros ativos que permite a execução em configurações de memória unificada de 128GB com quants de 4-bit.
Inconsistência de Iteração de Acompanhamento: A qualidade pode variar em threads de chat longas em comparação com gerações de prompt iniciais de shot único.

Inicio Rapido da API

deepseek/deepseek-v4-flash-0731

Ver Documentacao
deepseek SDK
import OpenAI from 'openai';

const openai = new OpenAI({
  baseURL: 'https://api.deepseek.com',
  apiKey: process.env.DEEPSEEK_API_KEY,
});

async function main() {
  const completion = await openai.chat.completions.create({
    model: 'deepseek-v4-flash',
    messages: [{ role: 'user', content: 'Write a TypeScript function to balance a binary search tree.' }],
    temperature: 1.0,
    top_p: 0.95,
  });

  console.log(completion.choices[0].message.content);
}

main();

Instale o SDK e comece a fazer chamadas de API em minutos.

O Que as Pessoas Estao Dizendo Sobre DeepSeek-V4-Flash

Veja o que a comunidade pensa sobre DeepSeek-V4-Flash

O DeepSeek V4 Flash 0731 é o líder indiscutível em preço-desempenho: ~158.000 requisições/mês dentro do limite de $60, inteligência 49,9 e pontuação de agente 45,7.
u/WegoW
reddit
Estamos tornando o atualizado DeepSeek V4-Flash 0731 gratuito no Cline. Este é o primeiro modelo flash que descobrimos que atua em níveis de SOTA para codificação autônoma.
@cline
twitter
A configuração 'reasoning effort' é brilhante. Eu uso baixo para testes e máximo para a lógica real. Economiza muito tempo nos pipelines diários.
BinaryBuilder
hackernews
O DeepSeek V4 Flash 0731 deve ser provavelmente o principal concorrente agora se você curte IA local.
Digital Spaceport
youtube
Modelos que você pode executar localmente agora têm a pontuação de inteligência dos principais frontier models de 5 meses atrás. Isso é absolutamente louco para open weights.
u/joorklee
reddit
O DeepSeek V4 Flash é ~150x mais barato do que opções proprietárias, enquanto entrega UX e outputs de tarefas de design altamente competitivos.
@CommandCodeAI
twitter

Videos Sobre DeepSeek-V4-Flash

Assista tutoriais, analises e discussoes sobre DeepSeek-V4-Flash

No SWE-bench, uma medida respeitada de capacidade de engenharia de software, a pontuação do modelo saltou de 7,3 para 54,4.

O DeepSeek V4 Flash é um modelo Mixture of Experts com 284 bilhões de parâmetros no total, mas apenas 13 bilhões de parâmetros ativos.

Esse tamanho de parâmetros ativos torna o modelo viável para ser executado em hardware de hobista local com 128GB de memória unificada.

As atualizações de pós-treinamento focam principalmente em fluxos de trabalho de agentes e execução automatizada de comandos.

Para o preço de 14 centavos por milhão de input tokens, a relação de desempenho é incomparável no momento.

É recomendado ter pelo menos 384.000 tokens de tamanho de contexto definidos, com um context window máximo de 1 milhão para este modelo.

Se você estiver fazendo trabalho de agente, convém ajustar seu top P para 0,95 em vez de 1,0.

Ele é muito analítico e faz muita verificação dupla, tripla e quádrupla durante o reasoning.

O DeepSeek V4 Flash 0731 deve ser provavelmente o principal concorrente agora se você curte IA local.

Executar a versão quantizada localmente requer um mínimo de 128GB a 138GB de VRAM ou memória do sistema.

Os ganhos não vêm do aumento da escala do tamanho do modelo, mas sim do pós-treinamento focado em melhorar o comportamento de agente.

No Terminal Bench 2.1, ele pontua 82,7, o que é um salto enorme em relação à sua pontuação de pré-visualização anterior de 61,8.

Ele oferece inteligência próxima ao nível do Luna a um custo cerca de 60% menor por tarefa, tornando-o um dos melhores modelos de desempenho por dólar.

A integração nativa da API de responses permite que os desenvolvedores processem fluxos de output de ferramentas sem formatação personalizada.

Ele lida com edições de repositórios de vários arquivos com uma precisão notável, dada sua pegada ativa leve.

Mais do que apenas prompts

Potencialize seu fluxo de trabalho com Automacao de IA

Automatio combina o poder de agentes de IA, automacao web e integracoes inteligentes para ajuda-lo a realizar mais em menos tempo.

Agentes de IA
Automacao Web
Fluxos Inteligentes

Dicas Profissionais para DeepSeek-V4-Flash

Dicas de especialistas para ajuda-lo a aproveitar ao maximo DeepSeek-V4-Flash e obter melhores resultados.

Calibre o Top-P para Fluxos de Trabalho de Agentes

Defina o top_p para 0,95 e a temperature para 1.0 ao implantar o modelo em harnesses de codificação para melhorar a estabilidade da execução de ferramentas.

Defina o Tamanho Mínimo de Contexto para Máximo Reasoning

Configure um buffer de contexto de pelo menos 384.000 tokens ao usar o reasoning effort máximo para garantir espaço para o processamento profundo de chain-of-thought.

Utilize Context Caching

Estruture system prompts repetidos e o contexto da base de código para atingir as camadas de cache da API, reduzindo os custos de input de $0,14 para $0,03 por milhão de tokens.

Use Janelas de Processamento Fora de Pico

Programe jobs em lote da API em massa durante horários de pico, pois os preços da API dobram durante períodos de alto tráfego.

Depoimentos

O Que Nossos Usuarios Dizem

Junte-se a milhares de usuarios satisfeitos que transformaram seu fluxo de trabalho

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Relacionados AI Models

other

MiMo V2.5 Pro

Other

MiMo V2.5 Pro is Xiaomi's open-source 1.02T parameter MoE model featuring a 1M context window, native multimodality, and elite agentic coding performance.

1M context
$1.00/$3.00/1M
deepseek

DeepSeek-V3.2-Speciale

DeepSeek

DeepSeek-V3.2-Speciale is a reasoning-first LLM featuring gold-medal math performance, DeepSeek Sparse Attention, and a 131K context window. Rivaling GPT-5...

131K context
$0.28/$0.42/1M
minimax

MiniMax M2.5

minimax

MiniMax M2.5 is a SOTA MoE model featuring a 1M context window and elite agentic coding capabilities at disruptive pricing for autonomous agents.

1M context
$0.15/$1.20/1M
google

Gemini 3.6 Flash

Google

Gemini 3.6 Flash is Google's high-speed model featuring a 17% reduction in token consumption, $1.50/M input pricing, and advanced 3D visualization.

1M context
$1.50/$7.50/1M
zhipu

GLM-4.7

Zhipu (GLM)

GLM-4.7 by Zhipu AI is a flagship 358B MoE model featuring a 200K context window, elite 73.8% SWE-bench performance, and native Deep Thinking for agentic...

200K context
$0.60/$2.20/1M
moonshot

Kimi K2.7 Code

Moonshot

Kimi K2.7 Code is a 1T parameter MoE model from Moonshot AI. It features a 262k context window and 30% more efficient reasoning for software engineering.

262K context
$0.95/$4.00/1M
alibaba

Qwen3-Coder-Next

alibaba

Qwen3-Coder-Next is Alibaba Cloud's elite Apache 2.0 coding model, featuring an 80B MoE architecture and 256k context window for advanced local development.

262K context
$0.12/$0.75/1M
openai

GPT-4o mini

OpenAI

OpenAI's most cost-efficient small model, GPT-4o mini offers multimodal intelligence and high-speed performance at a significantly lower price point.

128K context
$0.15/$0.60/1M

Perguntas Frequentes Sobre DeepSeek-V4-Flash

Encontre respostas para perguntas comuns sobre DeepSeek-V4-Flash