deepseek

DeepSeek-V4-Flash

DeepSeek-V4-Flash es un modelo de IA open-weight con 1M de contexto que obtiene 54.4% en SWE-bench a $0.14 por 1M de tokens, optimizado para programación...

Open WeightsAgentic CodingMoE Architecture1M Context WindowLow Cost
deepseek logodeepseekDeepSeek V42026-07-31
Contexto
1.0Mtokens
Salida máx.
8Ktokens
Precio entrada
$0.14/ 1M
Precio salida
$0.28/ 1M
Modalidad:TextImage
Capacidades:VisiónHerramientasStreamingRazonamiento
Benchmarks
GPQA
53.6%
GPQA: Q&A Científico Nivel Posgrado. Un riguroso benchmark con 448 preguntas de opción múltiple en biología, física y química creadas por expertos. Los doctores solo logran 65-74% de precisión, mientras que los no expertos obtienen solo 34% incluso con acceso ilimitado a internet (por eso 'a prueba de Google'). DeepSeek-V4-Flash obtuvo 53.6% en este benchmark.
HLE
25.2%
HLE: Razonamiento de Alto Nivel de Experticia. Evalúa la capacidad de un modelo para demostrar razonamiento a nivel experto en dominios especializados. Evalúa la comprensión profunda de temas complejos que requieren conocimiento profesional. DeepSeek-V4-Flash obtuvo 25.2% en este benchmark.
MMLU
88.7%
MMLU: Comprensión Masiva Multitarea del Lenguaje. Un benchmark completo con 16,000 preguntas de opción múltiple en 57 materias académicas incluyendo matemáticas, filosofía, derecho y medicina. Evalúa conocimiento amplio y capacidades de razonamiento. DeepSeek-V4-Flash obtuvo 88.7% en este benchmark.
MMLU Pro
72.6%
MMLU Pro: MMLU Edición Profesional. Una versión mejorada de MMLU con 12,032 preguntas usando un formato más difícil de 10 opciones. Cubre Matemáticas, Física, Química, Derecho, Ingeniería, Economía, Salud, Psicología, Negocios, Biología, Filosofía e Informática. DeepSeek-V4-Flash obtuvo 72.6% en este benchmark.
SimpleQA
38.2%
SimpleQA: Benchmark de Precisión Factual. Evalúa la capacidad de un modelo para proporcionar respuestas precisas y factuales a preguntas directas. Mide la fiabilidad y reduce las alucinaciones en tareas de recuperación de conocimiento. DeepSeek-V4-Flash obtuvo 38.2% en este benchmark.
IFEval
88%
IFEval: Evaluación de Seguimiento de Instrucciones. Mide qué tan bien un modelo sigue instrucciones y restricciones específicas. Evalúa la capacidad de adherirse a reglas de formato, límites de longitud y otros requisitos explícitos. DeepSeek-V4-Flash obtuvo 88% en este benchmark.
AIME 2025
93.1%
AIME 2025: Examen de Matemáticas Invitacional Americano. Problemas de matemáticas a nivel de competencia del prestigioso examen AIME diseñado para estudiantes talentosos de secundaria. Evalúa resolución avanzada de problemas matemáticos que requiere razonamiento abstracto. DeepSeek-V4-Flash obtuvo 93.1% en este benchmark.
MATH
76.6%
MATH: Resolución de Problemas Matemáticos. Un benchmark completo de matemáticas que evalúa la resolución de problemas en álgebra, geometría, cálculo y otros dominios matemáticos. Requiere razonamiento en múltiples pasos y conocimiento matemático formal. DeepSeek-V4-Flash obtuvo 76.6% en este benchmark.
GSM8k
96%
GSM8k: Matemáticas de Primaria 8K. 8,500 problemas de matemáticas de nivel primaria que requieren razonamiento en múltiples pasos. Evalúa aritmética básica y pensamiento lógico a través de escenarios cotidianos. DeepSeek-V4-Flash obtuvo 96% en este benchmark.
MGSM
90.5%
MGSM: Matemáticas de Primaria Multilingüe. El benchmark GSM8k traducido a 10 idiomas incluyendo español, francés, alemán, ruso, chino y japonés. Evalúa el razonamiento matemático en diferentes idiomas. DeepSeek-V4-Flash obtuvo 90.5% en este benchmark.
MathVista
63.8%
MathVista: Razonamiento Visual Matemático. Evalúa la capacidad de resolver problemas matemáticos que involucran elementos visuales como gráficos, diagramas de geometría y figuras científicas. Combina comprensión visual con razonamiento matemático. DeepSeek-V4-Flash obtuvo 63.8% en este benchmark.
SWE-Bench
54.4%
SWE-Bench: Benchmark de Ingeniería de Software. Los modelos de IA intentan resolver issues reales de GitHub en proyectos Python de código abierto con verificación humana. Evalúa habilidades prácticas de ingeniería de software. Los mejores modelos pasaron de 4.4% (2023) a más del 70% (2024). DeepSeek-V4-Flash obtuvo 54.4% en este benchmark.
HumanEval
90.2%
HumanEval: Problemas de Programación Python. 164 problemas de programación escritos a mano donde los modelos deben generar implementaciones correctas de funciones Python. Cada solución se verifica con tests unitarios. Los mejores modelos ahora logran más del 90%. DeepSeek-V4-Flash obtuvo 90.2% en este benchmark.
LiveCodeBench
33%
LiveCodeBench: Benchmark de Codificación en Vivo. Evalúa habilidades de codificación con desafíos de programación del mundo real continuamente actualizados. A diferencia de benchmarks estáticos, usa problemas frescos para prevenir contaminación de datos. DeepSeek-V4-Flash obtuvo 33% en este benchmark.
MMMU
69.1%
MMMU: Comprensión Multimodal. Benchmark de Comprensión Multimodal Multidisciplinaria Masiva que evalúa modelos de visión-lenguaje en problemas universitarios en 30 materias que requieren tanto comprensión de imágenes como conocimiento experto. DeepSeek-V4-Flash obtuvo 69.1% en este benchmark.
MMMU Pro
54%
MMMU Pro: MMMU Edición Profesional. Versión mejorada de MMMU con preguntas más desafiantes y evaluación más estricta. Evalúa razonamiento multimodal avanzado a niveles profesional y experto. DeepSeek-V4-Flash obtuvo 54% en este benchmark.
ChartQA
85.7%
ChartQA: Respuesta a Preguntas sobre Gráficos. Evalúa la capacidad de comprender y razonar sobre información presentada en gráficos y diagramas. Requiere extracción de datos, comparación de valores y cálculos desde representaciones visuales. DeepSeek-V4-Flash obtuvo 85.7% en este benchmark.
DocVQA
92.8%
DocVQA: Q&A Visual de Documentos. Benchmark de Respuesta a Preguntas Visuales de Documentos que evalúa la capacidad de extraer y razonar sobre información de imágenes de documentos incluyendo formularios, reportes y texto escaneado. DeepSeek-V4-Flash obtuvo 92.8% en este benchmark.
Terminal-Bench
82.7%
Terminal-Bench: Tareas de Terminal/CLI. Evalúa la capacidad de realizar operaciones de línea de comandos, escribir scripts de shell y navegar en entornos de terminal. Mide habilidades prácticas de administración de sistemas y flujos de trabajo de desarrollo. DeepSeek-V4-Flash obtuvo 82.7% en este benchmark.
ARC-AGI
7%
ARC-AGI: Abstracción y Razonamiento. Corpus de Abstracción y Razonamiento para AGI - evalúa inteligencia fluida a través de puzzles de reconocimiento de patrones novedosos. Cada tarea requiere descubrir la regla subyacente a partir de ejemplos, midiendo capacidad de razonamiento general en lugar de memorización. DeepSeek-V4-Flash obtuvo 7% en este benchmark.

Acerca de DeepSeek-V4-Flash

Conoce las capacidades, características y formas de uso de DeepSeek-V4-Flash.

DeepSeek-V4-Flash es un language model open-weight basado en Mixture of Experts (MoE) diseñado para ingeniería de software y tareas de razonamiento en múltiples pasos. Contiene 284 mil millones de parámetros totales con 13 mil millones de active parameters por token durante la inference. El modelo utiliza una context window nativa de 1,048,576 tokens, lo que permite a los desarrolladores procesar repositorios de código enteros o documentos técnicos extensos en una sola solicitud.

La actualización del 31 de julio de 2026 mantiene la arquitectura del modelo de previsualización inicial al tiempo que aplica un post-entrenamiento centrado en el comportamiento agéntico. Este re-post-entrenamiento mejoró su puntuación en Terminal-Bench 2.1 de 61.8 a 82.7 y aumentó su resultado en SWE-bench al 54.4%. El modelo admite niveles variables de reasoning effort y una integración nativa con la API de respuestas para transmitir comentarios intermedios junto con los outputs finales.

Los desarrolladores pueden acceder al modelo a través de la API compatible con OpenAI de DeepSeek o ejecutar open weights localmente en configuraciones de hardware con 128GB a 192GB de memoria unificada. El precio estándar de la API es de $0.14 por cada 1 millón de input tokens y $0.28 por cada 1 millón de output tokens, y las coincidencias de caché de entrada reducen el coste a $0.03 por millón de tokens.

DeepSeek-V4-Flash

Casos de uso de DeepSeek-V4-Flash

Descubre las diferentes formas de usar DeepSeek-V4-Flash para lograr excelentes resultados.

Programación agéntica autónoma

Ejecución de modificaciones de archivos y terminal en varios pasos utilizando Codex CLI o entornos Cline para corregir incidencias de GitHub y automatizar la creación de tests.

Despliegue de IA local

Alojamiento del modelo completo en estaciones de trabajo equipadas con 128GB de memoria unificada o cuatro GPUs utilizando cuantizaciones de 4 bits.

Refactorización de repositorios a gran escala

Ingesta de hasta 1 millón de tokens de contexto de bases de código para mapear dependencias y ejecutar actualizaciones arquitectónicas en múltiples módulos.

Generación web interactiva en 3D y front-end

Creación de aplicaciones web de un solo archivo, entornos 3D de Three.js y diagramas SVG complejos directamente a partir de las especificaciones del prompt.

Procesamiento de datos de alto volumen

Procesamiento de registros de texto extensos y documentos estructurados utilizando context caching para reducir los costes de la API a $0.03 por millón de tokens.

Automatización de terminal en múltiples pasos

Ejecución de comandos de shell y pipelines de scripts donde el modelo utiliza un razonamiento interno para manejar errores de comandos inesperados.

Fortalezas

Limitaciones

Alto rendimiento en SWE-bench: Obtiene una puntuación de 54.4% en SWE-bench Verified, superando a muchos modelos closed-source más grandes en la resolución de problemas reales de GitHub.
Recargos de precios variables: Los costes de los tokens de la API se duplican durante las horas de mayor uso, lo que aumenta los gastos para las aplicaciones en tiempo real.
Eficiencia de costes en la API: Con un precio de $0.14 por 1M de input tokens y $0.28 por 1M de output tokens, ofrece un menor coste por tarea que los modelos de la competencia.
Alto consumo de memoria para ejecución local: El alojamiento local requiere al menos 128GB de VRAM o memoria de sistema para niveles de cuantización utilizables.
Context window de 1M de tokens: Ingiere hasta 1,048,576 tokens en una sola solicitud, lo que permite el análisis de dependencias y la refactorización de toda la base de código.
Exceso de razonamiento en tareas simples: El profundo esfuerzo de razonamiento puede causar largos retrasos en las respuestas en consultas cortas si no se limitan los parámetros de razonamiento.
Alojamiento en hardware local: Utiliza una estructura MoE con 13B de active parameters que permite la ejecución en configuraciones de memoria unificada de 128GB con cuants de 4 bits.
Inconsistencia en iteraciones de seguimiento: La calidad puede variar a lo largo de hilos de chat largos en comparación con las generaciones iniciales de prompts de un solo intento (single-shot).

Inicio rápido de API

deepseek/deepseek-v4-flash-0731

Ver documentación
deepseek SDK
import OpenAI from 'openai';

const openai = new OpenAI({
  baseURL: 'https://api.deepseek.com',
  apiKey: process.env.DEEPSEEK_API_KEY,
});

async function main() {
  const completion = await openai.chat.completions.create({
    model: 'deepseek-v4-flash',
    messages: [{ role: 'user', content: 'Write a TypeScript function to balance a binary search tree.' }],
    temperature: 1.0,
    top_p: 0.95,
  });

  console.log(completion.choices[0].message.content);
}

main();

Instala el SDK y comienza a hacer llamadas API en minutos.

Lo que la gente dice sobre DeepSeek-V4-Flash

Mira lo que la comunidad piensa sobre DeepSeek-V4-Flash

DeepSeek V4 Flash 0731 es el líder indiscutible en rendimiento-precio: ~158,000 peticiones al mes dentro del límite de $60, inteligencia de 49.9 y puntuación agéntica de 45.7.
u/WegoW
reddit
Estamos haciendo que el actualizado DeepSeek V4-Flash 0731 sea gratuito en Cline. Este es el primer modelo flash que hemos encontrado que rinde a niveles SOTA para programación autónoma.
@cline
twitter
El ajuste de 'reasoning effort' es brillante. Uso bajo para tests y máximo para la lógica real. Ahorra muchísimo tiempo en pipelines diarios.
BinaryBuilder
hackernews
DeepSeek V4 Flash 0731 probablemente debería ser el principal contendiente en este momento si te gusta la IA local.
Digital Spaceport
youtube
Los modelos que puedes ejecutar localmente ahora tienen la puntuación de inteligencia de los mejores frontier models de hace 5 meses. Esto es una absoluta locura para open weights.
u/joorklee
reddit
DeepSeek V4 Flash es ~150 veces más barato que las opciones propietarias a la vez que ofrece resultados de tareas de diseño y UX altamente competitivos.
@CommandCodeAI
twitter

Videos sobre DeepSeek-V4-Flash

Mira tutoriales, reseñas y discusiones sobre DeepSeek-V4-Flash

En SWE-bench, una medida respetada de la capacidad de ingeniería de software, la puntuación del modelo saltó de 7.3 a 54.4.

DeepSeek V4 Flash es un modelo Mixture of Experts con 284 mil millones de parámetros totales, pero solo 13 mil millones de active parameters.

Este tamaño de parámetros activos hace que sea viable ejecutar el modelo en hardware local para aficionados con 128GB de memoria unificada.

Las actualizaciones de post-entrenamiento se centran principalmente en flujos de trabajo agénticos y ejecución automatizada de comandos.

Por un precio de 14 centavos por millón de input tokens, la relación de rendimiento no tiene rival en este momento.

Se recomienda configurar al menos 384,000 tokens de tamaño de contexto, con una context window máxima de 1 millón para este modelo.

Si estás realizando trabajo agéntico, querrás ajustar tu top P a 0.95 en lugar de 1.0.

Piensa mucho y hace una gran cantidad de doble, triple y cuádruple comprobación durante el razonamiento.

DeepSeek V4 Flash 0731 probablemente debería ser el principal contendiente en este momento si te gusta la IA local.

Ejecutar la versión cuantizada localmente requiere un mínimo de 128GB a 138GB de VRAM o memoria de sistema.

Las mejoras no provienen de escalar el tamaño del modelo, sino del post-entrenamiento enfocado en mejorar el comportamiento agéntico.

En Terminal Bench 2.1, obtiene una puntuación de 82.7, lo que supone un enorme salto desde su puntuación de previsualización anterior de 61.8.

Ofrece una inteligencia cercana al nivel de Luna a un coste aproximadamente un 60% menor por tarea, lo que lo convierte en uno de los modelos con mejor rendimiento por dólar.

La integración nativa de la API de respuestas permite a los desarrolladores procesar flujos de tool output sin formato personalizado.

Maneja ediciones de repositorios de múltiples archivos con notable precisión dado su ligero active footprint.

Mas que solo prompts

Potencia tu flujo de trabajo con Automatizacion IA

Automatio combina el poder de agentes de IA, automatizacion web e integraciones inteligentes para ayudarte a lograr mas en menos tiempo.

Agentes de IA
Automatización Web
Flujos Inteligentes

Consejos Pro para DeepSeek-V4-Flash

Consejos de expertos para ayudarte a sacar el máximo provecho de DeepSeek-V4-Flash.

Calibrar Top-P para flujos de trabajo de agentes

Configura top_p en 0.95 y la temperatura en 1.0 al desplegar el modelo en entornos de programación para mejorar la estabilidad de tool execution.

Establecer un tamaño de contexto mínimo para max reasoning

Configura un búfer de contexto de al menos 384,000 tokens al utilizar el máximo esfuerzo de razonamiento para garantizar espacio para el procesamiento profundo de chain-of-thought.

Utilizar context caching

Estructura los system prompts repetidos y el contexto del código para aprovechar las capas de caché de la API, reduciendo los costes de input de $0.14 a $0.03 por millón de tokens.

Usar ventanas de procesamiento fuera de hora pico

Programa trabajos por lotes (batch) de la API masivos durante horas de menor tráfico, ya que los precios de la API se duplican en periodos de alto tráfico.

Testimonios

Lo Que Dicen Nuestros Usuarios

Unete a miles de usuarios satisfechos que han transformado su flujo de trabajo

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Relacionados AI Models

other

MiMo V2.5 Pro

Other

MiMo V2.5 Pro is Xiaomi's open-source 1.02T parameter MoE model featuring a 1M context window, native multimodality, and elite agentic coding performance.

1M context
$1.00/$3.00/1M
deepseek

DeepSeek-V3.2-Speciale

DeepSeek

DeepSeek-V3.2-Speciale is a reasoning-first LLM featuring gold-medal math performance, DeepSeek Sparse Attention, and a 131K context window. Rivaling GPT-5...

131K context
$0.28/$0.42/1M
minimax

MiniMax M2.5

minimax

MiniMax M2.5 is a SOTA MoE model featuring a 1M context window and elite agentic coding capabilities at disruptive pricing for autonomous agents.

1M context
$0.15/$1.20/1M
google

Gemini 3.6 Flash

Google

Gemini 3.6 Flash is Google's high-speed model featuring a 17% reduction in token consumption, $1.50/M input pricing, and advanced 3D visualization.

1M context
$1.50/$7.50/1M
zhipu

GLM-4.7

Zhipu (GLM)

GLM-4.7 by Zhipu AI is a flagship 358B MoE model featuring a 200K context window, elite 73.8% SWE-bench performance, and native Deep Thinking for agentic...

200K context
$0.60/$2.20/1M
moonshot

Kimi K2.7 Code

Moonshot

Kimi K2.7 Code is a 1T parameter MoE model from Moonshot AI. It features a 262k context window and 30% more efficient reasoning for software engineering.

262K context
$0.95/$4.00/1M
alibaba

Qwen3-Coder-Next

alibaba

Qwen3-Coder-Next is Alibaba Cloud's elite Apache 2.0 coding model, featuring an 80B MoE architecture and 256k context window for advanced local development.

262K context
$0.12/$0.75/1M
openai

GPT-4o mini

OpenAI

OpenAI's most cost-efficient small model, GPT-4o mini offers multimodal intelligence and high-speed performance at a significantly lower price point.

128K context
$0.15/$0.60/1M

Preguntas Frecuentes Sobre DeepSeek-V4-Flash

Encuentra respuestas a preguntas comunes sobre DeepSeek-V4-Flash