deepseek

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash ofrece 1M de contexto, visión nativa y inference de 400 tok/s a $0.15 por millón de input tokens en una arquitectura MoE asimétrica.

Open WeightsMoEMultimodal VisionCode GenerationReasoning
deepseek logodeepseekDeepSeek V42026-09-10
Contexto
1Mtokens
Salida máx.
384Ktokens
Precio entrada
$0.15/ 1M
Precio salida
$0.60/ 1M
Modalidad:TextImage
Capacidades:VisiónHerramientasStreamingRazonamiento
Benchmarks
GPQA
90.9%
GPQA: Q&A Científico Nivel Posgrado. Un riguroso benchmark con 448 preguntas de opción múltiple en biología, física y química creadas por expertos. Los doctores solo logran 65-74% de precisión, mientras que los no expertos obtienen solo 34% incluso con acceso ilimitado a internet (por eso 'a prueba de Google'). DeepSeek V4.1 Flash obtuvo 90.9% en este benchmark.
HLE
36.8%
HLE: Razonamiento de Alto Nivel de Experticia. Evalúa la capacidad de un modelo para demostrar razonamiento a nivel experto en dominios especializados. Evalúa la comprensión profunda de temas complejos que requieren conocimiento profesional. DeepSeek V4.1 Flash obtuvo 36.8% en este benchmark.
MMLU
91%
MMLU: Comprensión Masiva Multitarea del Lenguaje. Un benchmark completo con 16,000 preguntas de opción múltiple en 57 materias académicas incluyendo matemáticas, filosofía, derecho y medicina. Evalúa conocimiento amplio y capacidades de razonamiento. DeepSeek V4.1 Flash obtuvo 91% en este benchmark.
MMLU Pro
81.2%
MMLU Pro: MMLU Edición Profesional. Una versión mejorada de MMLU con 12,032 preguntas usando un formato más difícil de 10 opciones. Cubre Matemáticas, Física, Química, Derecho, Ingeniería, Economía, Salud, Psicología, Negocios, Biología, Filosofía e Informática. DeepSeek V4.1 Flash obtuvo 81.2% en este benchmark.
SimpleQA
49%
SimpleQA: Benchmark de Precisión Factual. Evalúa la capacidad de un modelo para proporcionar respuestas precisas y factuales a preguntas directas. Mide la fiabilidad y reduce las alucinaciones en tareas de recuperación de conocimiento. DeepSeek V4.1 Flash obtuvo 49% en este benchmark.
IFEval
89.5%
IFEval: Evaluación de Seguimiento de Instrucciones. Mide qué tan bien un modelo sigue instrucciones y restricciones específicas. Evalúa la capacidad de adherirse a reglas de formato, límites de longitud y otros requisitos explícitos. DeepSeek V4.1 Flash obtuvo 89.5% en este benchmark.
AIME 2025
87.5%
AIME 2025: Examen de Matemáticas Invitacional Americano. Problemas de matemáticas a nivel de competencia del prestigioso examen AIME diseñado para estudiantes talentosos de secundaria. Evalúa resolución avanzada de problemas matemáticos que requiere razonamiento abstracto. DeepSeek V4.1 Flash obtuvo 87.5% en este benchmark.
MATH
88.5%
MATH: Resolución de Problemas Matemáticos. Un benchmark completo de matemáticas que evalúa la resolución de problemas en álgebra, geometría, cálculo y otros dominios matemáticos. Requiere razonamiento en múltiples pasos y conocimiento matemático formal. DeepSeek V4.1 Flash obtuvo 88.5% en este benchmark.
GSM8k
96.8%
GSM8k: Matemáticas de Primaria 8K. 8,500 problemas de matemáticas de nivel primaria que requieren razonamiento en múltiples pasos. Evalúa aritmética básica y pensamiento lógico a través de escenarios cotidianos. DeepSeek V4.1 Flash obtuvo 96.8% en este benchmark.
MGSM
92%
MGSM: Matemáticas de Primaria Multilingüe. El benchmark GSM8k traducido a 10 idiomas incluyendo español, francés, alemán, ruso, chino y japonés. Evalúa el razonamiento matemático en diferentes idiomas. DeepSeek V4.1 Flash obtuvo 92% en este benchmark.
MathVista
72.5%
MathVista: Razonamiento Visual Matemático. Evalúa la capacidad de resolver problemas matemáticos que involucran elementos visuales como gráficos, diagramas de geometría y figuras científicas. Combina comprensión visual con razonamiento matemático. DeepSeek V4.1 Flash obtuvo 72.5% en este benchmark.
SWE-Bench
74.2%
SWE-Bench: Benchmark de Ingeniería de Software. Los modelos de IA intentan resolver issues reales de GitHub en proyectos Python de código abierto con verificación humana. Evalúa habilidades prácticas de ingeniería de software. Los mejores modelos pasaron de 4.4% (2023) a más del 70% (2024). DeepSeek V4.1 Flash obtuvo 74.2% en este benchmark.
HumanEval
92.5%
HumanEval: Problemas de Programación Python. 164 problemas de programación escritos a mano donde los modelos deben generar implementaciones correctas de funciones Python. Cada solución se verifica con tests unitarios. Los mejores modelos ahora logran más del 90%. DeepSeek V4.1 Flash obtuvo 92.5% en este benchmark.
LiveCodeBench
73.3%
LiveCodeBench: Benchmark de Codificación en Vivo. Evalúa habilidades de codificación con desafíos de programación del mundo real continuamente actualizados. A diferencia de benchmarks estáticos, usa problemas frescos para prevenir contaminación de datos. DeepSeek V4.1 Flash obtuvo 73.3% en este benchmark.
MMMU
78.9%
MMMU: Comprensión Multimodal. Benchmark de Comprensión Multimodal Multidisciplinaria Masiva que evalúa modelos de visión-lenguaje en problemas universitarios en 30 materias que requieren tanto comprensión de imágenes como conocimiento experto. DeepSeek V4.1 Flash obtuvo 78.9% en este benchmark.
MMMU Pro
58.4%
MMMU Pro: MMMU Edición Profesional. Versión mejorada de MMMU con preguntas más desafiantes y evaluación más estricta. Evalúa razonamiento multimodal avanzado a niveles profesional y experto. DeepSeek V4.1 Flash obtuvo 58.4% en este benchmark.
ChartQA
88%
ChartQA: Respuesta a Preguntas sobre Gráficos. Evalúa la capacidad de comprender y razonar sobre información presentada en gráficos y diagramas. Requiere extracción de datos, comparación de valores y cálculos desde representaciones visuales. DeepSeek V4.1 Flash obtuvo 88% en este benchmark.
DocVQA
93%
DocVQA: Q&A Visual de Documentos. Benchmark de Respuesta a Preguntas Visuales de Documentos que evalúa la capacidad de extraer y razonar sobre información de imágenes de documentos incluyendo formularios, reportes y texto escaneado. DeepSeek V4.1 Flash obtuvo 93% en este benchmark.
Terminal-Bench
90.6%
Terminal-Bench: Tareas de Terminal/CLI. Evalúa la capacidad de realizar operaciones de línea de comandos, escribir scripts de shell y navegar en entornos de terminal. Mide habilidades prácticas de administración de sistemas y flujos de trabajo de desarrollo. DeepSeek V4.1 Flash obtuvo 90.6% en este benchmark.
ARC-AGI
11.4%
ARC-AGI: Abstracción y Razonamiento. Corpus de Abstracción y Razonamiento para AGI - evalúa inteligencia fluida a través de puzzles de reconocimiento de patrones novedosos. Cada tarea requiere descubrir la regla subyacente a partir de ejemplos, midiendo capacidad de razonamiento general en lugar de memorización. DeepSeek V4.1 Flash obtuvo 11.4% en este benchmark.

Acerca de DeepSeek V4.1 Flash

Conoce las capacidades, características y formas de uso de DeepSeek V4.1 Flash.

DeepSeek V4.1 Flash es un modelo mixture-of-experts de pesos abiertos que contiene 552 mil millones de parámetros totales. El modelo introduce una estructura asimétrica de codificador-decodificador causal diseñada para minimizar los costos de inference durante cargas de trabajo de alto rendimiento. Al procesar los prompts entrantes, la red activa solo 8 mil millones de parámetros, aumentando a 16 mil millones durante la generación de tokens. El núcleo subyacente incorpora caché de clave-valor comprimida compartida entre capas, un indexador disperso de dos etapas y una memoria de búsqueda Engram de 196 mil millones de parámetros, todo entrenado en un corpus de 45 billones de tokens.

A diferencia de las iteraciones anteriores de la familia V4, la comprensión visual nativa viene de serie sin necesidad de un checkpoint de visión separado. El modelo acepta imágenes directamente dentro de los prompts de texto estándar y evalúa artefactos visuales como gráficos arquitectónicos, diseños de UI y diagramas técnicos. En paralelo, el modo de pensamiento opera de forma nativa, generando trazos de reasoning explícitos antes de producir respuestas definitivas. El modelo opera a velocidades de generación entre 300 y 427 tokens por segundo en clústeres de aceleradores modernos, igualando o superando el perfil de latencia de modelos densos mucho más pequeños mientras conserva capacidades de reasoning a nivel de doctorado.

DeepSeek posicionó a V4.1 Flash como un reemplazo directo del buque insignia más grande V4 Pro. En evaluaciones de terceros que abarcan generación de frontend, operaciones de terminal y depuración de software, V4.1 Flash cumplió o superó la precisión de V4 Pro mientras operaba a menor latencia y gasto computacional. El modelo sirve para entornos agentic de alto volumen, herramientas de terminal automatizadas y flujos de trabajo de síntesis de código continuo donde los precios de las API flagship suelen ser prohibitivos.

DeepSeek V4.1 Flash

Casos de uso de DeepSeek V4.1 Flash

Descubre las diferentes formas de usar DeepSeek V4.1 Flash para lograr excelentes resultados.

Operaciones autónomas de terminal y shell

Ejecuta diagnósticos del sistema, ejecuta herramientas de compilación y resuelve errores de entorno dentro de sistemas en contenedores, logrando una puntuación de 90.6 en Terminal-Bench 2.1.

Prototipado full-stack de UI y frontend

Genera aplicaciones interactivas de una sola página, shaders de WebGL, entornos 3D de Three.js y diseños de paneles responsivos a partir de prompts de texto o imágenes de una sola ejecución.

Depuración compleja de código multiarchivo

Analiza proyectos de software con múltiples repositorios dentro de su contexto window de 1 millón de tokens, rastrea importaciones entre archivos y corrige lógica invertida o condiciones de carrera.

Extracción automatizada de documentos visuales

Inspecciona planos arquitectónicos complejos, diagramas de flujo de datos y maquetas de interfaces de usuario para generar esquemas JSON estructurados y contratos de API ejecutables.

Llamada a herramientas agentic de alto rendimiento

Ejecuta bucles continuos de reasoning en segundo plano que consultan endpoints REST en vivo, consultan bases de datos SQL y verifican cambios de estado invariantes a lo largo de múltiples turnos de ejecución.

Traducción multilingüe y análisis de dialectos

Traduce modismos, jerga regional y documentación técnica en dialectos de bajos recursos, señalando traducciones dudosas en lugar de alucinar términos.

Fortalezas

Limitaciones

Eficiencia MoE asimétrica: Activa solo 8B parámetros en el input y 16B en el output de un total de 552B, manteniendo el precio de input fuera de hora punta en $0.15 por millón de tokens.
Exceso de razonamiento en la lógica: Dedica un número excesivo de tokens de reasoning a prompts de código sencillos si el esfuerzo de pensamiento se deja sin restricciones por parte del usuario.
Rendimiento agentic de state-of-the-art: Alcanza un 90.6% en Terminal-Bench 2.1 y un 74.2% en DeepSWE v1.1, igualando o superando a las opciones propietarios flagship en tareas de ingeniería.
Imprecisión en física cinemática: Produce anomalías ocasionales en las rutas de movimiento y una física cuestionable al generar animaciones cinemáticas 3D complejas en pruebas de Three.js.
Generación de alto rendimiento: Ofrece velocidades de decodificación verificadas entre 300 y 427 tokens por segundo, reduciendo drásticamente los tiempos de respuesta para agentes con alta carga de reasoning.
Limitaciones estéticas de la UI: Se queda atrás de los modelos flagship propietarios en tipografía y espaciado sofisticados, produciendo jerarquías de paneles funcionales pero visualmente genéricas.
Contexto multimodal unificado: Ingiere tokens visuales y de texto de forma nativa dentro de un contexto window de 1,000,000 tokens sin la sobrecarga de adaptadores de visión secundarios.
Requisitos de memoria local prohibitivos: Requiere configuraciones de clúster multi-GPU especializadas para adaptarse a la enorme huella de memoria de 552B parámetros para un alojamiento local de precisión completa.

Inicio rápido de API

deepseek/deepseek-v4.1-flash

Ver documentación
deepseek SDK
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

async function main() {
  const completion = await client.chat.completions.create({
    model: "deepseek-flash",
    messages: [
      { role: "system", content: "You are an expert systems engineer." },
      { role: "user", content: "Write a high-performance WebGL compute shader." },
    ],
  });

  console.log(completion.choices[0].message.content);
}

main();

Instala el SDK y comienza a hacer llamadas API en minutos.

Lo que la gente dice sobre DeepSeek V4.1 Flash

Mira lo que la comunidad piensa sobre DeepSeek V4.1 Flash

Alcanzó el 98% de la puntuación de GPT-6 Astra al 1.4% del costo en tareas de diseño cotidianas basadas en solicitudes de usuario. Todos los modelos excepto Astra obtuvieron puntuaciones más bajas Y costaron más.
OpenDesign (@OpenDesignHQ)
twitter
Deepseek V4.1 Flash 552B total, 8/16B activos con una nueva arquitectura entrenada en 45T tokens... esta es probablemente la arquitectura más novedosa que he visto en mucho tiempo, bastante loca.
Elie Bakouch (@eliebakouch)
twitter
La velocidad importa mucho más de lo que la gente piensa; la verdad, preferiría un modelo ligeramente peor que sea 2 veces más rápido para la mayoría de los casos de uso de productos.
MoneyLovesSpeed
hackernews
En un momento dado, alcanzó un pico de unos demenciales 427 tokens por segundo. Pero lo más loco de todo esto es que toda la ejecución supuestamente costó solo 30 centavos.
WorldofAI
youtube
El hecho de que las consultas de V4 Pro se redirijan automáticamente a V4.1 Flash te dice todo sobre lo buena que es en realidad esta arquitectura.
KevDev99
reddit
Terminal-Bench en 90.6 es una locura para un modelo en este rango de precios. Las herramientas agentic acaban de volverse radicalmente más baratas.
SysAdminHero
reddit

Videos sobre DeepSeek V4.1 Flash

Mira tutoriales, reseñas y discusiones sobre DeepSeek V4.1 Flash

Este nuevo modelo DeepSeek versión 4.1 flash es ridículamente rápido. Obtienes unos 400 tokens por segundo, y la velocidad es, sinceramente, una locura.

Para un modelo de razonamiento con este nivel de capacidad, ese tipo de velocidad es seriamente impresionante, especialmente considerando que esto es solo una compilación de prueba temporal.

En un momento dado, alcanzó un pico de unos demenciales 427 tokens por segundo. Pero lo más loco de todo esto es que toda la ejecución supuestamente costó solo 30 centavos.

Las pruebas en el mundo real registran entre 300 y más de 400 tokens por segundo, alcanzando el 98% de la puntuación del benchmark de diseño de GPT-6 Astra.

No está generando código, en realidad está verificando sus propias matemáticas. Incluso detectó por sí mismo un sutil error de control de órbita.

pesos y una vez que se lance en la versión terminada lo revisaremos. Nuevamente, si quieres ayudar al canal, por favor hazte miembro. Gracias

Para ejecutar toda la suite de pruebas de Artificial Analysis, cuesta $72 con este modelo. Eso es 10 veces más barato que los modelos con las mismas puntuaciones de inteligencia.

DeepSeek V4 Flash es en realidad el más barato de todos los modelos, y GPT 5.6 Luna, que cuesta lo mismo, está de hecho dos puntos por detrás en el índice de inteligencia.

Sin duda estoy disfrutando de esta tendencia de los laboratorios chinos que llegan y reducen los precios de los laboratorios estadounidenses, igualando también su inteligencia.

Mas que solo prompts

Potencia tu flujo de trabajo con Automatizacion IA

Automatio combina el poder de agentes de IA, automatizacion web e integraciones inteligentes para ayudarte a lograr mas en menos tiempo.

Agentes de IA
Automatización Web
Flujos Inteligentes

Consejos Pro para DeepSeek V4.1 Flash

Consejos de expertos para ayudarte a sacar el máximo provecho de DeepSeek V4.1 Flash.

Gestiona el esfuerzo de razonamiento

Configura el esfuerzo de razonamiento en low para la generación de CRUD simple y en high o max al resolver matemáticas de varios pasos o errores complejos en bases de código para optimizar el uso de tokens.

Maximiza el prompt caching

Agrupa los system prompts consecutivos y las referencias de archivos estáticos al principio del contexto window para maximizar los aciertos de caché de prompts a la tarifa de hora baja de $0.003/M.

Entrada multimodal directa

Proporciona imágenes sin procesar y maquetas visuales directamente junto con los requisitos de CSS en lugar de transcribir manualmente las especificaciones de diseño para una mejor precisión espacial.

Usa los strings de modelo oficiales

Usa el string de modelo oficial deepseek-flash en las solicitudes de API para garantizar el enrutamiento automático al último checkpoint activo y la tarifa más eficiente.

Testimonios

Lo Que Dicen Nuestros Usuarios

Unete a miles de usuarios satisfechos que han transformado su flujo de trabajo

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Relacionados AI Models

moonshot

Kimi k2.6

Moonshot

Kimi k2.6 is Moonshot AI's 1T-parameter MoE model featuring a 256K context window, native video input, and elite performance in autonomous agentic coding.

256K context
$0.95/$4.00/1M
anthropic

Claude Opus 4.6

Anthropic

Claude Opus 4.6 is Anthropic's flagship model featuring a 1M token context window, Adaptive Thinking, and world-class coding and reasoning performance.

1M context
$5.00/$25.00/1M
google

Gemini 3 Flash

Google

Gemini 3 Flash is Google's high-speed multimodal model featuring a 1M token context window, elite 90.4% GPQA reasoning, and autonomous browser automation tools.

1M context
$0.50/$3.00/1M
deepseek

DeepSeek v4

DeepSeek

DeepSeek v4 is a 1.6T parameter MoE model featuring a 1M token context window and native multimodal support for text, vision, and video at disruptive prices.

1M context
$1.74/$3.48/1M
anthropic

Claude Sonnet 4.6

Anthropic

Claude Sonnet 4.6 offers frontier performance for coding and computer use with a massive 1M token context window for only $3/1M tokens.

1M context
$3.00/$15.00/1M
google

Gemini 3 Pro

Google

Google's Gemini 3 Pro is a multimodal powerhouse featuring a 1M token context window, native video processing, and industry-leading reasoning performance.

1M context
$2.00/$12.00/1M
alibaba

Qwen 3.7 Max

alibaba

Qwen 3.7 Max is Alibaba’s flagship AI model for deep reasoning and autonomous agent tasks, featuring a 256k context window and top-tier coding performance.

256K context
$1.20/$6.00/1M
openai

GPT-5.2 Pro

OpenAI

GPT-5.2 Pro is OpenAI's 2025 flagship reasoning model featuring Extended Thinking for SOTA performance in mathematics, coding, and expert knowledge work.

400K context
$21.00/$168.00/1M

Preguntas Frecuentes Sobre DeepSeek V4.1 Flash

Encuentra respuestas a preguntas comunes sobre DeepSeek V4.1 Flash