openai

GPT-5.3 Codex

GPT-5.3 Codex è il frontier model di OpenAI per il coding del 2026, dotato di un context window di 400K, un punteggio del 77,3% su Terminal-Bench e una logica...

Coding AgentGPT-5OpenAIIngegneria del SoftwareAI Autonoma
openai logoopenaiGPT5 febbraio 2026
Contesto
400Ktoken
Output max
128Ktoken
Prezzo input
$1.75/ 1M
Prezzo output
$14.00/ 1M
Modalita:TextImageAudioVideo
Capacita:VisioneStrumentiStreamingRagionamento
Benchmark
GPQA
81%
GPQA: Domande scientifiche livello laurea. Un benchmark rigoroso con 448 domande su biologia, fisica e chimica. Gli esperti PhD raggiungono solo il 65-74% di accuratezza. GPT-5.3 Codex ha ottenuto 81% in questo benchmark.
HLE
36%
HLE: Ragionamento esperto di alto livello. Testa la capacita di un modello di dimostrare ragionamento a livello esperto in domini specializzati. GPT-5.3 Codex ha ottenuto 36% in questo benchmark.
MMLU
93%
MMLU: Comprensione linguistica multitask massiva. Un benchmark completo con 16.000 domande su 57 materie accademiche. GPT-5.3 Codex ha ottenuto 93% in questo benchmark.
MMLU Pro
83%
MMLU Pro: MMLU Edizione Professionale. Una versione migliorata di MMLU con 12.032 domande e un formato piu difficile a 10 opzioni. GPT-5.3 Codex ha ottenuto 83% in questo benchmark.
SimpleQA
58%
SimpleQA: Benchmark di accuratezza fattuale. Testa la capacita di un modello di fornire risposte accurate e fattuali. GPT-5.3 Codex ha ottenuto 58% in questo benchmark.
IFEval
94%
IFEval: Valutazione del seguire istruzioni. Misura quanto bene un modello segue istruzioni e vincoli specifici. GPT-5.3 Codex ha ottenuto 94% in questo benchmark.
AIME 2025
94%
AIME 2025: Esame di matematica invitazionale americano. Problemi matematici a livello competitivo dal prestigioso esame AIME. GPT-5.3 Codex ha ottenuto 94% in questo benchmark.
MATH
96%
MATH: Risoluzione di problemi matematici. Un benchmark matematico completo che testa la risoluzione di problemi in algebra, geometria, calcolo. GPT-5.3 Codex ha ottenuto 96% in questo benchmark.
GSM8k
99%
GSM8k: Matematica scuola elementare 8K. 8.500 problemi matematici a parole di livello scuola elementare. GPT-5.3 Codex ha ottenuto 99% in questo benchmark.
MGSM
96%
MGSM: Matematica multilingue scuola elementare. Il benchmark GSM8k tradotto in 10 lingue. GPT-5.3 Codex ha ottenuto 96% in questo benchmark.
MathVista
78%
MathVista: Ragionamento visivo matematico. Testa la capacita di risolvere problemi matematici con elementi visivi. GPT-5.3 Codex ha ottenuto 78% in questo benchmark.
SWE-Bench
57%
SWE-Bench: Benchmark ingegneria software. I modelli AI tentano di risolvere veri problemi GitHub in progetti Python. GPT-5.3 Codex ha ottenuto 57% in questo benchmark.
HumanEval
93%
HumanEval: Problemi di programmazione Python. 164 problemi di programmazione dove i modelli devono generare implementazioni corrette di funzioni Python. GPT-5.3 Codex ha ottenuto 93% in questo benchmark.
LiveCodeBench
71%
LiveCodeBench: Benchmark di codifica live. Testa le capacita di codifica su sfide di programmazione reali continuamente aggiornate. GPT-5.3 Codex ha ottenuto 71% in questo benchmark.
MMMU
84%
MMMU: Comprensione multimodale. Benchmark di comprensione multimodale su 30 materie universitarie. GPT-5.3 Codex ha ottenuto 84% in questo benchmark.
MMMU Pro
64%
MMMU Pro: MMMU Edizione Professionale. Versione migliorata di MMMU con domande piu impegnative. GPT-5.3 Codex ha ottenuto 64% in questo benchmark.
ChartQA
91%
ChartQA: Domande e risposte su grafici. Testa la capacita di comprendere e analizzare informazioni da grafici e diagrammi. GPT-5.3 Codex ha ottenuto 91% in questo benchmark.
DocVQA
95%
DocVQA: Domande visive su documenti. Testa la capacita di estrarre informazioni da immagini di documenti. GPT-5.3 Codex ha ottenuto 95% in questo benchmark.
Terminal-Bench
77.3%
Terminal-Bench: Attivita terminale/CLI. Testa la capacita di eseguire operazioni da linea di comando. GPT-5.3 Codex ha ottenuto 77.3% in questo benchmark.
ARC-AGI
54%
ARC-AGI: Astrazione e ragionamento. Testa l'intelligenza fluida attraverso nuovi puzzle di riconoscimento di pattern. GPT-5.3 Codex ha ottenuto 54% in questo benchmark.

Informazioni su GPT-5.3 Codex

Scopri le capacita di GPT-5.3 Codex, le funzionalita e come puo aiutarti a ottenere risultati migliori.

Una nuova era dello sviluppo autonomo

GPT-5.3 Codex è il model di coding agentic più capace di OpenAI. Colma il divario tra la generazione di codice statico e l'ingegneria del software autonoma. Costruito sull'architettura GPT-5, integra conoscenze professionali specializzate con un reasoning avanzato per gestire attività a lungo termine come l'amministrazione di sistema, il monitoraggio del deployment e il refactoring architettonico. Il model include il mid-task steering, che consente agli sviluppatori di interagire e guidare l'agente in tempo reale mentre naviga in progetti complessi.

Intelligenza ricorsiva e performance

OpenAI ha addestrato questo model utilizzando le proprie iterazioni precedenti per eseguire il debug e ottimizzare il proprio deployment. Rappresenta un passo significativo verso sistemi che migliorano autonomamente. Eccelle negli ambienti Terminal-Bench 2.0, dimostrando la capacità di gestire terminali live, eseguire unit test e correggere bug iterativamente senza intervento umano. Questo approccio di training ricorsivo ha portato a un utilizzo efficiente dei token e a una context window di 400.000 token, permettendogli di analizzare interi repository aziendali in un unico passaggio.

Integrazione professionale senza soluzione di continuità

Disponibile tramite un'app Codex dedicata, CLI ed estensioni IDE, il model si integra perfettamente nei workflow moderni. È efficace nell'identificare exploit zero-day, ottimizzare architetture di data pipeline ed eseguire audit di livello professionale su codebase legacy. Con una logica superiore e prezzi competitivi, funge da strumento ad alte prestazioni per task di ingegneria del software ad alto impatto.

GPT-5.3 Codex

Casi d'uso per GPT-5.3 Codex

Scopri i diversi modi in cui puoi usare GPT-5.3 Codex per ottenere ottimi risultati.

Ingegneria del Software Autonoma

Progettare e costruire progetti software modulari multi-file a partire da specifiche di alto livello.

Auditing del codice in produzione

Analizzare codebase live alla ricerca di problemi di concorrenza, memory leak e debito tecnico architettonico.

Automazione DevOps in tempo reale

Gestire workflow basati su terminale, inclusi setup di server, deployment di container e scalabilità di cluster.

Rimediazione di vulnerabilità di sicurezza

Identificare e correggere exploit zero-day e vulnerabilità software con una logica difensiva ad alte prestazioni.

Prototipazione interattiva

Generare landing page e web app pronte per la produzione a partire da wireframe disegnati a mano o prompt poco specifici.

Architettura di Data Pipeline

Tracciare e ottimizzare flussi di dati complessi attraverso molteplici layer di elaborazione e ambienti asincroni.

Punti di forza

Limitazioni

Logica di coding state-of-the-art: Punteggio leader del settore del 77,3% su Terminal-Bench 2.0 e performance superiore su SWE-Bench Pro.
Brevità funzionale: Occasionalmente dà priorità alla brevità funzionale rispetto all'estrema profondità architettonica riscontrata in model come o3-pro.
Rapporto prestazioni-prezzo senza pari: Offre capacità agentic da frontier model a circa 1/7 del costo rispetto a rivali come Opus 4.6.
Default estetici: Sebbene sia logicamente impeccabile, i design UI iniziali per le app possono a volte mancare di rifiniture visive moderne.
Auto-ottimizzazione ricorsiva: Costruito utilizzando la propria architettura per identificare bug e ottimizzare il training per un'elevata efficienza.
Lacune nelle risorse critiche: Occasionalmente trascura specifici task di pulizia delle risorse in simulazioni complesse hardware-software.
Steering interattivo in tempo reale: Capacità unica di ricevere direttive umane durante l'esecuzione del task, riducendo la necessità di lunghi cicli iterativi.
Attrito dell'ecosistema: L'accesso primario è ottimizzato per l'app Codex specializzata e la CLI, il che rappresenta una curva di apprendimento per gli utenti API standard.

Avvio rapido API

openai/gpt-5.3-codex

Visualizza documentazione
openai SDK
import OpenAI from 'openai';

const openai = new OpenAI();

async function main() {
  const completion = await openai.chat.completions.create({
    messages: [{ role: 'user', content: 'Audit this Swift actor for race conditions' }],
    model: 'gpt-5.3-codex',
  });

  console.log(completion.choices[0].message.content);
}

main();

Installa l'SDK e inizia a fare chiamate API in pochi minuti.

Cosa dice la gente su GPT-5.3 Codex

Guarda cosa pensa la community di GPT-5.3 Codex

GPT-5.3 Codex sembra meno un chatbot generico e più un model dedicato agli ingegneri.
Federal-Piano8695
reddit
Codex fornisce codice migliore a circa 1/7 del prezzo. Le prestazioni per prezzo sono semplicemente assurde.
sergeykarayev
reddit
Non stava solo eseguendo le mie istruzioni. Stava prendendo decisioni intelligenti. Aveva qualcosa che sembrava giudizio.
mattshumer_
twitter
Ho appena migrato l'intera orchestrazione del nostro backend ad agenti Codex e l'affidabilità è spaventosamente alta.
HackerNewsUser99
hackernews
GPT 5.3 Codex ha stabilito il nuovo punteggio più alto su Terminal-Bench 2.0. Il 77,3% è un salto enorme rispetto alla versione precedente.
bridgemindai
twitter
La capacità di gestire una context window da 400k rende possibile l'audit di interi repository aziendali in un colpo solo.
cdcore
other

Video su GPT-5.3 Codex

Guarda tutorial, recensioni e discussioni su GPT-5.3 Codex

Preferisco la versione asciutta in cui devo leggere meno rispetto al modo più interattivo e gentile.

- Sì. Io, non ci riesco. Un altro confronto è tipo, Opus è come il collega che a volte è un po' sciocco, ma è davvero divertente e te lo tieni vicino. E Codex è tipo lo strambo nell'angolo con cui non vuoi parlare, ma è affidabile e porta a termine il lavoro.

- Se, se qualcuno passa all'altro, darei una settimana di tempo prima di sviluppare davvero un sesto senso per esso.

Guida in-task (mid-task steering). Questa è una caratteristica unica di Codex in questo momento. Puoi reindirizzarlo mentre sta lavorando.

OS World è un benchmark che misura la capacità di controllo del desktop. La versione precedente di Codex ha ottenuto circa il 38%. Questa versione, il 64. Il livello umano è intorno al 72%, ed è qui che si nota il grande miglioramento. Si sta avvicinando in generale a

Anche l'ecosistema attorno a questo si sta espandendo. C'è una nuova app desktop di Codex lanciata la stessa settimana di questo modello, progettata per gestire agenti AI per giorni o settimane, gestendo più

GPT 5.3 Codex è stato fondamentale nella creazione di se stesso... questo è quasi auto-miglioramento autonomo.

opinione. Ora, uno dei principali punti di forza di GPT 5.3 Codex è il fatto che puoi guidarlo a metà attività, e questo è molto diverso da qualsiasi cosa abbia visto altrove. E quindi, fammi prendere

uso. Ecco il benchmark OS World, e abbiamo quasi raddoppiato il punteggio del codec GPT 5.2 arrivando fino a 64.7. E OS World è la capacità del modello di controllare il computer. Quindi si tratta di comprendere

Piu di semplici prompt

Potenzia il tuo workflow con l'automazione AI

Automatio combina la potenza degli agenti AI, dell'automazione web e delle integrazioni intelligenti per aiutarti a fare di piu in meno tempo.

Agenti AI
Automazione web
Workflow intelligenti

Consigli Pro per GPT-5.3 Codex

Consigli esperti per aiutarti a ottenere il massimo da GPT-5.3 Codex e raggiungere risultati migliori.

Abilita il Real-Time Steering

Attiva il comportamento di follow-up nelle impostazioni di Codex per guidare il model durante la build senza perdere il context.

Sfrutta la Plan Mode

Usa il comando Plan per refactoring complessi, permettendo al model di delineare la propria strategia prima di apportare modifiche.

Revisioni di Batch Pull Request

Inserisci interi feature branch nella context window da 400K per test di integrazione approfonditi.

Compattazione del context

Affidati alla compattazione nativa del context per le sessioni agentic di lunga durata per mantenere il focus sul progetto.

Testimonianze

Cosa dicono i nostri utenti

Unisciti a migliaia di utenti soddisfatti che hanno trasformato il loro workflow

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Jonathan Kogan

Jonathan Kogan

Co-Founder/CEO, rpatools.io

Automatio is one of the most used for RPA Tools both internally and externally. It saves us countless hours of work and we realized this could do the same for other startups and so we choose Automatio for most of our automation needs.

Mohammed Ibrahim

Mohammed Ibrahim

CEO, qannas.pro

I have used many tools over the past 5 years, Automatio is the Jack of All trades.. !! it could be your scraping bot in the morning and then it becomes your VA by the noon and in the evening it does your automations.. its amazing!

Ben Bressington

Ben Bressington

CTO, AiChatSolutions

Automatio is fantastic and simple to use to extract data from any website. This allowed me to replace a developer and do tasks myself as they only take a few minutes to setup and forget about it. Automatio is a game changer!

Sarah Chen

Sarah Chen

Head of Growth, ScaleUp Labs

We've tried dozens of automation tools, but Automatio stands out for its flexibility and ease of use. Our team productivity increased by 40% within the first month of adoption.

David Park

David Park

Founder, DataDriven.io

The AI-powered features in Automatio are incredible. It understands context and adapts to changes in websites automatically. No more broken scrapers!

Emily Rodriguez

Emily Rodriguez

Marketing Director, GrowthMetrics

Automatio transformed our lead generation process. What used to take our team days now happens automatically in minutes. The ROI is incredible.

Correlati AI Models

zhipu

GLM-5.2

Zhipu (GLM)

GLM-5.2 is Zhipu AI's flagship open-weight model featuring a 1M context window and specialized agentic coding capabilities under an MIT license.

1M context
$1.40/$4.40/1M
alibaba

Qwen3.5-Omni

alibaba

Qwen3.5-Omni is a natively omnimodal AI by Alibaba Cloud, offering seamless audio-visual reasoning, real-time voice chat, and 256k context for low-latency apps.

256K context
$0.40/$4.80/1M
openai

GPT-5.4

OpenAI

GPT-5.4 is OpenAI's frontier model featuring a 1.05M context window and Extreme Reasoning. It excels at autonomous UI interaction and long-form data analysis.

1.1M context
$2.50/$15.00/1M
anthropic

Claude 4.5 Sonnet

Anthropic

Anthropic's Claude Sonnet 4.5 delivers world-leading coding (77.2% SWE-bench) and a 200K context window, optimized for the next generation of autonomous agents.

200K context
$3.00/$15.00/1M
moonshot

Kimi K2 Thinking

Moonshot

Kimi K2 Thinking is Moonshot AI's trillion-parameter reasoning model. It outperforms GPT-5 on HLE and supports 300 sequential tool calls autonomously for...

256K context
$0.60/$2.50/1M
openai

GPT-5.2

OpenAI

GPT-5.2 is OpenAI's flagship model for professional tasks, featuring a 400K context window, elite coding, and deep multi-step reasoning capabilities.

400K context
$1.75/$14.00/1M
alibaba

Qwen3.6-Max-Preview

alibaba

Qwen3.6-Max-Preview is Alibaba's flagship MoE model featuring 1M context, a native thinking mode, and SOTA scores in agentic coding and reasoning.

1M context
$1.25/$10.00/1M
zhipu

GLM-5

Zhipu (GLM)

GLM-5 is Zhipu AI's 744B parameter open-weight powerhouse, excelling in long-horizon agentic tasks, coding, and factual accuracy with a 200k context window.

200K context
$1.00/$3.20/1M

Domande frequenti su GPT-5.3 Codex

Trova risposte alle domande comuni su GPT-5.3 Codex