GPT-5.3-Codex : le guide complet de l'agent OpenAI
GPT-5.3-Codex fusionne le stack Codex et GPT-5 : benchmarks, prix, pilotage en temps réel et positionnement face à Claude Code. Mon analyse complète.
GPT-5.3-Codex est l’agent de codage le plus avancé d’OpenAI, lancé le 5 février 2026. Sa nouveauté n’est pas un simple gain de benchmark : il fusionne dans un seul modèle la performance en génie logiciel de GPT-5.2-Codex et le raisonnement général de GPT-5.2, tourne environ 25 % plus vite et se pilote en temps réel pendant qu’il travaille.
J’utilise les agents de codage OpenAI et Anthropic au quotidien depuis plusieurs mois. Dans ce guide, je détaille ce que change GPT-5.3-Codex : ses benchmarks, son prix, le fonctionnement du pilotage en cours d’exécution, ce qui évolue par rapport à Codex CLI, et son positionnement face à Claude Code.
GPT-5.3-Codex fusionne le stack Codex et le stack GPT-5 dans un modèle unique, avec +25 % de vitesse.
Ce que GPT-5.3-Codex change vraiment
GPT-5.3-Codex n’est plus seulement un assistant de code : c’est un agent de travail généraliste. OpenAI a réuni deux lignées de modèles qui avançaient en parallèle. D’un côté, la série Codex, optimisée pour le génie logiciel. De l’autre, la série GPT-5, forte en raisonnement, connaissance professionnelle et intelligence générale.
Jusqu’à GPT-5.2, il fallait arbitrer : un modèle Codex pour coder, un modèle GPT-5 pour raisonner sur un problème métier. GPT-5.3-Codex supprime cet arbitrage. Le même modèle débogue, teste, déploie, surveille et documente, mais gère aussi les prompts sous-spécifiés du développement web courant et produit des livrables comme des présentations ou des tableurs.
Trois changements concrets structurent cette version :
- La fusion des stacks : la performance frontière de GPT-5.2-Codex et le raisonnement de GPT-5.2 dans un seul système, sans avoir à changer de modèle en cours de tâche.
- La vitesse : environ 25 % plus rapide pour les utilisateurs de Codex, grâce à des améliorations d’infrastructure et d’inférence, et avec moins de tokens consommés à résultat équivalent.
- Le pilotage en temps réel : la possibilité d’interagir avec le modèle pendant qu’il exécute une tâche, sans perdre le contexte.
Terminal-Bench 2.0 (77,3 %) est le signal le plus fort de GPT-5.3-Codex.
Benchmarks : où se situe GPT-5.3-Codex
GPT-5.3-Codex atteint l’état de l’art sur plusieurs benchmarks agentiques, avec un avantage particulièrement net sur l’usage du terminal. Les chiffres ci-dessous proviennent de l’annonce officielle d’OpenAI (5 février 2026).
| Benchmark | GPT-5.3-Codex | Référence |
|---|---|---|
| SWE-Bench Pro (xhigh) | 56,8 % | léger gain vs GPT-5.2-Codex et GPT-5.2 |
| Terminal-Bench 2.0 | 77,3 % | écart creusé vs modèles précédents |
| OSWorld-Verified | 64,7 % | humains ≈ 72 % |
| GDPval (44 métiers) | 70,9 % de victoires ou égalités | tâches de connaissance professionnelle |
Le score de 77,3 % sur Terminal-Bench 2.0 est le signal le plus fort. Ce benchmark mesure la capacité d’un agent à enchaîner des commandes shell réelles pour accomplir une tâche complète, un terrain où GPT-5.3-Codex prend le dessus. Sur SWE-Bench Pro, le gain est plus modeste : la version améliore légèrement les scores plutôt que de les révolutionner.
Le score GDPval mérite attention. Il évalue le modèle sur des tâches professionnelles couvrant 44 métiers différents, au-delà du seul code. Avec 70,9 % de victoires ou d’égalités, GPT-5.3-Codex confirme sa vocation d’agent de travail généraliste, cohérente avec la fusion des deux stacks.
Le pilotage en temps réel : la vraie rupture d’usage
La fonctionnalité la plus différenciante de GPT-5.3-Codex est la capacité à le piloter pendant l’exécution. C’est ce qui transforme le plus l’expérience au quotidien, davantage que les gains de benchmark.
Concrètement, l’application Codex envoie désormais des mises à jour fréquentes pendant qu’une tâche tourne. Vous pouvez poser une question, discuter d’une approche ou réorienter le modèle sans attendre qu’il termine et sans perdre le contexte accumulé. Le modèle se comporte comme un collègue avec qui vous itérez, pas comme un générateur qui produit une réponse d’un bloc.
Cette interactivité prend tout son sens sur les tâches longues et sous-spécifiées. Plutôt que de lancer une exécution de plusieurs minutes puis de constater qu’elle a pris la mauvaise direction, vous corrigez le tir en cours de route. Combinée aux 25 % de vitesse gagnés, la boucle de feedback devient nettement plus courte.

Comment accéder à GPT-5.3-Codex
GPT-5.3-Codex n’est pas un produit à part : c’est le modèle qui alimente l’écosystème Codex. Vous y accédez par plusieurs surfaces, selon votre flux de travail.

Via Codex CLI
Codex CLI reste l’agent terminal open source qui lit, modifie et exécute votre code en local. GPT-5.3-Codex y devient le modèle par défaut recommandé pour les tâches agentiques. Si vous découvrez l’outil, je détaille l’installation, la configuration et le sandboxing dans le guide complet de Codex CLI.
Via l’application et le cloud
L’application Codex est là où le pilotage en temps réel se manifeste le mieux, avec les mises à jour fréquentes en cours de run. Codex Cloud, de son côté, permet de lancer des tâches autonomes en arrière-plan sur un environnement connecté à votre dépôt GitHub.
Via l’API
Pour les intégrations sur mesure, GPT-5.3-Codex est disponible en API avec une fenêtre de contexte de 400 000 tokens et jusqu’à 128 000 tokens de sortie. C’est l’option à privilégier si vous construisez votre propre agent ou pipeline plutôt que d’utiliser les interfaces prêtes à l’emploi.
Prix : un positionnement agressif
GPT-5.3-Codex est facturé de manière compétitive, aussi bien en API que par abonnement. Le modèle est aussi plus économe en tokens que ses prédécesseurs, ce qui réduit le coût réel à tâche équivalente.
| Poste | Tarif |
|---|---|
| Entrée (API) | 1,75 $ / million de tokens |
| Sortie (API) | 14 $ / million de tokens |
| Cache read | 0,175 $ / million de tokens |
| Contexte | 400 000 tokens |
| Sortie max | 128 000 tokens |
| Abonnement Codex | inclus dès ChatGPT Plus (20 $/mois) |
L’accès via abonnement suit la logique habituelle de Codex : le modèle est inclus dans ChatGPT Plus, Pro, Business et Enterprise, avec des limites d’usage croissantes selon le tier. Pour un usage API intensif, le tarif d’entrée à 1,75 $/M positionne GPT-5.3-Codex parmi les modèles frontière les plus abordables du marché.
GPT-5.3-Codex l’emporte sur vitesse et coût (1,75 $/M contre 5 $/M), Claude Code sur la qualité du code.
GPT-5.3-Codex face à Claude Code
Face à Claude Code, GPT-5.3-Codex l’emporte sur la vitesse, le coût et l’usage du terminal, tandis que Claude Code garde l’avantage sur la qualité et la documentation du code produit. Le choix dépend de votre manière de travailler, pas d’un vainqueur absolu.
| Critère | GPT-5.3-Codex | Claude Code (Opus 5) |
|---|---|---|
| Terrain fort | Terminal-Bench 2.0 (77,3 %), tâches itératives | SWE-bench Verified, refactoring complexe |
| Style de code | implémentations courtes, peu de commentaires | code documenté, priorité à la lisibilité |
| Prix API (entrée) | 1,75 $ / M tokens | 5 $ / M tokens |
| Prix API (sortie) | 14 $ / M tokens | 25 $ / M tokens |
| Approche | boucle de feedback rapide, pilotage en temps réel | design stable, exécution correcte en une passe |
Mon retour après avoir utilisé les deux : GPT-5.3-Codex convient quand le travail est itératif et que vous voulez la boucle de correction la plus courte, notamment sur des scripts, du DevOps ou des tâches terminales. Claude Code reste mon choix quand le résultat doit être bon du premier coup, bien structuré et documenté, sur du refactoring multi-fichiers ou du frontend.
L’écart de fenêtre de contexte s’est resserré : GPT-5.3-Codex lit 400 000 tokens en API comme dans l’application Codex, tandis que Claude Code atteint 1 million de tokens avec Opus 5. En pratique, la meilleure efficacité en tokens de Codex réduit cet écart sur les sessions longues. Pour une comparaison chiffrée plus large des deux agents, consultez mon comparatif Codex vs Claude Code, et si vous hésitez plutôt entre un agent terminal et un IDE assisté, le comparatif Claude Code vs Cursor éclaire ce second arbitrage.
Mon avis : pour qui GPT-5.3-Codex vaut le coup
GPT-5.3-Codex est la version la plus aboutie de l’agent OpenAI, et la fusion Codex + GPT-5 est plus qu’un argument marketing : elle supprime réellement l’arbitrage entre modèle de code et modèle de raisonnement. Pour un développeur qui vit dans le terminal et travaille par itérations, c’est un gain net.
Mon verdict : adoptez GPT-5.3-Codex si votre priorité est la vitesse, le coût et l’interactivité en cours d’exécution. Le pilotage en temps réel change concrètement l’expérience sur les tâches longues. Si votre priorité est un code documenté et correct dès la première passe, Claude Code reste une alternative solide, et beaucoup de développeurs, dont moi, gardent les deux dans leur boîte à outils.
L’essentiel à retenir : GPT-5.3-Codex n’est pas une mise à jour incrémentale de plus. C’est le moment où l’agent de code d’OpenAI devient un agent de travail généraliste, plus rapide et pilotable, tout en restant l’un des plus abordables du marché.
Questions fréquentes
Qu'est-ce que GPT-5.3-Codex ?
GPT-5.3-Codex est l'agent de codage le plus avancé d'OpenAI, lancé le 5 février 2026. Il fusionne dans un seul modèle la performance en génie logiciel de GPT-5.2-Codex et le raisonnement général de GPT-5.2. Il tourne environ 25 % plus vite pour les utilisateurs de Codex et se pilote en temps réel pendant qu'il travaille, comme un collègue avec qui vous itérez.
Quelle est la différence entre GPT-5.3-Codex et Codex CLI ?
Codex CLI est l'outil (l'agent terminal open source qui lit, modifie et exécute votre code). GPT-5.3-Codex est le modèle qui l'alimente. Vous utilisez GPT-5.3-Codex à travers Codex CLI, l'extension IDE, Codex Cloud ou l'application Codex. Le modèle remplace GPT-5.2 sur les tâches de raisonnement large, pas seulement le code pur.
Combien coûte GPT-5.3-Codex ?
En API, GPT-5.3-Codex facture 1,75 $ par million de tokens en entrée et 14 $ par million en sortie, avec un cache read à 0,175 $/M. Via abonnement, il est inclus dans Codex avec ChatGPT Plus (20 $/mois), Pro (200 $/mois), Business et Enterprise. Il est plus économe en tokens que les modèles Codex précédents à tâche équivalente.
GPT-5.3-Codex est-il meilleur que Claude Code ?
Cela dépend du type de travail. GPT-5.3-Codex domine Terminal-Bench 2.0 (77,3 %) et convient au travail itératif avec la boucle de feedback la plus rapide. Claude Code (Opus 5) mène sur SWE-bench Verified et produit un code plus documenté et lisible. En API, GPT-5.3-Codex est près de 3 fois moins cher qu'Opus 5 (1,75 $/M contre 5 $/M en entrée).
Que signifie 'piloter GPT-5.3-Codex pendant l'exécution' ?
Contrairement à un générateur statique qui produit une réponse d'un bloc, GPT-5.3-Codex envoie des mises à jour fréquentes pendant qu'il exécute une tâche. Vous pouvez lui poser des questions, discuter d'une approche et réorienter son travail en temps réel, sans perdre le contexte de la session. Le modèle se comporte comme un partenaire d'ingénierie réactif.
Quelle fenêtre de contexte a GPT-5.3-Codex ?
GPT-5.3-Codex dispose d'une fenêtre de contexte de 400 000 tokens en API, avec jusqu'à 128 000 tokens de sortie. Combinée à une meilleure efficacité en tokens, cette capacité permet de traiter des bases de code volumineuses ou des tâches longues sans perdre le fil.
Faut-il passer de GPT-5.2-Codex à GPT-5.3-Codex ?
Oui pour la plupart des usages. GPT-5.3-Codex améliore légèrement les scores de génie logiciel, creuse l'écart sur Terminal-Bench 2.0, ajoute le raisonnement général de GPT-5.2 et tourne 25 % plus vite avec moins de tokens. Le pilotage en temps réel change surtout l'expérience sur les tâches longues et sous-spécifiées.