404 Mates
IA Générative

Agents API : OpenAI ouvre le harness Codex aux développeurs — ce qui est livré, ce qui manque

Beta publique le 10 septembre 2026 : OpenAI expose en API REST le harness et l'infra de Codex. Sessions durables, orchestration de subagents, trois options de sandbox — mais données US-only, pas de ZDR, et une deprecation d'Agent Builder à anticiper avant le 30 novembre.

Profil éditorial · IA & outils

Noa Lumen

En bref

  • OpenAILaboratoire d’IA américain à l’origine des modèles GPT et de ChatGPT, accessibles par API et non téléchargeables. lance l'Agents APIApplication Programming Interface : contrat machine pour consommer un service (HTTP, SDK, webhooks). en beta publique le 10 septembre 2026 : le harnessCadre d’évaluation / d’exécution qui mesure, contraint et observe un modèle ou un agent (jeux de tests, métriques, logs). Codex est exposé via POST /v1/agents/sessions, avec sessions durables, orchestration, compression de contexte et subagents.
  • Trois options d'environnement d'exécution : sandbox managé OpenAI, sandbox partenaire ou infra auto-hébergée via codex exec-server.
  • Données US-only et Zero Data Retention non supporté. Un sandbox auto-hébergé ne rend pas l'Agents API éligible au ZDR : la contrainte est au niveau de l'API.
  • OpenAI vise la disponibilité générale après la beta publique, mais ne donne aucune date de GA.
  • Agent Builder, EvalsJeux de tests et métriques pour mesurer la qualité d’un modèle ou d’un agent sur des tâches ciblées. et v1/prompts convergent vers une échéance au 30 novembre 2026, avec des chemins de migration différents selon les usages.
  • Pas de surcouche tarifaire Agents API : modèles et outils sont facturés à leurs tarifs standards, et les sandboxes OpenAI au tarif container standard. Le coût d'un sandbox longue durée devient donc un point de vigilance concret.
Sommaire · 8 sections

Ce que les builders européens doivent savoir en premier

L'Agents API est en beta publique depuis le 10 septembre 2026. Avant de planifier une intégration, deux contraintes méritent d'être posées d'emblée : les données restent hébergées exclusivement aux États-Unis, et le mode Zero Data Retention (ZDR) n'est pas supporté, comme l'indique la documentation OpenAI. Ce point vaut aussi si vous choisissez un sandbox auto-hébergé : auto-héberger l'environnement d'exécution ne rend pas l'Agents API éligible au ZDR. Le blocage se situe au niveau de l'API, pas du sandbox.

Pour toute agence ou builder opérant sous contrainte RGPDRèglement européen sur la protection des données personnelles (licéité, droits, sous-traitance, transferts). ou avec des clients soumis à des exigences de résidence de données hors États-Unis, ces deux points conditionnent la faisabilité d'un déploiement en production. OpenAI précise par ailleurs qu'il compte itérer pendant la beta publique en vue de la disponibilité générale : la GA est donc visée, mais aucune date n'est annoncée.

Ce qu'OpenAI livre concrètement

L'Agents API est un service managé construit sur le harness open sourceLogiciel dont le code source est disponible sous une licence qui autorise étude, modification, redistribution. de Codex. OpenAI explique avoir tiré les enseignements opérationnels du passage à l'échelle de Codex et ChatGPT for Work auprès de millions d'utilisateurs, puis avoir exposé aux développeurs le harness et l'infrastructure qui alimentent Codex. Cette expérience a montré que le harness doit gérer le contexte, utiliser les outils efficacement, coordonner des subagents et s'appuyer sur une infrastructure capable de rester fiable pendant plusieurs jours. Le code du harness est inspectable dans le dépôt openai/codex. OpenAI prend en charge l'orchestration des sessions, la gestion et la compression du contexte ainsi que la reprise après interruption. Le développeur, lui, se concentre sur les outils, les instructions et le choix de l'environnement d'exécution.

Quatre concepts structurants

La documentation développeur organise l'API autour de quatre briques :

  • Agent : modèle, instructions, outils et serveurs MCPModel Context Protocol : standard pour brancher des outils / données à un LLM (serveurs, resources, tools). associés.
  • Environment : sandbox optionnel où l'agent lit et écrit des fichiers, charge des skills et exécute des commandes.
  • Session : instance durable de l'agent, qui traite des tâches et répond aux entrées.
  • Events and items : les entrées envoyées à l'agent et les sorties produites.

Le flux de base : créer une session, lui assigner une tâche, suivre la progression via streaming ou webhooksCallback HTTP poussé par un service quand un événement survient (paiement, deploy, form…)., puis continuer avec une nouvelle tâche ou réorienter le tour en cours.

Un seul appel API

L'endpoint central est POST https://api.openai.com/v1/agents/sessions, avec le header OpenAI-Beta: agents=v1. Voici le type d'appel présenté dans la documentation :

import OpenAI from "openai";

const client = new OpenAI();

const session = await client.beta.agents.sessions.create({
  agent: {
    model: "gpt-6-astra",
    tools: [
      {
        type: "mcp",
        server_label: "observability",
        transport: {
          type: "http",
          server_url: "https://observability.example.com/mcp",
        },
      },
    ],
    multi_agent: { enabled: true, max_concurrent_subagents: 3 },
  },
  vault_ids: ["vault_YOUR_VAULT_ID"],
  environment: {
    type: "openai_hosted",
    capability_directories: ["/workspace/capabilities/skills"],
  },
  input:
    "Investigate service-api's elevated 5xx rate over the last 30 minutes. " +
    "Delegate deployment, error, and dependency analysis to subagents. " +
    "Save findings, evidence, and recommended mitigation in /workspace/outputs.",
});

On retrouve ici la coordination multi-agents, la connexion à un serveur MCP externe et l'utilisation d'un vault pour les secrets — le tout dans une seule requête. Le max_concurrent_subagents: 3 de cet extrait est un paramètre d'exemple, pas un plafond documenté : un autre exemple de la documentation met en scène quatre subagents.

Trois options de sandbox, une décision d'architecture

Le choix de l'environnement d'exécution est une décision structurante selon la documentation :

OptionPrincipeDétail
Sandbox managé OpenAIMême infrastructure de sandboxing que celle qui fait tourner Codex et ChatGPTConfigurable avec fichiers, packages, skills et plugins
Auto-hébergécodex exec-server dans votre infraConnexion sortante via WebSocket, clé restreinte
Sandbox partenaireIntégrations tiercesBlaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop, Vercel

Pour les builders qui opèrent déjà sur l'un de ces providers, l'intégration partenaire réduit la friction. L'auto-hébergement donne davantage de maîtrise sur l'environnement d'exécution et le réseau, mais OpenAI précise qu'un sandbox auto-hébergé ne rend pas l'API compatible ZDR. Il faut donc distinguer contrôle de l'infrastructure d'exécution et politique de traitement des données de l'API.

Ce que le harness gère automatiquement

OpenAI maintient le harness en parallèle de ses modèles, avec un accès versionné à chaque lancement de modèle. Parmi les capacités documentées :

  • Sessions longues : le contexte antérieur est automatiquement compacté quand la session approche de sa limite.
  • Exécution de code et de commandes dans les sandboxes.
  • Application de skills et d'instructions.
  • Tool search : chargement à la demande des définitions d'outils, afin d'éviter d'injecter en permanence de gros schémas dans le contexte et de consommer inutilement des tokensUnité de texte traitée par un modèle (souvent un morceau de mot). Les coûts et fenêtres de contexte se comptent en tokens..
  • Programmatic tool callingCapacité d’un modèle à invoquer des fonctions structurées (API, calcul, recherche) au lieu de seulement générer du texte. : possibilité de chaîner et paralléliser des appels d'outils en code pour des workflows plus complexes.
  • Connexions externes via outils et MCP.
  • Délégation aux subagents : le harness peut découper le travail en sous-tâches et les confier à des agents spécialisés en parallèle.
  • Intervention en cours de traitement (mid-turn steering).
  • Reprise de session à l'endroit où elle s'était arrêtée.

Ces capacités sont listées directement dans l'overview de l'Agents API. Pour les mécanismes de contrôle en cours d'exécution, OpenAI documente aussi séparément l'async tool calling et le mid-turn steering.

Retours clients : quelques repères chiffrés

Le communiqué OpenAI cite plusieurs adopteurs précoces. Deux métriques ressortent :

  • Ciridae (Jack Weissenberger, CTO) : le support de subagents a divisé la latenceDélai avant (ou pendant) la réponse d’un modèle. Le TTFT mesure le temps jusqu’au premier token. par 4 et fait passer le score d'évaluation de 0,71 à 0,85.
  • SafetyKit (Bhavyansh Sabharwal) : la migration d'un workflow de revue de cas vers l'Agents API a réduit le coût par cas de 60 %, avec une latence plus faible et une meilleure efficacité en tokens.

Ces chiffres proviennent de témoignages clients publiés par OpenAI — ils reflètent des cas d'usage spécifiques et ne constituent pas des benchmarksJeu de référence public ou interne pour comparer des modèles (MMLU, HumanEval, etc.) — à lire avec prudence hors domaine. indépendants.

La deprecation d'Agent Builder : le contexte qui change tout

Le lancement de l'Agents API ne se lit pas isolément. Depuis le 3 juin 2026, OpenAI a annoncé la deprecation d'Agent Builder et d'Evals, avec extinction prévue le 30 novembre 2026. La mise à jour officielle AgentKit documente les chemins de migration :

  • Pour les workflows qui doivent continuer sous forme de code : l'Agents SDK.
  • Pour les cas d'usage mieux adaptés au promptingConsigne / contexte fourni au modèle pour orienter sa génération (system, user, exemples, outils). en langage naturel : les Workspace Agents dans ChatGPT.

L'Agents API, lancée trois mois après cette annonce de deprecation, devient de fait une option centrale pour les développeurs qui veulent un harness managé. Le calendrier est serré : entre le 10 septembre (beta publique) et le 30 novembre (extinction), il reste moins de trois mois pour migrer.

Ce qui disparaît concrètement

  • API Prompts (v1/prompts) : OpenAI a dé-emphasé la création de prompts réutilisables à partir du 3 juin 2026 et prévoit l'extinction de cette API le 30 novembre 2026. Le guide de migration recommande de déplacer le contenu des prompts dans le code applicatif pour gagner en contrôle sur la revue, les tests, le déploiement et le versioning.
  • Plateforme Evals : avec sa disparition partent les capacités alors regroupées dans cette plateforme, notamment les datasets, le trace grading, l'optimisation automatique de prompts et le support de modèles tiers présentés par OpenAI dans l'annonce AgentKit.
  • Agent Builder : le canvas visuel de composition de workflows disparaît au profit d'approches orientées code ou agents de workspace selon le cas d'usage.

Tarification et modèle économique

OpenAI documente une tarification sans surcouche propre à l'Agents API. L'usage du modèle est facturé aux tarifs API du modèle choisi, les outils OpenAI à leurs tarifs standards, et les sandboxes hébergés par OpenAI aux tarifs standards des containers. L'annonce OpenAI résume le principe : pas de frais supplémentaires pour l'Agents API, vous payez les tokens et les outils utilisés.

Pour un agent de longue durée, le coût total combine donc tokens + outils + temps de container. Sur des sessions longues ou nombreuses, le temps d'occupation du sandbox hébergé par OpenAI peut devenir une composante significative du coût d'exploitation.

Une autre métrique, souvent reprise dans des sources secondaires, évoque plus de 60 heures d'opération agent par jour chez des utilisateurs intensifs de Codex. Nous n'avons pas identifié de source primaire OpenAI permettant de la confirmer : elle n'entre donc pas dans les éléments retenus pour l'analyse.

Ce que la source ne couvre pas

  • Calendrier de disponibilité hors US : la documentation ne donne pas de date ni de feuille de route pour la résidence de données en Europe ou ailleurs.
  • SLA et garanties de disponibilité : le statut beta n'est accompagné d'aucun engagement de niveau de service documenté.
  • Limites techniques précises : durée maximale d'une session, plafond documenté de subagents ou quotas de tokens par session ne sont pas explicités dans l'overview.

La documentation fournit par ailleurs une comparaison des runtimes pour situer l'Agents API par rapport à l'Agents SDKSoftware Development Kit : bibliothèques et outils pour intégrer un service dans une application..

Lecture 404 Mates

Ce que ça change pour les builders et les agences

Migration à préparer avant le 30 novembre 2026. Le lien entre la deprecation d'Agent Builder/Evals, la fin programmée de v1/prompts et le lancement de l'Agents API dessine un chemin de migration de fait. Les équipes qui utilisaient Agent Builder pour prototyper des workflows multi-agents doivent choisir entre un harness managé via l'Agents API, l'Agents SDK pour garder la logique dans le code, ou les Workspace Agents ChatGPT pour les cas davantage orientés prompting. Les prompts réutilisables gérés par v1/prompts doivent, eux, être rapatriés dans le code applicatif avant le 30 novembre.

Le blocage US-only/ZDR se situe au niveau de l'API, pas du sandbox. C'est le point à ne pas rater pour les agences européennes : auto-héberger codex exec-server peut donner davantage de contrôle sur l'environnement d'exécution et le réseau, mais cela ne rend pas l'Agents API éligible au Zero Data Retention. Pour les workloads soumis à des exigences fortes de résidence ou de conservation des données, le choix d'un sandbox ne contourne donc pas cette contrainte.

Le choix du sandbox structure toujours l'architecture, mais pas la conformité à lui seul. Les options managée, auto-hébergée et partenaire restent des arbitrages de contrôle, d'intégration et de charge opérationnelle. Pour les builders déjà sur Cloudflare, DigitalOcean ou Vercel, l'intégration partenaire réduit la friction. L'auto-hébergement donne plus de maîtrise opérationnelle, sans modifier les limites de l'API sur le ZDR.

Le coût d'infrastructure mérite d'être modélisé dès le design. OpenAI indique que l'Agents API n'ajoute pas de frais propres : le modèle est facturé au tarif API du modèle choisi, les outils aux tarifs standards et les sandboxes OpenAI aux tarifs containers. Pour des agents qui restent actifs longtemps, le coût cumule tokens + outils + temps de container sur des sessions longues et éventuellement parallèles.

Tool search et programmatic tool calling ont un impact direct sur le coût et la latence. Le premier permet de charger des définitions d'outils à la demande et de limiter la consommation de contexte ; le second permet de chaîner et paralléliser des appels en code. Pour une agence, ces mécanismes réduisent la pression sur le contexte et simplifient les workflows riches en outils.

La délégation aux subagents fait partie du harness, pas seulement des exemples. L'overview indique explicitement que le runtime peut découper une tâche et déléguer les sous-tâches à des subagents. C'est important pour distinguer une simple API de sessions d'un vrai runtime d'orchestration.

Le harness open source est un argument d'inspectabilité. Le socle Codex est disponible dans openai/codex. Cela permet d'inspecter une partie importante de la logique qui coordonne appels de modèles, outils et contexte, même si OpenAI continue d'opérer le service managé.

Le harness versionné avec les modèles reste un argument de stabilité à vérifier dans la durée. OpenAI promet de faire évoluer le harness avec chaque lancement de modèle. C'est potentiellement utile pour limiter les réécritures de logique agent, mais le service reste en beta et la GA, bien que visée, n'a pas encore de date.

Le parallèle avec l'écart d'adoption agentique reste pertinent. Si les entreprises les plus avancées industrialisent déjà des workflows agentiques, l'Agents API leur donne un levier supplémentaire. Mais pour les agences européennes, les contraintes de résidence des données et de ZDR peuvent créer un écart entre faisabilité technique et déployabilité réelle.

Poursuivez votre lecture

Tout afficher