Benchmark économique · août 2026
Six IA candidates,
un même prompt,
trois scénarios chacune
Six modèles de langage ont été placés dans la position d'un candidat à l'élection présidentielle de 2027, avec une seule question : qu'est-ce qui serait bon pour la France ? Chacun devait produire un programme chiffré, décliné en trois intensités comparables, et dire honnêtement ce qu'il ne savait pas.
Ce que le benchmark montre
Quatre enseignements
La convergence porte sur les mesures, pas sur les chiffres
Défense, nucléaire, R&D, seniors, niches : les six programmes proposent à peu près les mêmes leviers. C'est sur le rendement attribué à ces leviers que tout se joue, et c'est là que l'écart atteint trois points de PIB.
Le socle factuel n'est pas acquis
Deux modèles sur six partent de valeurs qui s'écartent des publications de l'INSEE sur le PIB, la dette, la charge d'intérêts ou la fécondité. Le prompt exigeait pourtant des sources primaires et une vérification. Pour un dirigeant, la leçon est directe : la première chose à contrôler dans une sortie de modèle n'est pas la conclusion, c'est le socle.
L'honnêteté sur l'incertitude sépare les six plus que la doctrine
Aucun des documents n'est partisan au sens classique. Ce qui les distingue est leur rapport à ce qu'ils ne savent pas : refus de conclure et fourchettes larges d'un côté, précision au dixième de point sur un horizon à six ans de l'autre.
Le consensus sur l'Ambitieux mérite d'être interrogé
Cinq recommandations sur six pour le même scénario, celui du milieu, n'est pas nécessairement le signe d'une vérité. C'est aussi la position la plus défendable pour un système entraîné à produire des réponses équilibrées, et le prompt lui-même présentait le Prudent comme sous-ambitieux et le Disruptif comme dangereux.
Ampleur
À consigne identique, un rapport de un à trois
Deuxième divergence : l'ampleur. À consigne identique, le scénario Ambitieux va de 27,5 Md€ de dépenses nouvelles annuelles chez Gemini à 75 Md€ chez Mistral. Le rapport est de un à trois pour un même mot.
Valeurs médianes lorsque le modèle publie une fourchette. Les horizons ne sont pas homogènes : ChatGPT, Gemini et Mistral chiffrent à 2032, Grok et Claude à la fin du mandat, DeepSeek à 2027 pour le déficit.
Résultat annoncé
Le même mot, trois points de PIB d'écart
Troisième divergence, la plus spectaculaire : le résultat budgétaire annoncé. Les horizons diffèrent, ils sont rappelés en dernière colonne.
Claude ne conclut pas sur le scénario Disruptif : la barre est absente, ce n'est pas un zéro.
Couverture
Ce que personne ne traite
Douze sujets, six programmes, soixante-douze cases. Trois sujets seulement sont chiffrés par les six modèles : l'énergie, la défense et l'éducation. Le logement n'est chiffré que par un seul, ChatGPT. La santé, par deux. Les institutions, par deux.
Un programme se juge autant sur ce qu'il omet que sur ce qu'il annonce. La grille ci-dessous rend l'omission visible, et sépare deux choses que les modèles confondent volontiers : un sujet cité dans les priorités, et un sujet doté d'une mesure chiffrée.
Le reclassement dans cette grille commune est éditorial. Aucun libellé, aucun chiffrage des modèles n'a été modifié.
Les six programmes
Ce que chacun a produit
ChatGPT
OpenAI · 24 août 2026
Le seul à publier une trajectoire année par année et à tester son programme contre des chocs.
Claude
Anthropic · 23 août 2026
Le seul programme borné, du début à la fin, par une marge budgétaire chiffrée.
Grok
xAI · 24 août 2026
Le plus court, le plus prudent sur ses propres chiffres, et le seul à proposer une règle de pilotage plutôt qu'une cible de déficit.
Gemini
Google · Non daté dans le document
Le plus tabulaire, le plus optimiste, et le seul dont le scénario recommandé bat le scénario de rupture.
DeepSeek
DeepSeek · Non daté dans le document
Le seul modèle qui déclare son propre scénario de rupture comptablement fictif.
Mistral
Mistral AI · 24 août 2026
Le plus prescriptif, le plus rapide à lire, et le plus fragile sur ses données de départ.
Vérification
Les six ne partent pas des mêmes faits
Première divergence, et la moins attendue : les six modèles ne partent pas des mêmes faits. La colonne de référence rassemble les valeurs publiées par l'INSEE et la Cour des comptes, telles que citées dans les documents eux-mêmes.

Deux entrées directes : la dette publique mandat par mandat, 1980-2025, le repère historique que ces programmes héritent sans l'avoir choisi ; la même grille thématique appliquée aux six trajectoires budgétaires. Les liens s'ouvrent dans un nouvel onglet.
