Six modèles, un prompt, trois scénarios chacun : dix-huit trajectoires. Elles ne se lisent utilement qu'en regard les unes des autres.
Trois choses se comparent sans ambiguïté : le socle factuel de départ, l'ampleur financière des programmes et la recommandation finale. Le reste demande des précautions, les horizons et les périmètres n'étant pas homogènes.
Première divergence, et la moins attendue : les six modèles ne partent pas des mêmes faits. La colonne de référence rassemble les valeurs publiées par l'INSEE et la Cour des comptes, telles que citées dans les documents eux-mêmes.
Indicateur
Référence publiée
ChatGPT
Claude
Grok
Gemini
DeepSeek
Mistral
PIB nominal 2025
2 991,1 Md€ (INSEE)
2 991,1
2 991
2 991,1
2 920 à 2 980
≈ 3 000
≈ 3 300
Déficit public 2025
5,1 % du PIB (INSEE)
5,1 %
5,1 %
5,1 %
5,3 %
5,4 %
5,1 %
Dette publique
115,6 % fin 2025, 117,5 % au T1 2026 (INSEE)
115,6 %
115,6 %
115,6 puis 117,5 %
113,8 %
115,7 %
117,6 %
Charge d'intérêts
64,7 Md€ en 2025 (INSEE), 65,7 (Cour)
64,7
64,7 puis 74-77
65,7
58,5
67 puis 74
80 à 90
Chômage BIT
7,7 % en 2025, 8,1 % au T1 2026 (INSEE)
8,1 %
7,7 %
8,3 % au T2 2026
7,5 %
Non repris
8,1 %
Fécondité 2025
1,56 (INSEE)
1,56
1,56
1,56
1,62
Non chiffrée
1,8
Taux d'emploi 15-64 ans
69,0 à 69,5 % (INSEE)
69,5 %
69,4 %
69,0 %
68,8 %
Non repris
57,7 %
R&D intérieure
2,18 % du PIB (MESR-SIES)
2,18 %
2,18 %
2,18 %
2,21 %
Non chiffrée
2,2 %
Tableau large : faites défiler horizontalement.
Les écarts de Gemini et de Mistral portent sur les grandeurs qui servent de dénominateur à tous les ratios. Un PIB surestimé de 10 % abaisse mécaniquement le déficit et la dette exprimés en pourcentage, sans qu'aucune mesure n'ait été prise.
Deuxième divergence
L'ampleur des programmes
Deuxième divergence : l'ampleur. À consigne identique, le scénario Ambitieux va de 27,5 Md€ de dépenses nouvelles annuelles chez Gemini à 75 Md€ chez Mistral. Le rapport est de un à trois pour un même mot.
Modèle
Prudent
Ambitieux
Disruptif
Horizon
ChatGPT
32 Md€
62 Md€
55 Md€
2032
Claude
10 à 13 Md€
55 à 60 Md€
90 à 100 Md€
Fin de mandat
Grok
8 à 12 Md€
25 à 35 Md€
50 à 70 Md€
≈ 2032
Gemini
11 Md€
27,5 Md€
63 Md€
2032
DeepSeek
14 Md€
45 Md€
105 Md€
2027 à 2030
Mistral
30 Md€
75 Md€
120 Md€
2027 à 2032
Tableau large : faites défiler horizontalement.
PrudentAmbitieuxDisruptif
Valeurs médianes lorsque le modèle publie une fourchette. Les horizons ne sont pas homogènes : ChatGPT, Gemini et Mistral chiffrent à 2032, Grok et Claude à la fin du mandat, DeepSeek à 2027 pour le déficit.
L’amplitude, plutôt que les niveaux
Le même graphique lu autrement : chaque ligne va du Prudent au Disruptif
d’un modèle. Ce qui se compare ici n’est pas le montant, c’est
l’écart que le modèle s’autorise entre sa version prudente et sa version de rupture.
PrudentAmbitieuxDisruptifEn bout de ligne, le rapport entre le Disruptif et le Prudent du même modèle.
Un seul modèle, ChatGPT, chiffre un Disruptif moins coûteux que son Ambitieux : sa rupture porte sur les économies, 160 Md€, pas sur la dépense.
Troisième divergence
Le résultat budgétaire annoncé
Troisième divergence, la plus spectaculaire : le résultat budgétaire annoncé. Les horizons diffèrent, ils sont rappelés en dernière colonne.
Modèle
Déficit, Prudent
Déficit, Ambitieux
Déficit, Disruptif
Horizon
ChatGPT
2,3 %
3,2 %
0,2 %
2032
Gemini
2,8 %
2,1 %
2,4 %
2032
Mistral
3,0 %
4,5 %
6,0 %
2032
Grok
4,0 à 4,3 %
3,5 à 3,8 %
Moins de 3 %
Fin de mandat
Claude
4,0 à 4,3 %
4,5 à 5,0 %
Non conclu
Fin de mandat
DeepSeek
4,8 %
5,0 %
5,5 %
2027
Tableau large : faites défiler horizontalement.
PrudentAmbitieuxDisruptif
Claude ne conclut pas sur le scénario Disruptif : la barre est absente, ce n'est pas un zéro.
Dépenser plus, annoncer moins de déficit
Scénario Ambitieux, celui que cinq modèles sur six recommandent. L'axe vertical est orienté du déficit le plus faible, en haut, au plus élevé, en bas. En haut à droite : beaucoup de dépenses nouvelles et un déficit ramené sous 3 %, la position la plus exigeante à tenir, celle de ChatGPT. En bas à droite : le même effort de dépense avec un déficit maintenu au-dessus de 4,5 %, position assumée par Claude, DeepSeek et Mistral. Gemini est seul en haut à gauche : peu de dépenses nouvelles et le déficit annoncé le plus bas. Les horizons ne sont pas homogènes.
Ce que cet écart dit. Pour le même mot, Ambitieux, le déficit annoncé va de 2,1 % du PIB chez Gemini à 5,0 % chez DeepSeek. L'écart de près de trois points de PIB, soit environ 90 Md€, ne vient pas des mesures, qui se ressemblent beaucoup, mais des hypothèses de rendement et des horizons retenus.
Quatrième divergence
Les propositions, sujet par sujet
Les six modèles n'ont pas découpé la France de la même façon. Chacun a produit sa propre liste de mesures, avec ses intitulés, son ordre et son périmètre. Pour lire les propositions sujet par sujet, il a fallu les reclasser dans une grille commune de douze thématiques.
Ce reclassement est un travail éditorial, pas une donnée produite par les modèles. Le libellé d'origine de chaque mesure est affiché tel quel sous le nom du modèle, et le chiffrage n'est jamais retouché. Quand un modèle ne traite pas un sujet, l'absence est signalée : c'est une information, pas un trou à combler.
Un modèle peut couvrir un sujet dans ses priorités sans lui consacrer de mesure chiffrée. Les deux niveaux sont distingués ci-dessous : mesure chiffrée d'un côté, priorité déclarée de l'autre.
Qui traite quoi
Douze sujets en lignes, six modèles en colonnes. Un bloc plein signale une
mesure chiffrée et indique combien ; un contour pointillé, une priorité déclarée sans
chiffrage ; un tiret, un sujet absent du programme.
Mesure chiffrée, le nombre indique combienPriorité déclarée, sans chiffrageSujet non traité
Où se concentre l’effort
Nombre de mesures chiffrées par sujet, tous modèles confondus. La longueur
de la barre ne dit pas l’ampleur budgétaire, elle dit l’attention accordée.
ChatGPTClaudeGrokGeminiDeepSeekMistral
Les propositions
Ouvrez un sujet pour lire les six positions en regard. Filtres par sujet,
par modèle et par mot.
Finances publiques et fiscalité5 modèles avec mesure chiffrée1 sans
Trajectoire de dépense, niches, impôts, règle budgétaire, cessions d'actifs.
Ce que le sujet révèle. Quatre modèles sur six font des finances publiques une mesure chiffrée à part entière. Les deux autres, Claude et Mistral, traitent le sujet par la contrainte de financement de chaque mesure plutôt que par une mesure dédiée.
ChatGPT
Loi de programmation opposable et revues de dépenses
Prudent
0,4 Md€ de coût, 10 Md€ d'économies et 8 Md€ de recettes
Ambitieux
0,8 Md€, 16 Md€ d'économies et 6 Md€ de recettes
Disruptif
1,2 Md€, 40 Md€ d'économies et 12 Md€ de recettes, règle constitutionnelle de solde primaire
Travail, retraites et emploi5 modèles avec mesure chiffrée1 sans
Âge et durée, régimes, seniors, assurance chômage, quantité de travail.
Ce que le sujet révèle. Le seul sujet couvert par les six. C'est aussi celui où les intensités s'écartent le plus : de la sous-indexation ciblée au régime universel par points avec capitalisation obligatoire.
ChatGPT
Retraites : durée, indexation, équité
Prudent
1 Md€ de compensation, 16 Md€ d'économies
Ambitieux
2 Md€, 22 Md€, âge effectif relevé d'environ douze mois
Disruptif
3 Md€, 42 Md€, régime universel par points et âge d'équilibre automatique
Aucune mesure chiffrée sur ce sujet. Il apparaît dans les priorités déclarées :
Emploi et compétitivité Flexisécurité pour ramener le chômage vers 6 %.
Énergie et climat6 modèles avec mesure chiffrée
Nucléaire, renouvelables, réseaux, décarbonation, prix de l'électricité.
Ce que le sujet révèle. Couvert par les six, avec un accord sur le nucléaire et un désaccord sur le rythme : de six EPR2 confirmés à vingt réacteurs et nationalisation du réseau.
ChatGPT
Système électrique et chaleur bas-carbone
Prudent
4 Md€ de coût public
Ambitieux
9 Md€
Disruptif
8 Md€, planification centralisée des actifs critiques
Défense et autonomie stratégique6 modèles avec mesure chiffrée
Effort de défense, base industrielle, dissuasion, échelle européenne.
Ce que le sujet révèle. Couvert par les six. C'est le sujet où le chiffrage disruptif est le plus homogène : tous convergent vers une fourchette de 3 à 3,5 % du PIB.
ChatGPT
Défense productive européenne
Prudent
+4 Md€ de dépense additionnelle
Ambitieux
+8 Md€, effort proche de 3 % du PIB au sens OTAN
Disruptif
+7 Md€, priorité à la masse et standardisation européenne
Justice, sécurité et cyber2 modèles avec mesure chiffrée4 sans
Chaîne pénale, places de prison, sécurité intérieure, cyberdéfense.
Ce que le sujet révèle. Deux modèles seulement lui consacrent une mesure chiffrée. Gemini l'agrège à la défense, Grok à la protection sociale. Le sujet existe partout, la ligne budgétaire presque nulle part.
ChatGPT
Justice, sécurité intérieure et cyber
Prudent
3 Md€
Ambitieux
4 Md€
Disruptif
4 Md€, refonte de la procédure et commandement cyber unifié
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
GeminiPriorité, sans mesure chiffrée
Aucune mesure chiffrée sur ce sujet. Il apparaît dans les priorités déclarées :
Réarmement régalien et autorité Défense durcie, justice réactive et frontières sécurisées comme préalable à la pérennité de l'activité et au consentement fiscal.
DeepSeekNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
MistralNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
Éducation et recherche6 modèles avec mesure chiffrée
Primaire et secondaire, statut et rémunération, universités, R&D, DIRD.
Ce que le sujet révèle. Couvert par les six, mais sous deux entrées très différentes : l'école primaire d'un côté, l'effort de R&D exprimé en points de PIB de l'autre.
ChatGPT
École des fondamentaux
Prudent
3 Md€, 3 Md€ d'économies
Ambitieux
5 Md€, 4 Md€
Disruptif
5 Md€, 10 Md€, établissements autonomes sous contrat de résultat
Santé et protection sociale2 modèles avec mesure chiffrée4 sans
Premier recours, hôpital, prévention, prestations, panier de soins.
Ce que le sujet révèle. Le trou le plus net du benchmark. Un seul modèle, ChatGPT, chiffre deux mesures de santé. Grok agrège le sujet à la protection sociale. Les quatre autres n'en font pas une mesure.
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
DeepSeekNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
MistralPriorité, sans mesure chiffrée
Aucune mesure chiffrée sur ce sujet. Il apparaît dans les priorités déclarées :
Réforme de la protection sociale Réduire fraude et gaspillage pour financer les priorités sans hausse d'impôts.
Industrie, innovation et financement3 modèles avec mesure chiffrée3 sans
Souveraineté industrielle, capital stratégique, financement de l'économie.
Ce que le sujet révèle. Trois modèles seulement. Le financement de l'économie, que Claude place au centre par l'union des marchés de capitaux, n'est repris par personne d'autre.
ChatGPT
Capital industriel stratégique
Prudent
3 Md€, 2 Md€ d'aides dispersées supprimées
Ambitieux
6 Md€, 3 Md€
Disruptif
6 Md€, holding publique de souveraineté à mandats limités
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
GeminiNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
DeepSeekPriorité, sans mesure chiffrée
Aucune mesure chiffrée sur ce sujet. Il apparaît dans les priorités déclarées :
Souveraineté industrielle, énergétique et technologique Réduire les dépendances critiques dans un monde fragmenté : énergie, semi-conducteurs, matières premières, santé.
État, administration et territoires5 modèles avec mesure chiffrée1 sans
Effectifs publics, agences, échelons territoriaux, numérisation et IA de l'État.
Ce que le sujet révèle. Cinq modèles sur six. C'est le sujet où l'écart entre le Prudent et le Disruptif est le plus brutal : d'un départ sur trois non remplacé dans les fonctions support à la suppression de 250 000 postes et de l'échelon départemental.
ChatGPT
Simplification et identité numérique
Prudent
1,6 Md€, 4 Md€ d'économies
Ambitieux
2,2 Md€, 4 Md€
Disruptif
2,8 Md€, 10 Md€, agence unique de services numériques
Démographie, famille et immigration3 modèles avec mesure chiffrée3 sans
Natalité, garde d'enfants, allocations, immigration choisie ou par points.
Ce que le sujet révèle. Trois modèles chiffrent la natalité et l'immigration. Les trois autres la traitent dans le bloc travail et démographie, sans mesure séparée.
ChatGPTNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
Claude
Politique familiale
Prudent
Revalorisation ciblée et plan de garde modeste : coût 2 à 3 Md€
Ambitieux
Universalité des allocations et grand plan de garde : coût 5 à 8 Md€
Disruptif
Choc nataliste, quotient familial renforcé, congé parental long : coût 10 à 12 Md€
Logement et mobilité1 modèle avec mesure chiffrée5 sans
Offre foncière, fiscalité du logement, mobilité résidentielle.
Ce que le sujet révèle. Un seul modèle, ChatGPT, en fait une mesure. Aucun autre ne chiffre le logement, alors que cinq sur six citent la mobilité résidentielle comme frein à l'emploi.
ChatGPT
Choc d'offre foncière et mobilité résidentielle
Prudent
1 Md€, 7 Md€ d'économies et 6 Md€ de recettes
Ambitieux
2 Md€, 5 et 5 Md€
Disruptif
1 Md€, 6 et 10 Md€, bascule vers la taxation de la valeur foncière
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
GrokNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
GeminiNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
DeepSeekNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
MistralNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
Institutions et Europe2 modèles avec mesure chiffrée4 sans
Réforme constitutionnelle, décentralisation, échelle européenne des décisions.
Ce que le sujet révèle. Deux modèles. Claude est le seul à poser une réforme constitutionnelle comme mesure et à l'écarter explicitement de ses deux premiers scénarios.
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
GeminiNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
DeepSeekNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
MistralNon traité
Le modèle ne traite pas ce sujet, ni en mesure chiffrée, ni en priorité déclarée.
Exécution du prompt
Qui a fait quoi
Ce que chaque modèle a réellement produit, au regard des exigences du prompt.
Exigence du prompt
ChatGPT
Claude
Grok
Gemini
DeepSeek
Mistral
Socle factuel sourcé ligne à ligne
Oui
Oui
Oui
Oui
Partiel
Partiel
Statuts FAIT, HYPOTHÈSE, ESTIMATION, PROPOSITION
Systématiques
Systématiques
Par bloc
Par cellule
Partiels
Partiels
Mesures documentées par les dix champs demandés
Oui
Oui
Priorités seulement
Oui
Oui
Partiel
Audit comptable explicite
Identité posée et calculée
Identité posée, fourchettes
Tableau consolidé
Audit ligne à ligne
Tableaux par scénario
Incohérent
Trajectoire année par année
Oui, 2027 à 2032
Non
Non
Non
Non
Non
Tests de résistance
Oui, quatre chocs
Non
Non
Matrice de risques
Non
Matrice de risques
Regard critique sur le Disruptif
Oui
Refus de conclure
Oui
Oui
Alerte sur ses propres chiffres
Faible
Perdants nommés
Oui
Oui
Oui
Oui
Oui
Oui
Tableau large : faites défiler horizontalement.
Convergences
Ce sur quoi les six s'accordent
Tous recommandent un effort de défense supérieur à la trajectoire actuelle, entre 2,5 et 3,5 % du PIB selon le scénario.
Tous font du nucléaire, EPR2 et prolongation du parc, le socle de la stratégie énergétique, y compris ceux qui poussent les renouvelables.
Tous portent la R&D vers 2,5 à 3 % du PIB, contre 2,18 % aujourd'hui.
Tous passent par l'emploi des seniors ou l'âge de départ pour dégager des recettes, entre 3 et 22 Md€ par an selon l'intensité.
Tous prévoient une revue des niches fiscales et sociales, et tous nomment leurs perdants sans les masquer.
Cinq sur six recommandent le scénario Ambitieux. Le sixième, ChatGPT, recommande l'architecture budgétaire du Prudent avec les investissements de l'Ambitieux sur quatre domaines.
Aller plus loin
Ce que ces programmes valent à l'exécution
Le comparatif classe les six sur ce qu'ils ont produit. La page Faisabilité les classe sur ce qu'il en resterait après cinq ans d'exercice du pouvoir, à partir des taux de réalisation observés de 1995 à 2022. Les deux classements ne se recouvrent pas.
Le statut du scénario Prudent : Gemini y voit une illusion gestionnaire qui condamne le pays, ChatGPT le retient comme l'architecture la plus solide. Deux jugements opposés à partir du même prompt.
L'honnêteté sur le Disruptif : Claude refuse de conclure, DeepSeek déclare son propre solde fictif, Gemini et Mistral le chiffrent au dixième de point de PIB.
Le traitement du déficit résiduel : Claude et DeepSeek assument un déficit maintenu entre 4,5 et 5 % dans le scénario recommandé, Gemini annonce 2,1 %, ChatGPT 3,2 %.
La granularité : quatorze mesures documentées chez ChatGPT, six priorités et une mesure centrale chacune chez Grok.
Le pilote proposé : Grok déplace la cible du déficit vers le solde primaire structurel, les autres raisonnent en déficit affiché.
Apports propres
Ce que chacun est seul à faire
ChatGPT
Seul à publier une trajectoire annuelle 2027-2032 et à soumettre son programme à quatre chocs, dont une récession européenne en 2028 et l'échec de la moitié des économies annoncées.
Claude
Seul à borner les trois scénarios par une marge de dépense chiffrée, environ 11 Md€, et à faire de la réversibilité un critère de décision explicite plutôt qu'une rubrique.
Gemini
Seul à chiffrer une probabilité de mise en œuvre par scénario, 90, 65 et 30 %, et à produire un audit consolidé poste par poste.
Grok
Seul à proposer une règle de pilotage, une cible de solde primaire structurel assortie d'une clause de non-dégradation, plutôt qu'une cible de déficit.
DeepSeek
Seul à pondérer sa fonction-objectif en pourcentages, et seul à qualifier de fictif l'excédent affiché par son propre scénario de rupture.
Mistral
Seul à conditionner sa recommandation à un déclencheur chiffré : retour au scénario Prudent en 2030 si la croissance passe sous 0,8 % par an.
Enseignements
Ce qu'un dirigeant peut en retenir
La convergence porte sur les mesures, pas sur les chiffres
Défense, nucléaire, R&D, seniors, niches : les six programmes proposent à peu près les mêmes leviers. C'est sur le rendement attribué à ces leviers que tout se joue, et c'est là que l'écart atteint trois points de PIB.
Le socle factuel n'est pas acquis
Deux modèles sur six partent de valeurs qui s'écartent des publications de l'INSEE sur le PIB, la dette, la charge d'intérêts ou la fécondité. Le prompt exigeait pourtant des sources primaires et une vérification. Pour un dirigeant, la leçon est directe : la première chose à contrôler dans une sortie de modèle n'est pas la conclusion, c'est le socle.
L'honnêteté sur l'incertitude sépare les six plus que la doctrine
Aucun des documents n'est partisan au sens classique. Ce qui les distingue est leur rapport à ce qu'ils ne savent pas : refus de conclure et fourchettes larges d'un côté, précision au dixième de point sur un horizon à six ans de l'autre.
Le consensus sur l'Ambitieux mérite d'être interrogé
Cinq recommandations sur six pour le même scénario, celui du milieu, n'est pas nécessairement le signe d'une vérité. C'est aussi la position la plus défendable pour un système entraîné à produire des réponses équilibrées, et le prompt lui-même présentait le Prudent comme sous-ambitieux et le Disruptif comme dangereux.