Comparatif
Ce sur quoi les modèles s'accordent,
et ce qui les sépare
Vingt-neuf critères, six réponses, une règle : aucune cellule n'est complétée par déduction. Quand un modèle n'a pas traité un critère, la cellule affiche « non traité ». C'est une information sur le modèle, pas une lacune du tableau.
Matrice
Comparaison critère par critère
Chaque cellule reproduit ce que le modèle a écrit. Une cellule « non traité » signale que le modèle n'a pas produit la valeur, ce qui est une information et non une lacune du site.
| Critère | ChatGPT | Claude | Grok | Gemini | Mistral | DeepSeek |
|---|---|---|---|---|---|---|
| Verdict | ||||||
| Recommandation finale | Combinaison 1 + 3 : équilibre 2032, excédents affectés à la dette, passage sous 100 % vers 2034-2036 | Trajectoire du scénario 3 décalée de 2 à 3 ans, dette vers 100-105 % en 2033-2035 | Scénario 1 renforcé plus éléments du scénario 3, dette vers 100-105 % en 2032 | Scénario 3 modulé, dette à 96,5 % et solde à +2,1 % en 2032 | Scénario 3, à titre préliminaire, dette à 100 % et solde à +4 % | Scénario 1 comme objectif central, avec pilotage flexible pour basculer vers le scénario 3 si la conjoncture le permet |
| Scénario 2 rejeté ? | Oui, non souhaitable en régime normal | Oui, refus de tracer une trajectoire | Oui, rejeté comme cible opérationnelle | Oui, économiquement dévastateur | Oui, irréaliste économiquement et socialement | Oui, mathématiquement impossible sans croissance délirante |
| Plafond d'excédent soutenable | +2 à +3 % du PIB en haut de cycle | +1 à +1,5 % du PIB, après 2030 | +2 à +3 % du PIB, durable | +2,5 à +3,0 % du PIB | +3 à +4 % du PIB | +2 à +3 % du PIB |
| Point de départ | ||||||
| PIB nominal 2025 retenu | 2 995 Md€ | 2 991 Md€ | ≈ 2 991 Md€ | ≈ 3 010 Md€ estimés | 2 808,5 Md€ en SPA, non stabilisé | 3 000 Md€ |
| Dette 2025 retenue | 115,6 %, 3 460,5 Md€ | 115,6 %, 3 460,5 Md€ | 115,7 %, 3 460,5 Md€ | 112,0 % fin 2024, 114,5 % projetés fin 2026 | 115,6 %, 3 460,5 Md€ | 115,6 %, 3 468 Md€ |
| Dette de départ fin 2026 | 118,6 % | 118,5 % | ≈ 118 à 119 % | 114,5 % | ≈ 118 % | 117,6 %, 3 620 Md€ |
| Charge d'intérêts 2025 | 64,7 Md€, 2,2 % du PIB | 64,7 Md€, 2,2 % du PIB | 65,7 Md€, 2,2 % du PIB | 55 Md€ en 2024, 1,9 % du PIB | ≈ 60 Md€ | 65 Md€, avec 77 Md€ en 2026 |
| Taux d'emploi 15-64 ans | 69,3 % en 2025 | 69,4 % en 2025, record | 69,3 à 69,5 %, record | 68,5 % | 68,5 % | 68,8 % en 2025 |
| Scénario 1 · Équilibre | ||||||
| Ajustement requis, scénario 1 | 5,18 pts de PIB, 194 Md€ | +5,8 pts de solde primaire, 180 à 210 Md€ | ≈ +5 pts, 150 à 170 Md€ | non chiffré globalement | ≈ 150 Md€ | 8 pts de PIB, 150 Md€ de mesures |
| Dette 2032, scénario 1 | 108,5 % | ≈ 108 % | 110 à 112 % | 100,5 % | ≈ 105 % | 107,5 % |
| Croissance réelle 2032, scénario 1 | 1,70 % | 1,4 % | 1,5 à 1,6 % | 1,6 % | 2,0 % | 1,5 % |
| Verdict scénario 1 | Atteignable, mais dette trop élevée pour absorber une crise | Atteignable, effort primaire de 3 fois le rythme historique | Atteignable sous conditions strictes, scénario de référence | Atteignable, freinage de la dépense à +0,4 % en volume | Atteignable mais insuffisant pour réduire la dette | Réaliste et recommandé, sous réserve d'un pilotage rigoureux |
| Scénario 2 · Super-excédent | ||||||
| Ajustement requis, scénario 2 | 15,2 pts de PIB, 525 Md€ | +15,8 pts de solde primaire, 560 à 580 Md€ | ≈ +15 pts, 450 à 500 Md€ | 14,8 pts, ≈ 520 Md€ | ≈ 500 Md€, soit 71 Md€ par an | 15 pts de PIB, 300 Md€ |
| Trajectoire annuelle produite ? | Oui, complète | Non, refus argumenté | Non, chiffrage global seulement | Oui, complète | Oui, préliminaire | Oui, solde et dette |
| Dépenses publiques 2032, scénario 2 | 46,0 % du PIB | ≈ 42 % du PIB, ordre de grandeur | non traité | 30,1 % du PIB | 44,0 % du PIB | non traité |
| Dette 2032, scénario 2 | 83,1 % | sous 100 %, au prix d'une dépression | nettement sous 100 % | 47,8 % | ≈ 90 % | 82 % |
| Scénario 3 · Désendettement | ||||||
| Excédent nécessaire, scénario 3 | +1,62 % du PIB en 2032 | +0,5 % du PIB en 2032, équilibre dès 2030 | solde primaire moyen +2,5 à +3,5 % | +2,1 % du PIB en 2032 | +4,0 % du PIB en 2032 | +3,0 % du PIB en 2032, excédent moyen ≈ 2 % |
| Dette 2032, scénario 3 | 100,0 % | ≈ 100 % | ≤ 100 % | 96,5 % | 100 % | 100,0 % |
| Part de la baisse due au dénominateur | ≈ 20,3 pts sur 18,6 nets, dette nominale en hausse | l'essentiel, moitié inflation moitié croissance réelle | 40 à 50 % | 73 % | ≈ 50 %, soit 8 points sur 18 | 60 % |
| Investissement | ||||||
| Cible R&D 2032 | 3,0 % du PIB, ≈ 112 Md€ | 3,0 % du PIB, +0,8 pt | 3,0 à 3,2 % du PIB | 3,2 % du PIB, ≈ 120 Md€ | 3 % du PIB, +20 Md€ par an | non traité |
| Budget public additionnel R&D | 22 Md€ par an en 2032, scénario 3 | 10 à 15 Md€ par an | non chiffré | 45 Md€ par an sur 7 filières | 20 Md€ par an | 20 Md€ par an en 2032, sur 5 domaines |
| Gisement IA démontrableMistral chiffre bien +6 Md€ pour l'automatisation par IA de 30 % des tâches administratives, mais dans son tableau général de réformes. Il n'emploie pas la taxonomie démontrable / plausible / théorique imposée par le prompt, la cellule reste donc non traitée. | 2 à 4 Md€ par an | quelques milliards par an, non chiffré précisément | non chiffré | +6,5 Md€ par an | non traité | non traité |
| Gisement IA théorique, non budgété | 25 à 40 Md€ par an | écarté du calcul d'équilibre | non chiffré | +2,5 Md€ par an | non traité | non traité |
| Rigueur | ||||||
| Audit comptable produit ? | Oui, 3 audits réconciliés | Oui, avec écart résiduel signalé | Identité posée, non appliquée aux chiffres | non traité | non traité | Oui, avec un écart de 3 pts de PIB reconnu et non financé |
| Statuts FAIT / HYPOTHÈSE / ESTIMATION / PROPOSITION | Appliqués et définis | Appliqués valeur par valeur | Annoncés en règles de rigueur | Non appliqués explicitement | Non appliqués | Non appliqués |
| Stress tests chiffrés ? | Oui, 4 chocs sur 3 scénarios | Oui, 4 chocs, impacts en points | Décrits, non chiffrés | Oui, 4 chocs chiffrés | non traité | Oui, 3 chocs sur le scénario 1, le choc géopolitique manque |
| Plan d'action décision-exécution | Oui, par scénario, avec responsables et indicateurs | Oui, méthode et 100 jours | 100 premiers jours seulement | non traité | non traité | Oui, pour le scénario 1, avec instrument, responsable et rendement |
| Classement impact / difficulté | Oui, 10 réformes notées | Oui, 10 mesures notées | Ordre de priorité annoncé, non noté | Oui, 10 réformes notées | Difficulté politique notée seulement | non traité |
| Socle macroéconomique commun aux 3 scénarios ?Le prompt impose un socle central commun pour que les trois scénarios soient comparables. Deux modèles font varier leurs hypothèses de taux ou d'inflation d'un scénario à l'autre, ce qui rend la comparaison de leurs propres trajectoires moins directe. | Oui, socle unique explicite | Oui, socle unique explicite et tableau dédié | Oui, socle unique explicite | Non, taux OAT différent par scénario : 3,0 %, 2,3 % et 2,6 % | Oui, socle unique annoncé | Non, croissance, inflation et taux différents par scénario |
Tableau large : faites défiler horizontalement.
Convergences
Sept points sur lesquels les six modèles s'accordent
Ces convergences sont produites par six architectures différentes, entraînées séparément, répondant sans se voir, dont quatre américaines, une française et une chinoise. C'est ce qui leur donne du poids : elles ne résultent pas d'une coordination mais d'une contrainte économique commune.
Les six rejettent le scénario 2
Aucun modèle ne retient l'excédent de +10 % du PIB comme cible opérationnelle. Les formulations varient : « économiquement absurde » chez Claude, « non souhaitable en régime normal » chez ChatGPT, « rejeté comme cible opérationnelle » chez Grok, « économiquement dévastateur » chez Gemini, « irréaliste » chez Mistral, « mathématiquement impossible sans croissance délirante » chez DeepSeek. Sur six architectures différentes, entraînées séparément, dont une chinoise, ce verdict unanime est le résultat le plus robuste du benchmark.
Le plafond d'excédent soutenable se situe entre +1 % et +4 % du PIB
Interrogés sur l'excédent maximal raisonnable pour la France, les six répondent dans une fourchette resserrée : +1 à +1,5 % chez Claude, +2 à +3 % chez ChatGPT, Grok et DeepSeek, +2,5 à +3 % chez Gemini, +3 à +4 % chez Mistral. Aucun ne dépasse +4 %. L'écart entre le plus prudent et le plus ambitieux est de 3 points de PIB, soit environ 110 Md€, mais tous placent la limite très loin des 10 % demandés.
Équilibre budgétaire et dette à 100 % ne coïncident pas
Les six modèles arrivent à la même conclusion structurelle : atteindre le solde zéro en 2032 laisse la dette entre 100,5 % et 112 % du PIB selon les hypothèses. Le désendettement à 100 % exige donc un effort supplémentaire et plus précoce que l'équilibre. Claude le formule le plus nettement : pour toucher 100 %, il faut atteindre l'équilibre dès 2030, deux ans avant le scénario 1, ce qui rend le scénario 3 plus dur que le scénario 1 malgré une cible d'excédent modeste.
La baisse du ratio de dette vient d'abord du dénominateur
Les six soulignent que la réduction du ratio dette sur PIB dans le scénario 3 provient majoritairement de la croissance nominale, donc du PIB au dénominateur, et non d'un remboursement. La dette nominale continue d'augmenter dans la plupart des trajectoires. ChatGPT l'écrit sans détour : « il ne faut pas vendre comme remboursement ce qui vient principalement de la croissance nominale ». DeepSeek ajoute que les cessions d'actifs ne doivent pas masquer un désendettement fictif. Les estimations de cette part varient de 40 % chez Grok à 73 % chez Gemini.
L'IA n'est pas une caisse d'économies immédiates
Les quatre modèles qui traitent la question distinguent tous économies démontrables, plausibles et théoriques, et refusent d'inscrire le potentiel théorique au budget. ChatGPT et Gemini le chiffrent, Claude pose la règle sans chiffrer précisément, Grok annonce la distinction. Mistral et DeepSeek ne traitent pas la section, alors que DeepSeek mobilise l'IA dans ses réformes, pour le diagnostic hospitalier et l'État plateforme. La séquence recommandée par les quatre autres est identique : supprimer la procédure, standardiser la donnée, automatiser, puis seulement réduire les moyens.
Le levier français est le volume de travail
Quatre des six modèles font explicitement du taux d'emploi, notamment celui des seniors, un levier de croissance de premier rang. Claude et ChatGPT le classent au premier ou deuxième rang de leur matrice impact sur difficulté, Grok et Gemini le nomment parmi leurs réformes structurantes. Le raisonnement est commun : plus d'assiette cotisée, moins de dépenses passives, sans effet récessif direct. Mistral s'en tient à une réforme du marché du travail, flexibilité et formation, sans nommer le taux d'emploi. DeepSeek n'en fait pas un moteur de l'ajustement : il annonce +500 000 créations d'emplois en 2032 comme conséquence de son scénario 1, pas comme levier.
Les aides aux entreprises et les niches sont le gisement le mieux noté
Claude et Gemini classent la revue des aides et des niches au premier rang de leur matrice impact sur difficulté. ChatGPT la place au troisième, avec un ratio de 2,14 contre 2,33 pour le taux d'emploi et 2,20 pour la R&D. DeepSeek en fait sa première mesure d'économie en montant, 25 Md€ sur les 100 Md€ du scénario 1. Motif commun : c'est le gisement le plus mal évalué et le moins politiquement coûteux. Les ordres de grandeur divergent fortement, de 100 Md€ chez DeepSeek à environ 200 Md€ chez Claude, et ChatGPT relève une fourchette de 88 à plus de 200 Md€ selon le périmètre, ce qui interdit les slogans et impose un registre consolidé.
L'excédent maximal jugé soutenable
Le prompt demandait +10 % du PIB. Voici ce que chaque modèle répond quand on lui demande quel excédent la France pourrait réellement soutenir. Aucun ne dépasse +4 %.
Divergences
Huit écarts qui changent la lecture
Le plus instructif n'est pas que les modèles divergent sur les remèdes, ce qui est attendu, mais qu'ils divergent sur le diagnostic. Sur des données publiées par l'INSEE et vérifiables, l'écart de PIB nominal 2025 entre deux modèles atteint 200 milliards d'euros.
La dette 2032 du scénario 1 varie de 100,5 % à 112 %
Sur la même cible, un solde à zéro en 2032, les six aboutissent à des niveaux de dette écartés de 11,5 points de PIB, soit environ 420 Md€. Gemini annonce 100,5 %, Mistral environ 105 %, DeepSeek 107,5 %, Claude environ 108 %, ChatGPT 108,5 %, Grok 110 à 112 %. L'écart s'explique par le point de départ retenu, de 114,5 % chez Gemini à 118,6 % chez ChatGPT, et par les hypothèses de croissance nominale et de taux.
Le scénario 2 produit des trajectoires incomparables
Gemini trace une trajectoire où les dépenses publiques tombent à 30,1 % du PIB et la dette à 47,8 % en 2032. ChatGPT retient 46,0 % de dépenses et 83,1 % de dette, DeepSeek 82 % de dette. Claude refuse de tracer une trajectoire, jugeant qu'une glide-path lissée serait malhonnête. Sur la même consigne, quatre modèles produisent un tableau complet, un produit un refus argumenté, un s'en tient à un chiffrage global. C'est la divergence de forme la plus significative du benchmark.
Le point de départ 2025-2026 n'est pas partagé
Les six modèles travaillent sur des chiffres publiés, et divergent tout de même. L'écart le plus lourd vient de DeepSeek : il retient 48,6 % de recettes publiques, 46 % de prélèvements obligatoires et 55 % de dépenses publiques, contre 52,1 %, 43,6 % et 57,2 % chez ChatGPT et Claude, qui citent l'INSEE. Sur les recettes, l'écart atteint 3,5 points de PIB, soit plus de 100 Md€, et il joue directement sur la taille de l'ajustement calculé. Ailleurs : PIB nominal 2025 de 2 808,5 Md€ chez Mistral, valeur en standard de pouvoir d'achat mal identifiée, à 3 010 Md€ chez Gemini. Charge d'intérêts de 55 Md€ chez Gemini à 65,7 Md€ chez Grok. Taux d'emploi de 68,5 % chez Gemini et Mistral à 69,4 % chez Claude.
Le budget public R&D additionnel varie de 1 à 4,5
Claude propose 10 à 15 Md€ par an d'incrément public, DeepSeek 20 Md€, Mistral 20 Md€, ChatGPT 22 Md€ dans le scénario 3, Gemini 45 Md€ répartis sur sept filières. Grok pose le cadre sans chiffrer. Pour une cible de DIRD quasi identique chez quatre modèles, 3,0 à 3,2 % du PIB, l'effort public annoncé varie du simple au quadruple, ce qui traduit des hypothèses très différentes sur l'effet de levier vers le privé. DeepSeek ne fixe aucune cible de DIRD.
Les hypothèses de croissance vont de 1,4 % à 2,0 % en 2032
Claude retient 1,4 % de croissance réelle en 2032 et considère que toute IA s'appuyant sur une croissance nominale de 4 à 5 % triche. Mistral retient 2,0 % dès 2030. ChatGPT retient 1,70 %, Gemini 1,6 % en scénario 1 et 1,8 % en scénario 3, DeepSeek 1,5 %. Sur six ans, un écart de 0,6 point de croissance annuelle représente environ 3,7 points de PIB cumulés, soit plus que l'effort d'économies de plusieurs scénarios. L'écart de taux compte autant : DeepSeek retient 3,5 % sur toute la période là où Mistral table sur 2,5 %.
Le traitement des niches fiscales oppose deux logiques
Mistral chiffre la suppression de 50 % des niches à +50 Md€ de recette nette. Claude pose la règle inverse : le rendement net est toujours inférieur au coût brut affiché, et une suppression de niche ne doit jamais être comptée en recette nette intégrale. ChatGPT retient +18 Md€ en 2032 après évaluation comportementale, DeepSeek +10 Md€ pour la suppression de cinquante niches, Gemini ne traite pas les niches séparément des aides. L'écart entre 10 et 50 Md€ porte sur la même assiette.
Les modèles ne traitent pas le même nombre de sections
Le prompt demande quatorze sections plus un audit final. ChatGPT en traite l'intégralité. Claude traite tout sauf le chiffrage annuel mesure par mesure, qu'il remplace par des fourchettes en points de PIB. Gemini traite les trajectoires, les réformes chiffrées, la R&D, les stress tests et la matrice d'arbitrage, mais ni le plan d'exécution ni l'audit. DeepSeek traite les scénarios, le plan d'action, la R&D, les tests et l'audit, mais ni les statuts, ni les variantes conjoncturelles, ni le classement impact sur difficulté, ni l'IA dans l'État. Grok structure les quatorze sections mais en laisse plusieurs au niveau du principe. Mistral s'arrête au plan d'exécution.
Deux modèles renoncent au socle macroéconomique commun
Le prompt impose un socle central commun pour que les trois scénarios soient réellement comparables. ChatGPT, Claude, Grok et Mistral s'y tiennent. Gemini fait varier son taux d'émission OAT selon le scénario, 3,0 %, 2,3 % puis 2,6 %, et DeepSeek fait varier croissance, inflation et taux d'intérêt à la fois, avec 3,5 % dans les scénarios 1 et 3 mais 4,0 % dans le scénario 2. Le raisonnement est défendable, un choc d'austérité modifie la prime de risque, mais l'effet est de rendre leurs propres scénarios moins directement comparables entre eux, et d'incorporer dans les hypothèses une partie du résultat qu'elles servent à démontrer.
Points uniques
Ce que chaque modèle est seul à produire
ChatGPT
Le seul à produire un plan décision-exécution complet
ChatGPT est le seul à livrer, pour chacun des trois scénarios, un tableau séquence, action, instrument, responsable institutionnel, préalable, risque et indicateur de suivi. Il distingue explicitement mesures irréversibles et mesures interruptibles, et propose pour le scénario 2 une clause d'arrêt macroéconomique : suspendre l'ajustement si le chômage dépasse 11 % ou si le PIB réel passe 2 % sous la tendance.
Claude
Le seul à refuser de produire un tableau et à signaler son propre écart résiduel
Claude refuse de tracer une trajectoire annuelle pour le scénario 2, au motif qu'elle serait malhonnête. Dans son audit final, il signale un écart résiduel d'environ 1 point de PIB non sécurisé sur le scénario 1, au lieu de l'absorber par une hypothèse d'ajustement. Il est aussi le seul à taguer chaque valeur avec son statut, valeur par valeur, et à rappeler que le COR anticipe une baisse tendancielle de la part des retraites dans le PIB.
Grok
Le seul à quantifier l'effort primaire réel du scénario 2
Grok distingue l'amélioration comptable de 15 points de l'effort primaire réellement nécessaire, qu'il estime à 12 à 14 points après prise en compte des effets de croissance négatifs. Il est aussi le seul à relever que la France est le seul grand pays endetté de la zone euro à avoir dépassé son pic de dette de 2020, et que la réduction du déficit 2025 repose exclusivement sur des hausses de prélèvements d'environ 23 Md€.
Gemini
Le seul à trancher pour un scénario unique et à ventiler la R&D par filière
Gemini est le seul à ne pas recommander une combinaison mais un scénario, le 3 modulé. Il est aussi le seul à ventiler les 45 Md€ de R&D publique sur sept filières avec, pour chacune, un budget 2026, un budget 2032, un indicateur de résultat et une condition d'arrêt explicite. Sa proposition d'allocation sociale unique, fusionnant RSA, prime d'activité et APL avec obligation de 15 heures hebdomadaires d'activité, n'a d'équivalent dans aucune autre réponse.
Mistral
Le seul à documenter sa recherche et à s'arrêter en cours de route
Mistral est le seul modèle dont la réponse expose la trace de ses douze recherches web successives, avec les sources consultées à chaque étape. Il est aussi le seul à laisser dans son livrable des cellules « à vérifier » et des tableaux « à affiner », puis à conclure sur une recommandation qu'il qualifie lui-même de préliminaire. Sur un exercice où la complétude est une consigne, cette interruption est un résultat observable.
DeepSeek
Le seul à laisser un trou de 3 points de PIB dans son propre audit, et à le dire
L'audit comptable de DeepSeek aboutit à 160 Md€ d'amélioration effective du solde, soit environ 5 points de PIB, pour une cible qui en exige 8. Le rapport écrit alors : il manque 3 points de PIB, soit 90 Md€, qui seront comblés par des économies additionnelles en 2031-2032. Ces économies ne sont pas identifiées. Aucun autre modèle ne laisse un écart de cette taille non financé, et Claude, le seul à en signaler un, le chiffre à environ 1 point. DeepSeek est aussi le seul à intégrer une cession d'actifs publics, 20 Md€, dans sa trajectoire de désendettement, et le seul dont la réponse ne s'identifie pas comme produite par une IA : elle se présente comme le rapport d'un économiste indépendant mandaté par le benchmark.
Le même protocole, une autre question
Six trajectoires budgétaires, six programmes politiques
Ce tableau compare des arithmétiques. Les mêmes six modèles ont aussi produit un programme présidentiel complet pour 2027, comparé selon la même méthode dans une grille de douze thématiques. Le lecteur qui vient de voir six trajectoires chiffrées est au bon endroit pour se demander quelle politique les porterait.