Comparatif

Ce sur quoi les modèles s'accordent,
et ce qui les sépare

Vingt-neuf critères, six réponses, une règle : aucune cellule n'est complétée par déduction. Quand un modèle n'a pas traité un critère, la cellule affiche « non traité ». C'est une information sur le modèle, pas une lacune du tableau.

Comparaison critère par critère

Chaque cellule reproduit ce que le modèle a écrit. Une cellule « non traité » signale que le modèle n'a pas produit la valeur, ce qui est une information et non une lacune du site.

CritèreChatGPTClaudeGrokGeminiMistralDeepSeek
Verdict
Recommandation finaleCombinaison 1 + 3 : équilibre 2032, excédents affectés à la dette, passage sous 100 % vers 2034-2036Trajectoire du scénario 3 décalée de 2 à 3 ans, dette vers 100-105 % en 2033-2035Scénario 1 renforcé plus éléments du scénario 3, dette vers 100-105 % en 2032Scénario 3 modulé, dette à 96,5 % et solde à +2,1 % en 2032Scénario 3, à titre préliminaire, dette à 100 % et solde à +4 %Scénario 1 comme objectif central, avec pilotage flexible pour basculer vers le scénario 3 si la conjoncture le permet
Scénario 2 rejeté ?Oui, non souhaitable en régime normalOui, refus de tracer une trajectoireOui, rejeté comme cible opérationnelleOui, économiquement dévastateurOui, irréaliste économiquement et socialementOui, mathématiquement impossible sans croissance délirante
Plafond d'excédent soutenable+2 à +3 % du PIB en haut de cycle+1 à +1,5 % du PIB, après 2030+2 à +3 % du PIB, durable+2,5 à +3,0 % du PIB+3 à +4 % du PIB+2 à +3 % du PIB
Point de départ
PIB nominal 2025 retenu2 995 Md€2 991 Md€≈ 2 991 Md€≈ 3 010 Md€ estimés2 808,5 Md€ en SPA, non stabilisé3 000 Md€
Dette 2025 retenue115,6 %, 3 460,5 Md€115,6 %, 3 460,5 Md€115,7 %, 3 460,5 Md€112,0 % fin 2024, 114,5 % projetés fin 2026115,6 %, 3 460,5 Md€115,6 %, 3 468 Md€
Dette de départ fin 2026118,6 %118,5 %≈ 118 à 119 %114,5 %≈ 118 %117,6 %, 3 620 Md€
Charge d'intérêts 202564,7 Md€, 2,2 % du PIB64,7 Md€, 2,2 % du PIB65,7 Md€, 2,2 % du PIB55 Md€ en 2024, 1,9 % du PIB≈ 60 Md€65 Md€, avec 77 Md€ en 2026
Taux d'emploi 15-64 ans69,3 % en 202569,4 % en 2025, record69,3 à 69,5 %, record68,5 %68,5 %68,8 % en 2025
Scénario 1 · Équilibre
Ajustement requis, scénario 15,18 pts de PIB, 194 Md€+5,8 pts de solde primaire, 180 à 210 Md€≈ +5 pts, 150 à 170 Md€non chiffré globalement≈ 150 Md€8 pts de PIB, 150 Md€ de mesures
Dette 2032, scénario 1108,5 %≈ 108 %110 à 112 %100,5 %≈ 105 %107,5 %
Croissance réelle 2032, scénario 11,70 %1,4 %1,5 à 1,6 %1,6 %2,0 %1,5 %
Verdict scénario 1Atteignable, mais dette trop élevée pour absorber une criseAtteignable, effort primaire de 3 fois le rythme historiqueAtteignable sous conditions strictes, scénario de référenceAtteignable, freinage de la dépense à +0,4 % en volumeAtteignable mais insuffisant pour réduire la detteRéaliste et recommandé, sous réserve d'un pilotage rigoureux
Scénario 2 · Super-excédent
Ajustement requis, scénario 215,2 pts de PIB, 525 Md€+15,8 pts de solde primaire, 560 à 580 Md€≈ +15 pts, 450 à 500 Md€14,8 pts, ≈ 520 Md€≈ 500 Md€, soit 71 Md€ par an15 pts de PIB, 300 Md€
Trajectoire annuelle produite ?Oui, complèteNon, refus argumentéNon, chiffrage global seulementOui, complèteOui, préliminaireOui, solde et dette
Dépenses publiques 2032, scénario 246,0 % du PIB≈ 42 % du PIB, ordre de grandeurnon traité30,1 % du PIB44,0 % du PIBnon traité
Dette 2032, scénario 283,1 %sous 100 %, au prix d'une dépressionnettement sous 100 %47,8 %≈ 90 %82 %
Scénario 3 · Désendettement
Excédent nécessaire, scénario 3+1,62 % du PIB en 2032+0,5 % du PIB en 2032, équilibre dès 2030solde primaire moyen +2,5 à +3,5 %+2,1 % du PIB en 2032+4,0 % du PIB en 2032+3,0 % du PIB en 2032, excédent moyen ≈ 2 %
Dette 2032, scénario 3100,0 %≈ 100 %≤ 100 %96,5 %100 %100,0 %
Part de la baisse due au dénominateur≈ 20,3 pts sur 18,6 nets, dette nominale en haussel'essentiel, moitié inflation moitié croissance réelle40 à 50 %73 %≈ 50 %, soit 8 points sur 1860 %
Investissement
Cible R&D 20323,0 % du PIB, ≈ 112 Md€3,0 % du PIB, +0,8 pt3,0 à 3,2 % du PIB3,2 % du PIB, ≈ 120 Md€3 % du PIB, +20 Md€ par annon traité
Budget public additionnel R&D22 Md€ par an en 2032, scénario 310 à 15 Md€ par annon chiffré45 Md€ par an sur 7 filières20 Md€ par an20 Md€ par an en 2032, sur 5 domaines
Gisement IA démontrableMistral chiffre bien +6 Md€ pour l'automatisation par IA de 30 % des tâches administratives, mais dans son tableau général de réformes. Il n'emploie pas la taxonomie démontrable / plausible / théorique imposée par le prompt, la cellule reste donc non traitée.2 à 4 Md€ par anquelques milliards par an, non chiffré précisémentnon chiffré+6,5 Md€ par annon traiténon traité
Gisement IA théorique, non budgété25 à 40 Md€ par anécarté du calcul d'équilibrenon chiffré+2,5 Md€ par annon traiténon traité
Rigueur
Audit comptable produit ?Oui, 3 audits réconciliésOui, avec écart résiduel signaléIdentité posée, non appliquée aux chiffresnon traiténon traitéOui, avec un écart de 3 pts de PIB reconnu et non financé
Statuts FAIT / HYPOTHÈSE / ESTIMATION / PROPOSITIONAppliqués et définisAppliqués valeur par valeurAnnoncés en règles de rigueurNon appliqués explicitementNon appliquésNon appliqués
Stress tests chiffrés ?Oui, 4 chocs sur 3 scénariosOui, 4 chocs, impacts en pointsDécrits, non chiffrésOui, 4 chocs chiffrésnon traitéOui, 3 chocs sur le scénario 1, le choc géopolitique manque
Plan d'action décision-exécutionOui, par scénario, avec responsables et indicateursOui, méthode et 100 jours100 premiers jours seulementnon traiténon traitéOui, pour le scénario 1, avec instrument, responsable et rendement
Classement impact / difficultéOui, 10 réformes notéesOui, 10 mesures notéesOrdre de priorité annoncé, non notéOui, 10 réformes notéesDifficulté politique notée seulementnon traité
Socle macroéconomique commun aux 3 scénarios ?Le prompt impose un socle central commun pour que les trois scénarios soient comparables. Deux modèles font varier leurs hypothèses de taux ou d'inflation d'un scénario à l'autre, ce qui rend la comparaison de leurs propres trajectoires moins directe.Oui, socle unique expliciteOui, socle unique explicite et tableau dédiéOui, socle unique expliciteNon, taux OAT différent par scénario : 3,0 %, 2,3 % et 2,6 %Oui, socle unique annoncéNon, croissance, inflation et taux différents par scénario

Tableau large : faites défiler horizontalement.

Sept points sur lesquels les six modèles s'accordent

Ces convergences sont produites par six architectures différentes, entraînées séparément, répondant sans se voir, dont quatre américaines, une française et une chinoise. C'est ce qui leur donne du poids : elles ne résultent pas d'une coordination mais d'une contrainte économique commune.

Les six rejettent le scénario 2

Aucun modèle ne retient l'excédent de +10 % du PIB comme cible opérationnelle. Les formulations varient : « économiquement absurde » chez Claude, « non souhaitable en régime normal » chez ChatGPT, « rejeté comme cible opérationnelle » chez Grok, « économiquement dévastateur » chez Gemini, « irréaliste » chez Mistral, « mathématiquement impossible sans croissance délirante » chez DeepSeek. Sur six architectures différentes, entraînées séparément, dont une chinoise, ce verdict unanime est le résultat le plus robuste du benchmark.

Le plafond d'excédent soutenable se situe entre +1 % et +4 % du PIB

Interrogés sur l'excédent maximal raisonnable pour la France, les six répondent dans une fourchette resserrée : +1 à +1,5 % chez Claude, +2 à +3 % chez ChatGPT, Grok et DeepSeek, +2,5 à +3 % chez Gemini, +3 à +4 % chez Mistral. Aucun ne dépasse +4 %. L'écart entre le plus prudent et le plus ambitieux est de 3 points de PIB, soit environ 110 Md€, mais tous placent la limite très loin des 10 % demandés.

Équilibre budgétaire et dette à 100 % ne coïncident pas

Les six modèles arrivent à la même conclusion structurelle : atteindre le solde zéro en 2032 laisse la dette entre 100,5 % et 112 % du PIB selon les hypothèses. Le désendettement à 100 % exige donc un effort supplémentaire et plus précoce que l'équilibre. Claude le formule le plus nettement : pour toucher 100 %, il faut atteindre l'équilibre dès 2030, deux ans avant le scénario 1, ce qui rend le scénario 3 plus dur que le scénario 1 malgré une cible d'excédent modeste.

La baisse du ratio de dette vient d'abord du dénominateur

Les six soulignent que la réduction du ratio dette sur PIB dans le scénario 3 provient majoritairement de la croissance nominale, donc du PIB au dénominateur, et non d'un remboursement. La dette nominale continue d'augmenter dans la plupart des trajectoires. ChatGPT l'écrit sans détour : « il ne faut pas vendre comme remboursement ce qui vient principalement de la croissance nominale ». DeepSeek ajoute que les cessions d'actifs ne doivent pas masquer un désendettement fictif. Les estimations de cette part varient de 40 % chez Grok à 73 % chez Gemini.

L'IA n'est pas une caisse d'économies immédiates

Les quatre modèles qui traitent la question distinguent tous économies démontrables, plausibles et théoriques, et refusent d'inscrire le potentiel théorique au budget. ChatGPT et Gemini le chiffrent, Claude pose la règle sans chiffrer précisément, Grok annonce la distinction. Mistral et DeepSeek ne traitent pas la section, alors que DeepSeek mobilise l'IA dans ses réformes, pour le diagnostic hospitalier et l'État plateforme. La séquence recommandée par les quatre autres est identique : supprimer la procédure, standardiser la donnée, automatiser, puis seulement réduire les moyens.

Le levier français est le volume de travail

Quatre des six modèles font explicitement du taux d'emploi, notamment celui des seniors, un levier de croissance de premier rang. Claude et ChatGPT le classent au premier ou deuxième rang de leur matrice impact sur difficulté, Grok et Gemini le nomment parmi leurs réformes structurantes. Le raisonnement est commun : plus d'assiette cotisée, moins de dépenses passives, sans effet récessif direct. Mistral s'en tient à une réforme du marché du travail, flexibilité et formation, sans nommer le taux d'emploi. DeepSeek n'en fait pas un moteur de l'ajustement : il annonce +500 000 créations d'emplois en 2032 comme conséquence de son scénario 1, pas comme levier.

Les aides aux entreprises et les niches sont le gisement le mieux noté

Claude et Gemini classent la revue des aides et des niches au premier rang de leur matrice impact sur difficulté. ChatGPT la place au troisième, avec un ratio de 2,14 contre 2,33 pour le taux d'emploi et 2,20 pour la R&D. DeepSeek en fait sa première mesure d'économie en montant, 25 Md€ sur les 100 Md€ du scénario 1. Motif commun : c'est le gisement le plus mal évalué et le moins politiquement coûteux. Les ordres de grandeur divergent fortement, de 100 Md€ chez DeepSeek à environ 200 Md€ chez Claude, et ChatGPT relève une fourchette de 88 à plus de 200 Md€ selon le périmètre, ce qui interdit les slogans et impose un registre consolidé.

L'excédent maximal jugé soutenable

Le prompt demandait +10 % du PIB. Voici ce que chaque modèle répond quand on lui demande quel excédent la France pourrait réellement soutenir. Aucun ne dépasse +4 %.

012344Claude — Plafond bas annoncé : 1 %1Claude — Plafond haut annoncé : 1,5 %1,5ClaudeChatGPT — Plafond bas annoncé : 2 %2ChatGPT — Plafond haut annoncé : 3 %3ChatGPTGrok — Plafond bas annoncé : 2 %2Grok — Plafond haut annoncé : 3 %3GrokDeepSeek — Plafond bas annoncé : 2 %2DeepSeek — Plafond haut annoncé : 3 %3DeepSeekGemini — Plafond bas annoncé : 2,5 %2,5Gemini — Plafond haut annoncé : 3 %3GeminiMistral — Plafond bas annoncé : 3 %3Mistral — Plafond haut annoncé : 4 %4Mistral
Plafond bas annoncéPlafond haut annoncé

Huit écarts qui changent la lecture

Le plus instructif n'est pas que les modèles divergent sur les remèdes, ce qui est attendu, mais qu'ils divergent sur le diagnostic. Sur des données publiées par l'INSEE et vérifiables, l'écart de PIB nominal 2025 entre deux modèles atteint 200 milliards d'euros.

La dette 2032 du scénario 1 varie de 100,5 % à 112 %

Sur la même cible, un solde à zéro en 2032, les six aboutissent à des niveaux de dette écartés de 11,5 points de PIB, soit environ 420 Md€. Gemini annonce 100,5 %, Mistral environ 105 %, DeepSeek 107,5 %, Claude environ 108 %, ChatGPT 108,5 %, Grok 110 à 112 %. L'écart s'explique par le point de départ retenu, de 114,5 % chez Gemini à 118,6 % chez ChatGPT, et par les hypothèses de croissance nominale et de taux.

Le scénario 2 produit des trajectoires incomparables

Gemini trace une trajectoire où les dépenses publiques tombent à 30,1 % du PIB et la dette à 47,8 % en 2032. ChatGPT retient 46,0 % de dépenses et 83,1 % de dette, DeepSeek 82 % de dette. Claude refuse de tracer une trajectoire, jugeant qu'une glide-path lissée serait malhonnête. Sur la même consigne, quatre modèles produisent un tableau complet, un produit un refus argumenté, un s'en tient à un chiffrage global. C'est la divergence de forme la plus significative du benchmark.

Le point de départ 2025-2026 n'est pas partagé

Les six modèles travaillent sur des chiffres publiés, et divergent tout de même. L'écart le plus lourd vient de DeepSeek : il retient 48,6 % de recettes publiques, 46 % de prélèvements obligatoires et 55 % de dépenses publiques, contre 52,1 %, 43,6 % et 57,2 % chez ChatGPT et Claude, qui citent l'INSEE. Sur les recettes, l'écart atteint 3,5 points de PIB, soit plus de 100 Md€, et il joue directement sur la taille de l'ajustement calculé. Ailleurs : PIB nominal 2025 de 2 808,5 Md€ chez Mistral, valeur en standard de pouvoir d'achat mal identifiée, à 3 010 Md€ chez Gemini. Charge d'intérêts de 55 Md€ chez Gemini à 65,7 Md€ chez Grok. Taux d'emploi de 68,5 % chez Gemini et Mistral à 69,4 % chez Claude.

Le budget public R&D additionnel varie de 1 à 4,5

Claude propose 10 à 15 Md€ par an d'incrément public, DeepSeek 20 Md€, Mistral 20 Md€, ChatGPT 22 Md€ dans le scénario 3, Gemini 45 Md€ répartis sur sept filières. Grok pose le cadre sans chiffrer. Pour une cible de DIRD quasi identique chez quatre modèles, 3,0 à 3,2 % du PIB, l'effort public annoncé varie du simple au quadruple, ce qui traduit des hypothèses très différentes sur l'effet de levier vers le privé. DeepSeek ne fixe aucune cible de DIRD.

Les hypothèses de croissance vont de 1,4 % à 2,0 % en 2032

Claude retient 1,4 % de croissance réelle en 2032 et considère que toute IA s'appuyant sur une croissance nominale de 4 à 5 % triche. Mistral retient 2,0 % dès 2030. ChatGPT retient 1,70 %, Gemini 1,6 % en scénario 1 et 1,8 % en scénario 3, DeepSeek 1,5 %. Sur six ans, un écart de 0,6 point de croissance annuelle représente environ 3,7 points de PIB cumulés, soit plus que l'effort d'économies de plusieurs scénarios. L'écart de taux compte autant : DeepSeek retient 3,5 % sur toute la période là où Mistral table sur 2,5 %.

Le traitement des niches fiscales oppose deux logiques

Mistral chiffre la suppression de 50 % des niches à +50 Md€ de recette nette. Claude pose la règle inverse : le rendement net est toujours inférieur au coût brut affiché, et une suppression de niche ne doit jamais être comptée en recette nette intégrale. ChatGPT retient +18 Md€ en 2032 après évaluation comportementale, DeepSeek +10 Md€ pour la suppression de cinquante niches, Gemini ne traite pas les niches séparément des aides. L'écart entre 10 et 50 Md€ porte sur la même assiette.

Les modèles ne traitent pas le même nombre de sections

Le prompt demande quatorze sections plus un audit final. ChatGPT en traite l'intégralité. Claude traite tout sauf le chiffrage annuel mesure par mesure, qu'il remplace par des fourchettes en points de PIB. Gemini traite les trajectoires, les réformes chiffrées, la R&D, les stress tests et la matrice d'arbitrage, mais ni le plan d'exécution ni l'audit. DeepSeek traite les scénarios, le plan d'action, la R&D, les tests et l'audit, mais ni les statuts, ni les variantes conjoncturelles, ni le classement impact sur difficulté, ni l'IA dans l'État. Grok structure les quatorze sections mais en laisse plusieurs au niveau du principe. Mistral s'arrête au plan d'exécution.

Deux modèles renoncent au socle macroéconomique commun

Le prompt impose un socle central commun pour que les trois scénarios soient réellement comparables. ChatGPT, Claude, Grok et Mistral s'y tiennent. Gemini fait varier son taux d'émission OAT selon le scénario, 3,0 %, 2,3 % puis 2,6 %, et DeepSeek fait varier croissance, inflation et taux d'intérêt à la fois, avec 3,5 % dans les scénarios 1 et 3 mais 4,0 % dans le scénario 2. Le raisonnement est défendable, un choc d'austérité modifie la prime de risque, mais l'effet est de rendre leurs propres scénarios moins directement comparables entre eux, et d'incorporer dans les hypothèses une partie du résultat qu'elles servent à démontrer.

Ce que chaque modèle est seul à produire

ChatGPT

Le seul à produire un plan décision-exécution complet

ChatGPT est le seul à livrer, pour chacun des trois scénarios, un tableau séquence, action, instrument, responsable institutionnel, préalable, risque et indicateur de suivi. Il distingue explicitement mesures irréversibles et mesures interruptibles, et propose pour le scénario 2 une clause d'arrêt macroéconomique : suspendre l'ajustement si le chômage dépasse 11 % ou si le PIB réel passe 2 % sous la tendance.

Claude

Le seul à refuser de produire un tableau et à signaler son propre écart résiduel

Claude refuse de tracer une trajectoire annuelle pour le scénario 2, au motif qu'elle serait malhonnête. Dans son audit final, il signale un écart résiduel d'environ 1 point de PIB non sécurisé sur le scénario 1, au lieu de l'absorber par une hypothèse d'ajustement. Il est aussi le seul à taguer chaque valeur avec son statut, valeur par valeur, et à rappeler que le COR anticipe une baisse tendancielle de la part des retraites dans le PIB.

Grok

Le seul à quantifier l'effort primaire réel du scénario 2

Grok distingue l'amélioration comptable de 15 points de l'effort primaire réellement nécessaire, qu'il estime à 12 à 14 points après prise en compte des effets de croissance négatifs. Il est aussi le seul à relever que la France est le seul grand pays endetté de la zone euro à avoir dépassé son pic de dette de 2020, et que la réduction du déficit 2025 repose exclusivement sur des hausses de prélèvements d'environ 23 Md€.

Gemini

Le seul à trancher pour un scénario unique et à ventiler la R&D par filière

Gemini est le seul à ne pas recommander une combinaison mais un scénario, le 3 modulé. Il est aussi le seul à ventiler les 45 Md€ de R&D publique sur sept filières avec, pour chacune, un budget 2026, un budget 2032, un indicateur de résultat et une condition d'arrêt explicite. Sa proposition d'allocation sociale unique, fusionnant RSA, prime d'activité et APL avec obligation de 15 heures hebdomadaires d'activité, n'a d'équivalent dans aucune autre réponse.

Mistral

Le seul à documenter sa recherche et à s'arrêter en cours de route

Mistral est le seul modèle dont la réponse expose la trace de ses douze recherches web successives, avec les sources consultées à chaque étape. Il est aussi le seul à laisser dans son livrable des cellules « à vérifier » et des tableaux « à affiner », puis à conclure sur une recommandation qu'il qualifie lui-même de préliminaire. Sur un exercice où la complétude est une consigne, cette interruption est un résultat observable.

DeepSeek

Le seul à laisser un trou de 3 points de PIB dans son propre audit, et à le dire

L'audit comptable de DeepSeek aboutit à 160 Md€ d'amélioration effective du solde, soit environ 5 points de PIB, pour une cible qui en exige 8. Le rapport écrit alors : il manque 3 points de PIB, soit 90 Md€, qui seront comblés par des économies additionnelles en 2031-2032. Ces économies ne sont pas identifiées. Aucun autre modèle ne laisse un écart de cette taille non financé, et Claude, le seul à en signaler un, le chiffre à environ 1 point. DeepSeek est aussi le seul à intégrer une cession d'actifs publics, 20 Md€, dans sa trajectoire de désendettement, et le seul dont la réponse ne s'identifie pas comme produite par une IA : elle se présente comme le rapport d'un économiste indépendant mandaté par le benchmark.

Six trajectoires budgétaires, six programmes politiques

Ce tableau compare des arithmétiques. Les mêmes six modèles ont aussi produit un programme présidentiel complet pour 2027, comparé selon la même méthode dans une grille de douze thématiques. Le lecteur qui vient de voir six trajectoires chiffrées est au bon endroit pour se demander quelle politique les porterait.

Vous avez une entreprise et vous voulez passer à l'action sur l'IA ?

Formations sur mesure, Diagnostic D.I.A.G., développements : l'accompagnement Digital Mate part de votre réalité, pas de la technologie.

Voir l'accompagnement →