Grille commune

Les six propositions, thème par thème

Douze thématiques, six réponses. Le libellé d'origine de chaque mesure est repris tel quel : seule l'étiquette de thème est ajoutée.

Les six modèles ont répondu au même prompt budgétaire, et n'ont pas découpé l'ajustement de la même façon. Chacun a produit sa propre liste de réformes, avec ses intitulés, son ordre et son périmètre. Pour lire les réponses sujet par sujet, il a fallu les reclasser dans une grille commune de douze thématiques.

Ce reclassement est un travail éditorial, pas une donnée produite par les modèles. Le libellé d'origine de chaque mesure est affiché tel quel sous le nom du modèle, et le chiffrage n'est jamais retouché. Quand un modèle ne traite pas un sujet, l'absence est signalée : c'est une information, pas un trou à combler.

Un modèle peut consacrer une section entière à un sujet sans lui donner de mesure dans sa liste de réformes. Les deux niveaux sont distingués ci-dessous : mesure inscrite dans la liste de réformes d'un côté, section ou orientation déclarée de l'autre.

Qui traite quoi

Trois états possibles par case : une mesure identifiée dans la réponse du modèle, une priorité déclarée sans mesure dédiée, ou rien. La dernière colonne est une information, pas une lacune du site.

ThématiqueModèles avec mesureEn priorité seuleSans
Dette : point de départ et cible 2032150
Solde public, effort primaire et charge d'intérêts060
Dépense publique, aides et budgets protégés501
Fiscalité, niches et recettes nouvelles402
Retraites600
Travail, emploi et prestations600
Santé et hôpital600
État, opérateurs et collectivités600
Choc d'offre et croissance potentielle402
R&D, innovation et technologies critiques420
IA dans la transformation de l'État231
Méthode, stress tests et audit comptable060

Tableau large : faites défiler horizontalement.

Douze thématiques, réponse par réponse

Dette : point de départ et cible 20321 avec mesure5 en priorité seule

Niveau retenu pour 2025 et 2026, cible 2032, part de la baisse du ratio venant du dénominateur.

Ce que le sujet révèle. Les six partent du même ordre de grandeur pour 2025, de 115,6 % du PIB chez ChatGPT, Claude, Mistral et DeepSeek à 115,7 % chez Grok. Gemini fait exception et raisonne à partir de 112,0 % fin 2024 et de 114,5 % projetés fin 2026. Ce point de départ commande le résultat : sur la cible commune d'un solde nul en 2032, la dette finale va de 100,5 % chez Gemini à 110 ou 112 % chez Grok, soit un écart de 11,5 points de PIB. Sur la cible de 100 %, les six se resserrent, de 96,5 % chez Gemini à 100 % chez ChatGPT, Mistral et DeepSeek. Une seule mesure porte directement sur la dette elle-même : l'allongement de sa durée moyenne de 8 à 12 ans, proposé par Mistral. DeepSeek est le seul à inscrire une cession d'actifs publics, 20 Md€, dans sa trajectoire de désendettement, en indiquant qu'il distingue l'effet sur la dette nette sans chiffrer la perte patrimoniale.

ChatGPT

traité en priorité déclarée, sans mesure dédiée

  • Verdict exécutif
  • Scénario 3 · Dette à 100 % du PIB fin 2032

Lire la proposition

Claude

traité en priorité déclarée, sans mesure dédiée

  • Scénario 3 · Désendettement à 100 %

Lire la proposition

Grok

traité en priorité déclarée, sans mesure dédiée

  • Perspectives 2026 et diagnostic structurel
  • Scénario 3 · Désendettement
  • Conclusion générale

Lire la proposition

Gemini

traité en priorité déclarée, sans mesure dédiée

  • Scénario 3 · Désendettement
  • Synthèse comparative de Gemini

Lire la proposition

Mistral

1 mesure chiffrée

  • Allongement de la durée moyenne de la dette, de 8 à 12 ans

Lire la proposition

DeepSeek

traité en priorité déclarée, sans mesure dédiée

  • Synthèse exécutive
  • Scénario 3 · Désendettement

Lire la proposition

Solde public, effort primaire et charge d'intérêts0 avec mesure6 en priorité seule

Ampleur de l'ajustement, trajectoire annuelle du solde, coût de la dette, plafond d'excédent.

Ce que le sujet révèle. Aucun des six ne range le solde parmi ses mesures : c'est la cible, pas le levier. L'ajustement requis pour atteindre zéro en 2032 va de 5 points de PIB chez Grok, soit 150 à 170 Md€, à 8 points chez DeepSeek, soit 150 Md€ de mesures. ChatGPT chiffre 5,18 points, soit 194 Md€ ; Claude 5,8 points de solde primaire, soit 180 à 210 Md€ ; Mistral environ 150 Md€ ; Gemini ne chiffre pas globalement l'ajustement du scénario 1. La charge d'intérêts sépare ensuite les trajectoires. DeepSeek la voit croître de 77 à 96 Md€ jusqu'en 2032 sans se stabiliser, Gemini la voit refluer de 74 à 72 Md€. La cause est l'hypothèse de taux, 3,5 % sur toute la période chez DeepSeek contre 2,5 % chez Mistral. Sur le scénario 2, les six rejettent l'excédent de +10 % du PIB et situent le plafond soutenable entre +1 à +1,5 % chez Claude et +3 à +4 % chez Mistral.

ChatGPT

traité en priorité déclarée, sans mesure dédiée

  • Pourquoi le déficit persiste : sept constats
  • Scénario 1 · Équilibre en 2032
  • Scénario 2 · Excédent annuel de +10 % du PIB

Lire la proposition

Claude

traité en priorité déclarée, sans mesure dédiée

  • Les cinq constats structurants
  • Le besoin réel d'ajustement, décomposé en quatre moteurs
  • Scénario 1 · Équilibre en 2032
  • Scénario 2 · Super-excédent de +10 %

Lire la proposition

Grok

traité en priorité déclarée, sans mesure dédiée

  • Besoin d'ajustement par scénario
  • Scénario 1 · Équilibre
  • Scénario 2 · Super-excédent

Lire la proposition

Gemini

traité en priorité déclarée, sans mesure dédiée

  • Diagnostic macroéconomique de départ
  • Scénario 1 · Équilibre
  • Scénario 2 · Super-excédent

Lire la proposition

Mistral

traité en priorité déclarée, sans mesure dédiée

  • Diagnostic macroéconomique
  • Scénario 1 · Équilibre
  • Scénario 2 · Super-excédent

Lire la proposition

DeepSeek

traité en priorité déclarée, sans mesure dédiée

  • Diagnostic structurel : quatre constats
  • Scénario 1 · Équilibre
  • Scénario 2 · Super-excédent
  • Verdict final du modèle

Lire la proposition

Dépense publique, aides et budgets protégés5 avec mesure1 sans

Revue de la dépense, aides aux entreprises, budgets désignés à réduire, à protéger ou à augmenter.

Ce que le sujet révèle. Cinq modèles inscrivent la revue des aides aux entreprises dans leur liste de réformes. Mistral est le seul à ne pas le faire : son tableau chiffre les retraites, la santé, la fonction publique, la fiscalité, la croissance et la dette, pas les aides. Claude et Gemini classent ce gisement au premier rang de leur matrice impact sur difficulté, ChatGPT au troisième avec un ratio de 2,14 contre 2,33 pour le taux d'emploi. Les ordres de grandeur ne coïncident pas : plus de 100 Md€ par an de niches fiscales et sociales chez DeepSeek, environ 200 Md€ tous dispositifs chez Claude, et une fourchette de 88 à plus de 200 Md€ relevée par ChatGPT selon le périmètre retenu. DeepSeek est aussi le seul à faire figurer l'éducation prioritaire et la justice dans ses dix réformes, là où ChatGPT et Grok les rangent dans une liste séparée de budgets à protéger ou à augmenter.

Claude

1 mesure chiffrée

  • Revue des aides aux entreprises, effets d'aubaine, rentes

Lire la proposition

Grok

1 mesure chiffrée

  • Suppression ou réorientation des niches et aides d'aubaine inefficaces

Lire la proposition

Gemini

1 mesure chiffrée

  • Rationalisation des aides aux entreprises, +11 Md€ par an

Lire la proposition

DeepSeek

3 mesures chiffrées

  • Aides aux entreprises
  • Éducation prioritaire
  • Justice et sécurité

Lire la proposition

Fiscalité, niches et recettes nouvelles4 avec mesure2 sans

Niches fiscales, assiettes, prélèvements nouveaux, fraude et recouvrement.

Ce que le sujet révèle. Quatre modèles consacrent une mesure à la fiscalité. Claude et Gemini n'en ont aucune dans leur liste : Claude traite les niches dans sa revue de dépense, Gemini les agrège aux aides aux entreprises. L'écart de chiffrage est le plus large du benchmark sur une même assiette. Mistral chiffre la suppression de la moitié des niches à +50 Md€ de recette nette, sans estimation comportementale. ChatGPT retient +18 Md€ en 2032 après évaluation comportementale, DeepSeek +10 Md€ pour cinquante niches supprimées. Claude pose la règle inverse : le rendement net est toujours inférieur au coût brut affiché, et une suppression de niche ne doit jamais être comptée en recette nette intégrale. Sur les recettes nouvelles, Mistral et DeepSeek proposent une hausse de la CSG sur les revenus du capital ; DeepSeek y ajoute une fiscalité écologique et un mécanisme d'ajustement carbone aux frontières.

Grok

1 mesure chiffrée

  • Fiscalité : élargissement des bases, efficacité de la collecte, stabilité pour l'investissement

Lire la proposition

Mistral

2 mesures chiffrées

  • Suppression de 50 % des niches fiscales, base 100 Md€ par an
  • Hausse de la CSG d'un point sur les revenus du capital

Lire la proposition

Retraites6 avec mesure

Âge, durée, indexation, régimes spéciaux, convergence public-privé.

Ce que le sujet révèle. Thème couvert par les six, et celui où le nombre de mesures est le plus élevé. Les paramètres divergent : âge légal à 64 ans chez Mistral, âge pivot à 65 ans chez DeepSeek dans le scénario 1 et 66 ans dans le scénario 3, âge à 65 ans chez ChatGPT, âge effectif chez Grok. Gemini ne touche pas à l'âge et joue sur l'indexation différenciée, inflation moins 0,5 point pour les pensions supérieures à 2 000 € pendant quatre ans. Claude ne retient pas l'âge comme premier levier. Il classe l'indexation ciblée des pensions élevées au sixième rang de sa matrice et la convergence public-privé au neuvième, les deux avec une difficulté politique notée 8 et 9 sur 10. Il rappelle aussi que le COR anticipe, à législation constante, une baisse tendancielle de la part des retraites dans le PIB. Les rendements annoncés vont de 12 Md€ chez Gemini à 20 Md€ chez DeepSeek ; Mistral décompose 10 Md€ pour l'âge, 5 Md€ pour l'indexation et 3 Md€ pour les régimes spéciaux.

Claude

2 mesures chiffrées

  • Indexation ciblée des pensions élevées
  • Convergence des règles de retraite public-privé

Lire la proposition

Grok

1 mesure chiffrée

  • Réforme paramétrique et systémique des retraites : âge effectif, indexation, convergence, seniors

Lire la proposition

Mistral

3 mesures chiffrées

  • Relèvement de l'âge légal à 64 ans, 2027-2032
  • Indexation des pensions sur l'inflation moins 0,5 point
  • Fusion des régimes spéciaux, SNCF, RATP

Lire la proposition

Travail, emploi et prestations6 avec mesure

Taux d'emploi des seniors, durée effective, assurance chômage, prestations et effets de seuil.

Ce que le sujet révèle. Quatre modèles font du taux d'emploi, en particulier celui des seniors, un levier de premier rang. ChatGPT le place en tête de sa matrice avec un ratio de 2,33, Claude au deuxième rang, Grok et Gemini le nomment parmi leurs réformes. Mistral s'en tient à une réforme du marché du travail, flexibilité et formation, sans nommer le taux d'emploi. DeepSeek n'en fait pas un moteur de l'ajustement : il traite l'assurance chômage par la dégression des allocations au-delà de douze mois et annonce 500 000 créations d'emplois comme conséquence de son scénario 1. Sur les prestations, Claude cible les effets de seuil du RSA, de la prime d'activité et des APL, ChatGPT une base ressources commune avec versement automatique. Gemini va plus loin avec une allocation sociale unique fusionnant ces trois dispositifs, assortie d'une obligation de quinze heures hebdomadaires d'activité ou de formation. Cette proposition n'a d'équivalent dans aucune autre réponse.

Claude

2 mesures chiffrées

  • Emploi des seniors et assiette cotisée
  • Traitement des effets de seuil, RSA, prime d'activité, APL

Lire la proposition

Grok

1 mesure chiffrée

  • Marché du travail : emploi des seniors, formation, accompagnement renforcé, durée effective

Lire la proposition

Gemini

3 mesures chiffrées

  • Allocation sociale unique, +3,5 Md€ par an net
  • Temps de travail effectif et flexibilité, +4 Md€ par an
  • Réforme du CPF et de la formation continue, +2,5 Md€ par an

Lire la proposition

Mistral

1 mesure chiffrée

  • Réforme du marché du travail, flexibilité et formation

Lire la proposition

Santé et hôpital6 avec mesure

Pertinence des actes, achats hospitaliers, ambulatoire, prévention, fraude.

Ce que le sujet révèle. Thème couvert par les six. Le contenu converge chez cinq d'entre eux : pertinence des actes, achats hospitaliers mutualisés, virage ambulatoire, prévention, lutte contre la fraude. Gemini ajoute la forfaitisation des maladies chroniques et un agent d'audit des prescriptions et des doublons d'examens, pour 10 Md€ par an. DeepSeek retient la télémédecine, l'IA pour le diagnostic et le regroupement de sites. Grok ajoute la territorialisation. Mistral traite la santé par deux lignes seulement, la fraude pour +5 Md€ et l'optimisation des achats publics pour +4 Md€, sans réorganisation de l'offre de soins. Claude est le seul à donner un rendement en points de PIB, 0,4 à 0,8, et à le qualifier de lent, cinq à sept ans, avec une part à réinvestir.

Claude

1 mesure chiffrée

  • Pertinence des actes en santé et achats hospitaliers

Lire la proposition

Grok

1 mesure chiffrée

  • Réorganisation de l'offre de soins : pertinence, IA, prévention, territorialisation

Lire la proposition

Gemini

1 mesure chiffrée

  • Forfaitisation santé, IA et prévention, +10 Md€ par an

Lire la proposition

Mistral

2 mesures chiffrées

  • Lutte contre la fraude, 10 % des dépenses
  • Optimisation des achats publics, médicaments, hôpital

Lire la proposition

État, opérateurs et collectivités6 avec mesure

Effectifs et masse salariale, agences, fonctions support, échelons territoriaux, simplification.

Ce que le sujet révèle. Thème couvert par les six, et celui où les cibles d'effectifs s'écartent le plus. Mistral retient une réduction de 10 % des effectifs non remplacés pour +8 Md€, DeepSeek 5 % sur six ans par attrition pour +15 Md€, Gemini le non-remplacement de 45 000 agents administratifs en doublon. ChatGPT refuse le pourcentage uniforme et propose une gestion des effectifs par métiers. Claude refuse également de raisonner en nombre d'agents et classe l'attrition avec automatisation au dixième et dernier rang de sa matrice. Sur les collectivités, cinq modèles proposent une mesure : suppression de l'échelon départemental au profit des métropoles et EPCI chez Gemini, fusion des régions et des départements chez DeepSeek, rationalisation des échelons et des financements croisés chez Grok, fin des financements croisés ordinaires chez ChatGPT, réduction des échelons chez Claude, qui la note avec une difficulté de 9 sur 10 et un délai de 8 sur 10. Mistral ne traite pas les collectivités dans son tableau de réformes.

ChatGPT

2 mesures chiffrées

  • État recentré
  • Collectivités à compétences lisibles

Lire la proposition

Claude

3 mesures chiffrées

  • Rationalisation agences et opérateurs de l'État
  • Réduction des échelons territoriaux
  • Attrition et automatisation de la fonction publique

Lire la proposition

Grok

3 mesures chiffrées

  • Simplification administrative massive et transformation numérique de l'État
  • Réforme de la fonction publique : productivité, mobilité, automatisation des fonctions support
  • Rationalisation des échelons territoriaux et des financements croisés

Lire la proposition

Gemini

1 mesure chiffrée

  • Fusion départements et intercommunalités, +7 Md€ par an

Lire la proposition

DeepSeek

3 mesures chiffrées

  • État plateforme
  • Collectivités territoriales
  • Simplification administrative

Lire la proposition

Choc d'offre et croissance potentielle4 avec mesure2 sans

Hypothèses de croissance, simplification, énergie, logement et foncier, productivité.

Ce que le sujet révèle. Les hypothèses de croissance réelle en 2032 vont de 1,4 % chez Claude à 2,0 % chez Mistral, atteints dès 2030. ChatGPT retient 1,70 %, Gemini 1,6 % en scénario 1 et 1,8 % en scénario 3, Grok 1,5 à 1,6 %, DeepSeek 1,5 %. Sur six ans, un écart de 0,6 point représente environ 3,7 points de PIB cumulés, soit plus que l'effort d'économies de plusieurs scénarios. Claude écrit que toute IA faisant reposer l'atteinte de ses cibles sur une croissance nominale de 4 à 5 % triche. Quatre modèles inscrivent un levier d'offre dans leur liste de réformes : choc productif chez ChatGPT, simplification normative pro-investissement chez Claude, choc d'offre énergie compétitive chez Grok, choc d'offre logement et réforme des APL chez Gemini. Le logement n'est traité que par ChatGPT et Gemini. Mistral et DeepSeek ne consacrent aucune mesure à un choc d'offre : DeepSeek range sa simplification administrative du côté des normes et du silence vaut accord.

Grok

1 mesure chiffrée

  • Choc d'offre énergie compétitive : nucléaire, réseaux, bas carbone

Lire la proposition

Gemini

1 mesure chiffrée

  • Choc d'offre logement et réforme APL, +4,5 Md€ par an

Lire la proposition

R&D, innovation et technologies critiques4 avec mesure2 en priorité seule

Cible de DIRD, budget public additionnel, filières, indicateurs et conditions d'arrêt.

Ce que le sujet révèle. Quatre modèles fixent une cible de DIRD proche : 3,0 % du PIB chez ChatGPT et Claude, 3,0 à 3,2 % chez Grok, 3,2 % chez Gemini, 3 % chez Mistral. DeepSeek n'en fixe aucune. Le point de départ est le même partout, 2,18 % du PIB. Pour des cibles voisines, l'effort public annoncé varie du simple au quadruple : 10 à 15 Md€ par an chez Claude, 20 Md€ chez Mistral et DeepSeek, 22 Md€ chez ChatGPT dans le scénario 3, 45 Md€ chez Gemini répartis sur sept filières. Cet écart traduit des hypothèses très différentes sur l'effet de levier vers la recherche privée. Grok pose le cadre attendu, budget actuel, budget supplémentaire, financement, objectif, indicateurs et conditions d'arrêt, mais ne chiffre pas les montants par domaine. Gemini est le seul à donner pour chaque filière un budget 2026, un budget 2032, un indicateur de résultat et une condition d'arrêt. Claude et DeepSeek n'inscrivent pas la R&D dans leur liste de réformes : ils la traitent en section dédiée, comme un investissement soumis à évaluation.

Claude

traité en priorité déclarée, sans mesure dédiée

  • Budget stratégique R&D et innovation

Lire la proposition

Grok

1 mesure chiffrée

  • Budget R&D et innovation porté à 3,0-3,2 % du PIB avec évaluation stricte

Lire la proposition

Gemini

1 mesure chiffrée

  • Budget stratégique d'innovation et réindustrialisation, -15,5 Md€ par an réinvestis

Lire la proposition

DeepSeek

traité en priorité déclarée, sans mesure dédiée

  • Budget stratégique R&D et innovation

Lire la proposition

IA dans la transformation de l'État2 avec mesure3 en priorité seule1 sans

Gisements démontrables, plausibles et théoriques, séquence d'automatisation, risques.

Ce que le sujet révèle. Quatre modèles appliquent la taxonomie demandée par le prompt : économies démontrables, plausibles, théoriques. ChatGPT chiffre 2 à 4 Md€ par an de démontrable, 8 à 15 Md€ de plausible et 25 à 40 Md€ de théorique non budgété. Gemini chiffre 6,5 Md€ de démontrable, 5,5 Md€ de plausible et 2,5 Md€ de théorique non engagé. Claude pose la règle et écarte explicitement le potentiel théorique du calcul d'équilibre, sans le chiffrer. Grok annonce la distinction sans produire de gisement. Mistral et DeepSeek ne traitent pas cette section. Mistral chiffre néanmoins +6 Md€ pour l'automatisation par IA de 30 % des tâches administratives, dans son tableau général de réformes. DeepSeek mobilise l'IA dans le diagnostic hospitalier et dans son État plateforme, sans en tirer de gisement séparé. La séquence recommandée est identique chez les quatre qui traitent le sujet : supprimer la procédure, standardiser la donnée, automatiser, puis réduire ou redéployer les moyens.

ChatGPT

traité en priorité déclarée, sans mesure dédiée

  • IA et transformation de l'État

Lire la proposition

Claude

traité en priorité déclarée, sans mesure dédiée

  • L'IA dans la transformation de l'État

Lire la proposition

Grok

traité en priorité déclarée, sans mesure dédiée

  • IA dans la transformation de l'État

Lire la proposition

Gemini

1 mesure chiffrée

  • Déploiement numérique et IA dans l'État, +6,5 Md€ par an

Lire la proposition

Mistral

1 mesure chiffrée

  • Automatisation par IA de 30 % des tâches administratives

Lire la proposition

Méthode, stress tests et audit comptable0 avec mesure6 en priorité seule

Socle commun aux trois scénarios, statuts des valeurs, tests de résistance, réconciliation finale.

Ce que le sujet révèle. C'est le thème qui sépare le plus les six réponses, et aucun modèle n'en fait une mesure. ChatGPT et Claude appliquent les statuts FAIT, HYPOTHÈSE, ESTIMATION et PROPOSITION, Claude valeur par valeur. Grok les annonce en règles de rigueur. Gemini, Mistral et DeepSeek ne les appliquent pas. Quatre modèles tiennent un socle macroéconomique unique pour les trois scénarios. Gemini fait varier son taux d'émission OAT selon le scénario, 3,0 %, 2,3 % puis 2,6 %, et DeepSeek fait varier croissance, inflation et taux à la fois, ce qui rend leurs propres scénarios moins directement comparables entre eux. Trois audits comptables sont produits : ChatGPT en réconcilie trois, Claude signale un écart résiduel d'environ 1 point de PIB plutôt que de le forcer, DeepSeek reconnaît un écart de 3 points de PIB, soit 90 Md€, dont les économies correspondantes ne sont pas identifiées. Gemini et Mistral ne produisent pas d'audit. Les stress tests sont chiffrés chez ChatGPT, Claude, Gemini et DeepSeek, décrits sans chiffrage chez Grok, absents chez Mistral. Pour un même choc de récession, l'impact retenu sur le solde va de 1,1 point de PIB chez ChatGPT à 3,5 points chez DeepSeek.

ChatGPT

traité en priorité déclarée, sans mesure dédiée

  • Stress tests
  • Classement des réformes par rapport impact sur difficulté
  • Audits comptables

Lire la proposition

Claude

traité en priorité déclarée, sans mesure dédiée

  • Socle macroéconomique central commun
  • Stress tests
  • Audit comptable final

Lire la proposition

Grok

traité en priorité déclarée, sans mesure dédiée

  • Socle macroéconomique commun
  • Stress tests

Lire la proposition

Gemini

traité en priorité déclarée, sans mesure dédiée

  • Cadre d'analyse et socle macroéconomique central
  • Stress tests et résilience budgétaire
  • Matrice d'arbitrage des dix réformes clés

Lire la proposition

Mistral

traité en priorité déclarée, sans mesure dédiée

  • Méthode annoncée par Mistral
  • Socle macroéconomique commun
  • Ce que la réponse ne contient pas

Lire la proposition

DeepSeek

traité en priorité déclarée, sans mesure dédiée

  • Plan d'action séquencé, scénario 1
  • Tests de résistance, scénario 1
  • Audit comptable et réconciliation

Lire la proposition

Ce que personne ne chiffre

Douze thèmes, six réponses, soixante-douze cases. Quatre thèmes seulement sont dotés d'une mesure chez les six modèles : les retraites, la santé, l'État et le travail. Deux n'en reçoivent aucune, le solde public et la méthode, parce que ce sont la cible et le cadre, pas des leviers. La dette n'a qu'une mesure, l'allongement de sa durée moyenne proposé par Mistral. L'IA dans l'État en a deux, chez Gemini et Mistral.

Le benchmark porte sur une cible chiffrée commune, pas sur un programme politique. La grille sépare donc deux niveaux que les réponses mélangent : une mesure inscrite dans la liste de réformes du modèle, et un sujet traité en section sans mesure associée. Un sujet absent de la première colonne peut occuper plusieurs pages de la seconde.

Le reclassement dans cette grille commune est éditorial. Aucun libellé, aucun chiffrage des modèles n'a été modifié.

Le scénario 2 : ce que chaque IA écrit quand la cible devient absurde

["Le scénario 2, un excédent public de +10 % du PIB en 2032, n'est retenu par aucun des six modèles. Il reste le seul endroit du benchmark où l'on voit ce que chacun accepte de produire quand la cible est posée sans condition de soutenabilité. Voici, modèle par modèle, ce que leur propre réponse contient sur ce scénario, repris sans retouche.", 'Ces trajectoires ne sont pas des propositions du site. Ce sont les productions des modèles, y compris quand elles sont invraisemblables ou contredites par leur propre verdict.']

Mistral produit bien une trajectoire annuelle pour ce scénario, mais son tableau de synthèse porte la mention « à affiner avec chiffrage précis » et sa recommandation finale est qualifiée de préliminaire par le modèle lui-même. Ses valeurs sont lues sous ce statut, qui est celui du modèle et non le nôtre.
Deux façons de répondre apparaissent. Quatre modèles produisent un tableau complet, ChatGPT, Gemini, Mistral et DeepSeek. Grok s'en tient à un chiffrage global et distingue l'amélioration comptable de 15 points de l'effort primaire réel, qu'il estime à 12 à 14 points. Claude refuse de tracer une trajectoire, au motif qu'une montée en charge lissée serait malhonnête. Le modèle qui pousse la cible le plus loin, Gemini, aboutit à des dépenses publiques ramenées à 30,1 % du PIB et à une dette de 47,8 % en 2032, valeurs sans équivalent dans les cinq autres réponses.

Le même exercice, sur les programmes présidentiels

La grille thématique existe aussi sur IA Candidats 2027, où les six mêmes modèles ont produit un programme complet pour la présidentielle. Les deux sites se lisent ensemble : ici l'arithmétique budgétaire, là le programme politique qui devrait la porter.

Ouvrir la grille thématique d'IA Candidats 2027 (nouvel onglet)

Vous avez une entreprise et vous voulez passer à l'action sur l'IA ?

Formations sur mesure, Diagnostic D.I.A.G., développements : l'accompagnement Digital Mate part de votre réalité, pas de la technologie.

Voir l'accompagnement →