Faisabilité

Les six programmes passés à la grille de 1958-2027

La page Historique se termine sur trois questions : précision, capacité, réversibilité. Elles sont ici appliquées aux six programmes, engagement par engagement, avec la mesure citée qui justifie chaque note. Le classement qui en sort n'est pas celui du comparatif.

Note d'analyse réalisée le 26 août 2026 avec Claude Fable 5 Max. Grille dérivée de la série Sciences Po 1995-2022.

Le barème est publié avant les notes

3
critères
Précision, capacité, réversibilité
PROPOSITION
15
points au total
Cinq points par critère
PROPOSITION
8 à 11
sur 15
Écart entre le dernier et les premiers
INFÉRENCE
4
places gagnées
Écart avec le classement du comparatif
INFÉRENCE
Conflit d'intérêts déclaré. Cette page a été produite avec Claude, qui est l'un des six modèles notés, et Claude arrive en tête de la grille à égalité avec Mistral. Le lecteur est invité à contrôler chaque note contre la mesure citée, toutes reprises telles quelles des documents d'origine téléchargeables depuis la page Sources. Le barème est publié avant les notes précisément pour que le désaccord porte sur l'application de la règle, pas sur son existence.

Trois critères, cinq points chacun. Le barème est fixé à partir de ce que la série 1995-2022 mesure réellement, pas à partir de ce qui rend un programme sympathique. Un programme peut être excellent et mal noté ici : la grille n'évalue pas la qualité des idées, elle évalue la probabilité qu'il en reste quelque chose en 2032.

Précision

L'engagement est-il assez précis pour qu'on puisse vérifier sa tenue en 2032 : une date, un montant, un périmètre ?

Critère central de la méthode du Comparative Party Pledges Group (Thomson et al., 2017) : une promesse n'entre dans le corpus que si l'on peut construire un indicateur de vérification. Ce qui n'est pas codable n'est jamais ni tenu ni trahi, seulement oublié.

Le barème, note par note
  1. 5 : chaque mesure porte un montant, un périmètre et un horizon daté.
  2. 4 : montants et périmètres systématiques, horizon souvent implicite.
  3. 3 : chiffrage en fourchettes larges, plusieurs mesures non chiffrées.
  4. 2 : orientations chiffrées globalement, pas mesure par mesure.
  5. 1 : intentions sans indicateur possible.

Capacité

Quelle configuration institutionnelle l'exécution suppose-t-elle : loi de finances, loi ordinaire, loi organique, révision constitutionnelle, référendum, négociation européenne ?

Résultat le mieux établi de la série : la capacité explique le taux mieux que la sincérité. Chirac I à 30 % en cohabitation, Macron I au-dessus de 70 % avec une majorité absolue. Une note haute désigne un programme exécutable sans majorité absolue, pas un programme modeste.

Le barème, note par note
  1. 5 : exécutable en loi de finances et par voie réglementaire.
  2. 4 : lois ordinaires, majorité simple suffisante sur l'essentiel.
  3. 3 : suppose une majorité absolue et des lois lourdes.
  4. 2 : contient au moins une mesure structurante qui a déjà fait échouer un exécutif.
  5. 1 : suppose une révision constitutionnelle ou un référendum.

Réversibilité

Que reste-t-il de la mesure si la conjoncture tourne, si la majorité tombe, si le successeur la défait ? Et le modèle a-t-il posé la question ?

L'impôt sur les grandes fortunes de 1982 est supprimé en 1986, rétabli en 1989, transformé en 2017. La retraite à 60 ans de 1982 passe à 62, puis 64, puis se retrouve gelée en 2025. La note porte sur la lucidité du modèle : a-t-il chiffré le coût de sortie de ce qu'il engage ?

Le barème, note par note
  1. 5 : réversibilité traitée mesure par mesure, coûts de sortie chiffrés.
  2. 4 : seuil de sortie explicite et irréversibilités nommées.
  3. 3 : la conjoncture est testée, la réversibilité politique ne l'est pas.
  4. 2 : la question est mentionnée sans conséquence sur le chiffrage.
  5. 1 : engagements de plusieurs décennies, aucun coût de sortie.

Les six notés, avec la mesure qui justifie la note

Chaque note renvoie à une mesure citée telle qu'elle figure dans le document d'origine. Le scénario retenu est l'Ambitieux pour les six, parce que c'est celui que cinq d'entre eux recommandent et celui que le sixième chiffre le plus complètement. ChatGPT recommande en réalité un hybride, Prudent dans le budget et Ambitieux dans les actifs : sa colonne lit donc son scénario le plus documenté, pas sa recommandation littérale.

Rang et modèlePrécisionCapacitéRéversibilitéTotal
1. Claude3 / 54 / 54 / 511 / 15
2. Mistral3 / 53 / 55 / 511 / 15
3. ChatGPT5 / 52 / 53 / 510 / 15
4. Grok2 / 54 / 53 / 59 / 15
5. DeepSeek4 / 52 / 53 / 59 / 15
6. Gemini5 / 52 / 51 / 58 / 15

Tableau large : faites défiler horizontalement.

Rang 1 sur 6

ClaudeAnthropic

11/ 15
Précision3/5

Fourchettes systématiques, deux mesures non chiffrées

La mesure citée et la note

Emploi des seniors et quantité de travail, Ambitieux : index contraignant, conditionnalité des fins de carrière, réforme de l'assurance chômage : +15 à 25 Md€

Une amplitude de 10 milliards sur une seule ligne n'est pas vérifiable au sens du codage : à 15 comme à 25, la promesse est tenue. Deux mesures échappent complètement au chiffrage, « Immigration économique qualifiée : politique par compétences et intégration réelle » et « Union des marchés de capitaux : coût national quasi nul ». Le modèle assume ce choix, il n'en reste pas moins que le tiers de son programme ne serait pas codable.

Capacité4/5

Le seul à écarter explicitement la révision constitutionnelle

La mesure citée et la note

Réforme constitutionnelle, Prudent : écartée. Ambitieux : écartée.

Le programme recommandé tient en lois de finances et en lois ordinaires. Aucune mesure ne suppose de majorité qualifiée, aucune ne rejoue la réforme systémique des retraites qui a échoué en 2020 avec une majorité absolue et le 49.3. Réserve sérieuse : l'Union des marchés de capitaux dépend d'une négociation à vingt-sept qu'aucun président français ne contrôle, et elle porte une part significative de l'effet de croissance annoncé.

Réversibilité4/5

Un seuil de sortie chiffré

La mesure citée et la note

Marge de dépense hors lois de programmation et hors intérêts : 11 Md€/an, statut FAIT. Sur le Disruptif, le modèle refuse de conclure : la fourchette de financement est trop large, l'incertitude est le résultat.

Borner le programme par une marge connue donne un seuil explicite : on sait à quel moment on sort de l'épure et il faut arbitrer. Le refus de conclure sur le scénario de rupture, motivé par un couple incertitude-irréversibilité défavorable, est la formulation la plus proche du critère. Il manque le chiffrage des coûts de sortie mesure par mesure, que seul Mistral produit.

Rang 2 sur 6

MistralMistral AI

11/ 15
Précision3/5

Quatre colonnes solides, un audit qui se contredit

La mesure citée et la note

Audit du document : le scénario Disruptif affiche un solde net positif de 200 Md€ sur cinq ans tout en aboutissant à un déficit de 6 % du PIB en 2032, plus dégradé que le point de départ.

La structure est la meilleure des six, coût brut, financement annoncé et réversibilité pour chaque mesure. Mais le programme n'est pas décliné par scénario mesure par mesure, et l'incohérence comptable ci-dessus n'est pas relevée par le modèle. Un engagement précis adossé à un audit faux n'est pas plus vérifiable qu'un engagement vague.

Capacité3/5

Budgétaire dans l'exécution, fragile dans le financement

La mesure citée et la note

Souveraineté industrielle : 10 Md€, financés par 5 Md€ de taxe sur les grandes plateformes, 3 Md€ de cessions, 2 Md€ d'emprunt européen. Cession d'actifs : recette de 20 Md€/an.

Les mesures passent en loi de finances, ce qui est un avantage réel : pas de révision constitutionnelle, pas de référendum. Le point de rupture est ailleurs. La taxe sur les grandes plateformes relève d'un cadre européen ou expose à une riposte commerciale américaine, et 20 milliards de cessions d'actifs par an ne se répètent pas cinq années de suite : c'est un stock présenté comme un flux.

Réversibilité5/5

Le seul à chiffrer ses coûts de sortie

La mesure citée et la note

Relance du nucléaire, EPR2 et SMR : réversibilité très faible, 20 à 30 Md€ par réacteur. Cession d'actifs : irréversible, le modèle le signale.

Une colonne Réversibilité mesure par mesure, avec le coût d'arrêt en euros. C'est exactement la troisième question de la grille, posée par le modèle avant qu'on la lui pose. Le programme le plus prescriptif du benchmark est aussi le seul qui dise ce qu'il en coûterait de faire marche arrière, ce qui est la définition d'un engagement pris en connaissance de cause.

Rang 3 sur 6

ChatGPTOpenAI

10/ 15
Précision5/5

Quatorze mesures chiffrées et la seule trajectoire annuelle

La mesure citée et la note

Retraites : durée, indexation, équité, Ambitieux : 2 Md€ de compensation, 22 Md€ d'économies, âge effectif relevé d'environ douze mois. Trajectoire de déficit publiée pour 2027, 2028, 2029, 2030, 2031 et 2032.

Chaque mesure porte un coût, une économie et une recette, dans les trois intensités. Aucun autre modèle ne publie le chemin année par année, ce qui rend le programme vérifiable en cours de route et pas seulement à la fin. Réserve : « âge effectif relevé d'environ douze mois » décrit un résultat et non un levier juridique. Un codeur de 2032 saura le mesurer, il ne saura pas à quelle loi le rattacher.

Capacité2/5

Trois chantiers qui consomment chacun un mandat

La mesure citée et la note

Loi de programmation opposable et revues de dépenses. Disruptif : règle constitutionnelle de solde primaire. Retraites, Disruptif : régime universel par points et âge d'équilibre automatique.

Une loi de programmation « opposable » suppose au minimum une loi organique, la règle de solde primaire une révision constitutionnelle. Le régime universel par points est l'exemple canonique de ce qu'une majorité absolue et le 49.3 n'ont pas suffi à faire adopter en 2020. S'y ajoutent la refonte de la procédure pénale et la suppression d'échelons territoriaux. Le modèle s'attribue lui-même 40 % de probabilité de tenir son scénario Ambitieux, ce qui est la note de capacité la plus lucide des six, et il n'en tire aucune conséquence sur son chiffrage.

Réversibilité3/5

La conjoncture est testée, la majorité ne l'est pas

La mesure citée et la note

Tests de résistance : taux souverains +100 points de base, récession européenne en 2028. Verdict, ligne Réversibilité : forte, moyenne, faible selon le scénario.

Quatre chocs appliqués aux trois scénarios répondent à la première moitié de la question, celle de la conjoncture, et c'est le seul modèle à le faire. La seconde moitié manque : rien sur ce qui subsiste si la majorité tombe en 2029. La ligne Réversibilité du verdict est qualitative et n'est reprise nulle part dans les enveloppes.

Rang 4 sur 6

GrokxAI

9/ 15
Précision2/5

Six priorités, pas de mesures

La mesure citée et la note

Travail et démographie, Ambitieux : réforme systémique par points ou comptes notionnels partiels.

Le « ou » suffit à disqualifier l'engagement au sens du codage : les deux options n'ont ni le même coût, ni le même calendrier, ni le même conflit social, et rien ne dit laquelle serait tenue. Le modèle ne publie que six priorités et assume de ne donner que des fourchettes. C'est cohérent avec sa prudence affichée, mais un programme dont rien ne peut être vérifié en 2032 ne sera jamais reproché à personne.

Capacité4/5

Une règle de pilotage plutôt qu'une cible

La mesure citée et la note

Cible de solde primaire structurel : −1 % du PIB en Prudent, zéro en Ambitieux, +0,5 à +1 % en Disruptif.

Piloter par le solde primaire plutôt que par une cible de déficit est le choix institutionnellement le plus intelligent des six. C'est un instrument de loi de finances, réarbitré chaque année, qui ne suppose ni majorité qualifiée ni révision, et qui survit à un changement de majorité parce qu'il se renégocie au lieu de se défaire. Réserve : la réforme systémique de l'Ambitieux réintroduit exactement le chantier que cette prudence permettait d'éviter.

Réversibilité3/5

Réversible par construction, jamais traité explicitement

La mesure citée et la note

Énergie et nucléaire, Disruptif : nationalisation temporaire de segments critiques, 12 à 15 Md€/an.

Une règle de pilotage est ajustable, donc peu irréversible, et le modèle bénéficie de cette qualité sans l'avoir cherchée. En revanche la question n'est jamais posée. Le mot « temporaire » appliqué à une nationalisation, sans clause ni calendrier de sortie, est précisément ce que la série historique enseigne à ne pas croire.

Rang 5 sur 6

DeepSeekDeepSeek

9/ 15
Précision4/5

Chiffrage systématique, coûts de transition affichés

La mesure citée et la note

Retraites, Disruptif : âge pivot à 67 ans, suppression des régimes spéciaux, capitalisation complémentaire obligatoire : 20 Md€, 15 Md€ de transition.

Afficher le coût de transition à côté du rendement est une rigueur que quatre modèles sur six n'ont pas. Deux réserves : les horizons sont rarement datés, et le déficit est exprimé en 2027 quand les cinq autres le donnent en 2032, ce qui interdit la comparaison directe et raccourcit commodément la fenêtre d'évaluation.

Capacité2/5

Deux serpents de mer dans le scénario recommandé

La mesure citée et la note

Maîtrise de la dépense publique, Disruptif : fusion des régions de 13 à 6, suppression des départements. Niches fiscales, Disruptif : fusion IR-CSG. Retraites, Ambitieux : âge légal à 65 ans.

La suppression de l'échelon départemental suppose une révision constitutionnelle. La fusion de l'impôt sur le revenu et de la CSG est proposée depuis 1990 et n'a jamais été adoptée, sous aucune majorité. L'âge légal à 65 ans figure dans le scénario recommandé : deux ans au-dessus de ce que la réforme de 2023 a coûté à son exécutif, et cette réforme-là est aujourd'hui gelée.

Réversibilité3/5

Lucide sur son scénario de rupture, muet sur le reste

La mesure citée et la note

Le modèle assortit son scénario Disruptif d'une alerte explicite : l'excédent apparent de 10 Md€ est fictif faute de validation des hypothèses comportementales.

Déclarer soi-même un résultat comptablement fictif est une honnêteté rare, et elle vaut d'être signalée. Mais elle ne s'étend pas au programme recommandé : les 15 Md€ de coût de transition des retraites et les 5 Md€ de la fusion des régions sont engagés sans que rien ne soit dit de ce qu'il advient s'ils sont interrompus à mi-parcours, ce qui est le scénario le plus probable.

Rang 6 sur 6

GeminiGoogle

8/ 15
Précision5/5

Le plus codable des six

La mesure citée et la note

Travail et retraites, Ambitieux : âge légal à 65 ans en 2032, alignement des régimes, 20 h d'activité obligatoire au RSA : +14 Md€/an. Efficacité publique, Ambitieux : 120 000 postes supprimés, fusion de 80 agences : +7 Md€/an.

Une date, un seuil, un périmètre, un montant, sur chaque ligne. C'est la forme exacte que la méthode du consortium international réclame, et le seul programme du benchmark qu'un chercheur pourrait coder sans arbitrage. La note porte sur la forme et rien d'autre : elle ne dit pas que ces mesures sont bonnes, elle dit qu'on saura en 2032 si elles ont été prises.

Capacité2/5

Trois mesures jamais tentées, 65 % de probabilité affichée

La mesure citée et la note

Efficacité publique, Disruptif : suppression de l'échelon départemental et de 250 000 postes. Capital humain, Disruptif : chèque éducation universel, fin du statut pour les nouveaux enseignants. Probabilité de mise en œuvre affichée : 90 % en Prudent, 65 % en Ambitieux, 30 % en Disruptif.

La suppression du département relève de l'article 72 de la Constitution. La fin du statut et le chèque éducation n'ont jamais été tentés par aucune majorité de la Ve République. Le modèle affiche pourtant les probabilités de mise en œuvre les plus élevées des six. C'est l'écart le plus net du benchmark entre la difficulté réelle et la confiance déclarée.

Réversibilité1/5

Des engagements à trente ans sans coût de sortie

La mesure citée et la note

Souveraineté énergétique, Disruptif : vingt EPR2, nationalisation du réseau. Travail et retraites, Disruptif : régime universel par points et 5 % de capitalisation obligatoire. Fiscalité, Disruptif : suppression de tous les impôts de production.

Vingt réacteurs engagent trois décennies, une capitalisation obligatoire engage une génération, une suppression d'impôt de production ne se rétablit pas sans coût politique majeur. Aucun coût de sortie n'est chiffré. Plus révélateur encore : le scénario recommandé produit un meilleur résultat que le scénario de rupture, ce qui n'est arithmétiquement possible que si l'on suppose qu'aucune mesure ne se défait jamais.

Ce que devient un programme réalisé à 54 %

Un programme réalisé à 54 % ne produit pas 54 % de son résultat annoncé. Il en produit beaucoup moins, parce que les dépenses et les économies ne se réalisent pas au même rythme. C'est le seul enseignement de la série 1995-2022 qui se chiffre directement sur les six programmes.

La règle de réalisation asymétrique. Les dépenses nouvelles se réalisent presque intégralement, parce qu'elles passent par le vote annuel des crédits : elles ne demandent qu'une majorité et une signature. La série retient 90 %. Les économies et les recettes structurelles se réalisent au taux du mandat, parce qu'elles supposent des réformes, donc du conflit, du temps parlementaire et de la constance. La série retient 30 %, 54 % ou 70 % selon la configuration. La démonstration est dans les mandats eux-mêmes. Hollande a livré ses 60 000 postes, qui étaient une dépense, et pas son retour du déficit sous 3 %, qui était une économie. Macron I a livré la suppression de la taxe d'habitation, qui coûte, et pas la réforme des retraites, qui rapporte. Chirac II a livré la baisse de l'impôt sur le revenu au tiers de ce qu'il promettait, et intégralement les trois plans annoncés le 14 juillet 2002.
Majorité absolue70 % de réalisation · Macron I, 2017-2022 : plus de 70 % mesurés
Majorité et crise54 % de réalisation · Sarkozy, 2007-2012 : 54 % mesurés
Majorité relative ou cohabitation30 % de réalisation · Chirac I, 1995-2002 : 30 % mesurés
Programme, scénario AmbitieuxDéficit annoncéMajorité absolueMajorité et criseMajorité relative ou cohabitation
ChatGPT3,2 %22,6 Md€ (0,8 pt)38 Md€ (1,3 pt)61 Md€ (2 pt)
Claude4,5 à 5 %10 Md€ (0,3 pt)18,4 Md€ (0,6 pt)31 Md€ (1 pt)
Grok3,5 à 3,8 %7,5 Md€ (0,3 pt)13,1 Md€ (0,4 pt)21,5 Md€ (0,7 pt)
Gemini2,1 %9,1 Md€ (0,3 pt)15,4 Md€ (0,5 pt)24,9 Md€ (0,8 pt)
DeepSeek5,0 % en 20279 Md€ (0,3 pt)16,2 Md€ (0,5 pt)27 Md€ (0,9 pt)
Mistral4,5 %10,5 Md€ (0,4 pt)20,1 Md€ (0,7 pt)34,5 Md€ (1,1 pt)

Tableau large : faites défiler horizontalement.

Hypothèses de calcul et réserves
  • Le calcul porte sur le scénario Ambitieux de chaque modèle, à périmètre déclaré.
  • L'écart affiché est le trou annuel creusé par l'asymétrie, en plus de ce que le programme annonce déjà. Il ne recompose pas le solde public, qui dépend de variables que les six ne publient pas de la même façon.
  • La conversion en points de PIB retient un point à 30 Md€, ce qui suppose un PIB nominal de 3 000 Md€. Statut ESTIMATION, à recouper avec la série INSEE au moment de la lecture.
  • Grok publie des dépenses nouvelles nettes et non brutes : son écart est mécaniquement sous-estimé par rapport aux cinq autres.
  • DeepSeek exprime son déficit en 2027 quand les cinq autres le donnent en 2032.

Le résultat contredit l'intuition. Le programme le plus détaillé du benchmark est aussi le plus exposé : ChatGPT adosse son scénario à 96 milliards d'économies et de recettes annuelles, soit le double de la moyenne des cinq autres, et c'est précisément cette part qui ne se réalise pas. Plus un programme repose sur des économies, plus une réalisation partielle le détruit.

À l'inverse, Grok apparaît robuste. Cette robustesse n'est pas une qualité : elle est celle de qui promet peu. Un programme qui n'engage que 35 milliards de financement ne peut pas en perdre beaucoup, et il ne transforme rien non plus. La grille de précision l'avait déjà noté 2 sur 5.

Le cas Mistral est le plus instructif pour un dirigeant. Son écart n'est pas dû à des économies excessives mais à un déséquilibre de structure : 75 milliards de dépenses nouvelles pour 60 de financement, dont une partie en cessions d'actifs non reconductibles. Le programme est déjà en déficit de construction avant même que la moindre promesse ne soit manquée.

Simulateur : et si la configuration de 2027 n'était pas celle qu'on espère ?

Choisissez la configuration institutionnelle du prochain mandat. Le simulateur applique la règle de réalisation asymétrique aux six programmes et affiche le trou annuel que chacun creuserait.

Configuration institutionnelle du mandat 2027-2032

Taux de réalisation appliqué aux économies et aux recettes : 54 %. Les dépenses nouvelles se réalisent à 90 % dans les trois cas.

ChatGPT
Claude
Grok
Gemini
DeepSeek
Mistral

Trou annuel creusé par la réalisation asymétrique, en milliards d'euros par an, en plus de ce que le programme annonce.

Cet outil applique une règle simple à des ordres de grandeur. Il ne prédit rien, il ne remplace aucun chiffrage, et il donne délibérément des résultats ronds. Sa seule fonction est de montrer de combien un même programme change de nature selon la majorité qui l'exécute. Le taux appliqué est une moyenne de mandat observée entre 1995 et 2022, pas une probabilité pour 2027.

Ce que la grille change au classement

Le comparatif classait les six sur ce qu'ils avaient produit : socle sourcé, statuts explicites, audit comptable, réversibilité déclarée. La grille les classe sur ce qu'il en resterait. Les deux classements ne se recouvrent pas.

ChatGPT et Gemini, les deux plus impressionnants sur le papier, obtiennent les meilleures notes de précision et les plus mauvaises de capacité. Leur qualité rédactionnelle est exactement ce qui les expose : un engagement précis sur une mesure qui suppose une révision constitutionnelle est un engagement précisément non tenu. Claude et Mistral, moins spectaculaires, arrivent en tête parce qu'ils ont l'un et l'autre posé une limite, un seuil de dépense pour le premier, un coût de sortie pour le second.

Le résultat le plus net ne concerne aucun classement. Gemini s'attribue 65 % de probabilité de mise en œuvre pour un scénario contenant une révision constitutionnelle et deux mesures jamais tentées. ChatGPT s'attribue 40 % pour un scénario comparable, et c'est la seule autoévaluation lucide des six. La confiance déclarée est inversement proportionnelle à la faisabilité mesurée, chez les machines comme chez les candidats.

Pour un dirigeant, la transposition est directe. Un plan stratégique se juge sur trois questions et pas sur son épaisseur : est-il assez précis pour qu'on sache dans cinq ans s'il a été exécuté, quelle gouvernance son exécution suppose, et que reste-t-il si l'arbitrage change. Un plan qui échoue à la deuxième question est un catalogue d'intentions, quelle que soit la qualité de la première.

Vous avez une entreprise et vous voulez passer à l'action sur l'IA ?

Formations sur mesure, Diagnostic D.I.A.G., développements : l'accompagnement Digital Mate part de votre réalité, pas de la technologie.

Voir l'accompagnement →