La révolution de la crédibilité a-t-elle changé ce que la science économique sait ?

Dans les années 1990, la science économique a décidé de ne plus se fier aux modèles qu'elle ne pouvait pas vérifier et de se mettre à mener des expériences. Elle a obtenu de bien meilleures réponses. Elle a aussi cessé de poser certaines des plus grandes questions.

Étape 1 sur 4

Ce que la révolution a rendu traitable

« Contrairement à la prédiction centrale du modèle du manuel… nous ne trouvons aucun signe que la hausse du salaire minimum ait réduit l'emploi. »

— David Card & Alan Krueger, American Economic Review, 1994

En 1992, le New Jersey a relevé son salaire minimum et la Pennsylvanie ne l'a pas fait. Card et Krueger ont compté les emplois de la restauration rapide des deux côtés de la frontière, avant et après, et ont constaté que la prédiction du manuel échouait. Le résultat est célèbre pour ce qu'il a conclu. Il compte davantage par la manière dont il l'a conclu : pas de modèle structurel, pas d'hypothèses invérifiables, seulement une expérience naturelle qui fait le travail. Ce geste, c'est la révolution de la crédibilité, et Card-Krueger n'est lui-même qu'un cas dans une filiation plus longue propre à l'économie du travail, retracée dans sa propre Grande Question, de la théorie de la productivité marginale au tournant de la crédibilité.

Pour voir en quoi ce geste était une rupture, il faut partir de ce qu'il a remplacé. Dans les années 1970 et 1980, l'économie appliquée reposait sur des modèles structurels : écrire un modèle du comportement des agents, estimer ses paramètres sur des données d'observation, puis lire les effets des politiques dans la structure estimée. L'ennui, c'est que les réponses dépendaient d'hypothèses que les données ne pouvaient pas vérifier : formes fonctionnelles, distributions des erreurs, choix des variables exogènes. Robert LaLonde a rendu le problème indéniable en 1986. Il a pris une véritable expérience randomisée de formation professionnelle, a jeté la randomisation et s'est demandé si les principaux estimateurs structurels pouvaient retrouver la réponse expérimentale à partir des données d'observation. Ils ne le pouvaient pas. Des spécifications différentes et toutes raisonnables donnaient des effets très différents, et rien, de l'intérieur, ne permettait de dire laquelle était juste.

Le geste de la crédibilité a consisté à renoncer à modéliser le monde entier pour chercher plutôt un cadre où le traitement était attribué quasiment au hasard : un État qui relève son salaire minimum quand son voisin ne le fait pas, une loterie qui admet certains élèves et pas d'autres, une discontinuité d'éligibilité à un seuil arbitraire. Là où l'on trouve un tel cadre, on peut identifier un effet causal avec des hypothèses qu'un lecteur peut examiner. La boîte à outils qui s'est constituée autour de cette idée, à savoir les variables instrumentales employées avec soin, les différences de différences et la régression sur discontinuité, partage un trait : l'hypothèse identifiante est à découvert.

L'objet formel que cette boîte à outils estime est plus étroit qu'il n'y paraît. C'est l'effet moyen local du traitement (LATE), l'effet sur les personnes dont le traitement a effectivement changé du fait de l'expérience naturelle.

Notons $Y_i(1)$ et $Y_i(0)$ le résultat de l'unité $i$ avec et sans traitement, les deux résultats potentiels, dont un seul est jamais observé. Avec un instrument $Z$ qui déplace le traitement $D$ sans affecter $Y$ par ailleurs, l'estimande est

$$\text{LATE} = \frac{E[Y \mid Z=1] - E[Y \mid Z=0]}{E[D \mid Z=1] - E[D \mid Z=0]} = E\big[Y_i(1) - Y_i(0) \,\big|\, \text{compliers}\big]$$

Le dénominateur dit ceci : parmi tous ceux que l'instrument a poussés, on rapporte l'effet à la fraction dont le statut de traitement a effectivement basculé. Ce qui reste, c'est l'effet sur les « compliers », pas sur la population entière.

Intuition

On ne voit jamais la même personne à la fois traitée et non traitée, si bien qu'on ne peut jamais mesurer directement un effet individuel. L'expérience naturelle ne fournit une comparaison propre que pour les personnes dont elle a changé la situation : les restaurants du New Jersey qui ont embauché autrement à cause de la hausse du salaire. La réponse que livre la méthode est donc : « voici l'effet, pour ces personnes précises, dans ce cadre précis ». C'est moins que ce que les économistes prétendaient autrefois. C'est aussi plus défendable.

Une pièce de plus a fait tenir la révolution : l'inférence a rattrapé l'identification. Bertrand, Duflo et Mullainathan ont montré en 2004 que la façon habituelle de calculer les erreurs types dans les études en différences de différences était beaucoup trop confiante : elle traitait des observations corrélées comme indépendantes et fabriquait une significativité qui n'existait pas. Faire le ménage, avec des erreurs types regroupées par grappes et une incertitude honnête, voulait dire qu'une estimation causale crédible devait désormais résister à une hypothèse identifiante vérifiable et à une affirmation vérifiable sur le degré de certitude qu'on pouvait se permettre.

C'est le geste qui suit la contre-révolution de Lucas, et la tradition des manuels le raconte comme une filiation. Les contre-révolutionnaires avaient attaqué les modèles keynésiens parce qu'ils reposaient sur des relations qui s'effondraient dès que la politique s'en servait. Leur réponse avait été des microfondements plus profonds. La révolution de la crédibilité a répondu autrement à la même inquiétude : une identification qu'on pouvait vérifier. Le traitement qu'en donne Histoire de la pensée économique réunit les deux gestes dans un même chapitre et traite directement de l'économie du travail, là où le tournant de la crédibilité s'est amorcé.

L'économétrie formelle, c'est-à-dire le problème d'identification, les variables instrumentales, les différences de différences, la régression sur discontinuité et le cadre des résultats potentiels qui fonde le LATE, est exposée en détail dans le manuel d'Économie. L'arc chronologique de cette boîte à outils, des variables instrumentales aux différences de différences, puis à la régression sur discontinuité, à l'appariement, au contrôle synthétique et à l'apprentissage automatique causal, est retracé dans sa propre Grande Question, la filiation méthodologique de la révolution de la crédibilité.

La thèse des défenseurs, dans toute sa force

« La microéconomie empirique a connu une révolution de la crédibilité… De meilleurs protocoles de recherche sont indissociables de la fiabilité accrue de la microéconomie empirique. »

— Joshua Angrist & Jörn-Steffen Pischke, Journal of Economic Perspectives, 2010

Angrist et Pischke ne prétendent pas que la science économique a découvert de nouvelles vérités. Ils prétendent qu'elle a trouvé un moyen de dire lesquelles de ses affirmations empiriques méritent d'être crues. Avant la révolution, un rapporteur qui lisait un article structurel n'avait aucun moyen indépendant de vérifier les hypothèses qui produisaient son chiffre phare. Hypothèses et résultat étaient enchevêtrés, et le désaccord finissait par se ramener à une affaire de goût. Après elle, l'hypothèse identifiante est en surface, là où un lecteur hostile peut l'attaquer directement : la frontière de la Pennsylvanie est-elle vraiment un groupe de contrôle valable pour le New Jersey ? Le seuil d'éligibilité est-il vraiment arbitraire ? Ce sont des questions auxquelles on peut répondre. Le gain, c'est que les affirmations causales sont devenues contestables sur le fond : un article publiable de microéconomie appliquée en 2025 vit ou meurt sur un argument de protocole de recherche qu'un article de 1985 n'avait jamais à avancer et n'aurait pas pu gagner.

Et la discipline a généralisé ce geste sans ménagement. Dès lors que le domaine s'est accordé à faire de l'identification crédible le prix d'entrée, il a réorganisé autour de la recherche d'une variation propre la formation doctorale, l'évaluation des articles par les revues et toute la structure d'incitations du travail appliqué. Des littératures entières, sur le rendement de l'éducation, l'effet de la taille des classes ou l'impact de l'incarcération, ont été reconstruites sur des bases quasi expérimentales et ont produit des réponses qui ont résisté à la réplication, ce que les réponses de la génération précédente n'avaient pas fait. Selon ses propres critères, la thèse des défenseurs est juste.

Où cela nous mène

La révolution de la crédibilité a rendu visible une chose précise : l'hypothèse identifiante qui sous-tend une affirmation causale est-elle vérifiable par un lecteur ? C'est la ligne méthodologique qui sépare un article publiable de microéconomie appliquée d'aujourd'hui d'un article de 1985. Mais elle ne tranche pas la question de savoir si la question posée est la bonne, et elle achète sa certitude en rétrécissant ce à quoi elle répond : on passe de « l'effet de cette politique » à « l'effet sur les personnes que cette expérience-là a fait bouger ».

Obtenir une estimation causale propre pour une question précise sur une population précise, ce n'est pas la même chose que savoir comment le monde fonctionne. Les économistes du développement qui ont pris cela au sérieux n'ont pas mené une seule expérience. Ils en ont mené un millier. Qu'ont-ils appris, et à quoi le domaine a-t-il renoncé pour l'apprendre ?

Étape 2 sur 4

Ce qui a été rendu visible, et ce qui a été supplanté

« Nous ne savons pas vraiment si [notre aide] fait le moindre bien… La bonne nouvelle, c'est que nous pouvons le découvrir. Nous pouvons mener des expériences. »

— d'après Esther Duflo, TED, « Social experiments to fight poverty », 2010

Le plaidoyer de Duflo rabattait les prétentions tout en étant radical : l'économie du développement avait passé des décennies à se disputer sur de grandes théories de la croissance sans presque aucune preuve crédible sur les interventions qui aidaient vraiment. Sa réponse était de traiter la politique publique comme la médecine : randomiser, mesurer, accumuler. C'est la révolution de la crédibilité portée à sa forme la plus pure. Et c'est là que le coût de cette pureté apparaît.

Banerjee, Duflo et Sendhil Mullainathan ont fondé en 2003 le Poverty Action Lab du MIT et bâti une infrastructure pour mener à grande échelle des expériences de terrain randomisées. À la fin des années 2010, le programme avait produit de l'ordre d'un millier d'essais, sur le déparasitage, la microfinance, les transferts monétaires conditionnels, l'assiduité des enseignants, les moustiquaires ou les incitations à la vaccination. Le Nobel 2019 attribué à Banerjee, Duflo et Michael Kremer l'a consacré comme le paradigme empirique dominant en économie du développement. La filiation de l'économie du développement, de Lewis et des structuralistes jusqu'au tournant des RCT, est parcourue dans Histoire de la pensée économique.

Ce que les RCT ont rendu visible était un type de fait différent de ceux dont le domaine avait l'habitude. La littérature du développement d'avant la révolution faisait commerce de grandes affirmations structurelles, le « big push », la croissance équilibrée, le modèle à deux déficits, qui prétendaient dire ce qui faisait croître des économies entières. Les essais les ont remplacées par des effets modestes, précis et réfutables sur des populations identifiées : le déparasitage a augmenté de tant la fréquentation scolaire dans cette région du Kenya ; la microfinance a fait bien moins que ce que promettaient ses partisans, presque partout où elle a été testée. L'unité honnête de connaissance est passée de « ce qui cause le développement » à « ce que cette intervention a produit, ici ». Pour les questions que la méthode peut atteindre, c'est un vrai progrès : le domaine a cessé de bluffer sur des effets qu'il n'avait jamais mesurés de façon crédible.

La révolution a aussi déplacé le centre de gravité de toute la discipline, et d'autres programmes ont perdu du terrain. Les régressions de croissance entre pays à la manière de Barro, autrefois une industrie florissante, ont fini par paraître sans espoir, leurs hypothèses identifiantes étant irréfutables au sens où LaLonde l'avait annoncé. La macroéconomie structurelle calibrée et l'économétrie ambitieuse d'évaluation des politiques de la génération précédente ont cédé de la place dans les revues et de l'attention chez les doctorants aux expériences de terrain propres. Le programme supplanté remonte directement au geste de Lucas et des anticipations rationnelles, dont le tournant de la crédibilité a discrètement sapé, dans le travail appliqué, l'ambition de valoir pour toute la discipline.

Banerjee lui-même figure parmi les pluralistes modernes dans le graphe de la généalogie des idées. Vous pouvez voir la place du programme des RCT dans la filiation méthodologique sur le graphe interactif de la pensée économique.

Deux choses, toutes deux vraies

« La pratique des expériences a profondément changé notre façon de concevoir la compréhension du monde… un outil pour découvrir ce qui marche, plutôt qu'un moyen de confirmer ce que nous croyons déjà. »

— d'après Abhijit Banerjee & Esther Duflo, conférence Nobel, « Field Experiments and the Practice of Economics », 2019

La thèse de Banerjee et Duflo est que les expériences produisent un type d'affirmation différent et plus honnête : modeste, propre à un contexte et réfutable, là où la génération précédente offrait une généralité assurée qu'elle ne pouvait pas étayer. Ils disent explicitement que c'est une science économique plus humble, et ils soutiennent que cette humilité est le gain. Le domaine répondait autrefois à « comment les pays pauvres se développent-ils ? » par des théories que personne ne pouvait tester ; il répond aujourd'hui à « ceci marche-t-il, ici ? » avec des preuves que chacun peut vérifier, et il laisse les réponses s'accumuler. Sur les questions qu'il peut atteindre, c'est l'argument le plus fort en faveur de l'idée que la révolution a fait savoir davantage au domaine.

« La méthode de la randomisation… ne peut pas répondre à bon nombre des questions auxquelles les analystes des politiques publiques veulent une réponse… Des modèles structurels sont nécessaires pour extrapoler au-delà de la population expérimentale et pour évaluer des politiques qui n'ont pas encore été essayées. »

— d'après James Heckman, Journal of Economic Literature, 2010 (« Building Bridges… »)

Heckman présente l'argument du déplacement dans sa version la plus solide. Le programme structurel a été construit pour faire une chose dont le programme expérimental est structurellement incapable : évaluer une politique qui n'a pas encore été essayée, sur une population qui n'a pas encore été traitée, en explicitant le modèle de comportement et les hypothèses, et en acceptant que la réponse ne vaille pas mieux qu'eux. Un essai randomisé ne peut pas vous donner l'effet d'un salaire minimum que vous n'avez pas instauré, sur un marché du travail que vous n'avez pas observé. Pour y arriver, il faut un modèle de la façon dont les gens réagissent, c'est-à-dire l'appareil structurel que la révolution a supplanté. Heckman concède que Card-Krueger a tenu. Ce qu'il veut dire, c'est qu'une discipline qui ne sait répondre qu'aux questions qu'une expérience se trouve rendre accessibles a renoncé à toute une classe de questions auxquelles la politique a besoin de réponses.

Où cela nous mène

Deux choses sont vraies à la fois. Le tournant des RCT en économie du développement a rendu visible un type de connaissance sur lequel la littérature d'avant la révolution bluffait : des effets modestes, propres à un contexte et réfutables sur des populations identifiées, là où il n'y avait auparavant qu'une théorie assurée et presque aucune mesure crédible. Et le déplacement du programme structurel a été une vraie perte. Il existe des questions, comme l'effet d'une politique jamais essayée ou la réponse pour une population qu'aucune expérience n'a atteinte, que le programme structurel était conçu pour traiter et que la boîte à outils de la révolution de la crédibilité ne peut structurellement pas traiter.

Si la révolution réussit si bien ce qu'elle fait, pourquoi ses critiques les plus réfléchis, Deaton, Heckman, ceux qui font les comptes du côté de la macroéconomie, ont-ils passé quinze ans à soutenir que quelque chose d'important s'est perdu ? Ils formulent trois plaintes différentes. Quelle est la facture que la révolution doit encore ?

Étape 3 sur 4

Les critiques toujours vives

« Les RCT sont précieux, mais ils n'ont aucun statut particulier, et ils sont sujets à de nombreux problèmes… La question plus profonde, celle de savoir comment utiliser des résultats expérimentaux pour prendre des décisions concernant des personnes qui ne faisaient pas partie de l'expérience, n'a pas été traitée de façon satisfaisante. »

— Angus Deaton & Nancy Cartwright, Social Science & Medicine, 2018

Deaton a passé sa carrière à mesurer la pauvreté et a reçu un Nobel pour cela, et c'est ce qui donne du poids à la critique. Les défenseurs et les critiques de la révolution de la crédibilité, tous issus du courant dominant, se disputent sur trois choses à la fois : la validité externe, ce à quoi servaient les modèles structurels, et la question de savoir si tout cela s'agrège jusqu'à la macroéconomie.

Une estimation en forme réduite, le LATE propre de l'étape 1, repose sur des hypothèses minimales et possède une validité interne : dans son expérience, le chiffre est fiable. Une estimation structurelle fait davantage d'hypothèses et gagne en échange des affirmations plus larges sous ces hypothèses, mais ce sont précisément ces hypothèses qui sont difficiles à défendre. Aucun des deux camps n'obtient les deux. La révolution de la crédibilité a choisi la validité interne et les hypothèses minimales, et les trois critiques sont trois factures différentes pour ce choix.

La validité externe. Une estimation propre sur un échantillon ne dit rien d'une autre population, sauf à supposer que l'effet du traitement se généralise d'une manière connue, et dès que l'on suppose cela, on fait un travail structurel, simplement sans l'avouer. L'effet du déparasitage au Kenya ne se transpose pas au Bihar, où les parasites, les écoles et les ménages diffèrent, et aucune rigueur interne à l'essai ne peut retrouver ce que l'essai n'a jamais observé. La facture est structurelle.

Ce à quoi servait le structurel. Le point sur lequel Heckman insistait à l'étape 2 devient ici une critique : extrapoler à des politiques jamais essayées et à des populations jamais atteintes, c'est le travail pour lequel la modélisation structurelle a été construite. Une discipline qui l'abandonne a laissé tomber une fonction.

La macroéconomie ne s'agrège pas. Une estimation microéconomique crédible, par exemple la propension marginale à consommer des ménages qui vivent au jour le jour, peut éclairer la calibration d'un modèle macroéconomique, mais elle ne remplace pas les modèles de macroéconomie structurelle nécessaires pour dire ce qu'une baisse d'impôts fait à la production, ou si une hausse des taux provoquera une récession. La boîte à outils de la crédibilité ne remonte pas des effets microéconomiques propres jusqu'aux questions d'équilibre général, et c'est en grande partie pour cela que la révolution a l'air d'un événement de microéconomie appliquée. Du côté macroéconomique, l'après-2008 a ses propres comptes, plus profonds, à régler, traités dans leur propre Grande Question, 2008 a-t-il brisé la macroéconomie ?

Dans la filiation des manuels, la critique de la validité externe et le débat méthodologique d'après la révolution de la crédibilité se trouvent dans le chapitre du pluralisme moderne, qui examine ensemble le programme du J-PAL et l'objection de Deaton, Pritchett et Rodrik. La défense de l'économétrie structurelle passe par le tournant de la méthodologie économétrique que le chapitre sur l'économie de l'information place à côté de sa filiation de la mesure.

Trois critiques, trois factures différentes

« Sans savoir pourquoi les choses arrivent et pourquoi les gens font ce qu'ils font, nous courons le risque d'une théorisation causale désinvolte et sans valeur (du “conte de fées”), et nous ne saurons jamais si nos résultats se généralisent. »

— Angus Deaton, « Instruments, Randomization, and Learning about Development »

La critique de Deaton sur la validité externe est une observation juste sur les limites structurelles de la boîte à outils. Son accusation est précise : un essai qui livre un effet local propre, sans rendre compte de la raison pour laquelle l'effet s'est produit, a acheté la crédibilité de l'identification au prix de la compréhension, et c'est la compréhension qu'il faut pour dire quoi que ce soit des personnes qui ne faisaient pas partie de l'essai. Le mécanisme qui a produit l'effet du déparasitage au Kenya est la seule chose qui pourrait vous dire à quoi vous attendre au Bihar, et l'expérience, par construction, reste muette à son sujet. La facture est réelle et, quinze ans plus tard, largement impayée : l'infrastructure d'évaluation des politiques qu'a bâtie la révolution n'a pas résolu la validité externe, et faire comme si c'était le cas est l'illusion que le domaine entretient sur lui-même.

« Les évaluations les plus informatives combinent méthodes expérimentales et méthodes structurelles… Les approches athéoriques… n'offrent aucun cadre pour interpréter leurs estimations ni pour les extrapoler à de nouveaux environnements. »

— d'après James Heckman, « Econometric Causality », International Statistical Review, 2008

La défense de l'économétrie structurelle par Heckman repose sur son cadre méthodologique, et ce cadre est juste même là où son bilan empirique ne l'est pas. Il s'est trompé sur des points précis : certaines de ses réanalyses de Card-Krueger n'ont pas été répliquées, et Card-Krueger a tenu. Mais l'affirmation méthodologique ne dépend pas de ce tableau des scores : un modèle structurel est le seul objet qui fournisse les paramètres nécessaires pour interpréter une estimation et la transporter dans un nouvel environnement, parce qu'il dit quel comportement a engendré le chiffre. Retirez cela et il reste une mesure sans théorie du pourquoi, utile pour le cas en question, muette sur tous les autres. Le programme en forme réduite ne peut pas faire d'évaluation ex ante des politiques sous des hypothèses explicites. De meilleurs instruments n'y changent rien : par construction, le programme ne le fait pas.

« Nous nous enfonçons, pas à pas, toujours plus profondément dans un pays imaginaire, peuplé d'agents économiques capables de résoudre des problèmes d'équilibre général stochastique toujours plus riches, chargés de frictions de toutes sortes. »

— Ricardo Caballero, Journal of Economic Perspectives, 2010 (« Macroeconomics after the Crisis »)

La critique de l'agrégation macroéconomique est un argument qui porte sur le cadre. Caballero se plaint de ce que les questions macroéconomiques diffèrent par nature de celles de la microéconomie appliquée : elles relèvent de l'équilibre général dynamique, où l'objet d'intérêt est la réponse du système tout entier, et des preuves du niveau de la révolution de la crédibilité éclairent cette réponse sans jamais remplacer le modèle structurel nécessaire pour la calculer. On peut établir la propension marginale à consommer des ménages qui vivent au jour le jour grâce à une superbe expérience naturelle, mais on ne peut toujours pas lire ce qu'une relance fait à la production agrégée sans un modèle de la façon dont les pièces interagissent. Les preuves microéconomiques sont un intrant de la macroéconomie, et c'est précisément pourquoi les modèles DSGE et la macroéconomie structurelle calibrée persistent dans un domaine que la révolution de la crédibilité a par ailleurs remodelé.

Où cela nous mène

Deaton et Cartwright ont raison : la facture de la validité externe est réelle et largement impayée. Heckman a raison : le programme structurel était conçu pour faire une chose, l'évaluation ex ante sous des hypothèses explicites, dont le programme en forme réduite est structurellement incapable, et sa perte est réelle. Caballero et ceux qui font les comptes de la macroéconomie ont raison : le travail micro-empirique ne s'agrège pas jusqu'aux questions auxquelles la macroéconomie doit répondre. Aucune de ces critiques n'invalide le verdict de l'étape 1 : les exigences imposées aux affirmations causales se sont réellement élevées. Toutes limitent ce que ce verdict a le droit de signifier. La révolution a gagné le débat qu'elle avait choisi. Les critiques montrent du doigt les débats qu'elle a cessé d'avoir.

Alors, si les exigences imposées aux affirmations causales se sont élevées, si la facture de la validité externe est réelle et si le déplacement a été en partie une perte, que sait la science économique aujourd'hui qu'elle ne savait pas avant ? Et que fait la discipline de cette facture ?

Étape 4 sur 4

Ce que la science économique sait vraiment aujourd'hui

« L'étalon-or pour tirer des inférences sur l'effet d'une politique est une expérience contrôlée randomisée. Cependant… les chercheurs s'intéressent souvent à des questions qui… ne peuvent pas être tranchées par l'expérimentation. Le défi consiste à combiner la crédibilité des méthodes expérimentales et la généralisabilité des méthodes structurelles. »

— Susan Athey & Guido Imbens, Journal of Economic Perspectives, 2017 (« The State of Applied Econometrics… »)

Imbens a partagé le Nobel 2021 pour l'appareil même des résultats potentiels qui faisait tourner l'étape 1. Il nomme le travail inachevé : les méthodes crédibles répondent à une classe étroite de questions, les questions qui comptent tombent souvent en dehors, et le travail qui occupe aujourd'hui le domaine consiste à relier les deux sans retomber dans l'ancienne fausse assurance.

La réponse de la discipline à la facture de la validité externe est un ensemble de tentatives pour garder la rigueur de l'identification et retrouver la portée pour les politiques. Trois méritent d'être nommées. Imbens et ses coauteurs ont poussé le cadre des résultats potentiels directement vers les questions d'extrapolation et de validité externe, en traitant « cela se transpose-t-il ? » comme un problème formel. Susan Athey et Guido Imbens ont construit un programme d'apprentissage automatique causal, qui emploie des algorithmes flexibles pour estimer comment les effets du traitement varient d'une personne et d'un cadre à l'autre, cette hétérogénéité dont dépend la validité externe, tout en gardant en dessous une stratégie d'identification crédible. Et les travaux de Raj Chetty sur les données massives relient des millions de fichiers administratifs à des protocoles causaux, pour répondre à des questions de mobilité et d'égalité des chances à une échelle et avec une résolution que le RCT sur petit échantillon n'a jamais pu atteindre.

Le programme des modèles causaux structurels de Pearl et les méthodes d'apprentissage automatique double ou débiaisé accompagnent ces travaux comme autant d'outils supplémentaires pour le même projet : la frontière combine l'identification vérifiable de la révolution de la crédibilité avec l'ambition du programme structurel de parler de cas qu'aucune expérience n'a atteints. Le chapitre du pluralisme moderne y lit l'état méthodologique actuel de la discipline, un ensemble de programmes qui négocient le même arbitrage.

Les fils confrontés

Pesez les trois étapes à l'aune de la question qui a toujours été la leur, « que sait désormais la science économique ? ». Les défenseurs de l'étape 1 ont raison, et personne ne le conteste : en économie du travail, en économie publique, en économie du développement et en microéconomie appliquée, ce qui compte comme une affirmation causale crédible est bien plus strict et plus transparent qu'en 1985. Le gain est réel et durable. Le déplacement de l'étape 2 est lui aussi réel : l'éventail des questions que poursuit le domaine s'est rétréci dans certains champs et a changé de forme, et ce rétrécissement a été en partie un correctif, puisque LaLonde avait raison de dire que les affirmations structurelles d'avant la révolution étaient souvent exagérées, et en partie une perte, parce que le programme structurel faisait un vrai travail que rien n'a remplacé.

Les critiques de l'étape 3 limitent le verdict sans le renverser. La validité externe est une facture ouverte. La fonction défendue par Heckman, l'évaluation ex ante sous des hypothèses explicites, est une fonction que le programme en forme réduite ne peut pas remplir. La macroéconomie, pour l'essentiel, ne s'est pas agrégée à partir de la boîte à outils. Mis ensemble, les fils aboutissent à un résultat précis : la science économique sait d'autres choses, et mieux. Elle a une prise plus ferme sur une classe plus étroite de questions causales, une prétention plus faible sur les grandes questions structurelles auxquelles elle répondait autrefois avec une assurance imméritée, et un problème ouvert, honnêtement reconnu, la validité externe, là où elle se serait autrefois payée de mots.

Le verdict

La révolution de la crédibilité a-t-elle changé ce que la science économique sait ? Oui, mais la réponse est calibrée. La science économique sait d'autres choses, et mieux ; que cela veuille dire davantage dépend de la question qu'on pose. Quatre engagements soutiennent cette réponse. Les exigences imposées aux affirmations causales se sont réellement élevées : en microéconomie appliquée, la barre d'une affirmation causale crédible est bien plus haute et plus transparente qu'avant 1990, et ce n'est pas sérieusement contesté. L'éventail des questions s'est rétréci dans certains champs et a changé de forme : les régressions de croissance entre pays, les contrefactuels de la macroéconomie structurelle calibrée et le programme de l'économétrie structurelle ont perdu du terrain, ce déplacement étant pour une part un correctif et pour une autre une vraie perte. La validité externe est une facture réelle et non réglée : l'infrastructure d'évaluation des politiques n'a pas résolu le problème qui consiste à utiliser les résultats obtenus sur une population pour décider pour une autre, et la discipline devrait cesser de prétendre le contraire. La macroéconomie, pour l'essentiel, ne s'est pas agrégée : les modèles DSGE et la macroéconomie structurelle calibrée persistent parce que la boîte à outils de la crédibilité ne remplace pas ce qu'ils font, et c'est pourquoi la révolution se lit comme un événement de microéconomie appliquée plus que comme un événement de toute la discipline.

Une réserve : le rétrécissement est local. Dire que la science économique de 2025 est « plus étroite » sur toute la ligne est faux, car le domaine atteint des questions causales qu'il ne pouvait pas aborder de façon crédible il y a une génération. Et la synthèse d'après la révolution de la crédibilité, avec Imbens sur l'extrapolation, Athey et Imbens sur l'apprentissage automatique causal, Chetty sur l'inférence causale à partir de données massives, et à côté les modèles causaux structurels de Pearl et l'apprentissage automatique double ou débiaisé, constitue la réponse en cours à la facture. Couronner un vainqueur parmi ces directions serait prématuré, parce que le domaine ne l'a pas fait, et prétendre le contraire serait retomber dans l'assurance imméritée contre laquelle la révolution s'est construite.

La révolution de la crédibilité est un fil dans une question plus large, celle de savoir si la science économique est une science unique et unifiée ou une fédération de spécialités. Sur cette intégration, voir la Grande Question La science économique est-elle devenue une science unifiée ou un ensemble de spécialités ?. L'arc chronologique propre à la boîte à outils est retracé dans la Grande Question sur la filiation méthodologique ; les comptes que la macroéconomie a dû régler, et que cette révolution a pour l'essentiel laissés de côté, sont traités dans 2008 a-t-il brisé la macroéconomie ? ; et le moment quasi expérimental de l'économie comportementale est une affaire à part, exposée dans sa propre Grande Question.

Où cela nous mène

Nous sommes partis de deux restaurants de restauration rapide de part et d'autre d'une frontière entre États et d'un résultat qui a démenti une prédiction du manuel. Ce qui a donné son importance à Card et Krueger, c'est le geste : cesser de se fier aux modèles qu'on ne peut pas vérifier, trouver une variation qu'un lecteur peut examiner, et accepter en échange une affirmation plus étroite et plus honnête. Les économistes du développement ont porté ce geste à sa forme la plus pure et ont appris un millier de choses modestes, précises et réfutables, tandis que le programme structurel, qui répondait autrefois aux grandes questions, perdait sa place. Les critiques ont nommé le prix : une facture de validité externe impayée, une fonction réellement perdue dans l'évaluation ex ante des politiques, et une macroéconomie qui ne s'est jamais agrégée à partir de la boîte à outils. La frontière, faite d'apprentissage automatique causal, d'inférence causale sur données massives et d'étude formelle de l'extrapolation, est la tentative que mène le domaine pour garder la rigueur et retrouver la portée.

L'exigence imposée à une affirmation causale s'est élevée et ne redescendra pas. L'éventail de ce que le domaine poursuit avec assurance s'est rétréci par endroits, en partie pour de bonnes raisons et en partie à un coût réel. Et la question la plus difficile, comment utiliser ce que l'on a appris sur les personnes de son expérience pour décider pour celles qui n'y étaient pas, reste ouverte, et c'est là que le travail se fait aujourd'hui. La prochaine fois que quelqu'un vous dira que la révolution de la crédibilité a soit réparé la science économique, soit l'a vidée de sa substance, vous aurez les outils pour dépasser ces deux slogans et retrouver la calibration que chacun escamote.