Comment la science économique a-t-elle appris à formuler des affirmations causales crédibles ?
Pendant trente ans, les meilleurs économistes du monde ont construit des modèles géants de l'économie tout entière et leur ont fait confiance pour dire ce que produirait une politique. Puis trois chercheurs, sur trois fronts différents, ont montré que ces modèles ne pouvaient pas tenir leurs promesses. Le remède n'a pas été un meilleur modèle. Il a été une autre question sur la preuve, et il a changé ce que signifie savoir qu'une chose en cause une autre. Cette Grande Question suit le problème de l'identification lui-même, du programme structurel de la Commission Cowles à la révolution de la crédibilité, puis à la frontière de la synthèse. La réponse de chaque génération a échoué, et la suivante a été la riposte.
Voir la filiation méthodologique sous forme de grapheLe programme structurel
« L'économétrie… vise à unifier l'approche théorique-quantitative et l'approche empirique-quantitative des problèmes économiques… C'est cette unification qui constitue l'économétrie. »
— d'après Ragnar Frisch, la constitution fondatrice de l'Econometric Society et son éditorial de 1933 dans Econometrica
Lisez cela comme une promesse. L'ambition était d'estimer la mécanique de l'économie, les relations profondes qui gouvernent le comportement des ménages et des entreprises, puis de se servir de cette mécanique estimée pour répondre à n'importe quelle question de politique économique. Lawrence Klein, qui a construit les premiers modèles à tenter exactement cela, en a donné la version de travail sans détour : estimez la structure de l'économie sous la forme d'un système d'équations, et vous pourrez simuler n'importe quelle politique avant de l'essayer. Pendant deux décennies, on a pu croire que cette promesse était tenue.
Le geste qui a rendu cette promesse concevable est venu de Trygve Haavelmo, en 1944. Son Probability Approach in Econometrics soutenait qu'il fallait traiter les données économiques comme des tirages dans un modèle probabiliste joint : une économie est un système stochastique, et l'on peut raisonner à son sujet avec le même appareil statistique que pour tout autre processus aléatoire. Avant Haavelmo, cela n'allait pas de soi. Après lui, l'estimation structurelle avait un fondement. La Commission Cowles, avec Tjalling Koopmans, Jacob Marschak et leurs collaborateurs, a bâti l'appareil sur ce socle.
Le problème qu'ils devaient résoudre est plus ancien qu'il n'y paraît. Supposons que vous vouliez la courbe de demande d'un bien et que vous disposiez de données de prix et de quantités sur de nombreuses années. Vous ne pouvez pas simplement régresser la quantité sur le prix, parce que prix et quantité sont déterminés ensemble : chaque observation est l'intersection d'une courbe d'offre et d'une courbe de demande, qui bougent toutes deux. Le nuage de points que vous voyez ne dessine ni l'une ni l'autre. C'est le problème des équations simultanées, et la réponse de la Commission Cowles est l'identification : on ne peut retrouver les paramètres structurels que si l'on peut imposer assez de restrictions crédibles pour établir quelle courbe est laquelle.
Un système structurel écrit les variables endogènes $\mathbf{y}$ et les variables exogènes $\mathbf{x}$ sous la forme $\mathbf{B}\mathbf{y} + \mathbf{\Gamma}\mathbf{x} = \mathbf{u}$. La forme réduite est $\mathbf{y} = -\mathbf{B}^{-1}\mathbf{\Gamma}\,\mathbf{x} + \mathbf{B}^{-1}\mathbf{u}$, et c'est tout ce que les données peuvent montrer. Une équation n'est identifiée que si l'on impose assez de restrictions pour retrouver ses coefficients structurels à partir de la forme réduite, en général des exclusions, c'est-à-dire des variables supposées absentes de l'équation. La condition d'ordre (compter au moins autant de variables exogènes exclues que de variables endogènes incluses, moins une) est nécessaire. La condition de rang est l'exigence complète.
Pour tracer une courbe de demande, il faut quelque chose qui déplace l'offre sans toucher la demande, une mauvaise récolte par exemple, de sorte qu'en glissant le long de la courbe de demande fixe, l'offre balaie des points qui en révèlent la forme. L'identification est l'art de trouver ces facteurs de déplacement, ou de les supposer. Tout l'édifice repose sur la réalité de ces facteurs supposés.
Klein a porté cet appareil à grande échelle. Le modèle de Klein-Goldberger (1955) estimait l'économie américaine sous la forme d'un système de plusieurs dizaines d'équations. Le modèle de la Brookings et le modèle FRB-MIT-Penn des années 1960 en comptaient des centaines. Les gouvernements s'en servaient pour prévoir et pour simuler : relever tel impôt, modifier tel taux d'intérêt, et lire dans le système l'effet prédit. Dans l'histoire de la pensée économique, ce programme structurel a pour foyer la synthèse d'après-guerre du courant dominant, l'époque qui a confronté les modèles aux données avec une assurance nouvelle.
L'ambition structurelle était la bonne. L'objectif était d'estimer les paramètres profonds, c'est-à-dire les préférences, les technologies, les véritables relations de comportement, qui ne changent pas quand la politique change. Avec eux, on pouvait faire ce qu'aucun ajustement de courbes ne permettra jamais : évaluer une politique jamais essayée, sur une population jamais traitée, en simulant le système estimé sous la nouvelle règle. L'estimation structurelle est la seule approche qui s'y essaie seulement.
Et les hypothèses étaient sur la table. Un modèle structurel est un exposé complet et explicite du mécanisme : voici les équations, voici les restrictions d'exclusion, voici ce que nous supposons du fonctionnement de l'économie. On peut le discuter parce qu'il s'engage sur quelque chose. Un résumé en forme réduite de ce qui s'est passé dans les données ne dit rien de ce qui se passerait sous un autre régime. Le programme structurel était la manière disciplinée de faire de l'économie : estimer la machine, puis interroger la machine. La question qui allait le mettre en pièces était de savoir s'il pouvait livrer les paramètres profonds promis, ou seulement quelque chose qui leur ressemblait jusqu'à ce que la politique change.
Pendant deux décennies, tout a semblé fonctionner : les grands modèles prévoyaient, simulaient, conseillaient les présidents et les banques centrales. Tout reposait sur un seul mot, profond. Les coefficients estimés étaient-ils vraiment les paramètres structurels, invariants à la politique, que promettait le programme ? Ou étaient-ils des combinaisons de forme réduite qui bougeraient dès que la politique bougerait, laissant un modèle ajusté au passé et menteur sur l'avenir ? Et les restrictions identifiantes, ces exclusions qui permettent de tracer une courbe plutôt qu'une autre, ont-elles jamais été crédibles, ou seulement commodes ? Ces deux questions, ce que vous avez estimé est-il invariant et votre identification est-elle croyable, sont la fissure que la décennie suivante a élargie, sur trois fronts à la fois.
En 1976, un chercheur de trente-huit ans, à Chicago, tenait en une ligne l'argument selon lequel toute l'entreprise reposait sur une erreur. En 1980, un article intitulé Macroeconomics and Reality jugeait les restrictions identifiantes que tout le monde imposait, selon le mot de son auteur, incroyables. Et en 1986, quelqu'un a confronté les modèles structurels à une véritable expérience randomisée, et ils ont échoué.
Les critiques
« Étant donné que la structure d'un modèle économétrique est constituée des règles de décision optimales des agents économiques, et que ces règles varient systématiquement avec les changements de structure des séries pertinentes pour le décideur, il s'ensuit que tout changement de politique modifiera systématiquement la structure des modèles économétriques. »
— Robert Lucas, « Econometric Policy Evaluation : A Critique », 1976
Débarrassé de son formalisme, le coup est brutal. Les coefficients de ces grands modèles ne sont pas des paramètres profonds. Ce sont des mélanges de paramètres profonds et de la règle de politique sous laquelle vivaient les gens quand les données ont été produites. Changez la règle, et les gens changent de comportement : les coefficients bougent, ce qui veut dire que simuler un changement de politique à coefficients fixes est invalide dans son principe même. L'usage le plus répandu du programme structurel, la simulation de politiques, supposait disparue la seule chose que produit un changement de politique.
Trois critiques sont tombées en une décennie, chacune sur un front différent de la même stratégie d'identification.
Lucas (1976) : les paramètres ne sont pas invariants. Une équation estimée reflète la façon dont les gens se sont comportés sous le régime de politique qui a produit les données. Les gens forment des anticipations et optimisent en fonction de la règle qu'ils anticipent. Si la banque centrale change de règle, les anticipations changent, les comportements changent, et l'équation estimée sous l'ancienne règle ne tient plus. Les coefficients sont donc la structure profonde emmêlée avec l'ancienne politique. Simulez un changement de politique avec eux, et vous obtenez la réponse à une question que personne n'a posée.
Sims (1980) : les restrictions ne sont pas crédibles. Pour identifier leurs systèmes, les grands modèles devaient imposer des dizaines de restrictions d'exclusion, autant d'affirmations que telle variable n'entre pas dans telle équation. Christopher Sims soutenait qu'on les imposait parce que le modélisateur en avait besoin pour obtenir l'identification. Son mot était incroyables. Son alternative était l'autorégression vectorielle : modéliser toutes les variables de façon symétrique, reconnaître honnêtement que ce que l'on a retrouvé, c'est la dynamique de forme réduite, et n'imposer que les restrictions minimales et défendables nécessaires pour lire les chocs structurels.
LaLonde (1986) : les estimations ne reproduisent pas une expérience. Robert LaLonde a repris les données du National Supported Work, une véritable expérience randomisée de formation professionnelle avec un vrai groupe témoin. Il a écarté ce groupe témoin expérimental et s'est demandé si les estimateurs économétriques non expérimentaux standard pouvaient retrouver le résultat de l'expérience à partir de groupes de comparaison observationnels. Ils n'y sont pas parvenus. Des estimateurs également raisonnables donnaient des chiffres très différents, et peu étaient proches de la référence expérimentale.
Lucas d'abord. Les grands modèles servaient avant tout à simuler des politiques. Ce qu'ils tenaient fixe pour faire tourner la simulation, les coefficients estimés, est exactement ce que déplace un changement de politique, parce que ces coefficients encodent des comportements optimisés en fonction de la règle en vigueur. Aucun correctif n'est possible à l'intérieur du cadre à coefficients fixes : c'est la validité du cadre pour sa propre tâche centrale qui s'effondre. Lucas avait raison sur le mal et tort sur le remède qui l'emporterait. Il proposait d'estimer les paramètres véritablement profonds, préférences et technologie, qui sont invariants à la politique, et de reconstruire la macroéconomie sur ces microfondements. L'ennui est que ces paramètres profonds ne sont pas plus faciles à identifier de façon crédible que les coefficients structurels qu'ils remplaçaient. Identifier une fonction d'utilité à partir de données agrégées bute sur le même mur. C'est en grande partie pour cela que le tournant qui a conquis l'économie appliquée n'a pas été le tournant structurel des anticipations rationnelles que voulait Lucas.
Sims ensuite, dont l'argument présente le mal de l'identification comme un mal de croyance. Les modèles structurels obtenaient l'identification par décret, en excluant des variables des équations parce que l'exclusion était nécessaire pour rendre le système soluble. On peut habiller cela comme on veut, la restriction reste quelque chose que personne n'a de raison de croire. Son VAR est la réponse honnête : ne pas revendiquer une identification qu'on n'a pas méritée, modéliser la dynamique jointe, retrouver ce que les données établissent réellement, et réserver l'interprétation structurelle aux quelques restrictions que l'on peut défendre à voix haute.
LaLonde enfin, dont la critique a porté le coup empirique. Lucas et Sims soutenaient que le programme structurel ne pouvait pas identifier de façon crédible ce qu'il prétendait identifier. LaLonde a montré qu'il ne le faisait pas. Il disposait d'une véritable expérience pour vérifier, ce qui n'était le cas ni de Lucas ni de Sims. Quand on a demandé aux estimateurs non expérimentaux de reproduire le résultat de l'expérience, ils ont contredit l'expérience et se sont contredits entre eux. C'est le résultat négatif fondateur dont la génération suivante ferait son énoncé du problème : les hypothèses dont dépendent les estimateurs structurels sont, dans les termes de LaLonde, des hypothèses que les données ne peuvent pas tester, et quand on trouve un cas où l'on peut les tester, face à une expérience, elles perdent.
Trois critiques, trois fronts, une seule cible. Lucas : les paramètres ne sont pas invariants, on ne peut donc pas simuler. Sims : les restrictions identifiantes ne sont pas crédibles, on n'a donc même pas les paramètres qu'on croit avoir. LaLonde : quand une vraie expérience est disponible, les estimations structurelles ne la reproduisent pas. Chacune de ces critiques est un échec de l'identification. Tout l'appareil du programme structurel existait pour identifier des paramètres profonds à partir de données non expérimentales. Une fois qu'on voit que l'identification échoue, le geste suivant est presque imposé. Si l'identification par hypothèses imposées ne cesse d'échouer, cessez d'imposer. Allez chercher un contexte où la variation est déjà exogène, où vous n'avez pas à supposer votre chemin jusqu'à une comparaison propre parce que le monde vous en a offert une.
Ce contexte s'est révélé omniprésent, dès que les économistes ont appris à regarder. Une hausse du salaire minimum d'un côté d'une frontière entre États, mais pas de l'autre. Une loterie de conscription qui envoyait au hasard certains jeunes hommes à l'armée et pas d'autres. Un seuil de note qui fait entrer un élève dans un programme et en laisse le suivant dehors. On a appelé cela trouver une expérience naturelle, et en vingt ans la démarche avait conquis l'économie appliquée.
La révolution de la crédibilité
« Le 1er avril 1992, le salaire minimum du New Jersey a augmenté… Ils ne trouvent aucun signe que la hausse du salaire minimum ait réduit l'emploi. »
— David Card & Alan Krueger, American Economic Review, 1994
Remarquez ce que Card et Krueger n'ont pas fait. Ils n'ont pas écrit de modèle structurel du marché du travail de la restauration rapide pour ensuite imposer des restrictions afin de l'identifier. Ils ont trouvé un contexte où un État relevait son salaire minimum et son voisin non, interrogé des restaurants des deux côtés de la frontière avant et après, et simplement regardé. Le New Jersey est le groupe traité, la Pennsylvanie le groupe témoin que le monde a fourni gratuitement. L'hypothèse identifiante tient en une phrase qu'un lecteur peut discuter : sans la hausse du salaire minimum, les deux côtés de la frontière auraient évolué ensemble. Toute la révolution est dans cette étude, une comparaison trouvée.
L'approche par le protocole de recherche renverse la stratégie structurelle. Au lieu d'imposer des restrictions pour identifier des paramètres à partir des données dont on dispose, on va chercher une source de variation plausiblement aussi bonne qu'un tirage au sort, et l'on construit l'analyse autour d'elle. Quatre outils font l'essentiel du travail. Les variables instrumentales bien employées : une variable qui modifie le traitement mais n'agit plausiblement sur le résultat qu'à travers le traitement, avec une explication concrète et défendable de pourquoi. La régression sur discontinuité : comparer les unités situées juste au-dessus et juste au-dessous d'un seuil arbitraire, semblables en tout sauf par le côté du seuil où elles sont tombées. Les différences de différences : un groupe traité et un groupe témoin comparable, avant et après, en éliminant par différence ce qu'ils ont en commun. Et la randomisation elle-même, quand on peut mener l'expérience.
Le cadre qui a rendu cela rigoureux est le langage des résultats potentiels d'Angrist, Imbens et Rubin. Chaque unité a un résultat avec traitement et un résultat sans traitement, et l'on n'en observe jamais qu'un. Les effets causaux sont des comparaisons de résultats potentiels, et un protocole de recherche est crédible quand il affirme de façon défendable de quelles unités le groupe de comparaison remplace le résultat potentiel manquant. Le résultat le plus tranchant de ce cadre est aussi sa limite : l'effet moyen local du traitement.
Avec un instrument binaire $Z$, un traitement $D$ et un résultat $Y$, les variables instrumentales identifient le LATE :
$$\text{LATE} = \frac{\mathbb{E}[Y \mid Z=1] - \mathbb{E}[Y \mid Z=0]}{\mathbb{E}[D \mid Z=1] - \mathbb{E}[D \mid Z=0]}$$Sous les hypothèses de monotonie et d'exclusion, c'est l'effet moyen du traitement pour les « compliers », les unités dont l'instrument a effectivement modifié le statut de traitement, une quantité distincte de la moyenne de la population comme de l'effet sur les « always-takers » ou les « never-takers ».
Une expérience naturelle ne fait bouger que certaines personnes. La loterie de conscription modifie le service militaire des hommes dont le numéro est tombé près du seuil, pas celui du volontaire qui allait s'engager de toute façon, ni celui de l'homme qui n'allait jamais partir quoi qu'il arrive. Ce qu'on apprend, c'est l'effet sur les personnes que l'expérience a réellement fait bouger. C'est un savoir réel, proprement identifié, et ce n'est pas l'effet sur tout le monde.
L'hypothèse identifiante est désormais vérifiable. Un rapporteur peut poser une question précise : cet instrument est-il vraiment exogène ? Ce seuil est-il vraiment arbitraire ? Les deux côtés de la frontière auraient-ils vraiment évolué ensemble ? L'article vit ou meurt de la réponse. Comparez cela aux dizaines de restrictions d'exclusion des modèles structurels, qu'aucun rapporteur ne pouvait vérifier parce qu'elles n'avaient jamais été faites pour l'être. L'histoire de la pensée économique situe ce tournant dans l'époque moderne, où il est devenu la norme de preuve de la discipline.
Le tournant du protocole de recherche répond d'un coup aux trois critiques de l'étape 2, et la correspondance est exacte. Il ne simule pas de paramètres profonds fixes, donc la critique de Lucas ne porte pas : rien n'est tenu invariant d'un régime à l'autre, puisque la méthode estime un effet dans un contexte donné. Il n'impose pas de restrictions incroyables, donc la critique de Sims ne porte pas : l'hypothèse identifiante est une affirmation unique, énoncée et vérifiable, sur une seule source de variation. Et il reproduit les expériences, puisque tout l'enjeu est de trouver une variation qui imite une expérience, ce qui transforme la démonstration de LaLonde, d'acte d'accusation, en motivation fondatrice du programme.
Joshua Angrist et Jörn-Steffen Pischke ont baptisé ce basculement « révolution de la crédibilité » et affirmé que le travail empirique en économie est aujourd'hui bien plus crédible qu'il y a trente ans, parce que l'exigence posée à une affirmation causale a changé. La discipline l'a consacré par ses plus hautes distinctions : le Nobel 2019 à Banerjee, Duflo et Kremer pour l'approche expérimentale de la pauvreté, et le Nobel 2021 à Card, Angrist et Imbens pour leurs travaux empiriques sur le travail et pour le cadre qui a rendu interprétables les résultats d'expériences naturelles.
C'est en économie du travail que la révolution a fait ses preuves le plus tôt et le plus durement. Card et Krueger sur le salaire minimum, Angrist sur la loterie de conscription du Vietnam, le programme du monopsone qui a donné un mécanisme à l'absence d'effet du salaire minimum : c'est là que l'approche par le protocole est passée d'astuce ingénieuse à norme du domaine, et ce récit a sa propre filiation, retracée dans le fil propre à l'économie du travail.
La révolution de la crédibilité a fait la seule chose dont le programme structurel n'avait jamais été capable : rendre l'hypothèse identifiante vérifiable. En 1975, un rapporteur ne pouvait pas vérifier les restrictions d'un modèle structurel. En 2005, un rapporteur pouvait demander si l'instrument était vraiment exogène. À l'aune de l'exigence qu'elle s'était fixée, la révolution a gagné, et de façon décisive en microéconomie appliquée. Mais elle a renoncé à quelque chose. Elle a appris l'effet sur les « compliers », les personnes que l'expérience naturelle a fait bouger. Elle n'a pas appris l'effet sur tous les autres, ni l'effet d'une politique que personne n'a encore essayée, ni la réponse pour une population que la variation trouvée n'a jamais touchée. L'ambition impossible du programme structurel visait au moins ces questions. La révolution a-t-elle résolu l'identification, ou l'a-t-elle résolue en se limitant discrètement aux questions pour lesquelles une variation exogène se trouve traîner quelque part ?
Cette question a un défenseur qui la pose avec insistance depuis trente ans. James Heckman a reçu le Nobel pour l'économétrie structurelle, a vu la discipline s'en détourner, et n'a jamais cessé de soutenir que le programme du protocole de recherche oublie à quoi servait la structure. Le dernier geste du fil est une tentative d'avoir les deux.
La frontière de la synthèse
« L'écart entre une validité interne crédible et la validité externe qui nous importe en définitive s'est réduit, mais ne s'est pas refermé… c'est en combinant l'identification par le protocole de recherche et la modélisation explicite que les choses se jouent désormais. »
— Guido Imbens, dans l'esprit de sa conférence Nobel de 2021 sur l'inférence causale
Imbens appartient à la tradition du protocole de recherche : il a construit le cadre du LATE qui l'a définie. Et il est aujourd'hui l'un des chefs de file de l'effort pour remettre de la structure par-dessus. Quand les architectes mêmes de la révolution commencent à jeter des ponts vers le programme qu'elle a supplanté, on sait que la discipline est entrée dans sa phase de synthèse. Elle se demande comment garder le plancher de l'identification vérifiable tout en retrouvant l'extrapolation que ce plancher ne peut pas donner.
Le compromis est réel des deux côtés. Approche par le protocole ou en forme réduite : des hypothèses minimales, une identification transparente, une validité interne, mais un LATE mesuré sur une population trouvée ne s'extrapole ni à une autre population ni à une politique jamais essayée. Approche structurelle : davantage d'hypothèses, et des affirmations plus larges sous ces hypothèses, à savoir l'extrapolation et l'évaluation contrefactuelle ex ante des politiques, mais ces hypothèses sont précisément ce qui est difficile à défendre. Aucune ne domine l'autre. Elles répondent à des questions différentes.
La frontière, c'est l'ensemble des tentatives pour les combiner. Les modèles causaux structurels formalisent les conditions dans lesquelles un effet causal peut être identifié à partir d'un modèle explicite du mécanisme, et font des hypothèses structurelles des objets explicites que l'on peut examiner. L'apprentissage automatique causal, c'est-à-dire le programme de Susan Athey et Guido Imbens sur les méthodes que les économistes devraient connaître et le cadre d'apprentissage automatique double/débiaisé de Chernozhukov, place la discipline de l'identification par le protocole au premier plan, mais laisse des méthodes flexibles d'apprentissage automatique estimer les composantes de nuisance en grande dimension, si bien que l'on peut avoir une identification crédible et une hétérogénéité riche. Le but est de conserver la norme d'identification vérifiable de la révolution de la crédibilité tout en retrouvant la portée du programme structurel.
La défense de Heckman repose sur une chose que le programme structurel était conçu pour faire et que le programme du protocole ne peut pas faire, par construction : l'évaluation ex ante des politiques, c'est-à-dire prédire l'effet d'une politique qui n'a pas été mise en œuvre, sur une population qui n'a pas été traitée, sous des hypothèses explicites et énoncées. Un LATE mesuré sur les compliers d'une expérience naturelle ne dit rien d'une autre population, d'une version du programme à plus grande échelle ou d'une politique que personne n'a essayée. Si ce sont les questions auxquelles il faut répondre, et c'est le cas pour l'essentiel de la conception des politiques tournée vers l'avenir, alors il faut de la structure, parce que seule la structure s'y essaie. L'argument de Heckman sur la nécessité de « construire des ponts » rappelle que la victoire de la révolution a eu un coût réel, et ce coût, ce sont les questions pour lesquelles la structure avait été construite. Son cadre méthodologique est juste, et il tient indépendamment de son bilan sur certaines réanalyses empiriques, dont plusieurs n'ont pas résisté, alors que les résultats issus du protocole qu'elles contestaient, Card-Krueger en tête, ont tenu.
Et l'intégration est la destination de la filiation, portée par les propres acteurs de la révolution. Imbens, Athey, Chernozhukov, figures de proue de la tradition du protocole, réintroduisent aujourd'hui des ambitions structurelles, disciplinées par la norme de vérifiabilité que la révolution a établie. Dans cette synthèse, l'identification crédible est le plancher, et la combiner avec la pertinence structurelle pour les politiques est le chantier en cours.
La révolution de la crédibilité a relevé l'exigence. Chaque prédécesseur a échoué sur l'identification d'une manière que son successeur a correctement diagnostiquée. Lucas avait raison : les paramètres n'étaient pas invariants. Sims avait raison : les restrictions étaient souvent incroyables. LaLonde avait raison : les estimations structurelles ne reproduisaient pas les expériences. Et le tournant du protocole de recherche a résolu le problème commun en rendant l'hypothèse identifiante vérifiable. C'est un gain épistémique durable. Mais il a rétréci ce que la science économique entreprend. Les questions d'extrapolation structurelle sont devenues plus difficiles, et la défense de Heckman vaut précisément pour elles. La discipline s'est en partie retirée des questions que seule la tradition structurelle était équipée pour poser. La synthèse est en cours, la frontière intègre les deux, et aucune de ses directions ne l'a encore emporté. Enfin, la victoire est propre à certains domaines. L'identification par le protocole a gagné de façon décisive en microéconomie appliquée, qu'il s'agisse du travail, de l'économie publique, du développement ou de l'organisation industrielle appliquée, mais la macroéconomie ne s'est pas construite, pour l'essentiel, à partir de cette boîte à outils. Les modèles DSGE et la macroéconomie structurelle calibrée persistent pour des raisons que la révolution de la crédibilité n'a jamais traitées. Qualifier toute la discipline de « fondée sur le protocole de recherche » est faux.
Le fil a abouti à un point précis : l'identification crédible est devenue le plancher de l'économie appliquée, la barre qu'une affirmation causale doit franchir est désormais « un lecteur peut-il vérifier l'hypothèse identifiante ? », et le travail inachevé consiste à remettre la pertinence structurelle pour les politiques au-dessus de ce plancher sans le perdre. Un cadre se tient entièrement hors du fil : une tradition qui va de Mises à Hayek rejette le projet de l'identification dans son principe même, en tenant que les questions profondes de la science économique ne sont pas du tout tranchables empiriquement.
Ce fil a retracé comment les méthodes se sont accumulées, chaque échelon répondant à l'échec d'identification d'un prédécesseur. Pour ce que signifie cette accumulation, c'est-à-dire ce que la science économique sait désormais, ce qu'elle a cessé d'affirmer et ce qui a été déplacé, voir la Grande Question sur l'épistémologie.
Où le fil a abouti
Nous sommes partis d'une promesse : estimer la mécanique profonde de l'économie, puis simuler n'importe quelle politique. Le programme structurel de la Commission Cowles a bâti un véritable appareil pour la tenir. Puis trois critiques, sur trois fronts, ont montré que cet appareil ne pouvait pas livrer de façon crédible les paramètres profonds promis, et chacune relevait du même type d'échec, un échec de l'identification. La révolution de la crédibilité a répondu aux trois d'un coup en changeant de question : cesser d'imposer des hypothèses, trouver une variation exogène, et faire de la seule hypothèse conservée une affirmation qu'un lecteur peut vérifier. Elle a gagné de façon décisive en microéconomie appliquée. Elle a aussi appris l'effet sur les compliers et non sur tout le monde, ce qui explique que la défense de la tradition structurelle tienne pour les questions que seule celle-ci peut poser.
Le fil a donc abouti à un plancher. Remettre la pertinence structurelle pour les politiques au-dessus de ce plancher, avec les modèles causaux structurels, l'apprentissage automatique causal et l'estimation structurelle fondée sur le protocole, reste le travail inachevé, et ceux qui s'y attellent sont les architectes mêmes de la révolution. La prochaine fois qu'on vous dira qu'une étude « prouve » qu'une politique fonctionne, vous aurez la question que toute cette filiation a gagnée : peut-on vérifier l'hypothèse identifiante ? Pour voir la filiation des méthodes comme un graphe connecté, qui a répondu à qui à travers les époques que les livres organisés par époque tiennent séparées, ouvrez la vue de la filiation méthodologique.