Hat die Glaubwürdigkeitsrevolution verändert, was die Ökonomik weiß?
In den 1990er Jahren beschloss die Ökonomik, Modellen, die sie nicht überprüfen konnte, nicht länger zu vertrauen und stattdessen Experimente durchzuführen. Sie bekam weit bessere Antworten. Und sie hörte auf, einige der größten Fragen zu stellen.
Was die Revolution handhabbar machte
„Entgegen der zentralen Vorhersage des Lehrbuchmodells … finden wir keinen Hinweis darauf, dass die Anhebung des Mindestlohns die Beschäftigung verringert hat.“
— David Card & Alan Krueger, American Economic Review, 1994
1992 erhöhte New Jersey seinen Mindestlohn, Pennsylvania nicht. Card und Krueger zählten die Stellen in Fast-Food-Restaurants auf beiden Seiten der Grenze, vorher und nachher, und stellten fest, dass die Vorhersage des Lehrbuchs nicht eintraf. Berühmt ist das Ergebnis für seine Schlussfolgerung. Wichtiger ist es für die Art, wie es zu ihr kam: kein strukturelles Modell, keine unüberprüfbaren Annahmen, allein ein natürliches Experiment, das die Arbeit leistet. Dieser Zug ist die Glaubwürdigkeitsrevolution, und Card-Krueger ist selbst nur ein Fall in einer längeren Denklinie der Arbeitsökonomik, die eine eigene Große Frage nachzeichnet, von der Grenzproduktivitätstheorie bis zur Glaubwürdigkeitswende.
Um zu sehen, warum dieser Zug ein Bruch war, muss man bei dem beginnen, was er ersetzte. In den 1970er und 1980er Jahren beruhte die angewandte Ökonomik auf strukturellen Modellen: Man schreibt ein Modell dafür auf, wie sich die Akteure verhalten, schätzt seine Parameter aus Beobachtungsdaten und liest die Wirkungen von Politik an der geschätzten Struktur ab. Das Problem war, dass die Antworten von Annahmen abhingen, die die Daten nicht prüfen konnten, nämlich von Funktionsformen, Fehlerverteilungen und der Frage, welche Variablen exogen waren. Robert LaLonde machte das Problem 1986 unabweisbar. Er nahm ein echtes randomisiertes Experiment zu einem Programm der beruflichen Weiterbildung, verwarf die Randomisierung und fragte, ob die führenden strukturellen Schätzer das experimentelle Ergebnis aus Beobachtungsdaten zurückgewinnen konnten. Sie konnten es nicht. Verschiedene vernünftige Spezifikationen lieferten stark voneinander abweichende Effekte, und es gab keinen internen Weg, zu erkennen, welche richtig war.
Der Zug der Glaubwürdigkeitsrevolution bestand darin, nicht mehr die ganze Welt modellieren zu wollen, sondern nach einer Situation zu suchen, in der die Behandlung so gut wie zufällig zugeteilt wurde: ein Bundesstaat, der seinen Mindestlohn erhöhte, während der Nachbarstaat es nicht tat, eine Lotterie, die manche Schüler aufnahm und andere nicht, ein Sprung in der Anspruchsberechtigung an einer willkürlichen Schwelle. Wo man so etwas findet, lässt sich ein kausaler Effekt mit Annahmen identifizieren, die ein Leser prüfen kann. Der Werkzeugkasten, der um diesen Gedanken herum entstand, also sorgfältig eingesetzte Instrumentalvariablen, Differenz-von-Differenzen und Regressionsdiskontinuität, hat ein gemeinsames Merkmal: Die identifizierende Annahme liegt offen.
Das formale Objekt, das dieser Werkzeugkasten schätzt, ist enger, als es aussieht. Es ist der lokale durchschnittliche Behandlungseffekt (LATE), der Effekt auf diejenigen, deren Behandlung sich wegen des natürlichen Experiments tatsächlich geändert hat.
Man schreibe $Y_i(1)$ und $Y_i(0)$ für das Ergebnis der Einheit $i$ mit und ohne Behandlung, die beiden potenziellen Ergebnisse, von denen immer nur eines beobachtet wird. Mit einem Instrument $Z$, das die Behandlung $D$ verschiebt, ohne $Y$ auf anderem Weg zu beeinflussen, lautet die zu schätzende Größe
$$\text{LATE} = \frac{E[Y \mid Z=1] - E[Y \mid Z=0]}{E[D \mid Z=1] - E[D \mid Z=0]} = E\big[Y_i(1) - Y_i(0) \,\big|\, \text{compliers}\big]$$Der Nenner besagt: Von allen, die das Instrument angestoßen hat, wird mit dem Anteil derer hochgerechnet, deren Behandlungsstatus tatsächlich umgeschlagen ist. Übrig bleibt der Effekt auf die Complier, nicht auf die gesamte Population.
Man sieht nie dieselbe Person zugleich behandelt und unbehandelt, also kann man einen individuellen Effekt nie direkt messen. Das natürliche Experiment liefert einen sauberen Vergleich nur für die Menschen, deren Lage es verändert hat, für die Restaurants in New Jersey, die wegen der Lohnerhöhung anders einstellten. Die Antwort, die die Methode liefert, lautet deshalb: „Das ist der Effekt, für genau diese Menschen, in genau dieser Situation.“ Das ist weniger, als Ökonomen früher behaupteten. Es lässt sich auch besser verteidigen.
Ein weiteres Stück sorgte dafür, dass die Revolution Bestand hatte: Die Inferenz holte die Identifikation ein. Bertrand, Duflo und Mullainathan zeigten 2004, dass die übliche Berechnung der Standardfehler in Differenz-von-Differenzen-Studien viel zu zuversichtlich war. Sie behandelte korrelierte Beobachtungen als unabhängig und erzeugte Signifikanz, wo keine war. Nach der Bereinigung durch Clustering und ehrlich ausgewiesene Unsicherheit musste eine glaubwürdige Kausalschätzung zweierlei überstehen: eine überprüfbare identifizierende Annahme und eine überprüfbare Aussage darüber, wie sicher man sich sein durfte.
Das ist der nächste Zug nach der Gegenrevolution der rationalen Erwartungen um Lucas, und die Lehrbuchtradition stellt beide als eine Denklinie dar. Die Gegenrevolutionäre hatten keynesianische Modelle angegriffen, weil sie auf Zusammenhängen beruhten, die zerfielen, sobald die Politik sie nutzte. Ihre Antwort waren tiefere Mikrofundierungen. Die Glaubwürdigkeitsrevolution beantwortete dieselbe Sorge anders, mit einer Identifikation, die man überprüfen kann. Die Ideengeschichte behandelt beide Züge in einem Kapitel und geht direkt darauf ein, wie die Arbeitsökonomik die Glaubwürdigkeitswende in Gang setzte.
Die formale Ökonometrie, also das Identifikationsproblem, Instrumentalvariablen, Differenz-von-Differenzen, Regressionsdiskontinuität und der Rahmen der potenziellen Ergebnisse, auf dem der LATE beruht, wird im Lehrbuch der Volkswirtschaftslehre vollständig dargestellt. Den chronologischen Bogen dieses Werkzeugkastens, von IV über Differenz-von-Differenzen, RD, Matching und synthetische Kontrollgruppen bis zum kausalen maschinellen Lernen, zeichnet eine eigene Große Frage nach, die methodische Denklinie der Glaubwürdigkeitsrevolution.
Das Argument der Verteidiger in seiner stärksten Form
„Die empirische Mikroökonomik hat eine Glaubwürdigkeitsrevolution erlebt … Besseres Forschungsdesign ist ein wesentlicher Grund für die gestiegene Verlässlichkeit der empirischen Mikroökonomik.“
— Joshua Angrist & Jörn-Steffen Pischke, Journal of Economic Perspectives, 2010
Angrist und Pischke behaupten nicht, die Ökonomik habe neue Wahrheiten gefunden. Sie behaupten, sie habe einen Weg gefunden, zu erkennen, welche ihrer empirischen Aussagen Vertrauen verdienen. Vor der Revolution hatte ein Gutachter, der ein strukturelles Paper las, keine unabhängige Möglichkeit, die Annahmen zu prüfen, auf denen die zentrale Zahl beruhte. Annahmen und Ergebnis waren ineinander verwickelt, und Meinungsverschiedenheiten endeten beim Geschmack. Danach liegt die identifizierende Annahme an der Oberfläche, wo ein Gegner sie direkt angreifen kann: Ist die Grenze zu Pennsylvania eine gültige Kontrollgruppe für New Jersey? Ist die Schwelle für die Anspruchsberechtigung tatsächlich willkürlich? Das sind beantwortbare Fragen. Der Gewinn besteht darin, dass Kausalaussagen in der Sache anfechtbar wurden. Ein publizierbares Paper der angewandten Mikroökonomik steht und fällt 2025 mit einem Argument über das Forschungsdesign, das ein Paper von 1985 nie vorbringen musste und nicht hätte gewinnen können.
Und das Fach hat diesen Zug rücksichtslos ausgeweitet. Sobald Einigkeit bestand, dass glaubwürdige Identifikation der Eintrittspreis ist, richtete es die Doktorandenausbildung, die Begutachtung in den Fachzeitschriften und die gesamte Anreizstruktur der angewandten Forschung neu auf die Suche nach sauberer Variation aus. Ganze Literaturen, etwa zu den Bildungsrenditen, zur Wirkung der Klassengröße und zu den Folgen von Haftstrafen, wurden auf quasi-experimentelle Grundlagen gestellt und lieferten Antworten, die Replikationen standhielten, wie es die Antworten der vorigen Generation nicht getan hatten. An ihren eigenen Maßstäben gemessen haben die Verteidiger recht.
Wo uns das hinführt
Die Glaubwürdigkeitsrevolution hat eine bestimmte Sache sichtbar gemacht: ob ein Leser die identifizierende Annahme hinter einer Kausalaussage überprüfen kann. Das ist die methodische Trennlinie zwischen einem heute publizierbaren Paper der angewandten Mikroökonomik und einem von 1985. Sie entscheidet aber nicht, ob die gestellte Frage die richtige ist, und sie erkauft ihre Sicherheit damit, dass sie enger fasst, was sie beantwortet. Aus „Wie wirkt diese Politik?“ wird „Wie wirkt sie auf die Menschen, die dieses eine Experiment zufällig bewegt hat?“.
Eine saubere Kausalschätzung für eine bestimmte Frage in einer bestimmten Population ist etwas anderes als das Wissen darüber, wie die Welt funktioniert. Die Entwicklungsökonomen, die das ernst nahmen, führten nicht ein Experiment durch. Sie führten tausend durch. Was haben sie gelernt, und was hat das Fach aufgegeben, um es zu lernen?
Was sichtbar wurde und was verdrängt wurde
„Wir wissen nicht recht, ob [unsere Hilfe] etwas Gutes bewirkt … Die gute Nachricht ist, dass wir es herausfinden können. Wir können Experimente durchführen.“
— sinngemäß nach Esther Duflo, TED, „Social experiments to fight poverty“, 2010
Duflos Botschaft war ernüchternd und radikal zugleich: Die Entwicklungsökonomik hatte Jahrzehnte über große Wachstumstheorien gestritten und dabei kaum glaubwürdige Belege dafür gehabt, welche Maßnahmen tatsächlich halfen. Ihre Antwort war, Politik wie Medizin zu behandeln: randomisieren, messen, Wissen ansammeln. Das ist die Glaubwürdigkeitsrevolution in ihrer saubersten Form. Und genau hier werden die Kosten dieser Sauberkeit sichtbar.
Banerjee, Duflo und Sendhil Mullainathan gründeten 2003 am MIT das Poverty Action Lab und bauten eine Infrastruktur auf, um randomisierte Feldexperimente in großem Maßstab durchzuführen. Ende der 2010er Jahre hatte das Programm in der Größenordnung von tausend Studien hervorgebracht, zu Entwurmung, Mikrofinanz, bedingten Geldtransfers, der Anwesenheit von Lehrkräften, Moskitonetzen und Impfanreizen, und der Nobelpreis 2019 für Banerjee, Duflo und Michael Kremer bestätigte es als das vorherrschende empirische Paradigma der Entwicklungsökonomik. Die Denklinie der Entwicklungsökonomik, von Lewis und den Strukturalisten bis zur RCT-Wende, zeichnet die Ideengeschichte nach.
Was die RCTs sichtbar machten, war eine andere Art von Tatsache, als das Fach sie gewohnt war. Die Entwicklungsliteratur vor der Revolution handelte mit großen strukturellen Thesen, dem Big Push, dem ausgewogenen Wachstum, dem Zwei-Lücken-Modell, und diese Thesen benannten, was ganze Volkswirtschaften wachsen lässt. Die Studien ersetzten sie durch kleine, spezifische, falsifizierbare Effekte in identifizierten Populationen: Entwurmung erhöhte den Schulbesuch in diesem Teil Kenias um so und so viel, und Mikrofinanz bewirkte fast überall, wo sie getestet wurde, weit weniger, als ihre Fürsprecher versprochen hatten. Die ehrliche Einheit des Wissens schrumpfte von „Was verursacht Entwicklung?“ auf „Was hat diese Maßnahme hier bewirkt?“. Für alles, was die Methode erreichen kann, ist das eine echte Verbesserung: Das Fach hörte auf, bei Effekten zu bluffen, die es nie glaubwürdig gemessen hatte.
Die Revolution verschob auch den Schwerpunkt des ganzen Fachs, und andere Programme verloren an Boden. Länderübergreifende Wachstumsregressionen nach dem Vorbild Barros, einst eine blühende Industrie, wirkten bald aussichtslos, weil sich ihre identifizierenden Annahmen genau so wenig falsifizieren ließen, wie LaLonde gewarnt hatte. Die kalibrierte strukturelle Makroökonomik und die ehrgeizige Ökonometrie der Politikevaluation aus der vorigen Generation verloren Platz in den Fachzeitschriften und die Aufmerksamkeit der Doktoranden an saubere Feldexperimente. Das verdrängte Programm geht direkt auf den Zug der rationalen Erwartungen um Lucas zurück, dessen Anspruch auf das ganze Fach die Glaubwürdigkeitswende in der angewandten Forschung stillschweigend untergrub.
Banerjee selbst steht im Ideengraphen unter den modernen Pluralisten. Welchen Platz das RCT-Programm in der methodischen Denklinie einnimmt, zeigt der interaktive Ideengraph.
Zwei Dinge, beide wahr
„Die Praxis, Experimente durchzuführen, hat grundlegend verändert, wie wir darüber denken, die Welt zu verstehen … ein Werkzeug, um herauszufinden, was funktioniert, statt zu bestätigen, was wir ohnehin schon glauben.“
— sinngemäß nach Abhijit Banerjee & Esther Duflo, Nobelpreisvortrag, „Field Experiments and the Practice of Economics“, 2019
Banerjee und Duflo behaupten, dass Experimente eine andere, ehrlichere Art von Wissensanspruch hervorbringen: bescheiden, an den Kontext gebunden und falsifizierbar, wo die vorige Generation eine selbstsichere Allgemeinheit angeboten hatte, die sie nicht belegen konnte. Sie sagen ausdrücklich, dass dies eine bescheidenere Ökonomik ist, und sie argumentieren, dass gerade die Bescheidenheit der Gewinn ist. Früher beantwortete das Fach „Wie entwickeln sich arme Länder?“ mit Theorien, die niemand testen konnte. Heute beantwortet es „Funktioniert das, hier?“ mit Belegen, die jeder prüfen kann, und lässt die Antworten sich ansammeln. Für die Fragen, die es erreichen kann, ist das das stärkste Argument dafür, dass das Fach durch die Revolution mehr weiß.
„Die Methode der Randomisierung … kann viele der Fragen nicht beantworten, auf die Politikanalysten eine Antwort wollen … Strukturmodelle sind nötig, um über die Versuchspopulation hinaus zu extrapolieren und Maßnahmen zu bewerten, die noch nicht erprobt wurden.“
— sinngemäß nach James Heckman, Journal of Economic Literature, 2010 („Building Bridges …“)
Heckman trägt das Verdrängungsargument in seiner stärksten Form vor. Das strukturelle Programm wurde dafür gebaut, etwas zu leisten, was das experimentelle Programm aus strukturellen Gründen nicht kann: eine Politik zu bewerten, die noch nicht erprobt wurde, in einer Population, die noch nicht behandelt wurde, indem man das Verhaltensmodell und die Annahmen ausformuliert und hinnimmt, dass die Antwort nur so gut ist wie sie. Eine randomisierte Studie kann nicht sagen, wie ein Mindestlohn wirkt, den man nicht eingeführt hat, auf einem Arbeitsmarkt, den man nicht beobachtet hat. Dafür braucht man ein Modell davon, wie Menschen reagieren, also genau das strukturelle Instrumentarium, das die Revolution verdrängt hat. Heckman räumt ein, dass Card-Krueger Bestand hatte. Sein Punkt ist, dass ein Fach, das nur Fragen beantworten kann, die ein Experiment zufällig zugänglich macht, eine ganze Klasse von Fragen aufgegeben hat, auf die die Politik Antworten braucht.
Wo uns das hinführt
Zwei Dinge sind zugleich wahr. Die RCT-Wende in der Entwicklungsökonomik hat eine Art von Wissen sichtbar gemacht, bei der die Literatur vor der Revolution geblufft hatte: kleine, an den Kontext gebundene, falsifizierbare Effekte in identifizierten Populationen, wo es vorher selbstsichere Theorie und kaum glaubwürdige Messung gegeben hatte. Und die Verdrängung des strukturellen Programms war ein echter Verlust. Es gibt Fragen, etwa nach der Wirkung einer unerprobten Politik oder nach der Antwort für eine Population, die kein Experiment erreicht hat, für die das strukturelle Programm gebaut war und die der Werkzeugkasten der Glaubwürdigkeitsrevolution aus strukturellen Gründen nicht beantworten kann.
Wenn die Revolution in ihrem Bereich so erfolgreich ist, warum argumentieren dann ihre nachdenklichsten Kritiker, Deaton, Heckman und die Makroökonomen, die nach 2008 mit ihrem eigenen Fach abrechnen, seit fünfzehn Jahren, dass etwas Wichtiges verloren ging? Sie erheben drei verschiedene Einwände. Welche Rechnung ist für die Revolution noch offen?
Die Einwände, die fortbestehen
„RCTs sind wertvoll, aber sie haben keinen Sonderstatus, und sie sind vielen Problemen ausgesetzt … Die tiefere Frage, wie man experimentelle Belege nutzt, um über Menschen zu entscheiden, die nicht am Experiment teilgenommen haben, ist nicht angemessen behandelt worden.“
— Angus Deaton & Nancy Cartwright, Social Science & Medicine, 2018
Deaton hat ein Berufsleben lang Armut gemessen und dafür einen Nobelpreis erhalten, und deshalb sitzt die Kritik. Die Verteidiger und die Kritiker der Glaubwürdigkeitsrevolution, beide aus dem Mainstream, streiten über drei Dinge zugleich: über externe Validität, über den Zweck struktureller Modelle und darüber, ob sich irgendetwas davon zur Makroökonomik aggregieren lässt.
Eine Schätzung in reduzierter Form, der saubere LATE aus Schritt 1, trifft minimale Annahmen und ist intern valide: Innerhalb ihres Experiments ist die Zahl vertrauenswürdig. Eine strukturelle Schätzung trifft mehr Annahmen und erlaubt unter diesen Annahmen weiter reichende Aussagen, doch gerade die Annahmen sind schwer zu verteidigen. Keine Seite bekommt beides. Die Glaubwürdigkeitsrevolution hat sich für interne Validität und minimale Annahmen entschieden, und die drei Kritiken sind drei verschiedene Rechnungen für diese Entscheidung.
Externe Validität. Eine saubere Schätzung aus einer Stichprobe sagt nichts über eine andere Population, solange man nicht annimmt, dass sich der Behandlungseffekt auf eine bekannte Weise verallgemeinern lässt, und sobald man das annimmt, betreibt man strukturelle Arbeit, nur ohne es zuzugeben. Der Entwurmungseffekt in Kenia lässt sich nicht auf Bihar übertragen, wo Parasiten, Schulen und Haushalte anders sind, und keine noch so große Strenge innerhalb der Studie kann zurückholen, was die Studie nie beobachtet hat. Die Rechnung ist struktureller Natur.
Wofür strukturelle Modelle da waren. Der Punkt, den Heckman in Schritt 2 vorbrachte, spitzt sich hier zur Kritik zu: Die Extrapolation auf unerprobte Politik und unerreichte Populationen ist genau die Aufgabe, für die die strukturelle Modellierung gebaut wurde. Ein Fach, das sie aufgibt, hat eine Funktion fallen gelassen.
Die Mikrobefunde aggregieren sich nicht zur Makroökonomik. Eine glaubwürdige Mikroschätzung, etwa die marginale Konsumneigung von Hand-to-Mouth-Haushalten, kann in die Kalibrierung eines Makromodells einfließen, aber sie ersetzt nicht das strukturelle makroökonomische Instrumentarium, das man braucht, um zu beantworten, was eine Steuersenkung mit dem Output macht oder ob eine Zinserhöhung eine Rezession auslöst. Der Werkzeugkasten der Glaubwürdigkeitsrevolution führt nicht von sauberen Mikroeffekten hinauf zu Fragen des allgemeinen Gleichgewichts, und das erklärt zu einem großen Teil, warum die Revolution wie ein Ereignis der angewandten Mikroökonomik wirkt. Die Makroseite hat nach 2008 ihre eigene, tiefer gehende Abrechnung, der eine eigene Große Frage gewidmet ist: Hat 2008 die Makroökonomie zerbrochen?
In der Denklinie des Lehrbuchs stehen die Kritik an der externen Validität und die methodische Debatte nach der Glaubwürdigkeitsrevolution im Kapitel über den modernen Pluralismus, das das J-PAL-Programm und den Einwand von Deaton, Pritchett und Rodrik zusammen behandelt. Die Verteidigung der strukturellen Ökonometrie lässt sich über die ökonometrisch-methodische Wende verfolgen, die das Kapitel zur Informationsökonomik neben seine Denklinie der Messung stellt.
Drei Kritiker, drei verschiedene Rechnungen
„Ohne zu wissen, warum Dinge geschehen und warum Menschen etwas tun, laufen wir Gefahr, wertlose, leichtfertige Kausaltheorien zu entwerfen (‚Märchen‘), und wir werden nie wissen, ob sich unsere Ergebnisse verallgemeinern lassen.“
— Angus Deaton, „Instruments, Randomization, and Learning about Development“
Deatons Kritik an der externen Validität ist eine zutreffende Beobachtung über die strukturellen Grenzen des Werkzeugkastens. Sein Vorwurf ist präzise: Eine Studie, die einen sauberen lokalen Effekt liefert, ohne zu erklären, warum der Effekt eintrat, hat die Glaubwürdigkeit ihrer Identifikation mit Verständnis bezahlt, und Verständnis braucht man, um irgendetwas über Menschen zu sagen, die nicht an der Studie teilgenommen haben. Der Mechanismus, der den Entwurmungseffekt in Kenia hervorbrachte, ist das Einzige, was sagen könnte, was in Bihar zu erwarten ist, und das Experiment schweigt darüber, weil es so angelegt ist. Die Rechnung steht, und sie ist fünfzehn Jahre später weitgehend unbezahlt: Die Infrastruktur der Politikevaluation, die die Revolution aufgebaut hat, hat das Problem der externen Validität nicht gelöst, und das Gegenteil vorzugeben ist die dauerhafte Selbsttäuschung des Fachs.
„Die aufschlussreichsten Evaluationen verbinden experimentelle und strukturelle Methoden … Atheoretische Ansätze … bieten keinen Rahmen, um ihre Schätzungen zu interpretieren oder auf neue Umgebungen zu extrapolieren.“
— sinngemäß nach James Heckman, „Econometric Causality“, International Statistical Review, 2008
Heckmans Verteidigung der strukturellen Ökonometrie hält an ihrem methodischen Rahmen fest, und dieser Rahmen ist richtig, auch wo seine empirische Bilanz es nicht ist. Er hat sich in Einzelheiten geirrt: Einige seiner Neuanalysen von Card-Krueger ließen sich nicht replizieren, und Card-Krueger hatte Bestand. Die methodische These hängt aber nicht von diesem Punktestand ab. Ein strukturelles Modell ist das einzige Objekt, das die Parameter liefert, die man braucht, um eine Schätzung zu interpretieren und in eine neue Umgebung zu übertragen, weil es angibt, welches Verhalten die Zahl erzeugt hat. Nimmt man das weg, bleibt eine Messung ohne Theorie des Warum, nützlich für den vorliegenden Fall und stumm zu jedem anderen. Das Programm der reduzierten Form kann keine Politikevaluation ex ante unter expliziten Annahmen leisten. Sauberere Instrumente ändern daran nichts. Das Programm tut es konstruktionsbedingt nicht.
„Wir graben uns Stück für Stück immer tiefer in ein Fantasieland hinein, mit ökonomischen Akteuren, die immer reichhaltigere stochastische allgemeine Gleichgewichtsprobleme mit Friktionen aller Art lösen können.“
— Ricardo Caballero, Journal of Economic Perspectives, 2010 („Macroeconomics after the Crisis“)
Die Kritik, dass sich Mikrobefunde nicht zur Makroökonomik aggregieren, ist ein Argument auf der Ebene des Rahmens. Caballeros Einwand lautet, dass sich makroökonomische Fragen der Art nach von Fragen der angewandten Mikroökonomik unterscheiden. Sie gehören ins dynamische allgemeine Gleichgewicht, wo der Gegenstand des Interesses die Reaktion des ganzen Systems ist, und Belege von der Güte der Glaubwürdigkeitsrevolution fließen in diese Reaktion ein, ohne je das strukturelle Modell zu ersetzen, mit dem man sie berechnet. Man kann die marginale Konsumneigung von Hand-to-Mouth-Haushalten mit einem schönen natürlichen Experiment genau bestimmen und trotzdem ohne ein Modell des Zusammenspiels der Teile nicht ablesen, was ein Konjunkturpaket mit dem gesamtwirtschaftlichen Output macht. Die Mikrobefunde sind ein Input für die Makroökonomik, und genau deshalb bestehen DSGE-Modelle und die kalibrierte strukturelle Makroökonomik in einem Fach fort, das die Glaubwürdigkeitsrevolution sonst umgestaltet hat.
Wo uns das hinführt
Deaton und Cartwright haben recht: Die Rechnung für die externe Validität steht, und sie ist weitgehend unbezahlt. Heckman hat recht, dass das strukturelle Programm für etwas gebaut war, was das Programm der reduzierten Form aus strukturellen Gründen nicht kann, nämlich die Evaluation ex ante unter expliziten Annahmen, und dass mit ihm etwas verloren ging. Caballero und die Makroökonomen, die mit ihrem Fach abrechnen, haben recht, dass sich mikroempirische Arbeit nicht zu den Fragen aggregiert, die die Makroökonomik beantworten muss. Keiner dieser Einwände entkräftet das Urteil aus Schritt 1: Die Maßstäbe für Kausalaussagen sind tatsächlich gestiegen. Alle schränken ein, was dieses Urteil bedeuten darf. Die Revolution hat die Debatte gewonnen, die sie sich ausgesucht hat. Die Kritiker zeigen auf die Debatten, die sie nicht mehr führt.
Wenn also die Maßstäbe für Kausalaussagen gestiegen sind, die Rechnung für die externe Validität steht und die Verdrängung zum Teil ein Verlust war: Was weiß die Ökonomik heute, das sie vorher nicht wusste? Und was tut das Fach, um die Rechnung zu begleichen?
Was die Ökonomik heute tatsächlich weiß
„Der Goldstandard, um Schlüsse über die Wirkung einer Politik zu ziehen, ist ein randomisiertes kontrolliertes Experiment. Allerdings … interessieren sich Forscher oft für Fragen, die … sich nicht durch Experimente beantworten lassen. Die Herausforderung besteht darin, die Glaubwürdigkeit experimenteller Methoden mit der Verallgemeinerbarkeit struktureller Methoden zu verbinden.“
— Susan Athey & Guido Imbens, Journal of Economic Perspectives, 2017 („The State of Applied Econometrics …“)
Imbens erhielt 2021 einen Anteil am Nobelpreis für genau das Instrumentarium der potenziellen Ergebnisse, das Schritt 1 angetrieben hat. Er benennt die unerledigte Aufgabe: Die glaubwürdigen Methoden beantworten eine enge Klasse von Fragen, die Fragen, auf die es ankommt, liegen oft außerhalb davon, und die lebendige Arbeit des Fachs besteht darin, beides zu verbinden, ohne sich in die alte falsche Selbstsicherheit zurückzuziehen.
Die Antwort des Fachs auf die Rechnung der externen Validität ist eine Reihe von Versuchen, die Disziplin der Identifikation zu behalten und die Reichweite für die Politik zurückzugewinnen. Drei verdienen es, genannt zu werden. Imbens und seine Koautoren haben den Rahmen der potenziellen Ergebnisse direkt auf Fragen der Extrapolation und der externen Validität ausgedehnt und behandeln „Lässt sich das übertragen?“ als formales Problem. Susan Athey und Guido Imbens haben ein Programm des kausalen maschinellen Lernens aufgebaut, das mit flexiblen Algorithmen schätzt, wie Behandlungseffekte zwischen Menschen und Kontexten variieren, also genau die Heterogenität, an der die externe Validität hängt, und das darunter eine glaubwürdige Identifikationsstrategie beibehält. Und Raj Chettys Big-Data-Forschung verknüpft Millionen von Verwaltungsdatensätzen mit kausalen Designs und beantwortet Fragen zu Mobilität und Chancen in einem Maßstab und einer Auflösung, die die RCT mit kleiner Stichprobe nie erreichen konnte.
Pearls Programm der strukturellen Kausalmodelle und die Methoden des Double/Debiased Machine Learning stehen neben dieser Arbeit als weitere Werkzeuge für dasselbe Vorhaben. Die Forschungsfront verbindet die überprüfbare Identifikation der Glaubwürdigkeitsrevolution mit dem Anspruch des strukturellen Programms, über Fälle zu sprechen, die kein Experiment erreicht hat. Das Kapitel über den modernen Pluralismus liest das als den gegenwärtigen methodischen Zustand des Fachs: eine Reihe von Programmen, die um denselben Zielkonflikt ringen.
Die Stränge gegeneinander abgewogen
Wägen wir die drei Schritte gegen die Frage ab, um die es immer ging: „Was weiß die Ökonomik heute?“ Die Verteidiger aus Schritt 1 haben recht, und das ist unbestritten: In der Arbeitsökonomik, der Finanzwissenschaft, der Entwicklungsökonomik und der angewandten Mikroökonomik ist das, was als glaubwürdige Kausalaussage gilt, weit strenger und transparenter als 1985. Der Gewinn ist echt und dauerhaft. Auch die Verdrängung aus Schritt 2 hat stattgefunden: Die Bandbreite der Fragen, denen das Fach nachgeht, wurde in manchen Bereichen enger und änderte ihre Gestalt. Diese Verengung war zum Teil eine Korrektur, denn LaLonde hatte recht, dass strukturelle Aussagen vor der Revolution oft übertrieben waren, und zum Teil ein Verlust, weil das strukturelle Programm echte Arbeit leistete, die nichts ersetzt hat.
Die Kritiker aus Schritt 3 schränken das Urteil ein, ohne es umzustoßen. Die externe Validität ist eine offene Rechnung. Heckmans Funktion, die Evaluation ex ante unter expliziten Annahmen, kann das Programm der reduzierten Form nicht erfüllen. Zur Makroökonomik hat sich der Werkzeugkasten größtenteils nicht hochaggregieren lassen. Zusammengenommen ergeben die Stränge etwas Präzises: Die Ökonomik weiß andere Dinge, und diese besser. Sie hat einen festeren Griff auf eine engere Klasse von Kausalfragen, einen schwächeren Anspruch auf die großen strukturellen Fragen, die sie früher mit unverdienter Selbstsicherheit beantwortete, und mit der externen Validität ein ehrlich benanntes offenes Problem, wo sie sich früher mit vagen Andeutungen beholfen hätte.
Das Urteil
Hat die Glaubwürdigkeitsrevolution verändert, was die Ökonomik weiß? Ja, aber die Antwort ist kalibriert. Die Ökonomik weiß andere Dinge, und diese besser. Ob das mehr bedeutet, hängt von der Frage ab, die man stellt. Vier Festlegungen tragen dieses Urteil. Die Maßstäbe für Kausalaussagen sind tatsächlich gestiegen: In der angewandten Mikroökonomik liegt die Messlatte für eine glaubwürdige Kausalaussage weit höher und ist transparenter als vor 1990, und das wird nicht ernsthaft bestritten. Die Bandbreite der Fragen wurde in manchen Bereichen enger und änderte ihre Gestalt: Länderübergreifende Wachstumsregressionen, kontrafaktische Rechnungen mit kalibrierten strukturellen Makromodellen und das Programm der strukturellen Ökonometrie verloren an Boden, zum Teil als Korrektur, zum Teil als echter Verlust. Die externe Validität ist eine offene und ungelöste Rechnung: Die Infrastruktur der Politikevaluation hat nicht gelöst, wie man die Belege aus einer Population nutzt, um für eine andere zu entscheiden, und das Fach sollte aufhören, das Gegenteil zu behaupten. Die Mikrobefunde aggregierten sich größtenteils nicht zur Makroökonomik: DSGE-Modelle und die kalibrierte strukturelle Makroökonomik bestehen fort, weil der Werkzeugkasten der Glaubwürdigkeitsrevolution nicht ersetzt, was sie leisten, und deshalb liest sich die Revolution eher als Ereignis der angewandten Mikroökonomik denn als eines des ganzen Fachs.
Eine Einschränkung: Die Verengung ist lokal. Die Ökonomik von 2025 pauschal „enger“ zu nennen, ist falsch, denn das Fach reicht in Kausalfragen hinein, die es vor einer Generation nicht glaubwürdig berühren konnte. Und die Synthese nach der Glaubwürdigkeitsrevolution ist die lebendige Antwort auf die Rechnung: Imbens zur Extrapolation, Athey und Imbens zum kausalen maschinellen Lernen, Chetty zur kausalen Inferenz mit Big Data, daneben Pearls strukturelle Kausalmodelle und Double/Debiased ML. Unter diesen Richtungen einen Sieger zu küren, wäre verfrüht, weil das Fach es nicht getan hat, und das Gegenteil vorzugeben, wäre genau die unverdiente Selbstsicherheit, gegen die sich die Revolution richtete.
Die Glaubwürdigkeitsrevolution ist ein Strang in der größeren Frage, ob die Ökonomik eine einheitliche Wissenschaft ist oder eine Föderation von Spezialgebieten. Diese Gesamtschau bietet die Große Frage Ist die Ökonomik eine einheitliche Wissenschaft geworden oder eine Ansammlung von Spezialgebieten? Den chronologischen Bogen des Werkzeugkastens selbst zeichnet die Große Frage zur methodischen Denklinie nach. Die Abrechnung auf der Makroseite, die diese Revolution größtenteils nicht erreicht hat, behandelt Hat 2008 die Makroökonomie zerbrochen?, und der eigene quasi-experimentelle Moment der Verhaltensökonomie ist ein Thema für sich, dargestellt in der Großen Frage dazu.
Wo uns das hinführt
Wir begannen mit zwei Fast-Food-Restaurants auf beiden Seiten einer Staatsgrenze und einem Ergebnis, das eine Vorhersage des Lehrbuchs widerlegte. Was Card und Krueger bedeutend machte, war der Zug: Modellen, die man nicht prüfen kann, nicht mehr vertrauen, Variation finden, die ein Leser prüfen kann, und im Gegenzug eine engere, ehrlichere Aussage akzeptieren. Die Entwicklungsökonomen trieben diesen Zug in seine sauberste Form und lernten tausend kleine, spezifische, falsifizierbare Dinge, während das strukturelle Programm, das einst die großen Fragen beantwortete, seinen Platz verlor. Die Kritiker benannten den Preis: eine unbezahlte Rechnung für die externe Validität, eine tatsächlich verlorene Funktion in der Politikevaluation ex ante und eine Makroökonomik, zu der sich der Werkzeugkasten nie aggregieren ließ. Mit der Forschungsfront aus kausalem maschinellem Lernen, kausaler Inferenz mit Big Data und der formalen Untersuchung der Extrapolation arbeitet das Fach daran, die Disziplin zu bewahren und die Reichweite zurückzugewinnen.
Der Maßstab für eine Kausalaussage ist gestiegen und wird nicht wieder sinken. Die Bandbreite dessen, was das Fach mit Zuversicht verfolgt, ist stellenweise enger geworden, teils aus guten Gründen, teils zu einem echten Preis. Und die schwierigste Frage, wie man das, was man über die Menschen im eigenen Experiment gelernt hat, nutzt, um für die zu entscheiden, die nicht dabei waren, ist weiterhin offen, und genau dort findet die lebendige Arbeit statt. Wenn Ihnen das nächste Mal jemand erzählt, die Glaubwürdigkeitsrevolution habe die Ökonomik entweder repariert oder ausgehöhlt, haben Sie das Werkzeug, um über beide Parolen hinaus zu der Kalibrierung vorzudringen, die jede von ihnen auslässt.