Wie lernte die Ökonomik, glaubwürdige Kausalaussagen zu treffen?

Dreißig Jahre lang bauten die besten Ökonomen der Welt riesige Modelle der gesamten Wirtschaft und verließen sich darauf, dass diese Modelle sagen konnten, was eine Politik bewirken würde. Dann zeigten drei Leute von drei verschiedenen Seiten, dass die Modelle nicht halten konnten, was sie versprachen. Die Lösung war kein besseres Modell. Sie war eine andere Frage an die Evidenz, und sie veränderte, was als Wissen darüber gilt, dass eine Sache eine andere verursacht. Diese Große Frage verfolgt das Identifikationsproblem selbst, vom strukturellen Programm der Cowles Commission über die Glaubwürdigkeitsrevolution bis zur Forschungsfront der Synthese. Die Antwort jeder Generation scheiterte, und die nächste war die Reaktion darauf.

Die methodische Denklinie als Graph ansehen
Schritt 1 von 4

Das strukturelle Programm

„Die Ökonometrie… zielt auf eine Vereinigung des theoretisch-quantitativen und des empirisch-quantitativen Zugangs zu ökonomischen Problemen… Diese Vereinigung ist es, die die Ökonometrie ausmacht.“

— sinngemäß nach Ragnar Frisch, der Gründungssatzung der Econometric Society und seinem Editorial in Econometrica von 1933

Man muss das als Versprechen lesen. Das Ziel war, die Maschinerie der Wirtschaft zu schätzen, also die tiefen Zusammenhänge, die das Verhalten von Haushalten und Unternehmen bestimmen, und diese geschätzte Maschinerie dann jede beliebige politische Frage beantworten zu lassen. Lawrence Klein, der die ersten Modelle baute, die genau das versuchten, formulierte die Arbeitsfassung schlicht: Schätze die Struktur der Wirtschaft als Gleichungssystem, dann kannst du jede Politik simulieren, bevor du sie ausprobierst. Zwei Jahrzehnte lang sah es so aus, als werde dieses Versprechen gehalten.

Den Zug, der das Versprechen überhaupt denkbar machte, vollzog Trygve Haavelmo 1944. Sein Aufsatz Probability Approach in Econometrics argumentierte, dass ökonomische Daten als Ziehungen aus einem gemeinsamen Wahrscheinlichkeitsmodell zu behandeln seien: Eine Volkswirtschaft ist ein stochastisches System, und man kann über sie mit demselben statistischen Instrumentarium nachdenken wie über jeden anderen Zufallsprozess. Vor Haavelmo war das nicht selbstverständlich. Nach ihm hatte die strukturelle Schätzung ein Fundament. Die Cowles Commission, Tjalling Koopmans, Jacob Marschak und ihre Mitarbeiter, errichtete darauf das Instrumentarium.

Das Problem, das sie lösen mussten, ist älter, als es aussieht. Angenommen, man will die Nachfragekurve für ein Gut und hat Preis- und Mengendaten über viele Jahre. Man kann nicht einfach die Menge auf den Preis regressieren, denn Preis und Menge werden gemeinsam bestimmt: Jede Beobachtung ist der Schnittpunkt einer Angebots- und einer Nachfragekurve, die sich beide bewegen. Die Punktwolke, die man sieht, zeichnet keine der beiden Kurven nach. Das ist das Problem simultaner Gleichungen, und die Antwort der Cowles Commission darauf ist die Identifikation: Die strukturellen Parameter lassen sich nur gewinnen, wenn man genügend glaubwürdige Restriktionen auferlegen kann, um festzulegen, welche Kurve welche ist.

Ein strukturelles System schreibt die endogenen Variablen $\mathbf{y}$ und die exogenen Variablen $\mathbf{x}$ als $\mathbf{B}\mathbf{y} + \mathbf{\Gamma}\mathbf{x} = \mathbf{u}$. Die reduzierte Form ist $\mathbf{y} = -\mathbf{B}^{-1}\mathbf{\Gamma}\,\mathbf{x} + \mathbf{B}^{-1}\mathbf{u}$, und mehr können die Daten nicht zeigen. Eine Gleichung ist nur dann identifiziert, wenn genügend Restriktionen auferlegt werden, typischerweise Ausschlussrestriktionen, also Variablen, deren Fehlen in einer Gleichung angenommen wird, um ihre strukturellen Koeffizienten aus der reduzierten Form zu gewinnen. Die Ordnungsbedingung (abgezählt: mindestens so viele ausgeschlossene exogene Variablen wie einbezogene endogene, minus eins) ist notwendig. Die Rangbedingung ist die vollständige Anforderung.

Intuition

Um eine Nachfragekurve nachzuzeichnen, braucht man etwas, das das Angebot verschiebt, ohne die Nachfrage zu berühren, etwa eine schlechte Ernte. Wenn das Angebot dann an der festen Nachfragekurve entlanggleitet, verraten die Punkte, die es überstreicht, die Form der Kurve. Identifikation ist die Kunst, solche Verschieber zu finden oder anzunehmen. Das ganze Gebäude hängt davon ab, ob die angenommenen Verschieber real sind.

Klein brachte diese Maschinerie in großem Maßstab zum Einsatz. Das Klein-Goldberger-Modell (1955) schätzte die US-Wirtschaft als System aus Dutzenden Gleichungen, das Brookings-Modell und das FRB-MIT-Penn-Modell der 1960er Jahre kamen auf Hunderte. Regierungen nutzten sie, um zu prognostizieren und zu simulieren: diese Steuer erhöhen, jenen Zinssatz ändern und die vorhergesagte Wirkung am System ablesen. Ideengeschichtlich gehört dieses strukturelle Programm zur Mainstream-Synthese der Nachkriegszeit, der Ära, die Modelle mit neuem Selbstvertrauen an die Daten heranführte.

Der strukturelle Anspruch war der richtige Anspruch. Das Ziel war, die tiefen Parameter zu schätzen, die Präferenzen, die Technologien, die echten Verhaltenszusammenhänge, die sich nicht ändern, wenn sich die Politik ändert. Wer sie hätte, könnte etwas tun, was keine noch so gute Kurvenanpassung je leisten kann: eine Politik bewerten, die nie ausprobiert wurde, an einer Bevölkerung, die nie behandelt wurde, indem man das geschätzte System unter der neuen Regel fortschreibt. Die strukturelle Schätzung ist der einzige Ansatz, der das überhaupt versucht.

Und die Annahmen lagen offen auf dem Tisch. Ein strukturelles Modell ist eine vollständige, ausdrücklich formulierte Darstellung des Mechanismus: Hier sind die Gleichungen, hier die Ausschlussrestriktionen, hier das, was wir über das Funktionieren der Wirtschaft annehmen. Man kann damit streiten, weil es sich auf etwas festlegt. Eine Zusammenfassung dessen, was in den Daten geschehen ist, in reduzierter Form legt sich auf nichts fest, was unter einem anderen Regime geschehen würde. Das strukturelle Programm war die disziplinierte Art, Ökonomik zu betreiben: die Maschine schätzen, dann die Maschine befragen. Die Frage, die es aufreißen sollte, war, ob das Programm die versprochenen tiefen Parameter liefern konnte oder nur etwas, das ihnen glich, bis sich die Politik änderte.

Zwei Jahrzehnte lang sah es so aus, als funktioniere es: Die großen Modelle prognostizierten, sie simulierten, sie berieten Präsidenten und Zentralbanken. Alles hing an einem einzigen Wort, tief. Waren die geschätzten Koeffizienten tatsächlich die strukturellen, gegenüber der Politik invarianten Parameter, die das Programm versprochen hatte? Oder waren sie Kombinationen in reduzierter Form, die sich verschieben würden, sobald sich die Politik verschob, sodass man ein Modell in der Hand hatte, das zur Vergangenheit passte und über die Zukunft log? Und waren die identifizierenden Restriktionen, die Ausschlüsse, mit denen man die eine Kurve statt der anderen nachzeichnete, jemals glaubwürdig oder nur bequem? Diese beiden Fragen, ist das Geschätzte invariant und ist die Identifikation glaubhaft, sind der Riss, den das nächste Jahrzehnt von drei Seiten zugleich aufbrach.

1976 hatte ein Achtunddreißigjähriger in Chicago ein Argument in einem Satz dafür, dass das gesamte Unternehmen auf einem Fehler beruhte. 1980 nannte ein Aufsatz mit dem Titel Macroeconomics and Reality die identifizierenden Restriktionen, die alle auferlegten, mit dem Wort seines Autors unglaubwürdig. Und 1986 prüfte jemand die strukturellen Modelle an einem tatsächlichen randomisierten Experiment, und sie fielen durch.

Schritt 2 von 4

Die Kritiken

„Da die Struktur eines ökonometrischen Modells aus den optimalen Entscheidungsregeln der Wirtschaftssubjekte besteht und da sich optimale Entscheidungsregeln systematisch mit Änderungen in der Struktur der für den Entscheider relevanten Reihen ändern, folgt, dass jede Änderung der Politik die Struktur ökonometrischer Modelle systematisch verändern wird.“

— Robert Lucas, „Econometric Policy Evaluation: A Critique“, 1976

Nimmt man die Formalien weg, ist der Schlag brutal. Die Koeffizienten in diesen großen Modellen sind keine tiefen Parameter. Sie sind Mischungen aus tiefen Parametern und der Politikregel, unter der die Menschen lebten, als die Daten entstanden. Ändert man die Regel, ändern die Menschen ihr Verhalten, also bewegen sich die Koeffizienten, und deshalb ist es grundsätzlich unzulässig, eine Politikänderung bei festgehaltenen Koeffizienten zu simulieren. Die meistgenutzte Funktion des strukturellen Programms, die Politiksimulation, beruhte darauf, genau das Einzige wegzudefinieren, was eine Politikänderung bewirkt.

Drei Kritiken schlugen innerhalb eines Jahrzehnts ein, jede an einer anderen Flanke derselben Identifikationsstrategie.

Lucas (1976): Die Parameter sind nicht invariant. Eine geschätzte Gleichung bildet ab, wie sich Menschen unter dem Politikregime verhielten, das die Daten hervorbrachte. Menschen bilden Erwartungen und optimieren gegen die Regel, die sie erwarten. Ändert die Zentralbank ihre Regel, ändern sich die Erwartungen, das Verhalten ändert sich, und die unter der alten Regel geschätzte Gleichung gilt nicht mehr. Die Koeffizienten sind also die tiefe Struktur, verwoben mit der alten Politik. Wer mit ihnen eine Politikänderung simuliert, bekommt eine Antwort auf eine Frage, die niemand gestellt hat.

Sims (1980): Die Restriktionen sind nicht glaubwürdig. Um ihre Systeme zu identifizieren, mussten die großen Modelle Dutzende Ausschlussrestriktionen auferlegen, Behauptungen, dass diese Variable in jener Gleichung nicht vorkommt. Christopher Sims argumentierte, sie würden auferlegt, weil der Modellbauer sie für die Identifikation brauchte. Sein Wort dafür war unglaubwürdig. Seine Alternative war die Vektorautoregression: alle Variablen symmetrisch modellieren, ehrlich sagen, dass man die Dynamik in reduzierter Form gewonnen hat, und nur die minimalen, vertretbaren Restriktionen auferlegen, die man braucht, um strukturelle Schocks abzulesen.

LaLonde (1986): Die Schätzungen reproduzieren kein Experiment. Robert LaLonde nahm die Daten des National Supported Work Demonstration, eines tatsächlichen randomisierten Experiments zur beruflichen Weiterbildung mit einer echten Kontrollgruppe, verwarf die experimentelle Kontrollgruppe und fragte, ob die üblichen nichtexperimentellen ökonometrischen Schätzer das experimentelle Ergebnis mit Vergleichsgruppen aus Beobachtungsdaten wiederfinden könnten. Sie konnten es nicht. Verschiedene vernünftige Schätzer lieferten weit auseinanderliegende Zahlen, und nur wenige kamen dem experimentellen Maßstab nahe.

Zuerst Lucas. Die zentrale Verwendung der großen Modelle war die Politiksimulation. Was sie festhielten, um die Simulation durchzuführen, die geschätzten Koeffizienten, ist genau das, was eine Politikänderung bewegt, weil die Koeffizienten Verhalten enthalten, das gegen die geltende Regel optimiert wurde. Innerhalb des Rahmens fester Koeffizienten gibt es dafür keinen Flicken. Was scheitert, ist die Gültigkeit des Rahmens für seine eigene zentrale Aufgabe. Lucas hatte mit der Krankheit recht und lag falsch damit, welches Heilmittel sich durchsetzen würde. Sein Vorschlag war, die wirklich tiefen Parameter zu schätzen, Präferenzen und Technologie, die gegenüber der Politik invariant sind, und die Makroökonomik auf diesen Mikrofundierungen neu aufzubauen. Das Problem ist, dass sich diese tiefen Parameter nicht leichter glaubwürdig identifizieren lassen als die strukturellen Koeffizienten, die sie ersetzen sollten. Wer eine Nutzenfunktion aus aggregierten Daten identifizieren will, rennt gegen dieselbe Wand. Das ist ein wesentlicher Grund, warum die Wende, die sich in der angewandten Ökonomik durchsetzte, nicht die strukturelle Wende der rationalen Erwartungen war, die Lucas wollte.

Dann Sims, und bei ihm erscheint die Krankheit der Identifikation als Krankheit des Glaubens. Die strukturellen Modelle erreichten ihre Identifikation per Dekret, indem sie Variablen aus Gleichungen ausschlossen, weil der Ausschluss nötig war, um das System lösbar zu machen. Man kann das verpacken, wie man will: Die Restriktion bleibt etwas, für das niemand einen Grund hat, es zu glauben. Seine VAR ist die ehrliche Antwort darauf. Man beansprucht keine Identifikation, die man sich nicht erarbeitet hat, modelliert die gemeinsame Dynamik, gewinnt, was die Daten tatsächlich festlegen, und behält die strukturelle Deutung den wenigen Restriktionen vor, die man laut verteidigen kann.

Zuletzt LaLonde, und seine Kritik war die, die empirisch ins Fleisch schnitt. Lucas und Sims argumentierten, das strukturelle Programm könne nicht glaubwürdig identifizieren, was es beanspruchte. LaLonde zeigte, dass es das nicht tat. Er hatte ein echtes Experiment zum Abgleich, Lucas und Sims hatten keines. Als die nichtexperimentellen Schätzer das experimentelle Ergebnis reproduzieren sollten, widersprachen sie dem Experiment und einander. Das ist das grundlegende negative Ergebnis, das die nächste Generation zu ihrer Problemstellung machen sollte: Die Annahmen, von denen die strukturellen Schätzer abhängen, sind in LaLondes Deutung Annahmen, die die Daten nicht prüfen können, und wenn man einen Fall findet, in dem man sie an einem Experiment prüfen kann, verlieren sie.

Drei Kritiken, drei Flanken, ein Ziel. Lucas: Die Parameter sind nicht invariant, also kann man nicht simulieren. Sims: Die identifizierenden Restriktionen sind nicht glaubwürdig, also hat man nicht einmal die Parameter, die man zu haben glaubt. LaLonde: Wenn ein echtes Experiment verfügbar ist, reproduzieren die strukturellen Schätzungen es nicht. Jede davon ist ein Scheitern der Identifikation. Die gesamte Maschinerie des strukturellen Programms existierte, um tiefe Parameter aus nichtexperimentellen Daten zu identifizieren. Sobald man sieht, dass die Identifikation scheitert, ist der nächste Zug fast erzwungen. Wenn die Identifikation aus auferlegten Annahmen immer wieder scheitert, hört man auf, Annahmen aufzuerlegen, und sucht eine Situation, in der die Variation bereits exogen ist, in der man sich den sauberen Vergleich nicht mit Annahmen erkaufen muss, weil die Welt ihn einem geliefert hat.

Solche Situationen gab es überall, sobald die Ökonomen gelernt hatten hinzusehen. Eine Mindestlohnerhöhung auf der einen Seite einer Staatsgrenze, aber nicht auf der anderen. Eine Einberufungslotterie, die manche junge Männer zufällig zum Militär holte und andere nicht. Eine Schwelle bei den Testergebnissen, die den einen Schüler in ein Programm bringt und den nächsten nicht. Sie nannten es, ein natürliches Experiment zu finden, und binnen zwanzig Jahren hatte es die angewandte Ökonomik erobert.

Schritt 3 von 4

Die Glaubwürdigkeitsrevolution

„Am 1. April 1992 stieg der Mindestlohn in New Jersey… Sie finden keinen Hinweis darauf, dass die Erhöhung des Mindestlohns die Beschäftigung verringert hat.“

— David Card & Alan Krueger, American Economic Review, 1994

Man beachte, was Card und Krueger nicht taten. Sie schrieben kein strukturelles Modell des Arbeitsmarkts in der Fast-Food-Branche auf und legten ihm keine Restriktionen auf, um es zu identifizieren. Sie fanden eine Situation, in der ein Bundesstaat seinen Mindestlohn erhöhte und der benachbarte nicht, befragten Restaurants auf beiden Seiten der Grenze vorher und nachher und sahen einfach hin. New Jersey ist die Behandlungsgruppe. Pennsylvania ist die Kontrollgruppe, die die Welt kostenlos geliefert hat. Die identifizierende Annahme ist ein einziger Satz, über den ein Leser streiten kann: Ohne die Lohnänderung hätten sich beide Seiten der Grenze gleich entwickelt. In dieser einen Studie steckt die ganze Revolution, ein gefundener Vergleich.

Der designbasierte Zug kehrt die strukturelle Strategie um. Statt Restriktionen aufzuerlegen, um Parameter aus den vorhandenen Daten zu identifizieren, sucht man eine Quelle der Variation, die plausibel so gut wie zufällig ist, und baut die Analyse um sie herum. Vier Werkzeuge leisten den Großteil der Arbeit. Richtig eingesetzte Instrumentalvariablen: eine Variable, die die Behandlung verschiebt, das Ergebnis aber plausibel nur über die Behandlung beeinflusst, mit einer konkreten, vertretbaren Begründung dafür. Regressionsdiskontinuität: Einheiten knapp über und knapp unter einer willkürlichen Schwelle vergleichen, die sich in allem gleichen außer darin, auf welcher Seite der Linie sie gelandet sind. Differenz-von-Differenzen: eine behandelte Gruppe und eine vergleichbare Kontrollgruppe, vorher und nachher, wobei das Gemeinsame herausdifferenziert wird. Und die Randomisierung selbst, wo man das Experiment durchführen kann.

Den Rahmen, der das streng machte, liefert die Sprache der potenziellen Ergebnisse von Angrist, Imbens und Rubin. Jede Einheit hat ein Ergebnis mit Behandlung und eines ohne. Wir sehen immer nur eines davon. Kausale Effekte sind Vergleiche potenzieller Ergebnisse, und ein Forschungsdesign ist glaubwürdig, wenn es eine vertretbare Aussage darüber macht, für wessen fehlendes potenzielles Ergebnis die Vergleichsgruppe einsteht. Das schärfste Ergebnis dieses Rahmens ist zugleich seine Grenze: der lokale durchschnittliche Behandlungseffekt.

Mit einem binären Instrument $Z$, der Behandlung $D$ und dem Ergebnis $Y$ identifizieren Instrumentalvariablen den LATE:

$$\text{LATE} = \frac{\mathbb{E}[Y \mid Z=1] - \mathbb{E}[Y \mid Z=0]}{\mathbb{E}[D \mid Z=1] - \mathbb{E}[D \mid Z=0]}$$

Unter Monotonie und Ausschlussrestriktion ist das der durchschnittliche Behandlungseffekt für die Complier, die Einheiten, deren Behandlungsstatus das Instrument tatsächlich verändert hat. Diese Größe unterscheidet sich vom Durchschnitt der Gesamtpopulation und vom Effekt auf Always-Taker oder Never-Taker.

Intuition

Ein natürliches Experiment bewegt nur manche Menschen. Die Einberufungslotterie verändert den Militärdienst für die Männer, deren Losnummer zufällig nahe an der Schwelle lag, nicht für den Freiwilligen, der sich ohnehin gemeldet hätte, und nicht für den Mann, der auf keinen Fall gegangen wäre. Was man erfährt, ist der Effekt auf die Menschen, die das Experiment tatsächlich bewegt hat. Das ist echtes, sauber identifiziertes Wissen, und es ist nicht der Effekt auf alle.

Die identifizierende Annahme ist jetzt überprüfbar. Ein Gutachter kann eine scharfe Frage stellen: Ist dieses Instrument wirklich exogen? Ist diese Schwelle wirklich willkürlich? Hätten sich die beiden Seiten der Grenze wirklich gleich entwickelt? Mit der Antwort steht und fällt der Aufsatz. Man vergleiche das mit den Dutzenden Ausschlussrestriktionen der strukturellen Modelle, die kein Gutachter überprüfen konnte, weil sie nie zur Überprüfung gedacht waren. Die Ideengeschichte verortet diese Wende in der Moderne, in der sie zum Beweisstandard des Fachs wurde.

Die designbasierte Wende beantwortet alle drei Kritiken aus Schritt 2 auf einmal, und die Zuordnung ist genau. Sie simuliert keine festen tiefen Parameter, also greift die Lucas-Kritik nicht: Über einen Regimewechsel hinweg wird nichts invariant gehalten, weil die Methode einen Effekt in einer bestimmten Situation schätzt. Sie legt keine unglaubwürdigen Restriktionen auf, also greift die Kritik von Sims nicht: Die identifizierende Annahme ist eine einzige, ausdrücklich formulierte, überprüfbare Aussage über eine Quelle der Variation. Und sie reproduziert Experimente, weil es gerade darum geht, Variation zu finden, die ein Experiment nachahmt. So wird LaLondes Nachweis von einer Anklage zum Gründungsmotiv des Programms.

Joshua Angrist und Jörn-Steffen Pischke nannten den Umbruch die „Glaubwürdigkeitsrevolution“ und stellten fest, dass empirische Arbeit in der Ökonomik heute weit glaubwürdiger ist als vor dreißig Jahren, weil sich der Maßstab für eine Kausalaussage geändert hat. Das Fach bestätigte das mit seinen höchsten Ehren: dem Nobelpreis 2019 für Banerjee, Duflo und Kremer für den experimentellen Ansatz in der Armutsforschung und dem Nobelpreis 2021 für Card, Angrist und Imbens für die empirische Arbeitsmarktforschung und den Rahmen, der Evidenz aus natürlichen Experimenten deutbar machte.

In der Arbeitsökonomik bewährte sich die Revolution zuerst und am härtesten. Card-Krueger zum Mindestlohn, Angrist zur Einberufungslotterie des Vietnamkriegs, das Monopson-Programm, das dem ausbleibenden Beschäftigungseffekt des Mindestlohns einen Mechanismus gab: Hier wurde der designbasierte Zug vom cleveren Kunstgriff zum Standard des Fachs, und diese Entwicklung hat ihre eigene Denklinie, nachgezeichnet im eigenen Strang der Arbeitsökonomik.

Die Glaubwürdigkeitsrevolution hat das eine getan, was das strukturelle Programm nie konnte: Sie hat die identifizierende Annahme überprüfbar gemacht. Ein Gutachter konnte 1975 die Restriktionen eines strukturellen Modells nicht überprüfen. Ein Gutachter konnte 2005 fragen, ob das Instrument wirklich exogen war. Gemessen an dem Maßstab, den sie sich selbst gesetzt hat, hat die Revolution gewonnen, und in der angewandten Mikroökonomik hat sie entscheidend gewonnen. Aber sie hat etwas aufgegeben. Sie hat den Effekt auf die Complier gelernt, auf die Menschen, die das natürliche Experiment zufällig bewegt hat. Sie hat nicht den Effekt auf alle anderen gelernt, nicht den Effekt einer Politik, die noch niemand ausprobiert hat, und nicht die Antwort für eine Bevölkerung, die die gefundene Variation nie berührt hat. Der unmögliche Anspruch des strukturellen Programms zielte wenigstens auf diese Fragen. Hat die Revolution das Identifikationsproblem gelöst, oder hat sie es gelöst, indem sie sich stillschweigend auf die Fragen beschränkt hat, bei denen exogene Variation zufällig herumliegt?

Diese Frage hat einen Verteidiger, der sie seit dreißig Jahren stellt. James Heckman erhielt den Nobelpreis für strukturelle Ökonometrie, sah zu, wie sich das Fach von ihr abwandte, und hat nie aufgehört zu argumentieren, dass das designbasierte Programm vergisst, wozu die Struktur da war. Der letzte Zug im Strang ist der Versuch, beides zu haben.

Schritt 4 von 4

Die Forschungsfront der Synthese

„Die Lücke zwischen glaubwürdiger interner Validität und der externen Validität, auf die es uns letztlich ankommt, ist kleiner geworden, aber nicht geschlossen… Designbasierte Identifikation mit expliziter Modellierung zu verbinden, darin liegt jetzt die eigentliche Arbeit.“

— Guido Imbens, im Geist seiner Nobelpreisrede von 2021 über kausale Inferenz

Imbens gehört zur designbasierten Tradition. Er hat den LATE-Rahmen gebaut, der sie definierte. Und heute gehört er zu den führenden Köpfen der Bemühung, wieder Struktur auf dieses Fundament zu setzen. Wenn die Architekten der Revolution selbst Brücken zurück zu dem Programm bauen, das die Revolution verdrängt hat, weiß man, dass das Fach in seiner Phase der Synthese angekommen ist. Es fragt, wie man den Boden der überprüfbaren Identifikation behalten und zugleich die Extrapolation zurückgewinnen kann, die dieser Boden nicht liefern kann.

Der Zielkonflikt ist auf beiden Seiten real. Designbasiert, in reduzierter Form: wenige Annahmen, transparente Identifikation, intern valide, aber ein LATE für eine gefundene Population lässt sich nicht auf eine andere Population oder eine unerprobte Politik übertragen. Strukturell: mehr Annahmen und unter diesen Annahmen weiter reichende Aussagen, nämlich Extrapolation und kontrafaktische Politikbewertung ex ante, aber genau die Annahmen sind schwer zu verteidigen. Keiner dominiert den anderen. Sie beantworten verschiedene Fragen.

Die Forschungsfront besteht aus den Versuchen, beides zu verbinden. Strukturelle Kausalmodelle formalisieren, wann sich ein kausaler Effekt aus einem ausdrücklich formulierten Modell des Mechanismus identifizieren lässt, und machen die strukturellen Annahmen zu expliziten Gegenständen, die man prüfen kann. Kausales maschinelles Lernen, also das Programm von Susan Athey und Guido Imbens zu den Methoden, die Ökonomen kennen sollten, und der Double/Debiased-Machine-Learning-Ansatz von Chernozhukov, hält die Disziplin der designbasierten Identifikation an erster Stelle, lässt aber flexible ML-Verfahren die hochdimensionalen Störkomponenten schätzen, sodass man glaubwürdige Identifikation und reiche Heterogenität bekommt. Das Ziel ist, den Standard überprüfbarer Identifikation aus der Glaubwürdigkeitsrevolution zu bewahren und zugleich die Reichweite des strukturellen Programms zurückzugewinnen.

Heckmans Verteidigung beruht auf etwas, wofür das strukturelle Programm gebaut war und was das designbasierte Programm strukturbedingt nicht kann: Politikbewertung ex ante, also die Vorhersage der Wirkung einer Politik, die noch nicht umgesetzt wurde, auf eine Bevölkerung, die noch nicht behandelt wurde, unter expliziten, ausdrücklich formulierten Annahmen. Ein LATE für die Complier eines natürlichen Experiments sagt nichts über eine andere Bevölkerung, eine hochskalierte Version des Programms oder eine Politik, die niemand ausprobiert hat. Wenn das die Fragen sind, die man beantwortet braucht, und für die meiste vorausschauende Politikgestaltung sind sie es, dann braucht man Struktur, weil nur die Struktur überhaupt versucht, sie zu beantworten. Heckmans Plädoyer, „Brücken zu bauen“, erinnert daran, dass der Sieg der Revolution einen realen Preis hatte, und dieser Preis sind die Fragen, für deren Beantwortung die Struktur gebaut war. Sein methodischer Rahmen ist richtig, und er gilt unabhängig von seiner Bilanz bei bestimmten empirischen Neuauswertungen, von denen mehrere nicht standhielten, während die designbasierten Befunde, die sie bestritten, darunter Card-Krueger, standhielten.

Und die Verbindung beider ist das Ziel der Denklinie, vertreten von den eigenen Leuten der Revolution. Imbens, Athey und Chernozhukov, führende Köpfe der Designtradition, holen heute strukturelle Ansprüche zurück, diszipliniert durch den Standard der Überprüfbarkeit, den die Revolution gesetzt hat. In der Synthese ist glaubwürdige Identifikation der Boden, und sie mit struktureller Politikrelevanz zu verbinden, ist die Arbeit, die gerade läuft.

Die Glaubwürdigkeitsrevolution hat die Messlatte höher gelegt. Jeder Vorgänger scheiterte an der Identifikation auf eine Weise, die sein Nachfolger richtig diagnostizierte. Lucas hatte recht, dass die Parameter nicht invariant waren, Sims hatte recht, dass die Restriktionen oft unglaubwürdig waren, LaLonde hatte recht, dass die strukturellen Schätzungen Experimente nicht reproduzierten, und die designbasierte Wende löste das gemeinsame Problem, indem sie die identifizierende Annahme überprüfbar machte. Das ist ein dauerhafter erkenntnistheoretischer Gewinn. Aber sie hat verengt, was die Ökonomik sich vornimmt. Die Fragen der strukturellen Extrapolation sind schwerer geworden, und genau für sie gilt Heckmans Verteidigung. Das Fach hat sich zum Teil von den Fragen zurückgezogen, für die nur die strukturelle Tradition gerüstet war. Die Synthese ist im Gang, die Forschungsfront verbindet beide Ansätze, und unter ihren Richtungen gibt es noch keinen Sieger. Und der Sieg ist auf bestimmte Felder beschränkt: Die designbasierte Identifikation hat die angewandte Mikroökonomik entscheidend erobert, also Arbeitsökonomik, Finanzwissenschaft, Entwicklungsökonomik und angewandte Industrieökonomik, aber die Makroökonomik ist größtenteils nicht aus dem designbasierten Werkzeugkasten hervorgegangen. DSGE-Modelle und kalibrierte strukturelle Makromodelle bestehen fort, aus Gründen, mit denen sich die Glaubwürdigkeitsrevolution nie befasst hat. Das ganze Fach „designbasiert“ zu nennen, ist falsch.

Der Strang ist an einem bestimmten Punkt angekommen: Glaubwürdige Identifikation wurde zum Boden der angewandten Ökonomik. Die Messlatte, die eine Kausalaussage heute überspringen muss, lautet: „Kann ein Leser die identifizierende Annahme überprüfen?“ Die unerledigte Arbeit besteht darin, strukturelle Politikrelevanz wieder auf diesen Boden zu setzen, ohne ihn zu verlieren. Ein Rahmen steht ganz außerhalb des Strangs: Eine Tradition, die von Mises und Hayek ausgeht, verwirft das Identifikationsprojekt schon in seiner Prämisse und hält die tiefen Fragen der Ökonomik für empirisch überhaupt nicht entscheidbar.

Dieser Strang hat nachgezeichnet, wie sich die Methoden angesammelt haben, jede Sprosse eine Antwort auf das Scheitern eines Vorgängers an der Identifikation. Was diese Ansammlung bedeutet, also was die Ökonomik heute weiß, was sie nicht mehr beansprucht und was verdrängt wurde, behandelt die erkenntnistheoretische Große Frage.

Wo der Strang angekommen ist

Wir haben mit einem Versprechen begonnen: die tiefe Maschinerie der Wirtschaft schätzen und dann jede beliebige Politik simulieren. Das strukturelle Programm der Cowles Commission baute ein echtes Instrumentarium, um es einzulösen. Dann zeigten drei Kritiken an drei Flanken, dass dieses Instrumentarium die versprochenen tiefen Parameter nicht glaubwürdig liefern konnte, und alle drei waren dieselbe Art von Scheitern, ein Scheitern der Identifikation. Die Glaubwürdigkeitsrevolution beantwortete alle drei auf einmal, indem sie die Frage änderte: aufhören, Annahmen aufzuerlegen, exogene Variation finden und die eine Annahme, die man behält, zu einer Aussage machen, die ein Leser überprüfen kann. Sie hat die angewandte Mikroökonomik entscheidend erobert. Sie hat aber auch den Effekt auf die Complier gelernt und nicht den auf alle, und deshalb hat die Verteidigung der strukturellen Tradition für die Fragen Bestand, die nur sie stellen kann.

Der Strang ist also bei einem Boden angekommen. Strukturelle Politikrelevanz wieder auf diesen Boden zu setzen, mit strukturellen Kausalmodellen, kausalem maschinellem Lernen und designbasierter struktureller Schätzung, ist die unerledigte Arbeit, und wer sie leistet, sind die Architekten der Revolution selbst. Wenn Ihnen das nächste Mal jemand erzählt, eine Studie „beweise“, dass eine Politik wirkt, haben Sie die eine Frage, die sich die ganze Denklinie erarbeitet hat: Kann man die identifizierende Annahme überprüfen? Wer die methodische Denklinie als zusammenhängenden Graphen sehen will, also wer auf wen reagiert hat, über die Epochen hinweg, die die nach Epochen geordneten Bücher trennen, öffnet die Ansicht der methodischen Denklinie.