Management Review · Zweite Serie · November 2026 · Nr. 51

Generative KI bei der Arbeit: was die Studien zeigen

Vierzig Prozent schneller in einem Schreibtest, 2,8 % der Arbeitszeit gespart in Dänemark, drei Arten, wie Berater mit KI arbeiteten, was Supportkräfte von ihr lernten, was neben dem Tempo zählt, und eine Karte für einen Test.

Nr.
51
Seiten
10
Quellen
8
Themen
KI
Stiven CatalystZweite Serie · November 2026
ManagementReview

Management ohne Theater.

KI

Generative KI bei der Arbeit:was die Studien zeigen

Vierzig Prozent schneller in einem Schreibtest, 2,8 % der Arbeitszeit gespart in Dänemark, drei Arten, wie Berater mit KI arbeiteten, was Supportkräfte von ihr lernten, was neben dem Tempo zählt, und eine Karte für einen Test.

Nr.51

2,8 %

ihrer Arbeitszeit: so viel sparten Nutzer von KI-Chatbots in 11 Berufen in Dänemark 2024 im Schnitt.Humlum & Vestergaard, 2025

In dieser Ausgabe

  1. TitelthemaVierzig Prozent schneller, auf dem PapierSeite 03
  2. Das ModellDrei Arten, mit KI zu arbeitenSeite 05
  3. Werkzeug der AusgabeDie Karte für den KI-TestSeite 08

stivencatalyst.com

Management Review · Nr. 51 · November 2026KI
stivencatalyst.comStiven Catalyst2

Nr. 51 · KI

In dieser Ausgabe

Kaum ein Werkzeug kam so schnell in die Büros wie KI-Chatbots, und kaum eines wurde so schnell untersucht. Die Ergebnisse gehen weit auseinander. Diese Ausgabe liest sie nebeneinander: was jede Studie gemessen hat, an welcher Aufgabe, und was eine Führungskraft daraus für ihr Team mitnehmen kann.

In einem Schreibexperiment waren Fachleute mit ChatGPT 40 % schneller fertig. In Dänemark sparten Nutzer von KI-Chatbots im Schnitt 2,8 % ihrer Arbeitszeit. Bei 244 Beratern zeigten sich drei Arten, mit KI zu arbeiten, und jede baute andere Fähigkeiten auf. In einem Supportcenter gewannen die Neuesten am meisten, und wer den Vorschlägen folgte, lernte daraus; Schüler, die sich auf einen freien Chatbot stützten, schnitten ohne ihn schlechter ab.

  1. 03TitelthemaVierzig Prozent schneller, auf dem Papier
  2. 04Die ZahlenVom Test zur Arbeitswoche
  3. 05Das ModellDrei Arten, mit KI zu arbeiten
  4. 06Was die Forschung sagtWer gewinnt, wer lernt
  5. 07Wie man es misstMehr zählen als das Tempo
  6. 08Werkzeug der AusgabeDie Karte für den KI-Test
  7. 09QuellenQuellen und Methode

So lesen Sie diese Ausgabe

Zahl

Jede Zahl hat Quelle und Jahr unten auf ihrer Seite.

Unsere Lesart

Wo die Redaktion deutet und nicht die Forschung, steht es dabei.

Praxis

Schritte und Karte sind Vorschläge zum Ausprobieren, keine Forschungsergebnisse.

Management Review · Nr. 51 · November 2026KI
stivencatalyst.comStiven Catalyst3

Titelthema

Vierzig Prozent schneller,auf dem Papier

In einem 2023 veröffentlichten Experiment gaben Shakked Noy und Whitney Zhang vom MIT 453 Fachleuten mit Hochschulabschluss zwei Schreibaufgaben aus ihrem Beruf, etwa ein Anschreiben für einen Förderantrag oder eine E-Mail zu einer Umstrukturierung. Die Hälfte durfte, per Zufall bestimmt, bei der zweiten ChatGPT nutzen. Erfahrene Leute aus denselben Berufen bewerteten die Arbeit, ohne zu wissen, wer es genutzt hatte.

40 %weniger Zeit für die Aufgabe, im Schnitt
18 %bessere Noten von den Bewertenden
68 %gaben den ersten Entwurf von ChatGPT unbearbeitet ab (Arbeitspapier)

Wer bei der ersten Aufgabe schwächer war, gewann am meisten, der Abstand zwischen den Beschäftigten wurde also kleiner. Die Autoren nannten auch die Grenzen: Die Aufgaben verlangten kein Wissen über ein echtes Unternehmen oder einen echten Kunden, die Anweisungen waren eindeutig, und niemand prüfte die Fakten in den Texten.

Unsere Lesart

Das Experiment hat einen Entwurf gestoppt, keine Entscheidung. Wo ein Text über einen Kunden stimmen muss, zählt die gesparte Zeit erst, wenn jemand ihn geprüft hat.

Quellen: Shakked Noy & Whitney Zhang, Science 381(6654), 2023 (über Abstract at Stanford SCALE); Shakked Noy & Whitney Zhang, MIT, 2023; Zach Winn, MIT News, 2023

Ein vorab registriertes Online-Experiment mit Aufgaben von 20–30 Minuten, im Juli 2023 in Science veröffentlicht. Die 68 % stammen aus dem Arbeitspapier vom März 2023 (444 Teilnehmende), nicht aus dem veröffentlichten Artikel; die Grenzen nannten die Autoren gegenüber MIT News.

Management Review · Nr. 51 · November 2026KI
stivencatalyst.comStiven Catalyst4

Die Zahlen

Vom Testzur Arbeitswoche

Anders Humlum und Emilie Vestergaard befragten rund 25.000 Beschäftigte in Dänemark, in 11 Berufen, die KI-Chatbots ausgesetzt sind, und verknüpften die Antworten mit Registern zu Lohn und Stunden. Von Nutzern gesparte Zeit in % der Arbeitszeit, 2024:

Gesparte Zeit in % der Arbeitszeit, mit und ohne Ermutigung durch den Arbeitgeber

Nicht ermutigtErmutigtMarketing4,6 %6,8 %Entwickler3,9 %6,5 %Buchhaltung0,9 %2,2 %Lehrkräfte0,6 %1,0 %

Über alle 11 Berufe sparten Nutzer 2,8 % ihrer Zeit, und 80 % steckten sie in andere Aufgaben. In keinem Beruf änderten sich Lohn oder erfasste Stunden deutlich.

Unsere Lesart

Ein Experiment misst eine Aufgabe, die zum Werkzeug passt. Eine Arbeitswoche besteht meist aus anderen Aufgaben.

Quelle: Anders Humlum & Emilie Vestergaard, Becker Friedman Institute, University of Chicago, 2025

Selbst angegebene Ersparnis, von den Autoren in Anteile der Arbeitszeit umgerechnet; 4 der 11 Berufe. Arbeitspapier vom Mai 2025.

Management Review · Nr. 51 · November 2026KI
stivencatalyst.comStiven Catalyst5

Das Modell

Drei Arten,mit KI zu arbeiten

244 junge Beraterinnen und Berater der Boston Consulting Group lösten dasselbe Problem mit GPT-4: Welche der drei Marken eines erfundenen Unternehmens soll die Investition bekommen, in einem Memo von höchstens 500 Wörtern. Steven Randazzo, Hila Lifshitz und Kollegen lasen alle 4.975 Wechsel mit der KI und führten 237 Interviews.

01

Cyborgs · 60 %

arbeiten bei jedem Schritt mit KI, im ständigen Hin und Her; gewannen KI-Können und behielten ihr Fachwissen

02

Zentauren · 14 %

entscheiden, was und wie, und geben der KI gewählte Teile; die genauesten Antworten; vertieften ihr Fachwissen

03

Selbstautomatisierer · 27 %

übergeben die Aufgabe mit ein, zwei Anfragen; schnell und glatt, aber flach; bauten keine der beiden Fähigkeiten auf

Zwei Fragen trennen die drei: Wer wählt, was zu tun ist, und wer entscheidet, wie es getan wird. Von den Selbstautomatisierern übernahmen 44 % den Text der KI ohne jede Änderung, die übrigen änderten nur an der Oberfläche.

Unsere Lesart

„Ein Mensch in der Schleife“ kann drei verschiedene Dinge heißen. Für die Führungskraft ist die Frage, wer noch denkt und was jede Art lehrt.

Quellen: Steven Randazzo, Hila Lifshitz, Katherine C. Kellogg, Fabrizio Dell'Acqua, Ethan Mollick, François Candelon & Karim R. Lakhani, Harvard Business School Working Paper 26-036, 2025; Fabrizio Dell'Acqua, Edward McFowland III, Ethan Mollick et al., Harvard Business School, 2023

Die Aufgabe lag damals außerhalb dessen, was GPT-4 gut konnte, jenseits der „gezackten Grenze“ aus Ausgabe 10. Anteile wie von den Autoren gerundet (zusammen 101 %); die Namen auf Albanisch und Deutsch sind unsere. Arbeitspapier von 2025.

Management Review · Nr. 51 · November 2026KI
stivencatalyst.comStiven Catalyst6

Was die Forschung sagt

Wer gewinnt,wer lernt

Erik Brynjolfsson, Danielle Li und Lindsey Raymond begleiteten 5.179 Supportkräfte einer großen Softwarefirma, während ein KI-Assistent eingeführt wurde. Er schlug in jedem Chat Antworten vor; die Beschäftigten blieben verantwortlich und konnten ihn übergehen.

2 = 6Monate: Mit zwei Monaten und KI arbeiteten sie so gut wie andere mit über sechs Monaten ohne
38 %der Vorschläge wurden im Schnitt befolgt

Wer den meisten Vorschlägen folgte, gewann fast 25 %, wer den wenigsten folgte, etwa 10 %. Fiel das System aus, arbeiteten enge Befolger immer noch schneller als vorher: Sie hatten gelernt. Vor der KI bestand das Coaching aus einer kurzen Wochensitzung mit der Führungskraft.

Es geht auch umgekehrt. Fast 1.000 Schüler in der Türkei, die Mathe mit einem freien GPT-4 übten, waren beim Üben 48 % besser, in der Prüfung ohne ihn aber 17 % schlechter als jene, die ihn nie hatten. Eine Version, die Hinweise statt Antworten gab, vermied den Verlust.

Unsere Lesart

Dasselbe Werkzeug kann anleiten oder ersetzen. Ob Menschen die Arbeit noch können, wenn es abgeschaltet ist, muss man prüfen, nicht annehmen.

Quellen: Erik Brynjolfsson, Danielle Li & Lindsey Raymond, NBER, 2023; Hamsa Bastani, Osbert Bastani, Alp Sungu, Haosen Ge, Özge Kabakcı & Rei Mariman, PNAS 122(26), 2025 (über Abstract at IDEAS/RePEc and Knowledge at Wharton)

Eine Firma, nur Text-Chats; der Zusammenhang zwischen Befolgen und Gewinn kann teils daher rühren, wer sich zum Befolgen entschied. Die veröffentlichte Fassung (QJE, 2025) zeigt dieselben Muster. Bastani et al. untersuchten Schüler, keine Beschäftigten.

Management Review · Nr. 51 · November 2026KI
stivencatalyst.comStiven Catalyst7

Wie man es misst

Mehr zählenals das Tempo

Das Tempo ist am leichtesten zu messen. In den Studien dieser Ausgabe hingen die Ergebnisse auch an der Prüfung, daran, wer gewann, wohin die Zeit ging und was Menschen ohne das Werkzeug konnten. Fünf Dinge, die man bei einem Test zählt:

  1. Zeit, samt Prüfung

    Von der Anfrage bis zum fertigen, geprüften Ergebnis.

  2. Qualität, blind bewertet

    Von jemandem, der die Arbeit kennt, aber nicht weiß, welche Fassung KI nutzte.

  3. Neue und Erfahrene, getrennt

    Ein Mittelwert kann den Gewinn der einen und den Verlust der anderen verdecken.

  4. Wohin die gesparte Zeit geht

    Die Aufgabe benennen, in die sie fließt, sonst verschwindet sie.

  5. Ein Tag ohne Werkzeug

    Kann die Person die Aufgabe noch allein?

Hypothetisches Beispiel, ein Monat KI-Entwürfe für Kunden-E-Mails
Zeit
vorher 9 Min. pro E-Mail, jetzt 6 Min. mit Prüfung
Blinde Prüfung
Fehler vorher in 2 von 40, jetzt in 5 von 40
Nach Erfahrung
Neue −4 Min., Erfahrene −1 Min.

Schneller, aber mit mehr Fehlern: Der Test ist nicht fertig. Die Zahlen sind erfunden.

Quellen: Shakked Noy & Whitney Zhang, Science 381(6654), 2023 (über Abstract at Stanford SCALE); Erik Brynjolfsson, Danielle Li & Lindsey Raymond, NBER, 2023; Anders Humlum & Emilie Vestergaard, Becker Friedman Institute, University of Chicago, 2025; Hamsa Bastani, Osbert Bastani, Alp Sungu, Haosen Ge, Özge Kabakcı & Rei Mariman, PNAS 122(26), 2025 (über Abstract at IDEAS/RePEc and Knowledge at Wharton)

Die fünf Prüfungen hat die Redaktion aus den Studien dieser Ausgabe gewählt; das Beispiel stammt von der Redaktion.

Management Review · Nr. 51 · November 2026KI
stivencatalyst.comStiven Catalyst8

Werkzeug der Ausgabe

Die Karte fürden KI-Test

Eine Aufgabe, ein Monat, dieselbe Prüfung wie vorher. Vor dem Test aufschreiben, was gezählt wird, damit das Ergebnis nicht nach Wunsch gelesen wird. Vertrauliche Daten gehören nicht in Werkzeuge, die das Unternehmen nicht freigegeben hat.

  1. 01Die Aufgabewas, wie oft, wer sie heute macht

  2. 02Vor dem Testzwei Wochen ohne KI: Zeit pro Aufgabe und Fehler

  3. 03Wer testetNeue und Erfahrene, getrennt gezählt

  4. 04Was geprüft wirdFakten, Zahlen, Namen, Ton, Daten, die das Team nicht verlassen dürfen

  5. 05Wer denktwas der Mensch entscheidet, was die KI tut

  6. 06Ergebnis und EntscheidungZeit mit Prüfung, Fehler, ein Tag ohne Werkzeug; behalten, ändern oder stoppen

Quellen: Shakked Noy & Whitney Zhang, Science 381(6654), 2023 (über Abstract at Stanford SCALE); Steven Randazzo, Hila Lifshitz, Katherine C. Kellogg, Fabrizio Dell'Acqua, Ethan Mollick, François Candelon & Karim R. Lakhani, Harvard Business School Working Paper 26-036, 2025; Erik Brynjolfsson, Danielle Li & Lindsey Raymond, NBER, 2023

Eine Praxis, die die Redaktion vorschlägt, nach Noy & Zhang, Randazzo et al. und Brynjolfsson et al.; der Tag ohne Werkzeug folgt den Ausfällen im Supportcenter.

Management Review · Nr. 51 · November 2026Quellen
stivencatalyst.comStiven Catalyst9

Quellen und Methode

Jede Zahlhat eine Quelle.

Die Zahlen dieser Ausgabe stammen aus den folgenden Quellen. Das Jahr zeigt, wie aktuell jede ist.

  1. Experimental evidence on the productivity effects of generative artificial intelligenceShakked Noy & Whitney Zhang, Science 381(6654), 2023 · über Abstract at Stanford SCALEhttps://doi.org/10.1126/science.adh2586
  2. Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence (working paper, 10 March 2023)Shakked Noy & Whitney Zhang, MIT, 2023https://economics.mit.edu/sites/default/files/inline-files/Noy_Zhang_1_0.pdf
  3. Study finds ChatGPT boosts worker productivity for some writing tasksZach Winn, MIT News, 2023https://economics.mit.edu/news/study-finds-chatgpt-boosts-worker-productivity-some-writing-tasks
  4. Large Language Models, Small Labor Market Effects (Working Paper 2025-56, May 2025)Anders Humlum & Emilie Vestergaard, Becker Friedman Institute, University of Chicago, 2025https://bfi.uchicago.edu/wp-content/uploads/2025/04/BFI_WP_2025-56-3.pdf
  5. Cyborgs, Centaurs and Self-Automators: The Three Modes of Human-GenAI Knowledge Work and Their Implications for Skilling and the Future of ExpertiseSteven Randazzo, Hila Lifshitz, Katherine C. Kellogg, Fabrizio Dell'Acqua, Ethan Mollick, François Candelon & Karim R. Lakhani, Harvard Business School Working Paper 26-036, 2025https://www.hbs.edu/ris/Publication%20Files/26-036_e7d0e59a-904c-49f1-b610-56eb2bdfe6f9.pdf
  6. Navigating the Jagged Technological FrontierFabrizio Dell'Acqua, Edward McFowland III, Ethan Mollick et al., Harvard Business School, 2023https://papers.ssrn.com/abstract=4573321
  7. Generative AI at WorkErik Brynjolfsson, Danielle Li & Lindsey Raymond, NBER, 2023https://www.nber.org/papers/w31161
  8. Generative AI without guardrails can harm learning: Evidence from high school mathematicsHamsa Bastani, Osbert Bastani, Alp Sungu, Haosen Ge, Özge Kabakcı & Rei Mariman, PNAS 122(26), 2025 · über Abstract at IDEAS/RePEc and Knowledge at Whartonhttps://doi.org/10.1073/pnas.2422633122
Redaktionelle Methode

Jede Zahl wurde auf Jahr, Herausgeber und genaue Bedeutung geprüft. Wo die Seite des Herausgebers nicht erreichbar war, wurde sie an unabhängigen Zusammenfassungen geprüft und mit „über“ markiert. Die Deutung der Redaktion ist als „Unsere Lesart“ markiert. Zahlen, die sich nicht bestätigen ließen, stehen nicht in der Ausgabe.

ManagementReview

Management ohne Theater.

Jede Ausgabe eine Führungsfrage, geprüft an der besten Forschung.

Alle Ausgaben

stivencatalyst.com/de/magazine/management-review.html

Management Review · Nr. 51 · November 2026 · Stiven Catalyst

Management Review · Nr. 51

Die Zahlen der Ausgabe

Die Grafiken der gedruckten Seiten, mit ihren Quellen.

Die ZahlenGesparte Zeit in % der Arbeitszeit, mit und ohne Ermutigung durch den Arbeitgeber
Nicht ermutigtErmutigtMarketing4,6 %6,8 %Entwickler3,9 %6,5 %Buchhaltung0,9 %2,2 %Lehrkräfte0,6 %1,0 %
Nicht ermutigtErmutigtMarketing4,6 %6,8 %Entwickler3,9 %6,5 %Buchhaltung0,9 %2,2 %Lehrkräfte0,6 %1,0 %

Quelle: Anders Humlum & Emilie Vestergaard, Becker Friedman Institute, University of Chicago, 2025

Der ganze Text Die Ausgabe als Text lesen Zum Lesen auf kleinen Bildschirmen, zum Suchen oder mit Screenreader. Dieselben Worte, ohne die Seitengestaltung.

In dieser Ausgabe

Kaum ein Werkzeug kam so schnell in die Büros wie KI-Chatbots, und kaum eines wurde so schnell untersucht. Die Ergebnisse gehen weit auseinander. Diese Ausgabe liest sie nebeneinander: was jede Studie gemessen hat, an welcher Aufgabe, und was eine Führungskraft daraus für ihr Team mitnehmen kann.

In einem Schreibexperiment waren Fachleute mit ChatGPT 40 % schneller fertig. In Dänemark sparten Nutzer von KI-Chatbots im Schnitt 2,8 % ihrer Arbeitszeit. Bei 244 Beratern zeigten sich drei Arten, mit KI zu arbeiten, und jede baute andere Fähigkeiten auf. In einem Supportcenter gewannen die Neuesten am meisten, und wer den Vorschlägen folgte, lernte daraus; Schüler, die sich auf einen freien Chatbot stützten, schnitten ohne ihn schlechter ab.

Stiven Janaqi, Herausgeber

Titelthema

Vierzig Prozent schneller, auf dem Papier

In einem 2023 veröffentlichten Experiment gaben Shakked Noy und Whitney Zhang vom MIT 453 Fachleuten mit Hochschulabschluss zwei Schreibaufgaben aus ihrem Beruf, etwa ein Anschreiben für einen Förderantrag oder eine E-Mail zu einer Umstrukturierung. Die Hälfte durfte, per Zufall bestimmt, bei der zweiten ChatGPT nutzen. Erfahrene Leute aus denselben Berufen bewerteten die Arbeit, ohne zu wissen, wer es genutzt hatte.

  • 40 % weniger Zeit für die Aufgabe, im Schnitt
  • 18 % bessere Noten von den Bewertenden
  • 68 % gaben den ersten Entwurf von ChatGPT unbearbeitet ab (Arbeitspapier)

Wer bei der ersten Aufgabe schwächer war, gewann am meisten, der Abstand zwischen den Beschäftigten wurde also kleiner. Die Autoren nannten auch die Grenzen: Die Aufgaben verlangten kein Wissen über ein echtes Unternehmen oder einen echten Kunden, die Anweisungen waren eindeutig, und niemand prüfte die Fakten in den Texten.

Unsere Lesart

Das Experiment hat einen Entwurf gestoppt, keine Entscheidung. Wo ein Text über einen Kunden stimmen muss, zählt die gesparte Zeit erst, wenn jemand ihn geprüft hat.

Ein vorab registriertes Online-Experiment mit Aufgaben von 20–30 Minuten, im Juli 2023 in Science veröffentlicht. Die 68 % stammen aus dem Arbeitspapier vom März 2023 (444 Teilnehmende), nicht aus dem veröffentlichten Artikel; die Grenzen nannten die Autoren gegenüber MIT News.

Quellen: Shakked Noy & Whitney Zhang, Science 381(6654), 2023 (über Abstract at Stanford SCALE); Shakked Noy & Whitney Zhang, MIT, 2023; Zach Winn, MIT News, 2023

Die Zahlen

Vom Test zur Arbeitswoche

Anders Humlum und Emilie Vestergaard befragten rund 25.000 Beschäftigte in Dänemark, in 11 Berufen, die KI-Chatbots ausgesetzt sind, und verknüpften die Antworten mit Registern zu Lohn und Stunden. Von Nutzern gesparte Zeit in % der Arbeitszeit, 2024:

Gesparte Zeit in % der Arbeitszeit, mit und ohne Ermutigung durch den Arbeitgeber: Marketing: Nicht ermutigt 4,6 %, Ermutigt 6,8 %; Entwickler: Nicht ermutigt 3,9 %, Ermutigt 6,5 %; Buchhaltung: Nicht ermutigt 0,9 %, Ermutigt 2,2 %; Lehrkräfte: Nicht ermutigt 0,6 %, Ermutigt 1,0 %.

Über alle 11 Berufe sparten Nutzer 2,8 % ihrer Zeit, und 80 % steckten sie in andere Aufgaben. In keinem Beruf änderten sich Lohn oder erfasste Stunden deutlich.

Unsere Lesart

Ein Experiment misst eine Aufgabe, die zum Werkzeug passt. Eine Arbeitswoche besteht meist aus anderen Aufgaben.

Selbst angegebene Ersparnis, von den Autoren in Anteile der Arbeitszeit umgerechnet; 4 der 11 Berufe. Arbeitspapier vom Mai 2025.

Quelle: Anders Humlum & Emilie Vestergaard, Becker Friedman Institute, University of Chicago, 2025

Das Modell

Drei Arten, mit KI zu arbeiten

244 junge Beraterinnen und Berater der Boston Consulting Group lösten dasselbe Problem mit GPT-4: Welche der drei Marken eines erfundenen Unternehmens soll die Investition bekommen, in einem Memo von höchstens 500 Wörtern. Steven Randazzo, Hila Lifshitz und Kollegen lasen alle 4.975 Wechsel mit der KI und führten 237 Interviews.

  • Cyborgs · 60 %. arbeiten bei jedem Schritt mit KI, im ständigen Hin und Her; gewannen KI-Können und behielten ihr Fachwissen
  • Zentauren · 14 %. entscheiden, was und wie, und geben der KI gewählte Teile; die genauesten Antworten; vertieften ihr Fachwissen
  • Selbstautomatisierer · 27 %. übergeben die Aufgabe mit ein, zwei Anfragen; schnell und glatt, aber flach; bauten keine der beiden Fähigkeiten auf

Zwei Fragen trennen die drei: Wer wählt, was zu tun ist, und wer entscheidet, wie es getan wird. Von den Selbstautomatisierern übernahmen 44 % den Text der KI ohne jede Änderung, die übrigen änderten nur an der Oberfläche.

Unsere Lesart

„Ein Mensch in der Schleife“ kann drei verschiedene Dinge heißen. Für die Führungskraft ist die Frage, wer noch denkt und was jede Art lehrt.

Die Aufgabe lag damals außerhalb dessen, was GPT-4 gut konnte, jenseits der „gezackten Grenze“ aus Ausgabe 10. Anteile wie von den Autoren gerundet (zusammen 101 %); die Namen auf Albanisch und Deutsch sind unsere. Arbeitspapier von 2025.

Quellen: Steven Randazzo, Hila Lifshitz, Katherine C. Kellogg, Fabrizio Dell'Acqua, Ethan Mollick, François Candelon & Karim R. Lakhani, Harvard Business School Working Paper 26-036, 2025; Fabrizio Dell'Acqua, Edward McFowland III, Ethan Mollick et al., Harvard Business School, 2023

Was die Forschung sagt

Wer gewinnt, wer lernt

Erik Brynjolfsson, Danielle Li und Lindsey Raymond begleiteten 5.179 Supportkräfte einer großen Softwarefirma, während ein KI-Assistent eingeführt wurde. Er schlug in jedem Chat Antworten vor; die Beschäftigten blieben verantwortlich und konnten ihn übergehen.

  • 2 = 6 Monate: Mit zwei Monaten und KI arbeiteten sie so gut wie andere mit über sechs Monaten ohne
  • 38 % der Vorschläge wurden im Schnitt befolgt

Wer den meisten Vorschlägen folgte, gewann fast 25 %, wer den wenigsten folgte, etwa 10 %. Fiel das System aus, arbeiteten enge Befolger immer noch schneller als vorher: Sie hatten gelernt. Vor der KI bestand das Coaching aus einer kurzen Wochensitzung mit der Führungskraft.

Es geht auch umgekehrt. Fast 1.000 Schüler in der Türkei, die Mathe mit einem freien GPT-4 übten, waren beim Üben 48 % besser, in der Prüfung ohne ihn aber 17 % schlechter als jene, die ihn nie hatten. Eine Version, die Hinweise statt Antworten gab, vermied den Verlust.

Unsere Lesart

Dasselbe Werkzeug kann anleiten oder ersetzen. Ob Menschen die Arbeit noch können, wenn es abgeschaltet ist, muss man prüfen, nicht annehmen.

Eine Firma, nur Text-Chats; der Zusammenhang zwischen Befolgen und Gewinn kann teils daher rühren, wer sich zum Befolgen entschied. Die veröffentlichte Fassung (QJE, 2025) zeigt dieselben Muster. Bastani et al. untersuchten Schüler, keine Beschäftigten.

Quellen: Erik Brynjolfsson, Danielle Li & Lindsey Raymond, NBER, 2023; Hamsa Bastani, Osbert Bastani, Alp Sungu, Haosen Ge, Özge Kabakcı & Rei Mariman, PNAS 122(26), 2025 (über Abstract at IDEAS/RePEc and Knowledge at Wharton)

Mehr im Essay: Wie ich Front Desk Control gebaut habe

Wie man es misst

Mehr zählen als das Tempo

Das Tempo ist am leichtesten zu messen. In den Studien dieser Ausgabe hingen die Ergebnisse auch an der Prüfung, daran, wer gewann, wohin die Zeit ging und was Menschen ohne das Werkzeug konnten. Fünf Dinge, die man bei einem Test zählt:

  • Zeit, samt Prüfung. Von der Anfrage bis zum fertigen, geprüften Ergebnis.
  • Qualität, blind bewertet. Von jemandem, der die Arbeit kennt, aber nicht weiß, welche Fassung KI nutzte.
  • Neue und Erfahrene, getrennt. Ein Mittelwert kann den Gewinn der einen und den Verlust der anderen verdecken.
  • Wohin die gesparte Zeit geht. Die Aufgabe benennen, in die sie fließt, sonst verschwindet sie.
  • Ein Tag ohne Werkzeug. Kann die Person die Aufgabe noch allein?

Hypothetisches Beispiel, ein Monat KI-Entwürfe für Kunden-E-Mails

  • Zeit: vorher 9 Min. pro E-Mail, jetzt 6 Min. mit Prüfung
  • Blinde Prüfung: Fehler vorher in 2 von 40, jetzt in 5 von 40
  • Nach Erfahrung: Neue −4 Min., Erfahrene −1 Min.

Schneller, aber mit mehr Fehlern: Der Test ist nicht fertig. Die Zahlen sind erfunden.

Die fünf Prüfungen hat die Redaktion aus den Studien dieser Ausgabe gewählt; das Beispiel stammt von der Redaktion.

Quellen: Shakked Noy & Whitney Zhang, Science 381(6654), 2023 (über Abstract at Stanford SCALE); Erik Brynjolfsson, Danielle Li & Lindsey Raymond, NBER, 2023; Anders Humlum & Emilie Vestergaard, Becker Friedman Institute, University of Chicago, 2025; Hamsa Bastani, Osbert Bastani, Alp Sungu, Haosen Ge, Özge Kabakcı & Rei Mariman, PNAS 122(26), 2025 (über Abstract at IDEAS/RePEc and Knowledge at Wharton)

Werkzeug der Ausgabe

Die Karte für den KI-Test

Eine Aufgabe, ein Monat, dieselbe Prüfung wie vorher. Vor dem Test aufschreiben, was gezählt wird, damit das Ergebnis nicht nach Wunsch gelesen wird. Vertrauliche Daten gehören nicht in Werkzeuge, die das Unternehmen nicht freigegeben hat.

  1. Die Aufgabe was, wie oft, wer sie heute macht
  2. Vor dem Test zwei Wochen ohne KI: Zeit pro Aufgabe und Fehler
  3. Wer testet Neue und Erfahrene, getrennt gezählt
  4. Was geprüft wird Fakten, Zahlen, Namen, Ton, Daten, die das Team nicht verlassen dürfen
  5. Wer denkt was der Mensch entscheidet, was die KI tut
  6. Ergebnis und Entscheidung Zeit mit Prüfung, Fehler, ein Tag ohne Werkzeug; behalten, ändern oder stoppen

Eine Praxis, die die Redaktion vorschlägt, nach Noy & Zhang, Randazzo et al. und Brynjolfsson et al.; der Tag ohne Werkzeug folgt den Ausfällen im Supportcenter.

Quellen: Shakked Noy & Whitney Zhang, Science 381(6654), 2023 (über Abstract at Stanford SCALE); Steven Randazzo, Hila Lifshitz, Katherine C. Kellogg, Fabrizio Dell'Acqua, Ethan Mollick, François Candelon & Karim R. Lakhani, Harvard Business School Working Paper 26-036, 2025; Erik Brynjolfsson, Danielle Li & Lindsey Raymond, NBER, 2023

Tool öffnen: Sigma & Regel­karte

Quellen und Methode

Jede Zahl hat eine Quelle.

Die Zahlen dieser Ausgabe stammen aus den folgenden Quellen. Das Jahr zeigt, wie aktuell jede ist.

Redaktionelle Methode

Jede Zahl wurde auf Jahr, Herausgeber und genaue Bedeutung geprüft. Wo die Seite des Herausgebers nicht erreichbar war, wurde sie an unabhängigen Zusammenfassungen geprüft und mit „über“ markiert. Die Deutung der Redaktion ist als „Unsere Lesart“ markiert. Zahlen, die sich nicht bestätigen ließen, stehen nicht in der Ausgabe.

Management Review · Monatsausgabe

Eine andere Ausgabe lesen

Alle Ausgaben