Management Review · Zweite Serie · November 2026 · Nr. 69

Pilotprojekte und Experimente vor der großen Veränderung

Eine Idee, die sechs Monate wartete, wie wenige getestete Ideen etwas verbessern, das Model for Improvement, warum Effekte im Großen schrumpfen, wann man einer Zahl traut, und eine Karte für den Pilotplan.

Nr.
69
Seiten
10
Quellen
6
Themen
Strategie
Stiven CatalystZweite Serie · November 2026
ManagementReview

Management ohne Theater.

Strategie

Pilotprojekte und Experimentevor der großen Veränderung

Eine Idee, die sechs Monate wartete, wie wenige getestete Ideen etwas verbessern, das Model for Improvement, warum Effekte im Großen schrumpfen, wann man einer Zahl traut, und eine Karte für den Pilotplan.

Nr.69

12 %

mehr Umsatz bei Bing durch eine kleine Änderung an Anzeigenüberschriften, eine Idee, die über sechs Monate auf einen Test gewartet hatte.Kohavi & Thomke, 2017

In dieser Ausgabe

  1. TitelthemaSechs Monate in der SchubladeSeite 03
  2. Was die Forschung sagtWarum Ergebnisse im Großen schrumpfenSeite 06
  3. Werkzeug der AusgabeDie Karte für den PilotplanSeite 08

stivencatalyst.com

Management Review · Nr. 69 · November 2026Strategie
stivencatalyst.comStiven Catalyst2

Nr. 69 · Strategie

In dieser Ausgabe

Große Veränderungen werden meist aus Überzeugung beschlossen: ein Plan, ein Budget, ein Starttermin. Diese Ausgabe handelt davon, die Veränderung zuerst im Kleinen zu erproben, mit Vergleichsgruppe und vorab vereinbarter Entscheidungsregel, damit das Ergebnis entscheidet, nicht die lauteste Meinung.

Bei Bing wartete eine kleine Idee über sechs Monate und steigerte dann den Umsatz um 12 %. Bei Microsoft verbesserte nur jede dritte getestete Idee, was sie verbessern sollte. Das Model for Improvement testet eine Änderung im Kleinen: ein Tag, eine Einheit. In 126 Behördenstudien waren die Effekte viel kleiner als in veröffentlichten Studien. Vier Prüfungen zeigen, wann man einem Ergebnis traut, und eine Karte hilft beim Planen.

  1. 03TitelthemaSechs Monate in der Schublade
  2. 04Die ZahlenDie meisten Ideen wirken nicht
  3. 05Das ModellDrei Fragen, kleine Zyklen
  4. 06Was die Forschung sagtWarum Ergebnisse im Großen schrumpfen
  5. 07Wie man es misstZahlen, denen man traut
  6. 08Werkzeug der AusgabeDie Karte für den Pilotplan
  7. 09QuellenQuellen und Methode

So lesen Sie diese Ausgabe

Zahl

Jede Zahl hat Quelle und Jahr unten auf ihrer Seite.

Unsere Lesart

Wo die Redaktion deutet und nicht die Forschung, steht es dabei.

Praxis

Schritte und Karte sind Vorschläge zum Ausprobieren, keine Forschungsergebnisse.

Management Review · Nr. 69 · November 2026Strategie
stivencatalyst.comStiven Catalyst3

Titelthema

Sechs Monatein der Schublade

2012 schlug ein Microsoft-Mitarbeiter, der an der Suchmaschine Bing arbeitete, vor, Anzeigenüberschriften anders darzustellen. Ein Entwickler hätte dafür wenige Tage gebraucht, doch es war eine von Hunderten Ideen, und die Programmmanager gaben ihr niedrige Priorität.

Die Idee wartete über sechs Monate. Dann startete ein Entwickler, der sah, wie wenig der Code kosten würde, einen einfachen A/B-Test: Die Nutzer wurden zufällig den alten oder den neuen Überschriften zugeteilt. Binnen Stunden stieg der Umsatz so schnell, dass ein Alarm „zu gut, um wahr zu sein“ auslöste. Meist steckt dahinter ein Fehler. Diesmal nicht.

6+Monate wartete die Idee, mit niedriger Priorität
12 %mehr Umsatz, ohne die wichtigsten Nutzerkennzahlen zu schädigen
100+ Mio. $pro Jahr allein in den USA, nach Schätzung der Autoren
Unsere Lesart

Keine Besprechung hätte diese Idee richtig eingestuft. Ein billiger Test beantwortete in Stunden, was monatelanges Priorisieren nicht geschafft hatte.

Quelle: Ron Kohavi & Stefan Thomke, Harvard Business Review 95(5), 2017 (über HBR reprint R1705E)

Kohavi und Thomke nennen sie die umsatzstärkste Idee in der Geschichte von Bing. Die 12 % wurden im Test gemessen; die 100 Millionen Dollar sind ihre Jahreszahl für die USA.

Management Review · Nr. 69 · November 2026Strategie
stivencatalyst.comStiven Catalyst4

Die Zahlen

Die meisten Ideenwirken nicht

Unternehmen, die fast jede Änderung testen, lernen dieselbe Lektion, schreiben Ron Kohavi und Stefan Thomke: Die meisten neuen Ideen scheitern im Experiment, und selbst Fachleute irren oft, welche sich auszahlen. Bei Microsoft insgesamt:

In Experimenten getestete Ideen bei Microsoft, nach Ergebnis

  • 1 von 3erweisen sich als wirksam
  • 1 von 3bleiben ohne Wirkung
  • 1 von 3wirken negativ

In gut optimierten Produkten wie Google und Bing liefern nur etwa 10–20 % der Experimente positive Ergebnisse, bei Slack etwa 30 % der Experimente zur Monetarisierung (2019). Thomke schätzt den Schnitt auf etwa 10 %.

Unsere Lesart

Wenn zwei von drei plausiblen Ideen nichts ändern oder schaden, ist eine große Veränderung ohne Test eine Wette, keine Entscheidung.

Quellen: Ron Kohavi & Stefan Thomke, Harvard Business Review 95(5), 2017 (über HBR reprint R1705E); Ron Kohavi, Diane Tang & Ya Xu, Cambridge University Press, 2020 (über Chapter 1, published by the authors); Stefan H. Thomke, Harvard Business Review Press, 2020 (über Michael Blanding, "Creating the Experimentation Organization", HBS Working Knowledge, 2019)

Online-Produkte, in denen Tests billig sind; für Betriebe fanden wir keine vergleichbaren Anteile. Slack: ein Beitrag, zitiert von Kohavi, Tang & Xu; Thomkes 10 %: ein Interview (2019).

Management Review · Nr. 69 · November 2026Strategie
stivencatalyst.comStiven Catalyst5

Das Modell

Drei Fragen,kleine Zyklen

Das Model for Improvement von Associates in Process Improvement, dargestellt in The Improvement Guide (Langley und Kollegen, 2009), stellt drei Fragen, bevor etwas dauerhaft geändert wird.

01

Ziel

Was wollen wir erreichen?

02

Messung

Woran erkennen wir, dass eine Änderung eine Verbesserung ist?

03

Änderung

Welche Änderung führt zu einer Verbesserung?

Die Änderung testen: der Zyklus Plan-Do-Study-Act

  1. 01

    Planen

  2. 02

    Tun

  3. 03

    Studieren

  4. 04

    Handeln

Änderung planen, erproben, Ergebnisse studieren, nach dem Gelernten handeln. Der Test ist bewusst klein: Das Beispiel des Institute for Healthcare Improvement ist ein Patient, ein Tag. Nach mehreren Zyklen unter wechselnden Bedingungen, etwa Tag und Nacht, wird die Änderung dauerhaft eingeführt und ausgeweitet.

Unsere Lesart

Ein Pilot ist kein sanfter Start, sondern eine Frage mit Frist: Schneidet diese Änderung hier besser ab als das, was wir heute tun?

Quelle: Langley, Moen, Nolan, Nolan, Norman & Provost, Jossey-Bass, 2009 (über Institute for Healthcare Improvement, "Model for Improvement")

Fragen und Schritte folgen der Seite des Institute for Healthcare Improvement zum Modell; das Buch selbst lag nicht vor. Die Deutung stammt von der Redaktion.

Management Review · Nr. 69 · November 2026Strategie
stivencatalyst.comStiven Catalyst6

Was die Forschung sagt

Warum Ergebnisseim Großen schrumpfen

Stefano DellaVigna und Elizabeth Linos sammelten 126 randomisierte Studien mit 23 Millionen Menschen, alle von zwei großen „Nudge Units“ der US-Regierung, und verglichen sie mit Nudge-Studien aus Fachzeitschriften.

Mittlerer Effekt eines Nudges auf die Teilnahme, Prozentpunkte

8,7In Zeitschriften1,4Im Großen

Die veröffentlichten Studien waren klein: Der Median einer Behandlungsgruppe lag bei 484 Personen, in den Nudge Units bei 10.006. Kleine Studien erkennen nur große Effekte, und Zeitschriften drucken vor allem, was erkannt wird. Selektive Veröffentlichung, verstärkt durch geringe statistische Power, erklärt etwa 70 % der Lücke; Unterschiede der Nudges erklären den Großteil des Rests.

Unsere Lesart

Die Erfolgsgeschichte, die man liest, ist die veröffentlichte. Besser einplanen, dass die Einführung weniger bringt als der Pilot, der überzeugt hat.

Quelle: Stefano DellaVigna & Elizabeth Linos, Econometrica 90(1), 2022

Teilnahme: der Anteil derer, die tun, worum gebeten wird, etwa sich anmelden oder impfen lassen. Effekte und die 70 % aus Econometrica (2022); Gruppengrößen aus dem Arbeitspapier von 2020.

Management Review · Nr. 69 · November 2026Strategie
stivencatalyst.comStiven Catalyst7

Wie man es misst

Zahlen, denenman traut

„Zahlen zu bekommen ist leicht; Zahlen, denen man trauen kann, sind schwer“, schreiben Kohavi und Thomke. Vier Prüfungen, bevor ein Pilotergebnis entscheidet:

  1. Mit einer Kontrollgruppe vergleichen

    Bei Yahoo bezifferte eine Beobachtungsstudie den Effekt von Werbebannern auf Markensuchen auf 871–1.198 %; ein kontrolliertes Experiment fand 5,4 %.

  2. Eine Hauptkennzahl und Leitplanken festlegen

    Vor dem Start, nicht danach; Leitplanken dürfen nicht schlechter werden.

  3. Mindestens eine volle Woche laufen lassen

    LinkedIn misst mindestens eine Woche: Ein einzelner Tag überbewertet Vielnutzer.

  4. Aufteilung prüfen, Überraschungen misstrauen

    Falsche Gruppengrößen machen das Ergebnis oft wertlos. Twymans Gesetz: Jede Zahl, die interessant oder anders aussieht, ist meist falsch.

Hypothetisches Beispiel, eine neue Kommissionierroute im Lager
Vergleich
Zone A neue Route, Zone B wie bisher, dieselben zwei Wochen
Hauptkennzahl
Positionen pro Stunde: A +6 %, B +4 %
Leitplanke
Pickfehler: in beiden unverändert

Gegenüber Zone B bringt die Route etwa 2 Punkte, nicht 6. Die Zahlen sind erfunden.

Quellen: Ron Kohavi & Stefan Thomke, Harvard Business Review 95(5), 2017 (über HBR reprint R1705E); Ron Kohavi, Diane Tang & Ya Xu, Cambridge University Press, 2020 (über Chapter 1, published by the authors); Ya Xu, Weitao Duan & Shaochen Huang, KDD '18 (ACM), 2018

Prüfungen nach Kohavi & Thomke (2017), Kohavi, Tang & Xu (2020) und, für die Woche, Xu et al. (2018). Das Beispiel stammt von der Redaktion.

Management Review · Nr. 69 · November 2026Strategie
stivencatalyst.comStiven Catalyst8

Werkzeug der Ausgabe

Die Karte fürden Pilotplan

Vor dem Start ausfüllen, mit denen, die den Pilot durchführen. Dann in Stufen einführen: erst eine kleine Gruppe, dann eine Messphase, dann alle.

  1. 01Hypothesewenn wir X ändern, verbessert sich Y um etwa Z, weil …

  2. 02Was sich änderteine Änderung, so klar, dass jeder sie wiederholen kann

  3. 03Wo und wie langeein Bereich, eine Schicht, ein Team; mindestens eine normale Woche

  4. 04Was gemessen wirdeine Hauptkennzahl, wie sie gezählt wird, und die Leitplanken

  5. 05Vergleichsgruppewo es an denselben Tagen weiterläuft wie bisher

  6. 06Entscheidungsregelvor dem Start: einführen, anpassen oder stoppen, und wer entscheidet

Quellen: Langley, Moen, Nolan, Nolan, Norman & Provost, Jossey-Bass, 2009 (über Institute for Healthcare Improvement, "Model for Improvement"); Ya Xu, Weitao Duan & Shaochen Huang, KDD '18 (ACM), 2018; Stefan H. Thomke, Harvard Business Review Press, 2020 (über Michael Blanding, "Creating the Experimentation Organization", HBS Working Knowledge, 2019)

Eine Praxis, die die Redaktion vorschlägt, nach dem Model for Improvement, Xu et al. (2018) und Thomkes Regel: eine prüfbare Hypothese, eine Kontrollgruppe und sich an die Ergebnisse halten.

Management Review · Nr. 69 · November 2026Quellen
stivencatalyst.comStiven Catalyst9

Quellen und Methode

Jede Zahlhat eine Quelle.

Die Zahlen dieser Ausgabe stammen aus den folgenden Quellen. Das Jahr zeigt, wie aktuell jede ist.

  1. The Surprising Power of Online ExperimentsRon Kohavi & Stefan Thomke, Harvard Business Review 95(5), 2017 · über HBR reprint R1705Ehttps://hbr.org/2017/09/the-surprising-power-of-online-experiments
  2. Trustworthy Online Controlled Experiments: A Practical Guide to A/B TestingRon Kohavi, Diane Tang & Ya Xu, Cambridge University Press, 2020 · über Chapter 1, published by the authorshttps://experimentguide.com/
  3. Experimentation Works: The Surprising Power of Business ExperimentsStefan H. Thomke, Harvard Business Review Press, 2020 · über Michael Blanding, "Creating the Experimentation Organization", HBS Working Knowledge, 2019https://www.library.hbs.edu/working-knowledge/creating-the-experimentation-organization
  4. The Improvement Guide: A Practical Approach to Enhancing Organizational Performance (2nd ed.)Langley, Moen, Nolan, Nolan, Norman & Provost, Jossey-Bass, 2009 · über Institute for Healthcare Improvement, "Model for Improvement"https://www.ihi.org/resources/how-improve-model-improvement
  5. RCTs to Scale: Comprehensive Evidence from Two Nudge UnitsStefano DellaVigna & Elizabeth Linos, Econometrica 90(1), 2022https://doi.org/10.3982/ECTA18709
  6. SQR: Balancing Speed, Quality and Risk in Online ExperimentsYa Xu, Weitao Duan & Shaochen Huang, KDD '18 (ACM), 2018https://doi.org/10.1145/3219819.3219875
Redaktionelle Methode

Jede Zahl wurde auf Jahr, Herausgeber und genaue Bedeutung geprüft. Wo die Seite des Herausgebers nicht erreichbar war, wurde sie an unabhängigen Zusammenfassungen geprüft und mit „über“ markiert. Die Deutung der Redaktion ist als „Unsere Lesart“ markiert. Zahlen, die sich nicht bestätigen ließen, stehen nicht in der Ausgabe.

ManagementReview

Management ohne Theater.

Jede Ausgabe eine Führungsfrage, geprüft an der besten Forschung.

Alle Ausgaben

stivencatalyst.com/de/magazine/management-review.html

Management Review · Nr. 69 · November 2026 · Stiven Catalyst

Management Review · Nr. 69

Die Zahlen der Ausgabe

Die Grafiken der gedruckten Seiten, mit ihren Quellen.

Die ZahlenIn Experimenten getestete Ideen bei Microsoft, nach Ergebnis
  • 1 von 3erweisen sich als wirksam
  • 1 von 3bleiben ohne Wirkung
  • 1 von 3wirken negativ
  • 1 von 3erweisen sich als wirksam
  • 1 von 3bleiben ohne Wirkung
  • 1 von 3wirken negativ

Quelle: Ron Kohavi & Stefan Thomke, Harvard Business Review 95(5), 2017 (über HBR reprint R1705E)

Was die Forschung sagtMittlerer Effekt eines Nudges auf die Teilnahme, Prozentpunkte
8,7In Zeitschriften1,4Im Großen
8,7In Zeitschriften1,4Im Großen

Quelle: Stefano DellaVigna & Elizabeth Linos, Econometrica 90(1), 2022

Der ganze Text Die Ausgabe als Text lesen Zum Lesen auf kleinen Bildschirmen, zum Suchen oder mit Screenreader. Dieselben Worte, ohne die Seitengestaltung.

In dieser Ausgabe

Große Veränderungen werden meist aus Überzeugung beschlossen: ein Plan, ein Budget, ein Starttermin. Diese Ausgabe handelt davon, die Veränderung zuerst im Kleinen zu erproben, mit Vergleichsgruppe und vorab vereinbarter Entscheidungsregel, damit das Ergebnis entscheidet, nicht die lauteste Meinung.

Bei Bing wartete eine kleine Idee über sechs Monate und steigerte dann den Umsatz um 12 %. Bei Microsoft verbesserte nur jede dritte getestete Idee, was sie verbessern sollte. Das Model for Improvement testet eine Änderung im Kleinen: ein Tag, eine Einheit. In 126 Behördenstudien waren die Effekte viel kleiner als in veröffentlichten Studien. Vier Prüfungen zeigen, wann man einem Ergebnis traut, und eine Karte hilft beim Planen.

Stiven Janaqi, Herausgeber

Titelthema

Sechs Monate in der Schublade

2012 schlug ein Microsoft-Mitarbeiter, der an der Suchmaschine Bing arbeitete, vor, Anzeigenüberschriften anders darzustellen. Ein Entwickler hätte dafür wenige Tage gebraucht, doch es war eine von Hunderten Ideen, und die Programmmanager gaben ihr niedrige Priorität.

Die Idee wartete über sechs Monate. Dann startete ein Entwickler, der sah, wie wenig der Code kosten würde, einen einfachen A/B-Test: Die Nutzer wurden zufällig den alten oder den neuen Überschriften zugeteilt. Binnen Stunden stieg der Umsatz so schnell, dass ein Alarm „zu gut, um wahr zu sein“ auslöste. Meist steckt dahinter ein Fehler. Diesmal nicht.

  • 6+ Monate wartete die Idee, mit niedriger Priorität
  • 12 % mehr Umsatz, ohne die wichtigsten Nutzerkennzahlen zu schädigen
  • 100+ Mio. $ pro Jahr allein in den USA, nach Schätzung der Autoren

Unsere Lesart

Keine Besprechung hätte diese Idee richtig eingestuft. Ein billiger Test beantwortete in Stunden, was monatelanges Priorisieren nicht geschafft hatte.

Kohavi und Thomke nennen sie die umsatzstärkste Idee in der Geschichte von Bing. Die 12 % wurden im Test gemessen; die 100 Millionen Dollar sind ihre Jahreszahl für die USA.

Quelle: Ron Kohavi & Stefan Thomke, Harvard Business Review 95(5), 2017 (über HBR reprint R1705E)

Die Zahlen

Die meisten Ideen wirken nicht

Unternehmen, die fast jede Änderung testen, lernen dieselbe Lektion, schreiben Ron Kohavi und Stefan Thomke: Die meisten neuen Ideen scheitern im Experiment, und selbst Fachleute irren oft, welche sich auszahlen. Bei Microsoft insgesamt:

In Experimenten getestete Ideen bei Microsoft, nach Ergebnis: 1 von 3 erweisen sich als wirksam, 1 von 3 bleiben ohne Wirkung, 1 von 3 wirken negativ.

In gut optimierten Produkten wie Google und Bing liefern nur etwa 10–20 % der Experimente positive Ergebnisse, bei Slack etwa 30 % der Experimente zur Monetarisierung (2019). Thomke schätzt den Schnitt auf etwa 10 %.

Unsere Lesart

Wenn zwei von drei plausiblen Ideen nichts ändern oder schaden, ist eine große Veränderung ohne Test eine Wette, keine Entscheidung.

Online-Produkte, in denen Tests billig sind; für Betriebe fanden wir keine vergleichbaren Anteile. Slack: ein Beitrag, zitiert von Kohavi, Tang & Xu; Thomkes 10 %: ein Interview (2019).

Quellen: Ron Kohavi & Stefan Thomke, Harvard Business Review 95(5), 2017 (über HBR reprint R1705E); Ron Kohavi, Diane Tang & Ya Xu, Cambridge University Press, 2020 (über Chapter 1, published by the authors); Stefan H. Thomke, Harvard Business Review Press, 2020 (über Michael Blanding, "Creating the Experimentation Organization", HBS Working Knowledge, 2019)

Das Modell

Drei Fragen, kleine Zyklen

Das Model for Improvement von Associates in Process Improvement, dargestellt in The Improvement Guide (Langley und Kollegen, 2009), stellt drei Fragen, bevor etwas dauerhaft geändert wird.

  • Ziel. Was wollen wir erreichen?
  • Messung. Woran erkennen wir, dass eine Änderung eine Verbesserung ist?
  • Änderung. Welche Änderung führt zu einer Verbesserung?

Die Änderung testen: der Zyklus Plan-Do-Study-Act

  1. Planen.
  2. Tun.
  3. Studieren.
  4. Handeln.

Änderung planen, erproben, Ergebnisse studieren, nach dem Gelernten handeln. Der Test ist bewusst klein: Das Beispiel des Institute for Healthcare Improvement ist ein Patient, ein Tag. Nach mehreren Zyklen unter wechselnden Bedingungen, etwa Tag und Nacht, wird die Änderung dauerhaft eingeführt und ausgeweitet.

Unsere Lesart

Ein Pilot ist kein sanfter Start, sondern eine Frage mit Frist: Schneidet diese Änderung hier besser ab als das, was wir heute tun?

Fragen und Schritte folgen der Seite des Institute for Healthcare Improvement zum Modell; das Buch selbst lag nicht vor. Die Deutung stammt von der Redaktion.

Quelle: Langley, Moen, Nolan, Nolan, Norman & Provost, Jossey-Bass, 2009 (über Institute for Healthcare Improvement, "Model for Improvement")

Mehr im Essay: DMAIC ohne Black Belt

Was die Forschung sagt

Warum Ergebnisse im Großen schrumpfen

Stefano DellaVigna und Elizabeth Linos sammelten 126 randomisierte Studien mit 23 Millionen Menschen, alle von zwei großen „Nudge Units“ der US-Regierung, und verglichen sie mit Nudge-Studien aus Fachzeitschriften.

Mittlerer Effekt eines Nudges auf die Teilnahme, Prozentpunkte: In Zeitschriften 8,7, Im Großen 1,4.

Die veröffentlichten Studien waren klein: Der Median einer Behandlungsgruppe lag bei 484 Personen, in den Nudge Units bei 10.006. Kleine Studien erkennen nur große Effekte, und Zeitschriften drucken vor allem, was erkannt wird. Selektive Veröffentlichung, verstärkt durch geringe statistische Power, erklärt etwa 70 % der Lücke; Unterschiede der Nudges erklären den Großteil des Rests.

Unsere Lesart

Die Erfolgsgeschichte, die man liest, ist die veröffentlichte. Besser einplanen, dass die Einführung weniger bringt als der Pilot, der überzeugt hat.

Teilnahme: der Anteil derer, die tun, worum gebeten wird, etwa sich anmelden oder impfen lassen. Effekte und die 70 % aus Econometrica (2022); Gruppengrößen aus dem Arbeitspapier von 2020.

Quelle: Stefano DellaVigna & Elizabeth Linos, Econometrica 90(1), 2022

Wie man es misst

Zahlen, denen man traut

„Zahlen zu bekommen ist leicht; Zahlen, denen man trauen kann, sind schwer“, schreiben Kohavi und Thomke. Vier Prüfungen, bevor ein Pilotergebnis entscheidet:

  • Mit einer Kontrollgruppe vergleichen. Bei Yahoo bezifferte eine Beobachtungsstudie den Effekt von Werbebannern auf Markensuchen auf 871–1.198 %; ein kontrolliertes Experiment fand 5,4 %.
  • Eine Hauptkennzahl und Leitplanken festlegen. Vor dem Start, nicht danach; Leitplanken dürfen nicht schlechter werden.
  • Mindestens eine volle Woche laufen lassen. LinkedIn misst mindestens eine Woche: Ein einzelner Tag überbewertet Vielnutzer.
  • Aufteilung prüfen, Überraschungen misstrauen. Falsche Gruppengrößen machen das Ergebnis oft wertlos. Twymans Gesetz: Jede Zahl, die interessant oder anders aussieht, ist meist falsch.

Hypothetisches Beispiel, eine neue Kommissionierroute im Lager

  • Vergleich: Zone A neue Route, Zone B wie bisher, dieselben zwei Wochen
  • Hauptkennzahl: Positionen pro Stunde: A +6 %, B +4 %
  • Leitplanke: Pickfehler: in beiden unverändert

Gegenüber Zone B bringt die Route etwa 2 Punkte, nicht 6. Die Zahlen sind erfunden.

Prüfungen nach Kohavi & Thomke (2017), Kohavi, Tang & Xu (2020) und, für die Woche, Xu et al. (2018). Das Beispiel stammt von der Redaktion.

Quellen: Ron Kohavi & Stefan Thomke, Harvard Business Review 95(5), 2017 (über HBR reprint R1705E); Ron Kohavi, Diane Tang & Ya Xu, Cambridge University Press, 2020 (über Chapter 1, published by the authors); Ya Xu, Weitao Duan & Shaochen Huang, KDD '18 (ACM), 2018

Werkzeug der Ausgabe

Die Karte für den Pilotplan

Vor dem Start ausfüllen, mit denen, die den Pilot durchführen. Dann in Stufen einführen: erst eine kleine Gruppe, dann eine Messphase, dann alle.

  1. Hypothese wenn wir X ändern, verbessert sich Y um etwa Z, weil …
  2. Was sich ändert eine Änderung, so klar, dass jeder sie wiederholen kann
  3. Wo und wie lange ein Bereich, eine Schicht, ein Team; mindestens eine normale Woche
  4. Was gemessen wird eine Hauptkennzahl, wie sie gezählt wird, und die Leitplanken
  5. Vergleichsgruppe wo es an denselben Tagen weiterläuft wie bisher
  6. Entscheidungsregel vor dem Start: einführen, anpassen oder stoppen, und wer entscheidet

Eine Praxis, die die Redaktion vorschlägt, nach dem Model for Improvement, Xu et al. (2018) und Thomkes Regel: eine prüfbare Hypothese, eine Kontrollgruppe und sich an die Ergebnisse halten.

Quellen: Langley, Moen, Nolan, Nolan, Norman & Provost, Jossey-Bass, 2009 (über Institute for Healthcare Improvement, "Model for Improvement"); Ya Xu, Weitao Duan & Shaochen Huang, KDD '18 (ACM), 2018; Stefan H. Thomke, Harvard Business Review Press, 2020 (über Michael Blanding, "Creating the Experimentation Organization", HBS Working Knowledge, 2019)

Tool öffnen: Sigma & Regel­karte

Quellen und Methode

Jede Zahl hat eine Quelle.

Die Zahlen dieser Ausgabe stammen aus den folgenden Quellen. Das Jahr zeigt, wie aktuell jede ist.

Redaktionelle Methode

Jede Zahl wurde auf Jahr, Herausgeber und genaue Bedeutung geprüft. Wo die Seite des Herausgebers nicht erreichbar war, wurde sie an unabhängigen Zusammenfassungen geprüft und mit „über“ markiert. Die Deutung der Redaktion ist als „Unsere Lesart“ markiert. Zahlen, die sich nicht bestätigen ließen, stehen nicht in der Ausgabe.

Management Review · Monatsausgabe

Eine andere Ausgabe lesen

Alle Ausgaben