← Zurück zum BauplanDie Beweisebene

Woran Sie erkennen würden, dass es wirklich gewirkt hat

Der Bauplan liefert eine Schätzung. Schätzungen sind billig — einen Rechner, der eine schmeichelhafte Zahl ausgibt, kann jeder bauen. Das hier ist der Apparat, der diese Schätzung bestätigen oder kippen würde, und der Teil, in dem wir laut aussprechen, was er nicht belegen kann.

Zur Konsole
01 · Wie eine belastbare Aussage aussieht

Telemetrie allein kann Produktivität nicht belegen

Die Telemetrie belegt Adoption, Qualität der Fähigkeiten und Kosten — präzise. Produktivität belegt sie für sich allein nicht.

Telemetrie (Frühindikator)

Adoption + Fähigkeiten

×

Ihre Systeme (Spätindikator)

Ergebnistrend über die Zeit

=

die Aussage

belastbar

Was ein Anbieter sagt

„Ihre Entwickler sind 30 % schneller.“

Allein aus Tool-Telemetrie. Der erste kompetente CFO zerlegt das — und das zu Recht.

Was wir sagen würden

„Die Adoption erreichte 78 % der infrage kommenden Entwickler, die sechs von uns gebauten Fähigkeiten tragen 61 % der Agenten-Ausgaben bei 91 % Erfolgsquote, und im selben Zeitraum sank die PR-Durchlaufzeit um 22 % gegenüber einer Baseline, die wir vor dem Start erfasst haben.“

Jeder Teilsatz lässt sich auf eine benannte Quelle zurückführen. Der letzte ist nur wegen des nächsten Abschnitts möglich.

Was genau das eine verlangt, was die meisten Projekte auslassen: eine vor dem Start erfasste Baseline. Sechs bis zwölf Monate Ihrer Git-Historie, Incident-Aufzeichnungen und Ticket-Flüsse, gemessen und Ihnen am ersten Tag unveränderlich übergeben. Es ist die wertvollste Stunde des ganzen Projekts, sie kostet fast nichts, und sie lässt sich nachträglich nicht wiederherstellen.
02 · Die Konsole

Eine Seite, die eine Führungskraft in dreißig Sekunden liest

Jedes Panel unten führt seine eigene Herkunft mit. Schalten Sie Alle Metriken erklären ein — oder klicken Sie auf ein beliebiges ⓘ — und jede Zahl sagt Ihnen, woher sie kommt, welche Formel dahintersteckt, was sie zeigt und warum sie einer Prüfung standhält.

Delivery-Impact-Konsole

ILLUSTRATIVER KUNDE · KI-AUGMENTIERUNGSPROGRAMM · Q3

BEISPIELDATEN

Adoption

78%

▲ 71 pts62 of 79 eng

Ausgaben / Entw. / Mon.

$186

▲ $24Q1 $162

Durchlaufzeit p85

4.1d

▼ 21%Q1 5.2

Change Failure Rate

⚠ WATCH

11%

▲ 1 ptQ1 10

Rollout & Reaktion

ADOPTION vs DURCHLAUFZEIT · NACH WELLE
Welle 1 — 4 TeamsWelle 2 — 3 Teams

Adoption %

048.396.6Workshop · Welle 1Rollout Welle 2

Durchlaufzeit p85 (Tage)

3.94.85.8Q1 baseline 5.2dWorkshop · Welle 1Rollout Welle 2JanFebMärAprMaiJunJulAugSep

Welle 2 bleibt während der Verbesserung von Welle 1 flach und knickt erst nach ihrem eigenen Juni-Rollout ab — der versetzte Zeitplan wirkt als Kontrollgruppe.

Konvergente Evidenz

4 / 5 AGREE

Tempo

Durchlaufzeit p85 · Zeit bis Merge · Review-Latenz

IMPROVING

Volumen

Durchsatz · abgeschlossene Items

IMPROVING

Qualität

Fehlerrate · Defekte · Wiedereröffnungen · MTTR · Komplexität

MIXED

Adoption

aktive Entwickler · Nutzung der Fähigkeiten

IMPROVING

Wahrnehmung

Entwicklerbefragung · +0,8 Pkt.

IMPROVING

Live aus den Panels unten neu berechnet: eine Familie zählt als übereinstimmend, wenn sich ihre Metriken gegenüber der gewählten Baseline in die verbessernde Richtung bewegen.

Delivery

GITHUB · 90 T

Durchlaufzeit p85

4.1d

▼ 21%

Durchsatz

3.4PR/eng/wk

▲ 17%

Review-Latenz

5.2h

▼ 32%

PR-Größe

312LOC

▲ 18%

Steigend. Größere Änderungen bremsen Reviews normalerweise — die Durchlaufzeit hat sich trotzdem verbessert.

Qualitäts-Leitplanken

CI · INCIDENTS · JIRA

Change Failure Rate

11%

▲ 1 pt

Seit 4 Wochen über der Baseline. In Prüfung.

Entwichene Defekte

3.1/release

▼ 18%

Wiedereröffnungsrate

6.4%

▼ 2 pts

MTTR

47min

▼ 11%

Zyklomatische Komplexität

6.2% vs base

▲ 6.2 pts

Steigt seit Beginn der Adoption. Das wichtigste langfristige Risikosignal.

Revert-Rate

2.1%

▼ 0.5 pts

Was wir gebaut haben

FÄHIGKEITEN-PORTFOLIO · 30 T
FähigkeitNutzungenErfolgKosten/NutzungUrteil
code-review-agent1,24094%$0.11 BEHALTEN
migration-helper38091%$0.34 BEHALTEN
test-generator4461%$0.92 EINSTELLEN
doc-writer3 EINSTELLEN

Eine Fähigkeit, die niemand aufruft, ist kein neutrales Ergebnis — sie ist ein gescheitertes Liefergut, das wir ausgeliefert haben. Genau darum geht es, das Aussortieren zu berichten.

Wohin die Ausgaben fließen

NACH FÄHIGKEIT · 30 T
code-review-agent$2,140
migration-helper$710
test-generator$392
nicht zugeordnet / ad hoc$281

So ist das zu lesen

Design

Versetzter Rollout. Welle 2 dient bis Juni als Kontrolle.

Baseline

Q1, aus der Git-Historie vor dem ersten Workshop erfasst.

Störfaktoren

Die PR-Größe stieg im selben Fenster um 18 %; in zwei Teams änderte sich die Zusammensetzung.

Abdeckung

7 von 9 Teams. Platform und Data sind noch nicht instrumentiert.

03 · Die Leiter der Aussagen

Was wir belegen können und was wir zu behaupten ablehnen

Das zu veröffentlichen ist der Punkt. Sichtbare Disziplin an den Grenzen macht alles oberhalb der Linie glaubwürdig — und es ist der schnellste Weg, eine Messpraxis von einer Marketingpraxis zu unterscheiden.

A

Direkt gemessen

Hohe Sicherheit · direkt aus der Telemetrie

  • Wie viele Menschen es nutzen, wie oft, und wer es nie übernommen hat
  • Was es kostet — pro Person, pro Team, pro Monat
  • Welche der von uns gebauten Fähigkeiten genutzt und welche ignoriert werden
  • Welche Tools scheitern, wie oft und mit welchem Fehler
  • Welche MCP-Server still kaputt sind
  • Wohin das Budget tatsächlich fließt, nach Skill und nach Modell
B

Gemessen, mit echten Einschränkungen

Richtungsweisend · nie als Präzision zitiert

  • Anteil KI-unterstützten Codes — bewusst konservativ, eine Untergrenze und keine Messung
  • Annahmequote von Vorschlägen — ein gutes Reibungssignal, ein schlechtes Qualitätssignal
  • Codezeilen — eine echte Zahl, als Wertmaßstab nahezu wertlos
  • Modelldauer — Modellzeit, nicht Entwicklerzeit. Nie als Letztere dargestellt
C

Erfordert Ihre Systeme

Hier wird die Wertaussage tatsächlich getroffen

  • Durchlaufzeit und Lead Time for Change — aus Ihrer Git-Historie
  • Durchsatz pro Entwickler und Woche
  • Change Failure Rate, entwichene Defekte, MTTR
  • Nacharbeit: Reverts, Hotfixes, Wiedereröffnungsrate
  • Review-Latenz und Review-Last
  • Ob sich Entwickler wirksamer fühlen — Befragung, zur Baseline und an Tag 90
D

Das behaupten wir nicht

Nicht belastbar · wird nicht angeboten

  • „Wir haben Ihnen N Vollzeitstellen gespart“ — erfordert Annahmen, die niemand belegen kann
  • „KI hat N % Ihrer Codebasis geschrieben“ — die Zuordnung ist eine bewusste Untererfassung und trägt diese Lesart nicht
  • „Die Qualität hat sich dank KI verbessert“ — ohne kontrollierten Rollout bestenfalls Korrelation
  • „Das Team ist N % schneller“ — es sei denn, über Zeit gemessen, mit Kontrollgruppe, gepaart mit Qualität, über 90+ Tage

Störfaktoren, die wir vor Ihnen benennen

Neuheitseffekt

Eine Auswertung nach 14 Tagen ist Marketing, keine Messung. Wir berichten nach 90 Tagen.

Selbstselektion

Enthusiasten übernehmen zuerst und waren ohnehin schnell. Ein reiner Wellenvergleich kann beides nicht trennen.

Teamzusammensetzung

Menschen kommen und gehen mitten im Zeitfenster. Die Metriken normalisieren auf aktive Beitragende, nie auf Kopfzahl.

Saisonalität

Q4 und Feiertagsfenster verzerren den Durchsatz in beide Richtungen.

Parallele Initiativen

Landet im selben Quartal eine Plattformmigration, gehört ihr ein Teil des Ergebnisses.

Beobachtungseffekt

Gemessene Teams verhalten sich anders, solange sie gemessen werden.

04 · Der Takt

Neunzig Tage, mit dem ehrlichen Checkpoint an Tag 14

Der Zeitplan existiert, um die zwei Fehlermuster zu stoppen, die Glaubwürdigkeit zerstören: zu früh den Sieg auszurufen und nie zu prüfen, ob die ausgelieferten Fähigkeiten überhaupt genutzt werden.

T−2 Wochen

Baseline-Erfassung

Git-, Incident- und Ticket-Historie werden gemessen. Metrikensatz und Erfolgskriterien werden schriftlich vereinbart, bevor irgendwer geschult wird.

T−0

Workshop und Rollout

Telemetrie ab Tag eins live, mit bereits erteilter rechtlicher Freigabe.

Tag 14

Nur Adoptionsprüfung

Diagnostisch, nie ein Ergebnis. Wer nach zwei Wochen ein Ergebnis berichtet, misst Neuheit.

Tag 30

Review des Fähigkeiten-Portfolios

Jedes gebaute Ding behalten, beheben, ausrollen oder einstellen. Erste ehrliche Kostenauswertung.

Tag 90

Die eigentliche Messung

Ergebnisse gegen die Baseline, Befragung wiederholt, Familien gezählt. Das ist die Zahl, die zitiert wird.

Quartalsweise

Laufendes Review

Fähigkeiten verfallen, Nutzung driftet, neue Teams kommen dazu. Was seinen Platz nicht mehr verdient, wird stillgelegt.

Der Bericht an Tag 90

Zwei Seiten plus Anhang. Fünf Abschnitte, immer dieselben fünf.

  1. 01Adoption
  2. 02Fähigkeiten-Portfolio
  3. 03Wirtschaftlichkeit
  4. 04Ergebnisse vs. Baseline
  5. 05Die nächsten 90 Tage

Er berichtet mindestens einen negativen Befund. Ein Bericht ohne schlechte Nachrichten liest sich wie Marketing — und wird als Marketing gelesen.

05 · Evidenz aus der Praxis

Der nützlichste öffentliche Datensatz legt nahe, dass der Engpass nicht der Code sein muss

Öffentliche Forschung, kein Kunde von uns.

Bartosz Ocytko, „Agentic Engineering at Zalando: a snapshot“, Zalando Engineering Blog, 14. August 2026.

Das Original lesen

Berichtet über mehr als 250 Engineering-Teams hinweg, mit Adoption gemessen über einen Gateway-Proxy für rund 2.000 monatlich aktive Nutzer auf sechs kleinen Pods — das ist bescheidene Infrastruktur, kein Plattformprogramm.

33%

der PRs automatisch freigegeben

Ein risikobasierter Freigabe-Bot erledigt das risikoarme Drittel automatisch.

20–40%

kürzere Lead Time

Bei diesen PRs — ihr größter gemessener Gewinn, und er kam aus Prozessautomatisierung, nicht aus höherer Programmiergeschwindigkeit.

PR-Größe stieg

Durchgängig, in der Klasse 100–500 Zeilen und darüber. Das Gegenteil dessen, was die meisten KI-Produktivitätsmodelle annehmen.

Die Konsequenz für die Beratung ist der Teil, den wir ernst nehmen: die Intervention mit dem höchsten ROI ist womöglich gar kein Coding-Agent. Erst instrumentieren, den echten Engpass finden und bereit sein, einen Freigabe-Automatisierungs-Bot statt eines weiteren Skills zu empfehlen. Die Review-Latenz ist meist der größte Einzelblock der Durchlaufzeit, und eine Warteschlange zu beseitigen schlägt schnelleres Tippen.
06 · Wo anfangen

Das Baseline-Audit ist der günstige Teil

Es ist kurz, es findet vor jeder Schulung statt, und es ist das, was jede spätere Zahl überhaupt bedeutsam macht. Ohne es gibt es keine Messung — nur Behauptung.

Baseline-Audit

Zwei Wochen vor allem anderen. Wir messen Ihren Ist-Zustand und übergeben Ihnen eine unveränderliche Kopie davon.

Sprechen Sie uns an

Den Bauplan ansehen

Das vollständige Bild eines augmentiert arbeitenden Unternehmens — fünf Ebenen, jede Rolle, die Governance, die es sicher hält.

Der Bauplan

Prüfen, wo Sie stehen

Ein Selbstcheck mit acht Punkten gegen den Bauplan, mit ehrlicher Bewertung.

Selbstcheck
Kostenloses Diagnosegespräch buchen

Bringen Sie Ihr Team dazu, KI-Systeme zu orchestrieren, während andere noch vibe-coden.

Nach einer kostenlosen 30-minütigen Standortbestimmung bringen wir Ihre Entwickler zu mehrstufiger Orchestrierung und sicherer, paralleler Auslieferung, auf dem Qualitätsniveau, das Sie ohnehin erwarten. Kein Verkaufsgespräch.

Schreiben Sie uns
[email protected]

Warum uns kontaktieren?

Schnelle Antwort
Wir beantworten alle Anfragen innerhalb von 24 Stunden.
Kostenlose Beratung
Fachkundiger Rat ohne jede Verpflichtung.
Expertenrat
Von erfahrenen KI-Spezialisten mit über 40 Jahren kombinierter Erfahrung.