Adoption
78%
Der Bauplan liefert eine Schätzung. Schätzungen sind billig — einen Rechner, der eine schmeichelhafte Zahl ausgibt, kann jeder bauen. Das hier ist der Apparat, der diese Schätzung bestätigen oder kippen würde, und der Teil, in dem wir laut aussprechen, was er nicht belegen kann.
Zur Konsole ↓Die Telemetrie belegt Adoption, Qualität der Fähigkeiten und Kosten — präzise. Produktivität belegt sie für sich allein nicht.
Telemetrie (Frühindikator)
Adoption + Fähigkeiten
Ihre Systeme (Spätindikator)
Ergebnistrend über die Zeit
die Aussage
belastbar
Was ein Anbieter sagt
„Ihre Entwickler sind 30 % schneller.“
Allein aus Tool-Telemetrie. Der erste kompetente CFO zerlegt das — und das zu Recht.
Was wir sagen würden
„Die Adoption erreichte 78 % der infrage kommenden Entwickler, die sechs von uns gebauten Fähigkeiten tragen 61 % der Agenten-Ausgaben bei 91 % Erfolgsquote, und im selben Zeitraum sank die PR-Durchlaufzeit um 22 % gegenüber einer Baseline, die wir vor dem Start erfasst haben.“
Jeder Teilsatz lässt sich auf eine benannte Quelle zurückführen. Der letzte ist nur wegen des nächsten Abschnitts möglich.
Jedes Panel unten führt seine eigene Herkunft mit. Schalten Sie Alle Metriken erklären ein — oder klicken Sie auf ein beliebiges ⓘ — und jede Zahl sagt Ihnen, woher sie kommt, welche Formel dahintersteckt, was sie zeigt und warum sie einer Prüfung standhält.
ILLUSTRATIVER KUNDE · KI-AUGMENTIERUNGSPROGRAMM · Q3
Adoption
78%
Ausgaben / Entw. / Mon.
$186
Durchlaufzeit p85
4.1d
Change Failure Rate
⚠ WATCH11%
Adoption %
Durchlaufzeit p85 (Tage)
Welle 2 bleibt während der Verbesserung von Welle 1 flach und knickt erst nach ihrem eigenen Juni-Rollout ab — der versetzte Zeitplan wirkt als Kontrollgruppe.
Tempo
Durchlaufzeit p85 · Zeit bis Merge · Review-Latenz
IMPROVING
Volumen
Durchsatz · abgeschlossene Items
IMPROVING
Qualität
Fehlerrate · Defekte · Wiedereröffnungen · MTTR · Komplexität
MIXED
Adoption
aktive Entwickler · Nutzung der Fähigkeiten
IMPROVING
Wahrnehmung
Entwicklerbefragung · +0,8 Pkt.
IMPROVING
Live aus den Panels unten neu berechnet: eine Familie zählt als übereinstimmend, wenn sich ihre Metriken gegenüber der gewählten Baseline in die verbessernde Richtung bewegen.
Durchlaufzeit p85
4.1d
▼ 21%
Durchsatz
3.4PR/eng/wk
▲ 17%
Review-Latenz
5.2h
▼ 32%
PR-Größe
312LOC
▲ 18%⚠
Steigend. Größere Änderungen bremsen Reviews normalerweise — die Durchlaufzeit hat sich trotzdem verbessert.
Change Failure Rate
11%
▲ 1 pt⚠
Seit 4 Wochen über der Baseline. In Prüfung.
Entwichene Defekte
3.1/release
▼ 18%
Wiedereröffnungsrate
6.4%
▼ 2 pts
MTTR
47min
▼ 11%
Zyklomatische Komplexität
6.2% vs base
▲ 6.2 pts⚠
Steigt seit Beginn der Adoption. Das wichtigste langfristige Risikosignal.
Revert-Rate
2.1%
▼ 0.5 pts
| Fähigkeit | Nutzungen | Erfolg | Kosten/Nutzung | Urteil |
|---|---|---|---|---|
| code-review-agent | 1,240 | 94% | $0.11 | ★ BEHALTEN |
| migration-helper | 380 | 91% | $0.34 | ★ BEHALTEN |
| test-generator | 44 | 61% | $0.92 | ✕ EINSTELLEN |
| doc-writer | 3 | — | — | ✕ EINSTELLEN |
Eine Fähigkeit, die niemand aufruft, ist kein neutrales Ergebnis — sie ist ein gescheitertes Liefergut, das wir ausgeliefert haben. Genau darum geht es, das Aussortieren zu berichten.
Design
Versetzter Rollout. Welle 2 dient bis Juni als Kontrolle.
Baseline
Q1, aus der Git-Historie vor dem ersten Workshop erfasst.
Störfaktoren
Die PR-Größe stieg im selben Fenster um 18 %; in zwei Teams änderte sich die Zusammensetzung.
Abdeckung
7 von 9 Teams. Platform und Data sind noch nicht instrumentiert.
Das zu veröffentlichen ist der Punkt. Sichtbare Disziplin an den Grenzen macht alles oberhalb der Linie glaubwürdig — und es ist der schnellste Weg, eine Messpraxis von einer Marketingpraxis zu unterscheiden.
Hohe Sicherheit · direkt aus der Telemetrie
Richtungsweisend · nie als Präzision zitiert
Hier wird die Wertaussage tatsächlich getroffen
Nicht belastbar · wird nicht angeboten
Neuheitseffekt
Eine Auswertung nach 14 Tagen ist Marketing, keine Messung. Wir berichten nach 90 Tagen.
Selbstselektion
Enthusiasten übernehmen zuerst und waren ohnehin schnell. Ein reiner Wellenvergleich kann beides nicht trennen.
Teamzusammensetzung
Menschen kommen und gehen mitten im Zeitfenster. Die Metriken normalisieren auf aktive Beitragende, nie auf Kopfzahl.
Saisonalität
Q4 und Feiertagsfenster verzerren den Durchsatz in beide Richtungen.
Parallele Initiativen
Landet im selben Quartal eine Plattformmigration, gehört ihr ein Teil des Ergebnisses.
Beobachtungseffekt
Gemessene Teams verhalten sich anders, solange sie gemessen werden.
Der Zeitplan existiert, um die zwei Fehlermuster zu stoppen, die Glaubwürdigkeit zerstören: zu früh den Sieg auszurufen und nie zu prüfen, ob die ausgelieferten Fähigkeiten überhaupt genutzt werden.
T−2 Wochen
Git-, Incident- und Ticket-Historie werden gemessen. Metrikensatz und Erfolgskriterien werden schriftlich vereinbart, bevor irgendwer geschult wird.
T−0
Telemetrie ab Tag eins live, mit bereits erteilter rechtlicher Freigabe.
Tag 14
Diagnostisch, nie ein Ergebnis. Wer nach zwei Wochen ein Ergebnis berichtet, misst Neuheit.
Tag 30
Jedes gebaute Ding behalten, beheben, ausrollen oder einstellen. Erste ehrliche Kostenauswertung.
Tag 90
Ergebnisse gegen die Baseline, Befragung wiederholt, Familien gezählt. Das ist die Zahl, die zitiert wird.
Quartalsweise
Fähigkeiten verfallen, Nutzung driftet, neue Teams kommen dazu. Was seinen Platz nicht mehr verdient, wird stillgelegt.
Zwei Seiten plus Anhang. Fünf Abschnitte, immer dieselben fünf.
Er berichtet mindestens einen negativen Befund. Ein Bericht ohne schlechte Nachrichten liest sich wie Marketing — und wird als Marketing gelesen.
Öffentliche Forschung, kein Kunde von uns.
Bartosz Ocytko, „Agentic Engineering at Zalando: a snapshot“, Zalando Engineering Blog, 14. August 2026.
Das Original lesen ↗Berichtet über mehr als 250 Engineering-Teams hinweg, mit Adoption gemessen über einen Gateway-Proxy für rund 2.000 monatlich aktive Nutzer auf sechs kleinen Pods — das ist bescheidene Infrastruktur, kein Plattformprogramm.
33%
der PRs automatisch freigegeben
Ein risikobasierter Freigabe-Bot erledigt das risikoarme Drittel automatisch.
20–40%
kürzere Lead Time
Bei diesen PRs — ihr größter gemessener Gewinn, und er kam aus Prozessautomatisierung, nicht aus höherer Programmiergeschwindigkeit.
▲
PR-Größe stieg
Durchgängig, in der Klasse 100–500 Zeilen und darüber. Das Gegenteil dessen, was die meisten KI-Produktivitätsmodelle annehmen.
Es ist kurz, es findet vor jeder Schulung statt, und es ist das, was jede spätere Zahl überhaupt bedeutsam macht. Ohne es gibt es keine Messung — nur Behauptung.
Zwei Wochen vor allem anderen. Wir messen Ihren Ist-Zustand und übergeben Ihnen eine unveränderliche Kopie davon.
Sprechen Sie uns an →Das vollständige Bild eines augmentiert arbeitenden Unternehmens — fünf Ebenen, jede Rolle, die Governance, die es sicher hält.
Der Bauplan →Ein Selbstcheck mit acht Punkten gegen den Bauplan, mit ehrlicher Bewertung.
Selbstcheck →Nach einer kostenlosen 30-minütigen Standortbestimmung bringen wir Ihre Entwickler zu mehrstufiger Orchestrierung und sicherer, paralleler Auslieferung, auf dem Qualitätsniveau, das Sie ohnehin erwarten. Kein Verkaufsgespräch.