De Poolster.
Alles lezen Spatie pauzeert · → volgende · ← terug
Bruikbare incidenten, voor een mens of een agent.
Etappe 1 van 4 · Signaal: Wat überhaupt iemand bereikt
1 Bruikbaar betekent bedrijfsimpact
Een incident is bruikbaar als het de organisatie schaadt, of zal schaden.
Genoteerd, dank je
Etappe 1 van 4 · Signaal: Wat überhaupt iemand bereikt
2 Eerst de grondoorzaak
Verminder de ruis en vind de grondoorzaak voordat incident- of problemmanagement begint.
Genoteerd, dank je
Etappe 1 van 4 · Signaal: Wat überhaupt iemand bereikt
3 Weet wat er veranderde
Elk event draagt mee wat er rondom veranderde, goedgekeurd of niet.
Genoteerd, dank je
Etappe 1 van 4 · Signaal: Wat überhaupt iemand bereikt
4 De impact reist mee in de alert
Elke alert draagt zijn eigen aanwijzingen over bedrijfsimpact.
Genoteerd, dank je
Etappe 1 van 4 · Signaal: Wat überhaupt iemand bereikt
5 Sluit elk monitoringgat
Een gat dat na een storing wordt gevonden, blijft open tot de nieuwe monitoring draait en bewezen is.
Genoteerd, dank je
Etappe 2 van 4 · Reactie: Wat er daarna gebeurt, en wie handelt
6 Eén keer goedkeuren, daarna automatiseren
Zodra de organisatie goedkeurt hoe een grondoorzaak wordt opgelost, wordt elk later probleem met die grondoorzaak automatisch verholpen.
Genoteerd, dank je
Etappe 2 van 4 · Reactie: Wat er daarna gebeurt, en wie handelt
7 Gebruik wat leveranciers al oplosten
Catalogiseer elke oplossing die je leveranciers documenteren, en beoordeel die tegen je eigen risicobereidheid.
Genoteerd, dank je
Etappe 2 van 4 · Reactie: Wat er daarna gebeurt, en wie handelt
8 Eén escalatiepad
Incidenten bereiken mensen via één escalatiedienst, en alleen als dat moet.
Genoteerd, dank je
Etappe 3 van 4 · Bewijs: Hoe je weet dat het werkt
9 Bewijs het met een replay
Speel de storing opnieuw af om te bewijzen dat de oplossing werkt voordat die nodig is.
Genoteerd, dank je
Etappe 3 van 4 · Bewijs: Hoe je weet dat het werkt
10 Bewijs dat de wacht nog staat
Elke service-eigenaar kan bewijzen dat zijn monitoring nog werkt.
Genoteerd, dank je
Etappe 3 van 4 · Bewijs: Hoe je weet dat het werkt
11 Vertrouwen wordt aangetoond, niet geclaimd
Een automatische oplossing telt alleen als iets onafhankelijks laat zien dat die werkte.
Genoteerd, dank je
Etappe 3 van 4 · Bewijs: Hoe je weet dat het werkt
12 Replays zijn de evals voor AI
Elke replay is ook een test die je AI-agents moeten halen.
Genoteerd, dank je
Etappe 3 van 4 · Bewijs: Hoe je weet dat het werkt
13 Grenzen horen bij security
Je securityteam bepaalt wat automatisering en AI nooit mogen doen.
Genoteerd, dank je
Etappe 4 van 4 · Organisatie: Wat ervoor zorgt dat het blijft
14 Eén meetlat
Elk bedrijfsonderdeel meet eventmanagement op dezelfde manier.
Genoteerd, dank je
Etappe 4 van 4 · Organisatie: Wat ervoor zorgt dat het blijft
15 Sponsorschap bepaalt het plafond
Eventmanagement is zo goed als de hoogste persoon die er eigenaar van is.
Genoteerd, dank je
Etappe 4 van 4 · Organisatie: Wat ervoor zorgt dat het blijft
16 Begin bij wie al automatiseert
Vind wie vandaag automatiseert, en geef iedereen wat zij bouwden.
Genoteerd, dank je
Etappe 4 van 4 · Organisatie: Wat ervoor zorgt dat het blijft
17 Plan de mensen vóór de automatisering
Bepaal waar de vrijgekomen tijd naartoe gaat voordat de eerste oplossing wordt geautomatiseerd.
Genoteerd, dank je
Hoe ver ben je van de ster?
Bruikbare incidenten, voor een mens of een agent.
Etappe 1 van 4
Signaal
Etappe 2 van 4
Reactie
Etappe 3 van 4
Bewijs
Hoe ver ben je van de ster? Doe de zelfbeoordeling of plan een gesprek
Alles lezen
Dit is het ideaal om op te sturen, geen claim: waar het om gaat, is weten hoe ver je ervan af zit en die afstand stap voor stap kleiner maken.
1Bruikbaar betekent bedrijfsimpactEen incident is bruikbaar als het de organisatie schaadt, of zal schaden.
Een CPU-alert op zich is niet bruikbaar. Het wordt bruikbaar als andere alerts ermee correleren en de impact laten zien, of als een gedocumenteerd runbookscenario het al als bruikbaar aanmerkt en de acties benoemt. Reactieregels die elke manager anders instelt (hier alles onderzoeken, daar alleen P2 en hoger) houden eventmanagement blijvend reactief.
Gemeten met Bruikbaarheidsratio
Genoteerd, dank je
2Eerst de grondoorzaakVerminder de ruis en vind de grondoorzaak voordat incident- of problemmanagement begint.
Gemiddelde-tijdmetrieken zijn nuttig, maar ze zijn niet het doel. Het doel is de grondoorzaak elke keer sneller te vinden, want een grondoorzaak met een goedgekeurde oplossing kan de volgende keer automatisch worden verholpen.
Gemeten met Tijd tot grondoorzaak · Dekking grondoorzaak
Genoteerd, dank je
3Weet wat er veranderdeElk event draagt mee wat er rondom veranderde, goedgekeurd of niet.
De meeste storingen beginnen met een wijziging, dus is wijzigingscontext de snelste weg naar de grondoorzaak, en het dwingt wie monitors schrijft, mens of AI, om bij het bouwen aan wijzigingen te denken. Alerts binnen een goedgekeurd wijzigingsvenster zijn verwacht: ze worden vastgelegd in eventmanagement maar niet doorgezet naar incidentmanagement, en die vastlegging kan laten zien wanneer een goedgekeurde wijziging een service raakte die niet in de impactanalyse stond. Deploys buiten het wijzigingsproces om worden zichtbaar gemaakt, en een organisatie die met ITIL werkt, dringt ze terug. Het lastige is de prikkel: teams moeten helpen hun pipelines te koppelen en zien het extra toezicht zelden als iets in hun voordeel.
Gemeten met Tijd tot grondoorzaak
Genoteerd, dank je
4De impact reist mee in de alertElke alert draagt zijn eigen aanwijzingen over bedrijfsimpact.
Geen grote organisatie houdt een volledige, actuele servicekaart bij, en sommige services leven te kort om te modelleren. Dus zit de standaard in de alert: de verwachte impact als de monitor afgaat, hoe en binnen welke tijd de organisatie moet reageren, wat de service levert, en of klanten of alleen interne gebruikers (salarisadministratie, HR) worden geraakt. Elke monitor zegt ook of hij beschikbaarheid, functionaliteit of prestaties bewaakt. Eigenaren die hun CI’s niet bijwerken, kunnen worden gecoacht om dit in hun alerts te schrijven, en automatisering voert het na verloop van tijd terug in de CMDB. De standaard moet op beide manieren werken, zelfs binnen één organisatie: sommige belanghebbenden zien hem als principes en vertalen die naar hun eigen naamgeving, anderen willen een vaste conventie en passen hun data daarop aan, en de dienst ondersteunt beide naast elkaar. Relaties zijn in elke organisatie het grootste gat, dus wordt elke gegevensbron onderzocht op betrouwbare relaties, elk gemarkeerd met waar hij vandaan komt en hoeveel vertrouwen hij verdient.
Gemeten met Dekking impactaanwijzingen
Genoteerd, dank je
5Sluit elk monitoringgatEen gat dat na een storing wordt gevonden, blijft open tot de nieuwe monitoring draait en bewezen is.
De meeste storingen laten iets zien wat de monitoring miste. Dat gat volgen tot de nieuwe monitoring live is, en de storing opnieuw afspelen om te laten zien dat die nu wordt opgemerkt, maakt van een organisatie die hoopvol reageert er een die één keer reageert en daarna voorbereid is.
Gemeten met Monitoringgaten
Genoteerd, dank je
6Eén keer goedkeuren, daarna automatiserenZodra de organisatie goedkeurt hoe een grondoorzaak wordt opgelost, wordt elk later probleem met die grondoorzaak automatisch verholpen.
Het ID van de goedkeuring zit in de trigger van de monitor, zodat de monitor zelf laat zien hoe zijn oplossing is goedgekeurd. Waar meerdere oplossingen bestaan (een verouderd runbook, duidelijkere afsluitnotities bij een recent incident, verschillende oplossingen voor verschillende onderdelen van de organisatie), krijgt elke oplossing een directe en een indirecte betrouwbaarheidsscore.
Gemeten met Dekking automatisering · Herhaalde incidenten
Genoteerd, dank je
7Gebruik wat leveranciers al oplostenCatalogiseer elke oplossing die je leveranciers documenteren, en beoordeel die tegen je eigen risicobereidheid.
Begin bij de contracten: elke technologie waarvoor je support betaalt, heeft gedocumenteerde oplossingen. Verzamel ze, catalogiseer ze met betrouwbaarheidsscores, en laat elk onderdeel van de organisatie ze overnemen zoals ze zijn of met eigen extra stappen. AI doet het catalogiseren; mensen blijven in het gesprek en geven de laatste goedkeuring, maar worden daarvóór nooit de bottleneck.
Gemeten met Dekking automatisering
Genoteerd, dank je
8Eén escalatiepadIncidenten bereiken mensen via één escalatiedienst, en alleen als dat moet.
Incidentmanagement stuurt de afgesproken prioriteiten door naar één escalatiedienst. Meerdere overlappende meldingstools kosten geld en zorgen voor verloop. De responder krijgt de bruikbare details; de service-eigenaar krijgt de impact op zijn service en wat de automatisering deed. Een geslaagde automatische oplossing informeert mensen alleen als de organisatie werd geraakt. En een pilot die om de standaardflow heen gaat, moet worden gestopt, niet tot succes worden verklaard.
Genoteerd, dank je
9Bewijs het met een replaySpeel de storing opnieuw af om te bewijzen dat de oplossing werkt voordat die nodig is.
Werk de monitoring of de CMDB bij, veroorzaak het probleem opnieuw of breng het synthetisch terug, en kijk hoe de afgesproken stappen lopen: een runbook lost het op, er wordt toch een incident geopend zodat vastligt wanneer het gebeurde en hoe de automatisering het afhandelde, en de juiste mensen worden geïnformeerd. Er wordt geen echte responder opgeroepen, tenzij de organisatie ook hun reactie wil meten.
Gemeten met Dekking automatisering · Monitoringgaten
- Storing
- Gat gevonden
- Monitoring of oplossing bijgewerkt
- Replay
- Bewezen
Genoteerd, dank je
10Bewijs dat de wacht nog staatElke service-eigenaar kan bewijzen dat zijn monitoring nog werkt.
Monitoring vervalt zonder dat iemand het merkt: makers vertrekken of verschuiven, en de teams die hun monitors erven, hebben niet altijd de tijd of kennis om ze te begrijpen. Daarom is het auditen van monitoring een vaste activiteit waarop elke producteigenaar kan vertrouwen voor één vraag: halen we onze doelen voor beschikbaarheid, functionaliteit en prestaties nog? Een goed gebouwde, goed bewaakte service kan dat laten zien in de normale werking, tijdens blackout- en wijzigingsperiodes, en bij disaster-recovery-oefeningen waaraan de eigenaren meedoen. Storingen in de eventpijplijn zelf horen bij SRE en eerstelijns engineers, en zodra de oorzaak bekend is, wordt de oplossing standaard geautomatiseerd.
Gemeten met Monitoringgaten
Genoteerd, dank je
11Vertrouwen wordt aangetoond, niet geclaimdEen automatische oplossing telt alleen als iets onafhankelijks laat zien dat die werkte.
Bij de meeste monitoring is de eigen herstelmelding van de tool het bewijs: die loopt terug door eventmanagement en sluit het incident. Waar geen herstelsignaal is, zoals bij veel logcontroles, moet de oplossing laten zien dat de fout niet meer in de log verschijnt, of dat een ander bronsysteem weer gezond is: de mislukte salarisworkflow slaagde bij een nieuwe poging en de systemen erna hebben wat ze nodig hebben.
Genoteerd, dank je
12Replays zijn de evals voor AIElke replay is ook een test die je AI-agents moeten halen.
Naarmate AI het bewaken van services overneemt, heeft het de eigen definitie van de organisatie nodig van een geslaagde oplossing. Replays van echte storingen zijn precies dat: tests in de termen van de organisatie, vroeg en vaak gedraaid.
Genoteerd, dank je
13Grenzen horen bij securityJe securityteam bepaalt wat automatisering en AI nooit mogen doen.
AI-agents zijn al gezien buiten de grenzen die ze kregen. Waar een securityteam nog geen eigen richtlijnen heeft, zijn gepubliceerde overheidsrichtlijnen de basis.
Genoteerd, dank je
14Eén meetlatElk bedrijfsonderdeel meet eventmanagement op dezelfde manier.
Dezelfde metrieken en dezelfde verwachtingen, in een vorm die past bij wereldwijd erkende processen. Als één team de cijfers bezit en anderen stilletjes hun eigen maken, is niemand aan iemand verantwoording schuldig.
Genoteerd, dank je
15Sponsorschap bepaalt het plafondEventmanagement is zo goed als de hoogste persoon die er eigenaar van is.
Het bereikt senior bestuurders zelden vanzelf met genoeg urgentie. In een kleinere organisatie is die sponsor makkelijk te vinden. In een grote organisatie win je steun in de breedte en help je het huidige management de zaak urgent te maken, tot iemand hoog genoeg eigenaar wordt van de uitkomst. Keur het risico van automatisering op dat niveau goed, en schaal naar duizend services tegelijk in plaats van team voor team.
Gemeten met Personeel per gehaalde SLA
Genoteerd, dank je
16Begin bij wie al automatiseertVind wie vandaag automatiseert, en geef iedereen wat zij bouwden.
Sommige teams automatiseren hun oplossingen al. Leer hoe zij hun sponsorschap wonnen, werk met hen samen aan de grotere inspanning, en geef hun kant-en-klare processen aan de teams die nog niet automatiseren. Organisaties zijn het in principe eens over automatisering en oneens over hoeveel menselijke betrokkenheid er blijft, dus werkt de gids met de processen die er al zijn.
Genoteerd, dank je
17Plan de mensen vóór de automatisering · Open vraagstukBepaal waar de vrijgekomen tijd naartoe gaat voordat de eerste oplossing wordt geautomatiseerd.
Een team met budget voor drie mensen dat met automatisering door één persoon gedraaid kan worden, heeft een manager die nu twee functies moet verantwoorden. Die wrijving remt de adoptie ongemerkt af. Het beste antwoord dat ik ken: elk automatiseringsproject begint met een plan voor waar de mensen naartoe kunnen, en de besparing betaalt proactieve omscholing naar werk dat omzet oplevert. Ik claim niet dat dit is opgelost.
Gemeten met Personeel per gehaalde SLA
Genoteerd, dank je
Eén meetlat
Acht hoofdmetrieken, in elk bedrijfsonderdeel dezelfde.
Voorbeeldomgeving. Gemiddelde tijd tot bevestiging, detectie en oplossing worden nog steeds bijgehouden, als ondersteunende maten.
Waar elke richtlijn in ITIL zit
Voor engineers met een ITIL-achtergrond: de activiteiten van eventmanagement, en de richtlijnen die bij elke activiteit horen.
Opgesteld vanuit de gepubliceerde ITIL-praktijk; wordt nog beoordeeld.
Weet waar je staat vóór de volgende storm.
Dertig minuten, gratis en concreet. We kijken naar je omgeving en ik zeg je eerlijk of ik de juiste loods ben.
Koers uitzetten: plan een gesprek van 30 minuten