Hold AI stabil og håndtér fejl i drift
En AI-løsning i drift skal have en ansvarlig, mål for service og kvalitet samt en afprøvet vej til at stoppe, overtage og genoprette. Overvåg både teknik og forretningsresultat. En tjeneste kan være tilgængelig og samtidig give forkerte svar eller udføre den forkerte handling.
Driftsansvaret begynder, når rigtige brugere bliver afhængige af løsningen. Det kan ikke vente til en stor udrulning. En MVP behøver ikke samme beredskab som en kritisk platform, men brugerne skal vide, hvor de får hjælp, og hvad de gør, når AI ikke kan bruges.
Microsofts designprincipper beskriver AI-drift som en fortsat opgave med blandt andet fejlhåndtering og ændringer. [1] Denne artikel omsætter det til en ramme for en SMV. Systemmodenhed klar til agentisk AI (AI-03-001) forklarer det tekniske grundlag, og Beslut hvornår en AI løsning skal skaleres (Q26) beslutningen om skalering.
Udpeg en ejer for hele forløbet
Fordel ansvar for modeltjeneste, applikation, datakilder, integrationer og faglig kvalitet. En ekstern partner kan drive teknikken, mens virksomheden ejer proces og data. Der skal være en tydelig kontakt, som kan samle arbejdet, når fejlen går på tværs.
Skriv en kort driftsbeskrivelse: Hvilke opgaver understøttes? Hvornår skal løsningen være tilgængelig? Hvilke fejl kræver hurtig reaktion? Hvem er stedfortræder? En kontaktliste uden beslutningsmandat er utilstrækkelig, hvis ingen kan begrænse en risikabel funktion.
Aftal en manuel vej. Den kan være langsommere, men skal kunne håndtere de vigtigste opgaver i en passende periode. En løsning, der erstatter hele den gamle proces, kræver en stærkere plan for afbrydelser end en frivillig skriveassistent.
Overvåg det brugerne faktisk har behov for
| Område | Eksempel på observation | Relevant reaktion |
|---|---|---|
| Teknik | Fejl, svartid og kapacitet | Begræns brug eller ret forbindelsen |
| Data | Forældet kilde eller mislykket import | Afvis berørte opslag og ret grundlaget |
| Kvalitet | Flere faktuelle fejl eller rettelser | Undersøg version og afgræns anvendelsen |
| Handlinger | Forkerte eller uafklarede resultater | Stop handling og overtag sagen |
| Økonomi | Stigende forbrug pr. brugbar opgave | Find gentagelser og ændr rammer |
Vælg få alarmer, som nogen kan handle på. Mange beskeder uden tydelig konsekvens bliver let ignoreret. Adskil almindelig variation fra fejl, der kræver stop. Vurdér kvaliteten af AI svar og handlinger (Q24) beskriver kvalitet, og Budgettér hele omkostningen ved AI (Q06) omkostning pr. brugbart resultat.
Logs skal være tilstrækkelige til at undersøge fejl, men må ikke ukritisk gemme alle samtaler og personoplysninger. Afklar adgang og opbevaring. Registrér model, kilder, værktøjer og relevante hændelser, så ændringer i adfærd kan forklares.
Håndtér fejl efter deres type
Midlertidige tekniske fejl kan nogle gange gentages. Microsofts retry-vejledning understreger behovet for kontrollerede forsøg og hensyn til operationens virkning. [2] En afvist forretningsregel skal ikke løses ved blot at prøve igen. En ukendt handlingsstatus skal undersøges, før en ny handling oprettes.
Begræns antal forsøg, ventetid og forbrug. Brug operations-ID’er, så en gentagelse ikke skaber dobbelt virkning. Ved vedvarende fejl kan systemet midlertidigt standse kald og lade en ansvarlig overtage. Forbind AI med virksomhedens eksisterende systemer (Q15) beskriver disse integrationskrav.
Ved mistanke om sikkerhedsbrud skal virksomheden begrænse skaden og aktivere de relevante ansvarlige. NISTs materiale til små virksomheder omfatter hændelseshåndtering og gendannelse. [3] Datasikkerhed fra regler til daglig praksis (AI-11-001) beskriver, hvornår særskilte anmeldelsespligter kan være relevante. En teknisk fejl og et persondatasikkerhedsbrud skal ikke behandles som samme kategori uden undersøgelse.
Gennemfør ændringer kontrolleret
Model, instruktioner, kilder og integrationer kan ændre resultatet. Registrér en version af den samlede opsætning og test de relevante opgaver før frigivelse. En ændring, som forbedrer standardsvar, kan samtidig forringe sjældne undtagelser.
Anthropic beskriver evaluering og menneskelig kontrol som dele af en vedvarende kvalitetspraksis. [4] Brug derfor driftserfaringer til nye testtilfælde, men bevar et uafhængigt grundlag for at kontrollere forbedringen. En høj tilfredshedsscore alene er utilstrækkelig.
Udrul væsentlige ændringer til en begrænset gruppe først, når det er praktisk. Hav en kendt tidligere opsætning eller en anden sikker begrænsning, hvis resultatet forringes. En tilbagevenden skal også tage hensyn til ændrede data og handlinger, som allerede er udført.
Et eksempel med en fejl efter en kildeopdatering
Serviceassistenten i dette eksempel begynder at give forkerte svar om returfrister. Overvågningen viser flere rettelser. Teamet undersøger den seneste import og finder, at en gammel politik igen er blevet markeret som aktiv.
Den ansvarlige begrænser svar på det berørte emne, retter kildestatus og kontrollerer søgeindekset. Teamet vurderer, hvilke svar der kan have påvirket kunder, og følger op efter virksomhedens proces. Et nyt testtilfælde skal opdage samme versionskonflikt fremover.
Fejlen løses ikke ved blot at bede modellen være mere præcis. Den ligger i kildens livscyklus. Brug virksomhedens viden med RAG (Q14) beskriver dette ansvar, og Beskyt fortrolige oplysninger når I bruger AI (Q16) kontrollen med adgang og afledte kopier.
Budgettér den fortsatte opgave
Eksperimentet skal afdække de vigtigste driftsforudsætninger. MVP’en får hjælp, fejlvej og en afprøvet overtagelse. Skalering kræver kapacitet til vedligeholdelse, overvågning og genopretning. Afsæt tid til både kendte driftsopgaver og usikkerhed om nye fejltyper.
Skab en varig praksis for læring og drift (A10) sammenligner med agile transformationers læring om løbende forbedring. Et projekt kan afsluttes, mens ansvaret for løsningen fortsætter.
Næste ledelsesbeslutning: Navngiv driftsansvarlig og stedfortræder, fastlæg kritiske alarmer og gennemfør én realistisk fejløvelse. Kontrollér, at nogen kan stoppe løsningen og få den vigtigste arbejdsgang videre uden AI.
Kundeeksempel med mål og opfølgning
En serviceassistent kan miste nytte efter en opdatering af returregler. Følg genåbnede sager, rettelser og tid til løsning, og behold mulighed for at begrænse brugen. Genindlæsning er først færdig, når den korrekte version kan findes og den gamle er fjernet fra aktiv søgning.
Beredskabseksemplets risikoreduktion på 140.000 kr. årligt er et forventningsestimat. Tests af gendannelse og faktisk hændelseshåndtering giver evidens om beredskabet; fravær af fejl i en kort periode beviser ikke hele beløbet.
Brug den samlede VP/SE-model, VP-vejledningen og SE-vejledningen. Begge estimater revurderes før Hypotese, MVP og Skalering. VP/SE er et lokalt præferenceindeks, ikke økonomisk ROI eller WSJF. Lær anvendelsen på halvdag 1 om VP og halvdag 2 om SE og prioritering, hver fire timer inklusive pause.
Kilder og videre læsning
Eksempler og handlingsforslag er EnableAIs faglige vurdering. Virksomhedseksempler og regnetal er illustrative. Artiklen er opdateret med konkrete regneeksempler og henvisninger den 15. september 2026.
[1] Microsoft · Design principles for AI workloads