Gør kvalitet og sikkerhed til en del af leverancen

Aftal tidligt, hvad der skal være dokumenteret, før en AI-leverance må bruges. Teknisk funktion er kun én del af kvaliteten. Faglig korrekthed, databeskyttelse, adgang, menneskelig kontrol og drift skal vurderes i forhold til den konkrete opgave og dens konsekvens.

Scrum Guide beskriver en fælles Definition of Done som grundlag for gennemsigtighed om en færdig leverance. [1] Den læring kan bruges i AI-arbejde: krav til kvalitet skal indgå i planlægning og gennemførelse, så de ikke først opdages ved afslutningen.

En checkliste kan dog ikke love fejlfri AI. Den skal beskrive nødvendig dokumentation, acceptable begrænsninger og den ansvarlige beslutning om brug. Vurdér kvaliteten af AI svar og handlinger (Q24) uddyber kvalitetsvurdering, og Datasikkerhed fra regler til daglig praksis (AI-11-001) beskriver datasikkerhedens grundlag.

Gør kravene konkrete for anvendelsen

Et internt idéudkast og en agent, som ændrer kundeordrer, kræver forskellige kontroller. Beskriv, hvem der påvirkes af fejl, hvor let en handling kan rettes, og hvilken hjælp brugeren har. Ud fra det fastlægges vurdering, godkendelse og drift.

Kvalitetskrav skal omfatte både gode svar og korrekt afståelse. Løsningen skal kunne sige, at kilden mangler, adgang er afvist eller opgaven ligger uden for mandatet. Et system, som altid producerer et svar, kan være mindre sikkert end et system med tydelige begrænsninger.

Agile principper fremhæver teknisk kvalitet som støtte til tilpasning. [2] I AI omfatter det også et vedligeholdt evalueringsgrundlag. Uden det bliver det vanskeligt at vide, om en ændring forbedrer løsningen eller flytter fejl til andre opgaver.

Udvid den fælles forståelse af færdig

KvalitetsområdeAgil leverancepraksisAI tilføjelse
FunktionDen aftalte funktion virkerSvar og handlinger vurderes på realistiske opgaver
TestFejl og ændringer kan opdagesVariation, manglende viden og skadelige input indgår
SikkerhedAdgang og beskyttelse er afklaretKilder, modelkontekst og værktøjsmandat kontrolleres
OverdragelseBrug og vedligeholdelse er muligEvaluering, menneskelig overtagelse og modelændring er dækket

Sikkerhed og test er også en del af almindelig softwareudvikling. AI-tilføjelsen ligger i de nye fejlveje og i samspillet mellem model, data og handlinger. Tabellen er en praktisk tilpasning, ikke en fuldstændig kontrolstandard.

Kombinér faglig vurdering og tekniske kontroller

Brug realistiske opgaver med forventede kriterier for et brugbart resultat. Lad fagpersoner vurdere fejl, som kræver domæneviden. Automatisér de kontroller, der kan gentages pålideligt, eksempelvis tilladte værktøjer, obligatoriske felter og adgang til kilder.

Anthropics evalueringsvejledning beskriver, hvordan flere vurderingsformer kan indgå. [3] Hvis en model bruges som bedømmer, skal dens vurdering kalibreres mod mennesker og kontrolleres for systematiske fejl. Én samlet score bør ikke skjule en kritisk fejltype.

Hold et særskilt blik på manipulation gennem indhold. En tekst fra et dokument eller en ekstern side kan forsøge at påvirke agentens adfærd. OWASP beskriver agentrelaterede risici, herunder misbrug af værktøjer og mandat. [4] Beskyttelsen skal også ligge i systemets adgang og validering, ikke kun i instruktioner til modellen.

Et eksempel hvor en god demonstration ikke er færdig

Agenten i dette eksempel udarbejder leverandørhenvendelser og foreslår ændrede leveringsdatoer. Demonstrationen fungerer på fem pæne eksempler. Før brug gennemgår teamet også modstridende mails, manglende ordredata, ukendte leverandører og forsøg på at ændre agentens instruktioner.

Afprøvningen viser, at agenten kan foreslå en ændring på den forkerte ordre. Teamet indfører entydig identifikation, afgrænser værktøjsadgangen og kræver godkendelse før ændring. Et nyt testtilfælde skal opdage samme fejl efter kommende opdateringer.

Leverancen var teknisk mulig før disse ændringer, men endnu ikke tilstrækkeligt dokumenteret til det ønskede mandat. Fastlæg menneskelig kontrol med AI agenter (Q25) forklarer forholdet mellem konsekvens og menneskelig kontrol.

Tilpas dokumentationen til de tre stadier

Eksperimentet skal have sikre rammer og kunne give et troværdigt svar på hypotesen. En MVP skal også have brugbare begrænsninger, support og kontrol i den virkelige proces. Skalering kræver en vedligeholdt kvalitetspraksis, tydelige ejere og afprøvet håndtering af væsentlige fejl.

Inddrag relevante juridiske og sikkerhedsmæssige kompetencer, når anvendelsen kræver det. Brug personoplysninger lovligt i AI (Q17) og Afklar hvilke AI regler virksomheden skal følge (Q18) beskriver persondata og AI-regler. Et bestået teknisk testsæt er ikke dokumentation for lovlig behandling eller opfyldelse af alle reguleringskrav.

Gør kontrollen til en del af teamets kapacitet. Hvis kvalitet altid finansieres som en uventet ekstraopgave, bliver estimater og planer systematisk for optimistiske. Dokumentér kendt kontrolarbejde og væsentlig usikkerhed allerede ved næste investering.

Næste ledelsesbeslutning: Aftal en kort, opgavespecifik definition af færdig for den næste MVP. Angiv nødvendige test, data- og adgangsrammer, menneskelig kontrol og den person, der accepterer de resterende begrænsninger.

Kundeeksempel med mål og opfølgning

Rekrutteringsfirmaet forventer at gå fra 40 til 20 minutter pr. kandidatpræsentation. Aftal på forhånd højst 25 minutter inklusive kontrol og ingen væsentlige faktuelle fejl på de udvalgte testopgaver.

Et eksempelresultat på 35 minutter og for mange rettelser opfylder ikke kriteriet, selv om udkastet fremstår overbevisende. Testens størrelse på 30 opgaver er et afgrænset beslutningsgrundlag, ikke garanti for alle senere anvendelser. Afgræns eller ret løsningen før næste investering.

Brug den samlede VP/SE-model, VP-vejledningen og SE-vejledningen. Begge estimater revurderes før Hypotese, MVP og Skalering. VP/SE er et lokalt præferenceindeks, ikke økonomisk ROI eller WSJF. Lær anvendelsen på halvdag 1 om VP og halvdag 2 om SE og prioritering, hver fire timer inklusive pause.

Kilder og videre læsning

Eksempler og handlingsforslag er EnableAIs faglige vurdering. Virksomhedseksempler og regnetal er illustrative. Artiklen er opdateret med konkrete regneeksempler og henvisninger den 15. september 2026.

[1] Schwaber og Sutherland · Scrum Guide 2020

[2] Principperne bag Det Agile Manifest

[3] Anthropic · Demystifying evals for AI agents

[4] OWASP · AI Agent Security