Vurdér kvaliteten af AI svar og handlinger
Definér kvalitet for den konkrete opgave og mål den på repræsentative eksempler. Kontrollér både det faglige resultat og det systemforløb, der skaber det. Et velformuleret svar, en kildehenvisning eller modellens egen sikkerhed er ikke alene dokumentation for korrekthed.
En hallucination er her et svar, der fremsætter oplysninger uden et tilstrækkeligt korrekt grundlag. Problemet kan opstå, fordi modellen mangler viden, bruger den forkert eller forsøger at udfylde et hul. I en samlet løsning kan fejl også skyldes kilden, søgningen, værktøjet eller brugerens uklare spørgsmål.
Ledelsen skal vide, hvilke fejl der er acceptable, hvilke der kræver kontrol, og hvilke der blokerer brugen. Det kan ikke afgøres med én generel kvalitetsprocent. Et forkert komma og en forkert betalingsmodtager har forskellig betydning.
Definér et brugbart resultat
Beskriv korrekthed, relevans, dækning og anvendelighed. Et svar kan være faktuelt korrekt og stadig undlade den undtagelse, brugeren har brug for. Det kan også være så uklart, at medarbejderen bruger det forkert. Involvér de fagpersoner, der kender konsekvenserne.
For handlinger skal kvaliteten vurderes i det system, hvor resultatet registreres. Hvis agenten siger, at den har ændret en ordre, skal ordren kontrolleres. OWASP beskriver risici ved værktøjer og agenthandlinger. [4] En vellykket modelbesked er derfor et utilstrækkeligt slutkriterium.
| Fejlområde | Hvad I undersøger | Typisk forbedring |
|---|---|---|
| Kilde | Er informationen korrekt og aktuel | Ret original og gyldighed |
| Søgning | Findes det relevante grundlag | Forbedr metadata, opdeling eller rangering |
| Svar | Understøttes konklusionen af materialet | Justér instruktion og svarform |
| Handling | Er korrekt ændring faktisk gennemført | Styrk validering og systemkontrol |
| Brugerforløb | Forstår brugeren grænser og næste skridt | Forbedr visning, træning og overtagelse |
Denne opdeling gør det lettere at investere rigtigt. En større model løser ikke nødvendigvis forældede kilder eller et forkert kunde-ID. Brug virksomhedens viden med RAG (Q14) beskriver RAG-kæden, og Fastlæg menneskelig kontrol med AI agenter (Q25) kontrollen med handlinger.
Byg et testsæt fra virkelige opgaver
Saml almindelige opgaver, vanskelige undtagelser og spørgsmål uden dækning. Registrér forventede kilder og de forhold, et godt svar skal indeholde. Brug egnede data og beskyt personoplysninger. Et testsæt er selv en datakilde med behov for adgang og vedligeholdelse.
Hold et udvalg tilbage til uafhængig slutmåling. Tilføj nye fejl fra drift til udviklingstests, men bevar en måde at vurdere, om løsningen generaliserer til andre opgaver. Anthropic beskriver betydningen af evalueringsgrundlag og kombinationen af bedømmelsesmetoder. [1]
Gentag udvalgte opgaver, når variationen i svar eller handlingsforløb er vigtig. Registrér model, instruktioner, kilder og værktøjsversioner. Hvis resultatet ændres, skal I kunne undersøge hvorfor. Et lille testsæt kan afsløre problemer, men giver ikke garanti for en ekstremt lav fejlrate i fremtidig drift.
Kombinér regler og faglig vurdering
Automatiske kontroller er velegnede til eksempelvis talformater, obligatoriske felter, tilladte handlinger og kendte forventede resultater. Faglig vurdering er nødvendig, når svaret kræver forståelse af kontekst eller skøn. En model kan hjælpe med vurderingen, men skal kalibreres mod mennesker.
Lad to fagpersoner bedømme et fælles udsnit og afklare uenigheder. Det kan afsløre, at kvalitetskriterierne er uklare. Mål både kritiske fejl og den samlede anvendelighed. Hvis løsningen afviser alt, kan den være forsigtig, men den skaber næppe den forventede nytte.
Ved RAG skal kilderne faktisk støtte de centrale påstande. Microsoft beskriver RAG som en kombination af genfinding og generering. [2] Den kombination gør sporbarhed mulig, men det er stadig nødvendigt at kontrollere, om den fundne information er den rigtige, og om den bruges korrekt.
Aftal grænser før en ny version frigives
Vælg få, konkrete krav til den valgte anvendelse. Det kan være ingen observerede uautoriserede handlinger i det aftalte sikkerhedstestsæt, en bestemt grad af faglig korrekthed og en maksimal kontrolindsats. Angiv antal og typer af tests, så nul observerede fejl ikke forveksles med nul risiko.
NISTs Playbook kan støtte arbejdet med måling og risikohåndtering. [3] Vores anbefaling er at knytte alvorlige fejl til klare handlinger: stop, begræns anvendelsen eller kræv ekstra kontrol. Et godt gennemsnit bør ikke ophæve en kritisk adgangsfejl.
Et eksempel med en dokumentassistent
Virksomheden i dette eksempel tester 50 spørgsmål til produktvejledninger. De fleste svar er korrekte, men to blander produktversioner. Teamet opdager, at søgningen finder relevante dokumenter, men ikke filtrerer på den nødvendige version.
Forbedringen bliver derfor tydeligere metadata, præcisering af spørgsmålet og test af versionskonflikter. Teamet gentager målingen på et tilbageholdt udvalg og undersøger, om hjælpen stadig sparer tid inklusive kontrol. Tallene er et eksempel på testdesign, ikke et foreskrevet minimum.
Følg kvaliteten efter ibrugtagning
Eksperimentet afklarer fejltyper og målemetode. MVP’en viser kvalitet i rigtig brug. Ved skalering gentages relevante tests før ændringer, og driftsfejl undersøges løbende. Hold AI stabil og håndtér fejl i drift (Q27) beskriver denne praksis, og Gør kvalitet og sikkerhed til en del af leverancen (A08) sammenligner med agile kvalitetskrav.
Næste ledelsesbeslutning: Godkend et repræsentativt testsæt, kritiske fejltyper og en ansvarlig faglig bedømmer. Lad kvalitet, anvendelse og kontrolindsats afgøre næste trin sammen med værdimålingen i Mål om AI skaber reel værdi (Q09).
Kundeeksempel med mål og opfølgning
En serviceassistent testes både på standardsager, særlige aftaler og spørgsmål uden tilstrækkeligt kildegrundlag. Mål korrekthed, korrekt afståelse og efterarbejde sammen med tidsmålet fra 12 til 9 minutter pr. sag.
Hvis modellen svarer hurtigere, men flere sager må genåbnes, tælles genarbejdet med. Kvalitetskrav fastlægges før testen. Resultater fordeles på sagstyper, så et godt gennemsnit ikke skjuler en uegnet eller risikabel anvendelse.
Brug den samlede VP/SE-model, VP-vejledningen og SE-vejledningen. Begge estimater revurderes før Hypotese, MVP og Skalering. VP/SE er et lokalt præferenceindeks, ikke økonomisk ROI eller WSJF. Lær anvendelsen på halvdag 1 om VP og halvdag 2 om SE og prioritering, hver fire timer inklusive pause.
Kilder og videre læsning
Eksempler og handlingsforslag er EnableAIs faglige vurdering. Virksomhedseksempler og regnetal er illustrative. Artiklen er opdateret med konkrete regneeksempler og henvisninger den 15. september 2026.
[1] Anthropic · Demystifying evals for AI agents