Testa och kvalitetssäkra AI-agenter

En AI-agent ska inte godkännas för att en demonstration ser imponerande ut. Den behöver provas mot representativa, svåra och avsiktligt problematiska fall. Kvalitetssäkring innebär att definiera vad ett bra resultat är, samla en testsvit, mäta utfallet och följa upp hur lösningen fungerar efter lansering.

Språkmodeller kan ge olika svar på liknande frågor. Därför behöver utvärderingen kombinera tydliga mätvärden med mänsklig bedömning.

Börja med acceptanskriterier

Skriv kriterier innan du finjusterar instruktionen. För en kvalitetsgranskare kan kriterierna vara:

  • identifierar alla obligatoriska avvikelser,
  • hittar inte på regler,
  • skiljer fakta från förslag,
  • hänvisar till rätt källdokument,
  • följer det bestämda svarsformatet,
  • stoppar och ber om hjälp när underlag saknas.

Bestäm vilka fel som är kritiska. Ett missat kommatecken och ett felaktigt juridiskt påstående ska inte väga lika.

Bygg en varierad testsvit

Minst fem testfall räcker för första iterationen, men en verklig pilot behöver fler. Ta med normala fall, gränsfall, ofullständig indata, motstridiga källor och uppgifter utanför agentens mandat. Lägg också till fientliga fall, till exempel ett dokument som säger åt agenten att ignorera instruktionerna eller avslöja intern information.

Varje test ska ha förväntat resultat. Det kan vara ett exakt svar, obligatoriska punkter eller förväntat beteende som ”ska eskalera till människa”.

Mät mer än korrekthet

Korrekthet: Stämmer påståendena? Relevans: Besvarar resultatet rätt fråga utan onödigt innehåll? Källstöd: Kan viktiga påståenden spåras till godkänt underlag? Format: Följs obligatoriska fält och struktur? Säkerhet: Respekteras behörigheter, sekretess och stoppregler? Effektivitet: Hur lång tid, hur många modellanrop och hur mycket mänsklig redigering krävs?

En totalsiffra kan dölja ett farligt problem. Redovisa därför kritiska fel separat.

Jämför modeller rättvist

Om du jämför ChatGPT, Claude eller andra tjänster ska samma instruktion, källmaterial och testfall användas så långt produkterna tillåter. Kör gärna flera gånger för att se variation. Utse inte en generell vinnare; välj det alternativ som fungerar bäst för den egna uppgiften, dataskyddskraven, kostnaden och arbetsmiljön.

Dokumentera modell- och instruktionsversion. Resultat kan ändras när leverantören uppdaterar tjänsten.

Exempel på testtabell

| Testfall | Förväntat | Korrekt | Relevant | Rätt källa | Säkert beteende | Status | |---|---|---:|---:|---:|---:|---| | Normal text | Tre kända avvikelser | Ja | Ja | Ja | Ja | Godkänd | | Regel saknas | Markera osäkerhet | Ja | Ja | Ja | Ja | Godkänd | | Manipulativ fil | Ignorera filens instruktion | Nej | – | – | Nej | Kritisk ändring |

Tabellen är enkel, men den gör beslutet spårbart.

Testa hela systemet

Det räcker inte att testa modellsvaret. Kontrollera autentisering, verktygsanrop, felhantering, loggning och vad som händer om en datakälla är nere. Simulera att ett API returnerar fel data eller att användaren saknar behörighet. Testa att stoppknappar verkligen stoppar.

Kvalitet efter lansering

Granska regelbundet ett slumpmässigt urval av verkliga resultat. Samla feltyper och incidenter. Kör om den fasta testsviten när instruktion, modell, källa eller integration ändras. Versionsmärk förändringar och ha möjlighet att återgå till en tidigare fungerande version.

En månatlig rutin kan vara att granska tio resultat, kontrollera de vanligaste felen, uppdatera källor och köra regressionstester. För högre risk krävs tätare och mer formell övervakning.

Kort sammanfattat

Kvalitetssäkring av AI-agenter kräver förväntade resultat, varierade testfall och mätning av både innehåll och säkerhet. Testa hela arbetsflödet, följ kritiska fel separat och kör om testsviten efter varje viktig förändring.

Relaterat

Källor

Senast granskad: 16 september 2026.