Artikler · Data og ansvar · 4 min. læsning
Datakvalitet før automatisering og AI: fem tjek, I kan lave i dag
Automatisering og AI gør jeres data hurtigere at bruge. Det gør også fejlene i dem hurtigere at sprede.
Af Martin Egesø · Udgivet
Kort svar
Datakvalitet er, om jeres data er fuldstændige, ensartede, aktuelle, uden dubletter og har en ejer. Tjek de fem punkter på 50 til 100 poster, før I automatiserer eller bruger AI. Dårlige data gør, at systemet gentager fejlene hurtigere, end I kan rette dem, og en AI kan svare sikkert på noget forkert.
I artiklen 8 afsnit
Det vigtigste
- Dårlige data gør, at automatisering og AI gentager fejlene hurtigere, end I kan rette dem.
- Fem tjek: fuldstændighed, ensartethed, aktualitet, dubletter og ejerskab.
- Tjek 50 til 100 poster, ikke hele databasen.
- Ret kun de felter, løsningen faktisk bruger.
Hvad er datakvalitet?
Datakvalitet er, om de oplysninger, I har i jeres systemer, er gode nok til det, I vil bruge dem til. Det handler ikke om, at alt skal være perfekt, men om, at de felter, en automatisering eller en AI skal bruge, er rigtige. Er det personoplysninger, gælder der også regler om rigtighed. Det er et juridisk spørgsmål, og jeg giver ikke juridisk rådgivning.
Datakvalitet er trin 3 i fem tegn på, at en arbejdsgang egner sig: Data skal findes digitalt og være i orden.
Fem tjek før I automatiserer
Modellen hedder Fem tjek før I automatiserer. Den er min egen tjekliste, ikke en standard. Tabellen viser tjekkene og en tænkt fejl for hvert.
| Tjek | Spørgsmålet | Et tænkt eksempel på en fejl |
|---|---|---|
| 1. Fuldstændighed | Mangler der oplysninger? | Kunder uden telefonnummer eller e-mail |
| 2. Ensartethed | Er det samme skrevet på samme måde? | "Firma A/S", "Firma AS" og "firma a/s" |
| 3. Aktualitet | Er oplysningerne stadig rigtige? | En kontaktperson, der er stoppet for to år siden |
| 4. Dubletter | Findes den samme post flere gange? | Samme kunde oprettet to gange med forskellig adresse |
| 5. Ejerskab | Hvem må rette, og hvem er ansvarlig? | Ingen ved, hvem der kan rette kundelisten |
Det femte tjek er ofte det vigtigste. Uden en ejer bliver dataene rettet af dem, der opdager fejlen, og ofte på forskellige måder. Se hvem der ejer systemet.
Sådan laver I et lille stikprøvetjek
Et tænkt eksempel
I vil bruge kundelisten til at sende automatiske ordrebekræftelser. Et stikprøvetjek af 50 kunder viser, at nogle mangler e-mail, og at flere kunder står to gange. Hvis I automatiserer nu, får nogle kunder to bekræftelser og andre ingen. Alle detaljer er tænkte.
Gør sådan: Tag 50 til 100 poster fra det system, I vil bruge. Gennemgå de felter, løsningen skal bruge, og tæl, hvor mange der har en fejl. Skriv ned, hvilke typer fejl I finder. Det er en stikprøve, ikke en revision, og den giver et billede af, hvor meget der skal rettes.
Hvad gør I med resultatet?
Resultatet kan føre til tre svar:
- Dataene er gode nok. Gå videre med en beskrivelse af behovet.
- Nogle felter skal rettes. Ret de felter, løsningen bruger, og aftal, hvem der holder dem rene fremover.
- Dataene er ikke brugbare. Vent med automatiseringen, og find ud af, hvordan dataene kan komme i orden, eller om en anden arbejdsgang er bedre at starte med.
Vælg ikke at rette alt. Ret det, løsningen skal bruge. Er systemerne ikke koblet endnu, så læs hvornår en integration giver mening.
Hvad sker der, hvis I ikke tjekker?
Hvis I automatiserer på dårlige data, sker fejlene hurtigere og flere gange: forkerte mails, dobbelte ordrer, manglende opfølgning. Fejlene bliver sværere at finde, fordi de sker i et system og ikke i en person. Med AI kommer en ekstra risiko: Svaret kan lyde sikkert, selvom det bygger på forkerte oplysninger. Se også hvad I skal vide, når I bruger AI til at udvikle systemer.
Hvordan kan jeg hjælpe?
Dataene er en del af at forstå processen. Jeg kigger på, hvilke data løsningen skal bruge, og hvor kvaliteten er god nok, før jeg bygger. Se mine systemer og løsninger. Jeg giver ikke juridisk rådgivning og garanterer ikke compliance.
Hvad kan I gøre nu?
Gør dette:
- Vælg den arbejdsgang, I vil automatisere, og find de felter, den bruger.
- Tag 50 til 100 poster og gennemgå dem efter de fem tjek.
- Skriv ned, hvilke fejl der er hyppigst.
- Udpeg en ejer, der må rette og holder dataene rene.
Kort sagt: Tjek dataene, før I bygger. Det er billigere at rette en liste end at rette de fejl, en automatisering har spredt.
Ofte stillede spørgsmål
Hvorfor er datakvalitet vigtig før AI?
Fordi AI og automatisering arbejder på det, de får. Er data ufuldstændige, forældede eller dobbelte, gentager systemet fejlene hurtigere, end I kan rette dem. En AI kan desuden svare sikkert på noget, der er forkert.
Hvad er dårlige data?
Data, hvor oplysninger mangler, er skrevet forskelligt, er forældede eller findes flere gange. Et eksempel er det samme firma med tre forskellige stavemåder og to adresser.
Hvordan tjekker jeg datakvaliteten?
Tag 50 til 100 poster fra det system, I vil bruge, og tæl, hvor mange der er fuldstændige, ensartede, aktuelle og entydige. Spørg også, hvem der ejer dataene, og hvem der må rette dem.
Skal alle data være perfekte?
Nej. De skal være gode nok til den arbejdsgang, I vil automatisere. Start med de felter, løsningen faktisk bruger, og ret dem. Resten kan vente.
Artiklen er generel vejledning og ikke juridisk rådgivning. Udgivet .