Syntetiske data er datapunkter en maskin har generert for å ligne på ekte data. Mønstrene, fordelingene og sammenhengene bevares, men ingen rad handler om en virkelig kunde, pasient eller ansatt.
De brukes særlig i to situasjoner. Når ekte data er for sensitive til å deles, for eksempel personopplysninger. Og når det finnes for lite ekte materiale til å trene eller teste et system skikkelig. Da kan man lage tusenvis av realistiske eksempler i stedet, gjerne med utgangspunkt i mønstrene fra ekte treningsdata.
Kvaliteten avhenger av at de syntetiske dataene faktisk speiler virkeligheten. Lages de slurvete, arver de skjevheter fra kildematerialet eller mister mønstrene som betyr noe, og da blir alt som bygges på dem tilsvarende dårlig.
Hvorfor det betyr noe for din bedrift
Syntetiske data lar deg teste og utvikle uten å sette kundenes personopplysninger i spill. Det senker terskelen for å prøve ut nye systemer, gjør personvernvurderingene enklere og gir deg treningsmateriale der det ekte er for tynt. For mindre bedrifter er det ofte forskjellen på å kunne prøve noe og å måtte la være.