Az adattisztítás az a fázis, ahol a mérnök azonosítja és korrigálja az adathalmazban található hibákat, következetlenségeket és zajt. Fontos megérteni, hogy a hibás bemeneti adatok ("Garbage In, Garbage Out" elv) elkerülhetetlenül hibás predikciókhoz vezetnek, függetlenül attól, mennyire komplex a választott algoritmus. A folyamat első lépése a duplikációk és irreleváns megfigyelések eltávolítása, amelyek feleslegesen növelnék a számítási kapacitást.
A leggyakoribb tisztítási műveletek:
- 01. Hiányzó értékek kezelése: Dönthetünk az adatsor törlése mellett, vagy alkalmazhatunk imputációs technikákat (átlag, medián vagy módusz behelyettesítése).
- 02. Kiugró értékek (Outliers) szűrése: A mérési hibákból vagy extrém esetekből fakadó adatok torzíthatják a modell általánosító képességét, ezért statisztikai módszerekkel (pl. Z-score) kezelni kell őket.
- 03. Adattípusok kényszerítése: Biztosítani kell, hogy a numerikus mezők valóban számként, a dátumok pedig időbélyegként szerepeljenek a rendszerben.
"Az adatok tisztasága nem esztétikai kérdés, hanem a matematikai integritás záloga. Egyetlen hibás tizedesvessző képes tönkretenni egy több millió paraméteres neurális hálózat gradiens süllyedését."