Kvalita výstupného modelu strojového učenia je priamo závislá od čistoty vstupných dát. V laboratórnych podmienkach Matrixco sme definovali prísny protokol, ktorý eliminuje anomálie, chýbajúce hodnoty a duplicitu ešte pred samotným procesom trénovania. Tento krok je kritický, pretože surové dáta často obsahujú až 30 % irelevantných informácií alebo systémového šumu, ktorý by mohol viesť k nesprávnej generalizácii modelu.
Náš proces začína identifikáciou odľahlých hodnôt (outliers) pomocou štatistických metód, ako je Z-skóre alebo metóda interkvartilového rozpätia (IQR). Tieto anomálie sú následne buď odstránené, alebo nahradené syntetickými hodnotami na základe kontextuálnej analýzy. Správna manipulácia s chýbajúcimi dátami vyžaduje nasadenie imputerov, ktoré využívajú medián alebo k-najbližších susedov (k-NN) na zachovanie štatistickej distribúcie pôvodného súboru.
Kľúčové fázy čistenia:
- → Detekcia a filtrácia technických artefaktov v signáloch.
- → Odstránenie multikolinearity medzi premennými.
- → Korekcia chýb v kódovaní kategórií.
- → Odstránenie časovo nekonzistentných záznamov.