Augmentarea datelor este o tehnică de îmbogățire artificială a unui set de datedate de antrenament prin generarea de variații ale exemplelor existente, fără a colecta date noi din lumea reală. Scopul este de a crește diversitatea și volumul datelor disponibile, ajutând modelul de învățare automată să generalizeze mai bine și să evite supraadaptarea (overfitting) la particularitățile unui set limitat de exemple.
Pentru imagini, tehnicile comune includ rotația, oglindirea, decuparea, ajustarea luminozității sau contrastului, adăugarea de zgomot și schimbarea perspectivei — toate acestea produc variații plauzibile ale aceleiași imagini originale, învățând modelul să recunoască un obiect indiferent de unghi, iluminare sau poziționare.
Pentru text, augmentarea poate include înlocuirea sinonimelor, parafrazarea propozițiilor, traducerea inversă (traducerea într-o altă limbă și înapoi, pentru a genera formulări alternative ale aceluiași sens) sau inserarea/eliminarea aleatorie de cuvinte.
Augmentarea datelor este deosebit de valoroasă atunci când colectarea de date reale suplimentare este costisitoare, lentă sau imposibilă — de exemplu, în diagnosticarea medicală, unde imaginile radiologice pentru boli rare sunt limitate. Un caz special este augmentarea sintetică generativă, unde modele AI (precum GAN-urile) creează exemple complet noi, statistic similare cu datele reale, pentru a suplimenta seturile de antrenament în domenii cu date insuficiente.
