Un Data Lake (lac de date) este un repozitoriu centralizat de stocare care păstrează cantități masive de date brute, în formatul lor original — structurat, semi-structurat sau complet nestructurat — fără a impune o schemă predefinită rigidă la momentul stocării, spre deosebire de o bază de date tradițională, care necesită definirea structurii datelor înainte ca acestea să poată fi introduse.
Această flexibilitate face din Data Lake o infrastructură deosebit de potrivită pentru proiectele de inteligență artificială și învățare automată, care necesită adesea acces la volume enorme și diverse de date de antrenament — text, imagini, înregistrări audio, date de senzori, jurnale de sistem — provenind din surse extrem de variate, fără a fi nevoie de o transformare și structurare costisitoare a tuturor acestor date înainte de a fi disponibile pentru analiză sau antrenament de modele.
Principiul „schema-on-read” (schema aplicată la citire, nu la scriere) caracteristic Data Lake-urilor permite echipelor de date și AI să decidă flexibil, în momentul analizei, cum interpretează și structurează datele relevante pentru un proiect specific, evitând constrângerile impuse de o structură fixă, decisă în avans, care s-ar putea dovedi prea rigidă pentru nevoi ulterioare neanticipate.
Provocarea principală asociată cu Data Lake-urile este riscul de a deveni un „mlaștină de date” (data swamp) — o colecție haotică de date nesortate, prost documentate și greu de găsit sau de folosit eficient — dacă nu sunt implementate practici riguroase de guvernanță, catalogare și metadate care să mențină datele organizate și accesibile. Companiile moderne combină frecvent Data Lake-uri cu instrumente de guvernanță a datelor și cataloage de metadate pentru a păstra beneficiile flexibilității, minimizând riscul de dezorganizare.
