Random Forest (pădure aleatoare) este unul dintre cei mai populari algoritmi de învățare automată de tip ansamblu, care construiește un număr mare de arbori de decizie independenți în timpul antrenamentului și combină predicțiile lor pentru a obține un rezultat final mai precis și mai stabil decât ar oferi orice arbore individual.
Numele algoritmului provine din două surse de aleatorietate introduse deliberat pentru a face arborii cât mai diferiți unii de alții: fiecare arbore este antrenat pe un eșantion aleatoriu al datelor de antrenament (extras prin bootstrap, adică cu înlocuire), iar la fiecare punct de decizie din arbore, algoritmul ia în considerare doar un subset aleatoriu al caracteristicilor disponibile, nu toate. Această diversitate forțată reduce corelația dintre erorile arborilor individuali, astfel încât, atunci când predicțiile lor sunt combinate (prin vot majoritar pentru clasificare sau medie pentru regresie), erorile individuale tind să se anuleze reciproc, rezultând o predicție finală mai robustă.
Random Forest oferă un echilibru remarcabil de bun între precizie, rezistență la overfitting și ușurință în utilizare — funcționează bine „din start”, fără reglaje complexe de hiperparametri, gestionează natural atât date numerice cât și categorice, și tolerează bine valorile lipsă și outlierii.
Un avantaj practic important este capacitatea sa de a calcula automat importanța fiecărei caracteristici de intrare pentru predicția finală, oferind o formă de interpretabilitate absentă în multe alte modele complexe. Este folosit pe scară largă în finanțe (scoring de credit), sănătate (predicția riscului de boală), marketing (segmentarea clienților) și ecologie (modelarea distribuției speciilor).
