Un arbore de decizie este un model de învățare automată care ia decizii printr-o serie de întrebări succesive de tip „da/nu” sau „mai mare/mai mic decât”, organizate ierarhic într-o structură de arbore, similară modului în care un om ar putea raționa pas cu pas printr-un flux de decizie.
Structura pornește de la un nod rădăcină, care reprezintă întreaga populație de date, și se ramifică succesiv pe baza celei mai informative întrebări posibile la fiecare pas — de exemplu, „venitul anual este mai mare de 50.000 lei?” — împărțind datele în subgrupuri din ce în ce mai omogene. Procesul continuă până când fiecare „frunză” a arborelui conține predominant exemple dintr-o singură categorie (pentru clasificare) sau o valoare relativ constantă (pentru regresie).
Alegerea întrebării optime la fiecare nod se face prin măsuri statistice precum indicele Gini sau câștigul de informație (information gain), care cuantifică cât de mult reduce o anumită întrebare incertitudinea din date.
Principalul avantaj al arborilor de decizie este interpretabilitatea excepțională: spre deosebire de rețelele neuronale, un arbore de decizie poate fi vizualizat și înțeles complet, urmărind pur și simplu drumul de la rădăcină la frunza corespunzătoare unei predicții — o proprietate valoroasă în domenii reglementate, precum aprobarea creditelor sau diagnosticul medical, unde deciziile trebuie justificate explicit. Principala limitare este tendința de a se supraadapta (overfitting) la datele de antrenament dacă nu sunt limitate corespunzător în adâncime, motiv pentru care, în practică, arborii individuali sunt adesea înlocuiți de ansambluri precum Random Forest.
