Regresia este o categorie de algoritmi de învățare automată supravegheată folosiți pentru a prezice o valoare numerică continuă — spre deosebire de clasificare, care prezice o categorie discretă. De exemplu, estimarea prețului unei locuințe, prognozarea vânzărilor lunare sau anticiparea temperaturii de mâine sunt toate probleme de regresie.
Cel mai simplu și cunoscut algoritm este regresia liniară, care presupune o relație de tip linie dreaptă între variabilele de intrare și valoarea prezisă, calculând coeficienți care minimizează diferența dintre valorile prezise și cele reale observate în datele de antrenament. Deși simplă, regresia liniară rămâne extrem de utilă pentru probleme unde relațiile dintre variabile sunt aproximativ liniare și interpretabilitatea modelului este importantă.
Pentru relații mai complexe și neliniare, se folosesc tehnici mai avansate: regresia polinomială, arborii de decizie pentru regresie, pădurile aleatoare (random forest) și, pentru probleme extrem de complexe, rețelele neuronale — care pot învăța automat relații neliniare arbitrar de complexe între variabilele de intrare și ieșirea prezisă.
Evaluarea unui model de regresie se face prin metrici precum eroarea medie pătratică (MSE) sau eroarea absolută medie (MAE), care măsoară cât de departe sunt, în medie, predicțiile modelului de valorile reale. Regresia este folosită pe scară largă în finanțe (predicția prețurilor acțiunilor), marketing (estimarea bugetului optim de publicitate), imobiliare (evaluarea proprietăților) și meteorologie.
