Regresia logistică este un algoritm de învățare automată supravegheată folosit pentru probleme de clasificare — în ciuda numelui, care sugerează regresie (predicția unei valori numerice continue), regresia logistică prezice de fapt probabilitatea ca un exemplu să aparțină unei anumite categorii.
Algoritmul funcționează calculând o combinație liniară a variabilelor de intrare (similar regresiei liniare clasice), dar aplică apoi o funcție matematică numită funcția sigmoidă, care „comprimă” acest rezultat într-un interval între 0 și 1, interpretabil direct ca probabilitate. De exemplu, într-o problemă de detectare a fraudei, modelul ar putea prezice că o tranzacție are o probabilitate de 87% de a fi frauduloasă, pe baza caracteristicilor sale (sumă, locație, oră, istoric).
Pentru probleme cu mai mult de două categorii, regresia logistică se extinde la varianta „multinomială”, care calculează simultan probabilitatea pentru fiecare categorie posibilă și alege categoria cu probabilitatea cea mai mare.
Popularitatea acestui algoritm, în ciuda existenței unor modele mai complexe și adesea mai precise, vine din combinația unică de simplitate, viteză de antrenament, și mai ales interpretabilitate: coeficienții modelului arată clar direcția și magnitudinea influenței fiecărei variabile asupra rezultatului, un avantaj crucial în domenii precum medicina (identificarea factorilor de risc pentru o boală) sau finanțele (justificarea deciziilor de aprobare a creditelor) unde explicabilitatea este adesea o cerință legală sau etică, nu doar una tehnică.
