Gradientul de coborâre (gradient descent) este algoritmul fundamental de optimizare folosit pentru antrenarea majorității modelelor de învățare automată, inclusiv rețelele neuronale. Scopul său este de a găsi valorile parametrilor (ponderilor) unui model care minimizează funcția de cost — o măsură a cât de departe sunt predicțiile modelului de rezultatele corecte.
Principiul funcționează ca urcatul unui deal în ceață, dar în sens invers: algoritmul calculează gradientul (direcția de cea mai abruptă creștere) al funcției de cost în raport cu fiecare parametru al modelului, apoi ajustează parametrii în direcția opusă gradientului — adică spre cea mai abruptă scădere — cu un pas de mărime controlată de rata de învățare. Acest proces se repetă iterativ, mii sau milioane de ori, până când funcția de cost ajunge la un minim acceptabil.
Există mai multe variante practice: gradientul de coborâre pe batch complet (calculează gradientul pe întregul set de date, precis dar lent), stochastic (folosește un singur exemplu la fiecare pas, rapid dar zgomotos) și mini-batch (compromisul standard folosit în practică, care calculează gradientul pe grupuri mici de exemple).
O rată de învățare prea mare poate face algoritmul să „sară” peste minim, oscilând fără să convergă, în timp ce o rată prea mică face antrenamentul extrem de lent. Variante avansate, precum Adam sau RMSprop, ajustează automat rata de învățare pe parcursul antrenamentului, devenind standardul de facto pentru antrenarea rețelelor neuronale moderne.
