O rețea neuronală recurentă (RNN – Recurrent Neural Network) este o arhitectură de rețea neuronală special concepută pentru a procesa date secvențiale — text, serii temporale, semnale audio — păstrând o „memorie” internă a informațiilor procesate anterior în secvență, spre deosebire de rețelele clasice feedforward, care tratează fiecare intrare independent.
Mecanismul central al unui RNN este bucla de recurență: la fiecare pas al secvenței, rețeaua combină intrarea curentă cu o „stare ascunsă” care rezumă informația din pașii anteriori, actualizând continuu această stare pe măsură ce parcurge secvența. Astfel, predicția pentru cuvântul al zecelea dintr-o propoziție poate ține cont de toate cele nouă cuvinte anterioare, nu doar de cel imediat precedent.
Deși inovatoare la momentul introducerii lor, RNN-urile clasice suferă de o problemă cunoscută sub numele de „dispariția gradientului” (vanishing gradient), care le face dificil să rețină informații relevante din secvențe foarte lungi — o propoziție lungă poate „uita” contextul din primele cuvinte până ajunge la ultimele. Această limitare a dus la dezvoltarea variantelor mai sofisticate, precum LSTM și GRU, care includ mecanisme explicite de control al memoriei.
Deși arhitecturile de tip transformer au înlocuit RNN-urile ca standard pentru majoritatea aplicațiilor moderne de procesare a limbajului (inclusiv modelele mari de limbaj precum ChatGPT), RNN-urile rămân relevante pentru aplicații cu resurse limitate, procesare audio în timp real și anumite tipuri de analiză a seriilor temporale, unde eficiența computațională contează mai mult decât capacitatea de a modela dependențe pe secvențe extrem de lungi.
