LSTM (Long Short-Term Memory) este o arhitectură avansată de rețea neuronală recurentă, proiectată special pentru a depăși limitarea principală a RNN-urilor clasice — incapacitatea de a reține informații relevante pe parcursul unor secvențe lungi de date.
Inovația centrală a LSTM este introducerea unei „celule de memorie” separate, controlate de trei mecanisme numite „porți” (gates): poarta de uitare (decide ce informație din memoria anterioară trebuie ștearsă), poarta de intrare (decide ce informație nouă trebuie adăugată la memorie) și poarta de ieșire (decide ce parte din memoria curentă trebuie folosită pentru predicția pasului actual). Aceste porți sunt, la rândul lor, mici rețele neuronale antrenabile, care învață automat, din date, ce informație merită păstrată și ce trebuie uitată.
Datorită acestui design, un LSTM poate reține informații relevante din începutul unei secvențe lungi (de exemplu, subiectul unei propoziții menționat cu multe cuvinte în urmă) și le poate folosi corect la sfârșitul secvenței, rezolvând problema dispariției gradientului care afecta RNN-urile clasice.
Înainte de dominația arhitecturii transformer, LSTM-urile au fost tehnologia standard pentru majoritatea aplicațiilor de procesare a limbajului natural — traducere automată, generare de text, recunoașterea vorbirii — precum și pentru predicția seriilor temporale în finanțe și analiza senzorilor industriali. Rămân, în continuare, o alegere eficientă pentru aplicații cu resurse de calcul limitate sau pentru procesarea în timp real a fluxurilor de date secvențiale.
