Modelarea subiectelor (topic modeling) este o tehnică de învățare automată nesupravegheată care descoperă automat temele sau subiectele latente dintr-o colecție mare de documente text, fără a necesita etichetare manuală prealabilă a conținutului fiecărui document.
Cel mai cunoscut algoritm de modelare a subiectelor este LDA (Latent Dirichlet Allocation), care presupune că fiecare document este format dintr-un amestec de mai multe subiecte, iar fiecare subiect este, la rândul lui, caracterizat de o distribuție de probabilitate peste cuvinte — de exemplu, un subiect despre „tehnologie” ar avea probabilități ridicate pentru cuvinte precum „software”, „internet”, „computer”, în timp ce un subiect despre „sănătate” ar favoriza cuvinte precum „medic”, „tratament”, „pacient”.
Algoritmul analizează statistic cum coapar cuvintele în documentele din colecție și deduce automat atât subiectele latente, cât și amestecul specific de subiecte prezent în fiecare document individual, fără a fi nevoie ca vreun om să citească și să eticheteze manual documentele în prealabil.
Aplicațiile practice includ organizarea automată a arhivelor mari de documente (biblioteci digitale, arhive juridice), analiza tendințelor din publicații științifice de-a lungul timpului (identificarea temelor emergente într-un domeniu de cercetare), descoperirea subiectelor dominante în comentariile clienților sau recenziile de produse (fără a citi manual mii de recenzii), și îmbunătățirea sistemelor de recomandare de conținut, care pot sugera articole similare tematic, chiar dacă nu folosesc exact aceleași cuvinte cheie.
