TF-IDF (Term Frequency-Inverse Document Frequency) este o măsură statistică folosită în procesarea limbajului natural și în motoarele de căutare pentru a evalua cât de important este un cuvânt pentru un document specific dintr-o colecție mai mare de documente, combinând două componente complementare.
Prima componentă, frecvența termenului (Term Frequency), măsoară simplu cât de des apare un cuvânt într-un document dat — cu cât un cuvânt apare mai frecvent, cu atât pare mai relevant pentru conținutul acelui document. A doua componentă, frecvența inversă a documentului (Inverse Document Frequency), penalizează cuvintele care apar în majoritatea documentelor din colecție (precum articolele, prepozițiile sau cuvintele foarte comune, care nu ajută la distingerea conținutului specific al unui document) și favorizează cuvintele rare, distinctive, care apar doar în puține documente.
Scorul final TF-IDF pentru un cuvânt dintr-un document este produsul acestor două componente: un cuvânt care apare frecvent într-un document specific, dar rar în restul colecției, primește un scor ridicat, indicând că este probabil un termen caracteristic și distinctiv pentru acel document.
TF-IDF a fost, timp de decenii, tehnica standard pentru motoarele de căutare de a determina relevanța documentelor față de o interogare, și rămâne relevantă astăzi ca metodă simplă, rapidă și interpretabilă pentru extragerea automată de cuvinte cheie dintr-un text, clasificarea documentelor, detectarea plagiatelor prin comparație de similaritate textuală, și ca strat de preprocesare pentru sisteme mai complexe de căutare și recomandare de conținut.
