Etichetarea părților de vorbire (POS Tagging – Part-of-Speech Tagging) este o tehnică de procesare a limbajului natural care atribuie automat, fiecărui cuvânt dintr-un text, categoria sa gramaticală — substantiv, verb, adjectiv, adverb, prepoziție, conjuncție și așa mai departe — pe baza contextului în care apare cuvântul respectiv.
Provocarea centrală a acestei sarcini este ambiguitatea: multe cuvinte pot avea funcții gramaticale diferite în funcție de context. Cuvântul românesc „scris”, de exemplu, poate fi verb la participiu (,,am scris o scrisoare”), adjectiv (,,un text bine scris”) sau substantiv (,,scrisul de mână este o artă pe cale de dispariție”) — iar un etichetator corect trebuie să determine funcția potrivită analizând cuvintele din jur, nu doar cuvântul izolat.
Sistemele moderne de etichetare a părților de vorbire folosesc modele statistice sau rețele neuronale antrenate pe texte etichetate manual de lingviști, învățând să recunoască tipare contextuale — de exemplu, un cuvânt care urmează imediat după un articol hotărât este foarte probabil un substantiv sau un adjectiv, nu un verb.
Etichetarea corectă a părților de vorbire este un pas fundamental de preprocesare pentru numeroase aplicații ulterioare de NLP: analiza sintactică se bazează pe aceste etichete pentru a construi structura gramaticală completă a propoziției, sistemele de recunoaștere a entităților denumite folosesc informația gramaticală pentru a distinge nume proprii de cuvinte comune, iar corectoarele gramaticale automate identifică erori de acord (de exemplu, dezacordul dintre subiect și predicat) analizând etichetele gramaticale ale cuvintelor implicate.
