Detectarea limbii (language detection) este o tehnică de procesare a limbajului natural care identifică automat limba în care este scris un text dat, un pas de preprocesare adesea esențial înainte de aplicarea altor sisteme de NLP, care sunt de regulă specializate pentru o singură limbă sau un set restrâns de limbi.
Metodele clasice de detectare a limbii se bazează pe analiza frecvenței n-gramelor de caractere — secvențe scurte de 2-4 litere specifice fiecărei limbi (de exemplu, combinația „ț” sau „ă” indică puternic limba română) — comparând tiparele găsite în textul de analizat cu profilurile statistice cunoscute ale diferitelor limbi. Sistemele moderne folosesc rețele neuronale antrenate pe corpusuri masive multilingve, capabile să distingă cu precizie ridicată chiar și limbi înrudite, dificil de separat prin metode statistice simple (precum limba română față de alte limbi romanice).
Aplicațiile practice ale detectării automate a limbii sunt numeroase: motoarele de traducere automată o folosesc pentru a determina automat limba sursă atunci când utilizatorul nu o specifică explicit; platformele de social media o folosesc pentru a modera conținut sau a afișa reclame relevante lingvistic; motoarele de căutare o folosesc pentru a filtra rezultatele după limba preferată a utilizatorului; iar sistemele de analiză a sentimentului sau de moderare a conținutului trebuie să detecteze corect limba înainte de a aplica modelul lingvistic potrivit, deoarece un model antrenat pentru engleză va produce rezultate nesigure sau greșite pe text în altă limbă.
