Word2Vec este o tehnică de reprezentare a cuvintelor sub formă de vectori numerici (embeddings), dezvoltată de o echipă Google în 2013, care a introdus o abordare revoluționară pentru a captura sensul semantic al cuvintelor prin poziția lor relativă într-un spațiu matematic multidimensional.
Principiul central se bazează pe ipoteza distribuțională din lingvistică: cuvintele care apar în contexte similare tind să aibă sensuri similare. Word2Vec învață vectori numerici pentru fiecare cuvânt dintr-un vocabular, antrenând un model neuronal simplu să prezică fie cuvintele din contextul unui cuvânt dat (modelul Skip-gram), fie cuvântul central pe baza contextului din jur (modelul CBOW — Continuous Bag of Words), folosind cantități mari de text nesupervizat.
Rezultatul remarcabil al acestei abordări este că vectorii rezultați capturează relații semantice care pot fi manipulate prin operații matematice simple — celebrul exemplu fiind că vectorul pentru „rege” minus vectorul pentru „bărbat” plus vectorul pentru „femeie” produce un vector foarte apropiat de cel al cuvântului „regină”, demonstrând că modelul a învățat implicit conceptul de gen și relații regale doar din statistica coapariției cuvintelor în text.
Deși Word2Vec a fost depășit de tehnici mai avansate, precum embeddings-urile contextuale generate de modele transformer (unde același cuvânt poate avea vectori diferiți în funcție de context, spre deosebire de Word2Vec, care generează un singur vector fix per cuvânt), rămâne un concept fundamental pentru înțelegerea evoluției reprezentărilor vectoriale ale limbajului în inteligența artificială modernă.
