BERT (Bidirectional Encoder Representations from Transformers) este un model de limbaj dezvoltat de Google în 2018, care a marcat un moment important în evoluția procesării limbajului natural prin introducerea unei abordări bidirecționale de înțelegere a contextului — analizând un cuvânt ținând cont simultan de cuvintele care îl preced și de cele care îl urmează în propoziție, spre deosebire de modelele anterioare, care citeau textul într-o singură direcție.
Această capacitate bidirecțională permite lui BERT să înțeleagă mult mai precis sensul cuvintelor ambigue în funcție de context complet — de exemplu, cuvântul „bancă” are sensuri complet diferite în „am mers la bancă să retrag bani” versus „m-am așezat pe bancă în parc”, iar înțelegerea corectă necesită analiza atât a cuvintelor anterioare, cât și a celor următoare.
BERT a fost antrenat printr-o tehnică inovatoare numită „masked language modeling”, în care anumite cuvinte dintr-o propoziție sunt ascunse aleatoriu, iar modelul trebuie să le prezică pe baza contextului rămas — un exercițiu care forțează modelul să dezvolte o înțelegere profundă a relațiilor gramaticale și semantice din limbaj.
Spre deosebire de modelele generative precum GPT, care sunt optimizate pentru a genera text nou, BERT este optimizat pentru sarcini de înțelegere: clasificarea textelor, răspunsul la întrebări bazat pe un document dat, analiza sentimentului și recunoașterea entităților denumite. Motorul de căutare Google a integrat BERT începând din 2019 pentru a înțelege mai bine intenția din interogările de căutare complexe, conversaționale, îmbunătățind semnificativ relevanța rezultatelor pentru întrebări formulate natural.
