RAG (Retrieval-Augmented Generation) este o arhitectură de inteligență artificială care combină două componente complementare — un sistem de recuperare a informației și un model generativ de limbaj — pentru a produce răspunsuri mai precise, actualizate și verificabile decât ar putea genera un model de limbaj folosind exclusiv cunoștințele memorate în timpul antrenamentului.
Procesul funcționează astfel: atunci când primește o întrebare, sistemul RAG caută mai întâi, într-o bază de date sau colecție de documente relevante (adesea folosind o bază de date vectorială pentru căutare semantică), fragmentele de text cele mai relevante pentru întrebarea respectivă; aceste fragmente recuperate sunt apoi introduse ca parte din contextul oferit modelului generativ de limbaj, alături de întrebarea inițială; modelul generează răspunsul final bazându-se explicit pe informația recuperată, nu doar pe cunoștințele sale interne, memorate static din antrenament.
Această abordare rezolvă două limitări importante ale modelelor mari de limbaj folosite izolat: cunoștințele lor sunt „înghețate” la momentul antrenamentului (nu cunosc evenimente sau informații ulterioare acelei date) și sunt predispuse la halucinații (generarea de informații plauzibile, dar false). Prin ancorarea răspunsului în documente reale, verificabile, RAG reduce semnificativ riscul de halucinație și permite modelului să răspundă corect la întrebări despre informații specifice, actuale sau private — de exemplu, documentele interne ale unei companii, care nu au fost niciodată parte din datele de antrenament ale modelului.
RAG a devenit arhitectura de bază pentru majoritatea asistenților AI corporativi și chatbot-urilor de suport clienți care trebuie să răspundă precis pe baza documentației specifice a unei companii.
