Transcrierea automată (speech-to-text) este o tehnologie de inteligență artificială care convertește discursul vorbit, captat printr-un microfon sau dintr-o înregistrare audio, în text scris, cu acuratețe și viteză care permit utilizarea în timp real pentru aplicații conversaționale sau de documentare.
Sistemele moderne de transcriere automată folosesc rețele neuronale profunde antrenate pe cantități masive de date audio adnotate manual, învățând să recunoască fonemele (sunetele de bază ale vorbirii), să le combine corect în cuvinte, ținând cont de context lingvistic pentru a dezambiguiza cuvinte cu pronunție similară dar sens diferit, și să insereze corect punctuația și formatarea pe baza pauzelor și intonației naturale a vorbirii.
Precizia acestor sisteme variază semnificativ în funcție de calitatea audio (zgomot de fundal, calitatea microfonului), claritatea vorbirii (accent, viteza de vorbire, dicție), și disponibilitatea datelor de antrenament pentru limba și dialectul specific — limbi cu resurse lingvistice digitale mai bogate (precum engleza) beneficiază de sisteme mai precise decât limbi cu resurse mai limitate.
Aplicațiile practice sunt extinse: subtitrarea automată a conținutului video pentru accesibilitate și localizare, transcrierea automată a întâlnirilor de business sau a conferințelor pentru documentare și căutare ulterioară în conținut, dictarea vocală pentru redactarea de documente fără tastare manuală, comenzile vocale pentru asistenți virtuali și dispozitive inteligente, și transcrierea automată a consultațiilor medicale pentru documentarea rapidă a fișelor de pacient, reducând timpul administrativ al personalului medical.
