Calculul distribuit este o metodă de prelucrare a datelor în care sarcina de calcul este împărțită între mai multe mașini (noduri) interconectate în rețea, care lucrează simultan pentru a rezolva o problemă mult mai rapid decât ar putea-o face un singur computer.
În contextul inteligenței artificiale, calculul distribuit este indispensabil pentru antrenarea modelelor mari de limbaj sau a rețelelor neuronale complexe, care necesită procesarea a miliarde de parametri pe seturi de date de dimensiuni uriașe. Antrenamentul se poate distribui în principal în două moduri: paralelism de date (fiecare nod procesează o porțiune diferită a setului de date, folosind aceeași copie a modelului) și paralelism de model (modelul însuși este împărțit pe mai multe noduri, fiecare gestionând un subset de straturi sau parametri, necesar când modelul e prea mare pentru memoria unui singur GPU).
Infrastructura tipică folosește clustere de GPU-uri sau TPU-uri conectate prin rețele de mare viteză, coordonate de framework-uri software precum PyTorch Distributed, Horovod sau Ray, care gestionează sincronizarea gradientelor și comunicarea între noduri.
Dincolo de antrenarea modelelor, calculul distribuit susține și inferența la scară — servirea simultană a milioane de cereri către un chatbot popular, de exemplu — și este esențial pentru companiile care rulează infrastructură AI proprie, oferind o alternativă la limitările unui singur server, dar cu costuri și complexitate operațională semnificativ mai mari.
