Dal caso del pre-training di Llama 3 405B e dalla convergenza tra intelligenza artificiale e systems engineering si è passati ai fondamenti: tassonomia della dependability, metriche SLI, SLO, SLA ed error budget, tail latency e limiti della scalabilità. La prima parte ha trattato i sistemi per l'AI: training distribuito e parallelismo, inversione del failure domain, fault tolerance con checkpointing, detection e isolamento, inference serving e MLOps come reliability engineering. La seconda ha riguardato l'AI per i sistemi: pipeline del failure management, Large Language Model, il caso RCACopilot a Microsoft, i benchmark sull'autonomia degli agenti e STRATUS. La chiusura ha unito reliability e security in un unico spazio dei guasti: threat model secondo NIST AI 100-2 E2025, forensic readiness dei sistemi AI, sfide aperte e cinque tesi conclusive.
Materiali
La presentazione del seminario, 36 pagine in PDF, segue il percorso dalle metriche della dependability fino al rapporto tra reliability e security ed è derivata dal white paper omonimo. È disponibile anche la registrazione video dell'intervento.