La sua ricerca applica l'intelligenza artificiale alla gestione operativa delle infrastrutture di calcolo su larga scala, dai supercalcolatori Tier-0 ai cluster Kubernetes cloud-native, lungo quattro temi collegati.
1. Agenti autonomi per operazioni HPC e Kubernetes
Progettazione di architetture multi-agente orchestrate da LLM che eseguono operazioni reali sui cluster di calcolo, e non si limitano a suggerirle, con un esplicito gate di approvazione umana su ogni azione che modifica lo stato del sistema, sintesi di nuovi strumenti a runtime e controllo degli accessi basato sui ruoli. Il tema comprende anche il problema della valutazione: come misurare, in presenza di politiche realistiche di controllo degli accessi, se tali agenti siano sufficientemente affidabili per operare infrastrutture di produzione (KubeIntellect, AOBench).
2. Rilevamento e previsione di anomalie per datacenter e supercalcolatori
Framework scalabili per rilevare e anticipare anomalie termiche, di sistema e a livello di job in infrastrutture di classe exascale, mediante deep learning, modellazione statistica e metodi basati su grafi applicati a telemetria su larga scala. Il lavoro è stato sviluppato e validato sul sistema Tier-0 Marconi100 del CINECA e ha prodotto dataset aperti per la comunità scientifica (HazardNet, ThermADNet, GRAAFE, M100 ExaData, PM100).
3. Digital twin e scheduling basato su AI lungo il continuum di calcolo
Modellazione in tempo reale, tramite digital twin, di infrastrutture eterogenee che comprendono dispositivi, edge, cloud e HPC, basata su telemetria Prometheus, e suo utilizzo come fondamento di osservabilità per l'allocazione dei carichi di lavoro guidata da AI in ambienti Kubernetes e SLURM, con obiettivi di efficienza energetica e latenza.
4. MLOps, AI in produzione e computing sostenibile
Piattaforme MLOps end-to-end per il ciclo di vita dei modelli di AI in ambienti HPC e Kubernetes - pipeline di addestramento, versionamento dei modelli, serving di inferenza multi-modello, rilevamento del drift e promozione basata su metriche - insieme a stack completi di osservabilità, e loro applicazione all'analisi dei consumi energetici, alla previsione dell'intensità di carbonio e all'allocazione dei job consapevole delle emissioni, per un supercalcolo più sostenibile.