Foto del docente

Mohsen Seyedkazemi Ardebili

Assegnista di ricerca

Dipartimento di Ingegneria dell'Energia Elettrica e dell'Informazione "Guglielmo Marconi"

Temi di ricerca

Parole chiave: Sistemi di calcolo ad alte prestazioni (HPC) AIOps e intelligenza artificiale per le infrastrutture Agenti autonomi basati su LLM Kubernetes e sistemi cloud-native MLOps e AI in produzione Rilevamento e previsione di anomalie Digital twin per sistemi di calcolo Monitoraggio e telemetria dei datacenter Efficienza energetica e computing sostenibile Deep learning per serie temporali Continuum di calcolo edge-cloud-HPC

La sua ricerca applica l'intelligenza artificiale alla gestione operativa delle infrastrutture di calcolo su larga scala, dai supercalcolatori Tier-0 ai cluster Kubernetes cloud-native, lungo quattro temi collegati.

1. Agenti autonomi per operazioni HPC e Kubernetes

Progettazione di architetture multi-agente orchestrate da LLM che eseguono operazioni reali sui cluster di calcolo, e non si limitano a suggerirle, con un esplicito gate di approvazione umana su ogni azione che modifica lo stato del sistema, sintesi di nuovi strumenti a runtime e controllo degli accessi basato sui ruoli. Il tema comprende anche il problema della valutazione: come misurare, in presenza di politiche realistiche di controllo degli accessi, se tali agenti siano sufficientemente affidabili per operare infrastrutture di produzione (KubeIntellect, AOBench).

2. Rilevamento e previsione di anomalie per datacenter e supercalcolatori

Framework scalabili per rilevare e anticipare anomalie termiche, di sistema e a livello di job in infrastrutture di classe exascale, mediante deep learning, modellazione statistica e metodi basati su grafi applicati a telemetria su larga scala. Il lavoro è stato sviluppato e validato sul sistema Tier-0 Marconi100 del CINECA e ha prodotto dataset aperti per la comunità scientifica (HazardNet, ThermADNet, GRAAFE, M100 ExaData, PM100).

3. Digital twin e scheduling basato su AI lungo il continuum di calcolo

Modellazione in tempo reale, tramite digital twin, di infrastrutture eterogenee che comprendono dispositivi, edge, cloud e HPC, basata su telemetria Prometheus, e suo utilizzo come fondamento di osservabilità per l'allocazione dei carichi di lavoro guidata da AI in ambienti Kubernetes e SLURM, con obiettivi di efficienza energetica e latenza.

4. MLOps, AI in produzione e computing sostenibile

Piattaforme MLOps end-to-end per il ciclo di vita dei modelli di AI in ambienti HPC e Kubernetes - pipeline di addestramento, versionamento dei modelli, serving di inferenza multi-modello, rilevamento del drift e promozione basata su metriche - insieme a stack completi di osservabilità, e loro applicazione all'analisi dei consumi energetici, alla previsione dell'intensità di carbonio e all'allocazione dei job consapevole delle emissioni, per un supercalcolo più sostenibile.