HPC · hexaos-rc22
Qualifier un cluster HPC multi-nœuds
Passer du Slurm local aux joins, au provisioning et aux workloads distribués.
Préflight
- DNS et temps.
- Munge.
- Cgroup v2.
- Réseau de gestion.
- Stockage partagé ou contrat explicite.
- Certificats.
- Inventaire matériel.
Scénario
- Bootstrap du contrôleur.
- Join d’un nœud.
- srun et sbatch multi-nœuds.
- Métriques Prometheus.
- Drain et reprise.
- Sauvegarde et restauration de configuration.