HPC · hexaos-rc22

Qualifier un cluster HPC multi-nœuds

Passer du Slurm local aux joins, au provisioning et aux workloads distribués.

BROUILLON TECHNIQUE
01

Préflight

  1. DNS et temps.
  2. Munge.
  3. Cgroup v2.
  4. Réseau de gestion.
  5. Stockage partagé ou contrat explicite.
  6. Certificats.
  7. Inventaire matériel.
02

Scénario

  1. Bootstrap du contrôleur.
  2. Join d’un nœud.
  3. srun et sbatch multi-nœuds.
  4. Métriques Prometheus.
  5. Drain et reprise.
  6. Sauvegarde et restauration de configuration.
03

Limite