run_cluster_sanity_check
Check GPU health across cluster nodes for thermal/power throttling, uncorrected memory errors, and low clocks. Get a ready-to-use --exclude list for suspect nodes to prevent silent job slowdowns.
Instructions
Verifie la sante des GPU sur un ou plusieurs noeuds : bridage thermique ou de puissance, erreurs memoire non corrigees, frequence anormalement basse. Un noeud degrade ne plante pas, il ralentit tout un job reparti sans erreur visible. Rend une clause --exclude prete a l'emploi pour les noeuds suspects.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| nodes | No | ||
| minutes | No | ||
| max_nodes | No | ||
| check_type | No | gpu |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||