submit_resilient_job
Submit long computations as chained, resumable Slurm segments that checkpoint before timeout and restart from checkpoint_dir, overcoming partition time limits.
Instructions
Soumet un calcul long sous forme de chaine de segments reprenables, pour depasser la limite de temps d'une partition rapide. Chaque segment recoit SIGUSR1 avant son expiration pour sauvegarder, et le suivant demarre apres lui via une dependance, en reprenant du dernier point de sauvegarde. Un marqueur de fin fait sauter les segments restants si le calcul se termine avant terme. Ton code doit savoir reprendre depuis checkpoint_dir et, idealement, traiter SIGUSR1.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| arch | No | ||
| name | Yes | ||
| mem_gb | No | ||
| command | Yes | ||
| confirm | No | ||
| workdir | No | ||
| segment_time | No | 1h | |
| cpus_per_task | No | ||
| gpus_per_node | No | ||
| signal_before | No | ||
| stage_archive | No | ||
| checkpoint_dir | No | ||
| max_total_time | No | 6h | |
| spack_packages | No |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||