submit_job
Prepare and submit Slurm jobs on the ROMEO HPC cluster via SSH. Simulates submission by default; set confirm=true to actually submit, with options for GPUs, containers, and distributed runtimes.
Instructions
Prepare et soumet un job SLURM. distributed='mpi' couvre le calcul parallele courant (prefixe srun, avec ou sans GPU) ; les familles ddp, accelerate, deepspeed et srun sont propres a PyTorch et ajoutent son point de rendez-vous. Options : container pour une image Apptainer, redirect_caches pour detourner les caches Python hors du home, stage_archive pour mettre un jeu de donnees en memoire vive. data_files choisit les entrees a empreinter au demarrage pour export_job_report (20 fichiers, 64 Mio). En simulation par defaut : rend le script sbatch genere, la partition et l'architecture deduites, et les avertissements de dimensionnement, SANS rien soumettre. Relance avec confirm=true pour soumettre reellement. La partition est deduite du temps demande et l'architecture du besoin en GPU : ne les force que si tu as une raison precise.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| arch | No | ||
| name | Yes | ||
| array | No | ||
| nodes | No | ||
| mem_gb | No | ||
| command | Yes | ||
| confirm | No | ||
| modules | No | ||
| workdir | No | ||
| cpu_bind | No | ||
| container | No | ||
| partition | No | ||
| data_files | No | ||
| job_tmpdir | No | ||
| nccl_debug | No | ||
| time_limit | No | 1h | |
| distributed | No | ||
| cpus_per_task | No | ||
| gpus_per_node | No | ||
| keep_patterns | No | ||
| stage_archive | No | ||
| spack_packages | No | ||
| ntasks_per_node | No | ||
| redirect_caches | No | ||
| secret_env_file | No |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||