Aller au contenu principal
PostePublic
FP d'État Cat. BEmploi ouvert uniquement aux contractuelsTechnique & MaintenanceIl y a 1 mois

Ingénieur Système HPC / GPU / SLURM F/H (réf. 2026-1400)

Sorbonne Université– Services Universitaires (ouvre un nouvel onglet) — Sorbonne Université– Services Universitaires

Localisation
Paris (75), France (75)
Télétravail
Oui
Niveau d'études
Niveau 4 Baccalauréat
Expérience
Confirmé
Publication
29 juillet 2026
Domaine
Numérique
Secteur
Technique & Maintenance

Missions principales

Fonctions : Ingénieur.e Système HPC / GPU / SLURM Catégorie : B Corps : TECH BAP : E CDD de 12 mois. Missions principales : 1. Administration système - Déploiement et maintenance des nœuds de calcul GPU sous Debian - Déploiement et maintenance de nœuds proxmox, vm et docker - Gestion des mises à jour système, des pilotes NVIDIA et des librairies CUDA - Configuration et optimisation du réseau haute performance (bonding, VLAN) - Mise en œuvre et gestion des systèmes de fichiers distribués (NFS, CEPH, CephFS) - Automatisation des déploiements via Ansible 2. Administration SLURM - Installation, configuration et mise à jour de SLURM (slurmctld, slurmd, slurmdbd) - Définition des partitions, QOS, comptes et limites de ressources - Intégration des GPU NVIDIA dans les ressources SLURM (GRES) - Surveillance des jobs, diagnostics et interventions sur les nœuds en défaut - Rédaction et mise à jour des procédures SLURM à destination des utilisateurs 3. Support utilisateurs et opérateurs - Support de niveau 2/3 pour les utilisateurs de la plateforme HPC - Accompagnement des utilisateurs sur l’optimisation de leurs soumissions SLURM - Participation aux réunions techniques et rédaction des comptes-rendus - Rédaction de la documentation technique et des runbooks 4. Supervision et performance - Mise en place et maintenance des outils de supervision (Prometheus, Grafana) - Analyse des performances GPU (utilisation, mémoire, température, bande passante NVLink) - Optimisation des politiques d’ordonnancement selon la charge de la plateforme - Gestion des incidents et participation aux astreintes selon planning

Compétences attendues

Fonctions : Ingénieur.e Système HPC / GPU / SLURMCatégorie : BCorps : TECHBAP : ECDD de 12 mois.Missions principales :1. Administration systèmeDéploiement et maintenance des nœuds de calcul GPU sous DebianDéploiement et maintenance de nœuds proxmox, vm et dockerGestion des mises à jour système, des pilotes NVIDIA et des librairies CUDAConfiguration et optimisation du réseau haute performance (bonding, VLAN)Mise en œuvre et gestion des systèmes de fichiers distribués (NFS, CEPH, CephFS)Automatisation des déploiements via Ansible2. Administration SLURMInstallation, configuration et mise à jour de SLURM (slurmctld, slurmd, slurmdbd)Définition des partitions, QOS, comptes et limites de ressourcesIntégration des GPU NVIDIA dans les ressources SLURM (GRES)Surveillance des jobs, diagnostics et interventions sur les nœuds en défautRédaction et mise à jour des procédures SLURM à destination des utilisateurs3. Support utilisateurs et opérateursSupport de niveau 2/3 pour les utilisateurs de la plateforme HPCAccompagnement des utilisateurs sur l’optimisation de leurs soumissions SLURMParticipation aux réunions techniques et rédaction des comptes-rendusRédaction de la documentation technique et des runbooks4. Supervision et performanceMise en place et maintenance des outils de supervision (Prometheus, Grafana)Analyse des performances GPU (utilisation, mémoire, température, bande passante NVLink)Optimisation des politiques d’ordonnancement selon la charge de la plateformeGestion des incidents et participation aux astreintes selon planning

Profil attendu

Compétences techniques indispensables : - Solide maîtrise de Linux/Debian : administration système, packaging, systemd, réseau - Expérience confirmée sur SLURM : configuration, partitions, GRES GPU, accounting - Bonne connaissance de l’écosystème NVIDIA : drivers, CUDA, NVML, DCGM - Maîtrise des outils d’automatisation : Ansible, Bash, Python - Expérience sur les réseaux : Bonding, Vlan, routage Compétences appréciées : - Connaissance de systèmes de fichiers distribués : Ceph, cephfs - Pratique de la supervision avec Prometheus, Grafana, Alertmanager - Notions de MPI (OpenMPI, MVAPICH2) et de librairies de calcul (cuBLAS, NCCL) - Expérience avec des frameworks IA/ML : PyTorch, TensorFlow (usage sur HPC) - Connaissances en gestion de version : Git, GitLab CI Qualités personnelles : - Rigueur, méthode et sens de la documentation - Autonomie et capacité à gérer les priorités en environnement de production - Bon relationnel et goût pour le travail en équipe - Curiosité technique et veille active sur l’écosystème HPC/GPU

Informations complémentaires

CDD de 12 mois. Toute candidature (CV et lettre de motivation) doit impérativement être envoyée sur : https://jobs.sorbonne-universite.fr/offre-de-emploi/emploi-ingenieur-systeme-hpc-gpu-slurm-f-h_1400.aspx

Métier de référence

Technicienne / Technicien d'exploitation et maintenance 1er niveau

Comprendre ce poste

L'ingénieur système HPC/GPU assure le fonctionnement d'une infrastructure de calcul haute performance au service de la communauté scientifique universitaire. Il administre des grappes de serveurs équipés de GPU, orchestrant les allocations de ressources via SLURM et veillant à l'optimisation des performances. Au quotidien, il déploie des systèmes, gère les mises à jour critiques, diagnostique les défaillances matérielles et aide les chercheurs à exploiter pleinement cet écosystème complexe. Ce rôle est central pour maintenir la disponibilité et la fiabilité d'outils essentiels à la recherche scientifique.

Le recrutement dans ce cadre

Ce CDD de 12 mois relève de la catégorie B (technicien spécialisé) en FPE, accessible uniquement aux contractuels. Il offre une expérience directe dans un environnement de recherche de haut niveau, avec possibilité de stabilisation ou de transition vers d'autres projets informatiques universitaires selon les besoins.

Conseils pour candidater

  • **Structurez votre expérience SLURM précisément** : au-delà de la théorie, mettez en avant des cas concrets (partitioning, gestion des QOS, intégration GPU réussie). Les évaluateurs cherchent du vécu, pas juste des connaissances déclaratives.
  • **Démontrez une vraie maîtrise de Debian et de l'écosystème NVIDIA** : fournissez des exemples d'optimisations système ou de résolutions de problèmes GPU/CUDA. Les niveaux de driver et d'API comptent ; détaillez vos versions de référence.
  • **Valorisez l'automatisation comme levier de fiabilité** : exposez des playbooks Ansible ou scripts Bash/Python ayant rédu it le travail manuel. Pour un poste HPC, montrer qu'on pense systématisation augmente la crédibilité technique.

Éclairage rédigé par PostePublic pour contextualiser cette offre.

Réf. 2026-2367662Fonction publique d'État

Offres similaires