Bonjour,
Depuis ce midi, mes jobs restent en pause sans reprendre leur exécution.
Je constate par ailleurs que ce type de dysfonctionnement devient de plus en plus fréquent et impacte fortement nos délais de traitement des données.
Pourriez-vous, s’il vous plaît, nous apporter des éléments d’explication concernant ce problème ?
Je vous remercie par avance pour votre retour.
Bonjour,
Les jobs W4M sont exécuté sur le cluster de calcul de l'IFB Core Cluster, via l'instance Galaxy.
Ces infrastructures sont donc très liées.
Il peut y avoir plusieurs choses qui impactent les jobs.
Par exemple, dernièrement, un problème sur le stockage à bloquer certains jobs, ou une partie de l'infrastructure a été arrêté sur demande de l'hébergeur (cause forte chaleur, limitant les ressources). Il y a aussi des opérations de gestion et de maintenance importante depuis plusieurs mois sur l'infrastructure (changement de la solution de stockage, augmentation du niveau de sécurité, incidents matériel, etc). L'équipe est très mobilisé sur toutes les urgences mais aussi sur les sujets de fonds (gestion utilisateurs, espace du stockage, hébergement, sécurité, mise à jour de l'infrastructure, communication, etc) et pour traiter les demandes de support (+ de 1500 en moins d'un an).
Tout ça pour donner quelques éléments d'explications sur les difficultés que vous pouvez parfois rencontrer.
Nous surveillons attentivement l'infrastructure mais nous sommes toujours preneur de vos retours (tel que votre message) qui peuvent nous alerter (plusieurs noeuds étaient anormalement "drained").
A cette heure, il n'y a pas de jobs en attente pour W4M/Galaxy.
En espérant vous avoir apporté quelques éléments de réponses.
Bonne journée
Ok merci pour ces éléments de réponse