View a markdown version of this page

Erreur de cluster Amazon EMR : nœuds Deny-listed - Amazon EMR

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Erreur de cluster Amazon EMR : nœuds Deny-listed

Le NodeManager démon est responsable du lancement et de la gestion des conteneurs sur les nœuds principaux et de tâche. Les conteneurs sont alloués au NodeManager démon par le ResourceManager démon qui s'exécute sur le nœud maître. Le NodeManager nœud est ResourceManager surveillé par battement de cœur.

Il existe plusieurs situations dans lesquelles le ResourceManager démon refuse la liste a NodeManager et la supprime du pool de nœuds disponibles pour traiter les tâches :

  • Si le n' NodeManager a pas envoyé de battement de cœur au ResourceManager démon au cours des 10 dernières minutes (600 000 millisecondes). Cette période de temps peut être configurée à l'aide du paramètre de configuration yarn.nm.liveness-monitor.expiry-interval-ms. Pour plus d'informations sur la modification des paramètres de configuration de Yarn, consultez Configuration des applications dans le Guide de version Amazon EMR.

  • NodeManager vérifie l'état de santé des disques déterminé par yarn.nodemanager.local-dirs etyarn.nodemanager.log-dirs. Les vérifications incluent les autorisations et l'espace disque disponible (< 90 %). Si un disque échoue à la vérification, il NodeManager cesse d'utiliser ce disque en particulier mais indique toujours que l'état du nœud est sain. Si plusieurs disques échouent à la vérification, le nœud est signalé comme étant défectueux ResourceManager et aucun nouveau conteneur n'est attribué au nœud.

Le maître de l'application peut également refuser de NodeManager répertorier un nœud si plus de trois tâches ont échoué. Vous pouvez le remplacer par une valeur plus élevée à l'aide du paramètre de configuration mapreduce.job.maxtaskfailures.per.tracker. D'autres paramètres de configuration que vous pouvez modifier contrôlent le nombre de tentatives pour une tâche avant de l'indiquer comme ayant échoué : mapreduce.map.max.attempts pour les tâches Map et mapreduce.reduce.maxattempts pour les tâches Reduce. Pour plus d'informations sur la modification des paramètres de configuration, consultez Configuration des applications dans le Guide de version Amazon EMR.