View a markdown version of this page

Création et configuration de plans de réponse dans Incident Manager -  Incident Manager

AWS Systems Manager Incident Manager n'est plus ouvert aux nouveaux clients. Les clients existants peuvent continuer à utiliser le service normalement. Pour plus d'informations, consultez AWS Systems Manager Incident Manager la section Modification de disponibilité.

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Création et configuration de plans de réponse dans Incident Manager

Les plans de réponse vous permettent de planifier la manière de réagir à un incident qui a un impact sur vos utilisateurs. Un plan de réponse fonctionne comme un modèle qui inclut des informations sur les personnes à engager, la gravité attendue de l'événement, des runbooks automatiques à lancer et des mesures à surveiller.

Bonnes pratiques

Vous pouvez réduire l'impact des incidents sur vos équipes en planifiant les incidents à l'avance. Les équipes doivent prendre en compte les meilleures pratiques suivantes lors de la conception d'un plan de réponse.

  • Engagement rationalisé  : identifiez l'équipe la mieux adaptée à un incident. Si vous utilisez une liste de distribution trop longue ou si vous impliquez les mauvaises équipes, vous risquez de semer la confusion et de faire perdre du temps aux intervenants lors d'un incident.

  • Escalade fiable — Pour vos engagements dans le cadre d'un plan d'intervention, nous vous recommandons de sélectionner un plan d'engagement plutôt que des contacts ou des horaires d'astreinte. Le plan d'engagement doit spécifier les contacts individuels ou les horaires de garde (qui contiennent plusieurs contacts rotatifs) à engager lors d'incidents. Étant donné que les répondeurs spécifiés dans votre plan d'engagement peuvent parfois être injoignables, vous devez configurer des répondeurs de secours dans votre plan de réponse pour couvrir ces scénarios. Avec les contacts de secours, si les contacts principaux et secondaires ne sont pas disponibles ou s'il existe d'autres lacunes imprévues dans la couverture, Incident Manager informe toujours un contact de l'incident.

  • Runbooks  : utilisez les runbooks pour fournir des étapes reproductibles et compréhensibles qui réduisent le stress ressenti par le répondeur lors d'un incident.

  • Collaboration  : utilisez les canaux de discussion pour rationaliser la communication lors d'incidents. Les canaux de discussion aident les intervenants à rester au courant des informations. Ils peuvent également partager des informations avec d'autres intervenants via ces canaux.

Création d'un plan de réponse

Suivez la procédure suivante pour créer un plan de réponse et automatiser la réponse aux incidents.

Pour créer un plan de réponse
  1. Ouvrez la console Incident Manager et, dans le volet de navigation, choisissez Plans de réponse.

  2. Choisissez Créer un plan de réponse.

  3. Dans Nom, entrez un nom de plan de réponse unique et identifiable à utiliser dans l'Amazon Resource Name (ARN) pour le plan de réponse.

  4. (Facultatif) Pour Nom d'affichage, entrez un nom plus lisible pour aider à identifier le plan de réponse lorsque vous créez des incidents.

  5. Continuez en spécifiant des valeurs par défaut pour les enregistrements d'incidents.

Spécifier les valeurs par défaut des incidents

Pour vous aider à gérer les incidents plus efficacement, vous pouvez spécifier des valeurs par défaut. Incident Manager applique ces valeurs à tous les incidents associés à un plan de réponse.

Pour spécifier les valeurs par défaut des incidents
  1. Dans Titre, saisissez un titre pour cet incident afin de vous aider à l'identifier sur la page d'accueil du Gestionnaire d'incidents.

  2. Pour Impact, choisissez un niveau d'impact pour indiquer la portée potentielle des incidents créés à partir de ce plan de réponse, par exemple Critique ou Faible. Pour plus d'informations sur les évaluations d'impact dans Incident Manager, consultezTri.

  3. (Facultatif) Dans Résumé, saisissez un bref résumé du type d'incidents créés à partir de ce plan de réponse.

  4. (Facultatif) Pour la chaîne de déduplication, entrez une chaîne de déduplication. Incident Manager utilise cette chaîne pour empêcher la même cause première de créer plusieurs incidents sur le même compte.

    Une chaîne de déduplication est un terme ou une expression que le système utilise pour vérifier la présence d'incidents dupliqués. Si vous spécifiez une chaîne de déduplication, Incident Manager recherche les incidents ouverts qui contiennent la même chaîne dans le dedupeString champ lors de la création de l'incident. Si un doublon est détecté, Incident Manager déduplique le nouvel incident dans l'incident existant.

    Note

    Par défaut, Incident Manager déduplique automatiquement les multiples incidents créés par la même CloudWatch alarme Amazon ou le même événement Amazon. EventBridge Il n'est pas nécessaire de saisir votre propre chaîne de déduplication pour empêcher la duplication pour ces types de ressources.

  5. (Facultatif) Sous Étiquettes d'incidents, ajoutez des clés de balise et des valeurs à attribuer aux incidents créés à partir de ce plan de réponse.

    Vous devez avoir l'TagResourceautorisation pour que la ressource d'enregistrement des incidents définisse des balises d'incident dans le plan de réponse.

  6. Continuez en spécifiant un canal de discussion facultatif permettant aux résolveurs de communiquer entre eux au sujet des incidents.

(Facultatif) Spécifier un canal de discussion dédié à la réponse aux incidents

Lorsque vous incluez un canal de discussion dans un plan de réponse, les intervenants reçoivent des mises à jour sur les incidents via ce canal. Ils peuvent interagir avec l'incident directement depuis le canal de discussion à l'aide des commandes de chat.

À l'aide d'Amazon Q Developer dans les applications de chat, vous pouvez créer un canal pour SlackMicrosoft Teams, pour ou pour Amazon Chime à utiliser dans vos plans de réponse. Pour plus d'informations sur la création d'un canal de discussion dans Amazon Q Developer dans les applications de chat, consultez le Guide de l'administrateur d'Amazon Q Developer in chat applications .

Important

Incident Manager doit être autorisé à publier sur la rubrique Amazon Simple Notification Service (Amazon SNS) d'une chaîne de discussion. Si vous n'êtes pas autorisé à publier sur cette rubrique SNS, vous ne pouvez pas l'ajouter au plan de réponse. Incident Manager publie une notification de test dans la rubrique SNS afin de vérifier les autorisations.

Pour plus d'informations sur les canaux de discussion, consultezCréation et intégration de canaux de discussion pour les intervenants dans Incident Manager.

Pour spécifier un canal de discussion dédié à la réponse aux incidents
  1. Pour le canal de discussion, sélectionnez un développeur Amazon Q dans le canal de discussion des applications de chat où les intervenants peuvent communiquer lors d'un incident.

    Astuce

    Pour créer un nouveau canal de discussion dans Amazon Q Developer dans les applications de chat, choisissez Configurer un nouveau client Chatbot.

  2. Pour les sujets SNS du canal de discussion, choisissez des sujets SNS supplémentaires sur lesquels publier pendant l'incident. L'ajout de sujets SNS à plusieurs Régions AWS augmente la redondance au cas où une région serait en panne au moment de l'incident.

  3. Continuez en sélectionnant les contacts, les horaires de garde et les plans d'escalade à engager lors d'un incident.

(Facultatif) Sélectionnez des ressources pour participer à la réponse aux incidents

Il est important d'identifier les intervenants les plus appropriés en cas d'incident. À titre de meilleure pratique, nous vous recommandons de procéder comme suit :

  1. Ajoutez des contacts et des horaires de garde comme canaux d'escalade dans un plan d'escalade.

    Note

    Actuellement, la possibilité d'ajouter un contact partagé depuis un autre compte à un plan de réponse n'est pas prise en charge.

  2. Choisissez un plan d'escalade comme engagement dans un plan de réponse.

Pour plus d'informations sur les contacts et les plans d'escalade, consultez Création et configuration de contacts dans Incident Manager etCréation d'un plan d'escalade pour l'engagement des intervenants dans Incident Manager.

Pour sélectionner les ressources nécessaires à la réponse aux incidents
  1. Pour les engagements, choisissez un certain nombre de plans d'escalade, de calendriers d'astreinte et de contacts individuels.

  2. Continuez en spécifiant éventuellement un runbook à exécuter dans le cadre de l'atténuation de vos incidents.

(Facultatif) Spécifier un runbook pour atténuer les incidents

Vous pouvez utiliser les runbooks d'AWS Systems Manager Automation, un outil de AWS Systems Manager, pour automatiser les tâches d'application et d'infrastructure courantes dans votre AWS Cloud environnement.

Chaque runbook définit un flux de travail de runbook. Un flux de travail Runbook inclut les actions que Systems Manager effectue sur vos nœuds gérés ou sur d'autres types de AWS ressources. Dans Incident Manager, un runbook permet de répondre aux incidents et de les atténuer.

Pour plus d'informations sur l'utilisation des runbooks dans les plans de réponse,Intégration des runbooks d'automatisation de Systems Manager dans Incident Manager pour la résolution des incidents.

Pour spécifier un runbook pour l'atténuation des incidents, procédez comme suit :

  1. Pour Runbook, effectuez l'une des opérations suivantes :

    • Choisissez Cloner le livre d'exécution à partir d'un modèle pour créer une copie du livre d'exécution par défaut d'Incident Manager. Dans le champ Nom du runbook, entrez un nom descriptif pour le nouveau runbook.

    • Choisissez Sélectionner un runbook existant. Sélectionnez le propriétaire, le runbook et la version à utiliser.

      Astuce

      Pour créer un runbook à partir de zéro, choisissez Configurer un nouveau runbook.

      Pour plus d'informations sur la création de runbooks, consultez Intégration des runbooks d'automatisation de Systems Manager dans Incident Manager pour la résolution des incidents.

  2. Dans la zone Paramètres, indiquez tous les paramètres demandés pour le runbook que vous avez sélectionné.

    Les paramètres disponibles sont ceux spécifiés par le runbook. Un runbook peut nécessiter des paramètres différents d'un autre. Certains paramètres peuvent être obligatoires et d'autres facultatifs.

    Dans de nombreux cas, vous pouvez choisir de saisir manuellement une valeur statique pour un paramètre, telle qu'une liste d'ID d'instance Amazon EC2. Vous pouvez également laisser Incident Manager fournir les valeurs de paramètres générées dynamiquement par un incident.

  3. (Facultatif) Pour AutomationAssumeRole, spécifiez le rôle Gestion des identités et des accès AWS (IAM) à utiliser. Ce rôle doit disposer des autorisations nécessaires pour exécuter les commandes individuelles spécifiées dans le runbook.

    Note

    Si aucun n'AssumeRoleest spécifié, Incident Manager tente d'utiliser le rôle de service Runbook pour exécuter les commandes individuelles spécifiées dans le runbook.

    Choisissez parmi les options suivantes :

    • Entrez la valeur ARN — Entrez manuellement le nom de ressource Amazon (ARN) d'un AssumeRole, au formatarn:aws:iam::account-id:role/assume-role-name. Par exemple, arn:aws:iam::123456789012:role/MyAssumeRole.

    • Utiliser le rôle de service existant  : choisissez un rôle avec les autorisations requises dans la liste des rôles existants de votre compte.

    • Créez un nouveau rôle de service  : choisissez parmi les politiques AWS gérées à associer à votre AssumeRole. Après avoir sélectionné cette option, pour les politiques AWS gérées, choisissez une ou plusieurs politiques dans la liste.

      Vous pouvez accepter le nom par défaut suggéré pour le nouveau rôle ou saisir le nom de votre choix.

      Note

      Ce nouveau rôle de service Runbook est associé au runbook spécifique que vous avez sélectionné. Il ne peut pas être utilisé avec différents runbooks. Cela est dû au fait que la section Ressources de la politique ne prend pas en charge les autres runbooks.

  4. Pour le rôle de service Runbook, spécifiez le rôle IAM à utiliser pour fournir les autorisations nécessaires pour accéder et démarrer le flux de travail pour le runbook lui-même.

    Le rôle doit au minimum autoriser l'ssm:StartAutomationExecutionaction pour votre runbook spécifique. Pour que le runbook fonctionne sur tous les comptes, le rôle doit également autoriser l'sts:AssumeRoleaction pour le AWS-SystemsManager-AutomationExecutionRole rôle que vous avez créé pendantGestion des incidents par région Comptes AWS et par région dans Incident Manager.

    Choisissez parmi les options suivantes :

    • Créer un nouveau rôle de service — Incident Manager crée pour vous un rôle de service Runbook qui inclut les autorisations minimales requises pour démarrer le flux de travail Runbook.

      Pour Nom du rôle, vous pouvez accepter le nom par défaut suggéré ou saisir le nom de votre choix. Nous vous recommandons d'utiliser le nom suggéré ou de conserver le nom du runbook dans le nom. En effet, le nouveau AssumeRole est associé au runbook spécifique que vous avez sélectionné et peut ne pas inclure les autorisations requises pour les autres runbooks.

    • Utiliser le rôle de service existant  : un rôle IAM que vous ou Incident Manager avez créé précédemment accorde les autorisations nécessaires.

      Dans Nom du rôle, sélectionnez le nom du rôle existant à utiliser.

  5. Développez Options supplémentaires et choisissez l'une des options suivantes pour spécifier l' Compte AWS endroit où le flux de travail Runbook doit s'exécuter.

    • Compte du propriétaire du plan de réponse  : lancez le flux de travail Runbook dans Compte AWS celui qui l'a créé.

    • Compte concerné  : lancez le flux de travail Runbook sur le compte qui a déclenché ou signalé l'incident.

      Choisissez Compte concerné lorsque vous utilisez Incident Manager pour des scénarios multicomptes et que le runbook doit accéder aux ressources du compte concerné pour y remédier.

  6. Continuez en intégrant éventuellement un PagerDuty service dans le plan de réponse.

(Facultatif) Intégrer un PagerDuty service dans le plan d'intervention

Pour intégrer un PagerDuty service dans le plan de réponse

Lorsque vous intégrez Incident Manager à PagerDuty, PagerDuty crée un incident correspondant chaque fois qu'Incident Manager crée un incident. L'incident PagerDuty utilise le flux de travail de pagination et les politiques d'escalade que vous y avez définies, en plus de celles d'Incident Manager. PagerDuty joint les événements chronologiques d'Incident Manager en tant que notes sur votre incident.

  1. Développez Third-party les intégrations, puis cochez la case Activer PagerDuty l'intégration.

  2. Pour Sélectionner un secret, sélectionnez le secret dans AWS Secrets Manager lequel vous stockez les informations d'identification pour accéder à votre PagerDuty compte.

    Pour plus d'informations sur le stockage de vos PagerDuty informations d'identification dans un secret de Secrets Manager, consultezStockage des informations d' PagerDuty accès dans un AWS Secrets Manager secret.

  3. Pour le PagerDuty service, sélectionnez le service de votre PagerDuty compte dans lequel vous souhaitez créer l' PagerDuty incident.

  4. Continuez en ajoutant des balises facultatives et en créant le plan de réponse.

Ajouter des balises et créer le plan de réponse

Pour ajouter des balises et créer le plan de réponse
  1. (Facultatif) Dans la zone Tags, appliquez une ou plusieurs name/value paires de clés de tag au plan de réponse.

    Les balises sont des métadonnées facultatives que vous affectez à une ressource. Les balises vous permettent de classer une ressource de différentes manières, par exemple par objectif, propriétaire ou environnement. Par exemple, vous souhaiterez peut-être baliser un plan de réponse pour identifier le type d'incident qu'il est censé atténuer, les types de canaux d'escalade qu'il contient ou le plan d'escalade qui lui sera associé. Pour plus d'informations sur le balisage des ressources d'Incident Manager, consultezMarquage des ressources dans Incident Manager.

  2. Choisissez Créer un plan de réponse.