View a markdown version of this page

Creazione e configurazione dei piani di risposta in Incident Manager -  Incident Manager

Strumento di gestione degli incidenti AWS Systems Manager non è più aperto a nuovi clienti. I clienti esistenti possono continuare a utilizzare il servizio normalmente. Per ulteriori informazioni, consulta Strumento di gestione degli incidenti AWS Systems Manager la modifica della disponibilità.

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Creazione e configurazione dei piani di risposta in Incident Manager

I piani di risposta consentono di pianificare come rispondere a un incidente che ha un impatto sugli utenti. Un piano di risposta funziona come un modello che include informazioni su chi coinvolgere, la gravità prevista dell'evento, i runbook automatici da avviare e le metriche da monitorare.

Best practice

Puoi ridurre l'impatto degli incidenti sui tuoi team pianificando gli incidenti in anticipo. I team dovrebbero prendere in considerazione le seguenti best practice quando si progetta un piano di risposta.

  • Coinvolgimento semplificato: identifica il team più appropriato per un incidente. Se coinvolgi una lista di distribuzione troppo ampia o se coinvolgi i team sbagliati, puoi creare confusione e far perdere tempo ai soccorritori durante un incidente.

  • Escalation affidabile: per i tuoi impegni nell'ambito di un piano di risposta, ti consigliamo di selezionare un piano di coinvolgimento anziché i contatti o gli orari di chiamata. Il piano di coinvolgimento dovrebbe specificare i singoli contatti o gli orari delle chiamate (che contengono più contatti a rotazione) da coinvolgere durante gli incidenti. Poiché a volte i soccorritori specificati nel piano di coinvolgimento possono essere irraggiungibili, è necessario configurare i soccorritori di riserva nel piano di risposta in modo da coprire questi scenari. Con i contatti di backup, se i contatti primari e secondari non sono disponibili o ci sono altre lacune non pianificate nella copertura, Incident Manager notifica comunque l'incidente al contatto.

  • Runbook: utilizza i runbook per fornire passaggi ripetibili e comprensibili che riducano lo stress che un soccorritore prova durante un incidente.

  • Collaborazione: utilizza i canali di chat per semplificare la comunicazione durante gli incidenti. I canali di chat aiutano i rispondenti a rimanere aggiornati sulle informazioni. Possono anche condividere informazioni con altri soccorritori attraverso questi canali.

Creazione di un piano di risposta

Utilizza la procedura seguente per creare un piano di risposta e automatizzare la risposta agli incidenti.

Come creare un piano di risposta
  1. Apri la console di Incident Manager e, nel riquadro di navigazione, scegli i piani di risposta.

  2. Scegli Crea piano di risposta.

  3. Per Nome, inserisci un nome univoco e identificabile del piano di risposta da utilizzare nell'Amazon Resource Name (ARN) per il piano di risposta.

  4. (Facoltativo) Per Nome visualizzato, inserisci un nome più leggibile dall'uomo per identificare il piano di risposta quando crei incidenti.

  5. Continua specificando i valori predefiniti per i record degli incidenti.

Specificare i valori predefiniti degli incidenti

Per aiutarti a gestire gli incidenti in modo più efficace, puoi specificare i valori predefiniti. Incident Manager applica questi valori a tutti gli incidenti associati a un piano di risposta.

Per specificare i valori predefiniti degli incidenti
  1. Per Titolo, inserisci un titolo per questo incidente per aiutarti a identificarlo nella home page di Incident Manager.

  2. Per Impact, scegli un livello di impatto per indicare la potenziale portata di un incidente creato da questo piano di risposta, ad esempio Critico o Basso. Per informazioni sulle valutazioni di impatto in Incident Manager, vedereTriage.

  3. (Facoltativo) Per Riepilogo, inserisci un breve riepilogo del tipo di incidenti creati da questo piano di risposta.

  4. (Facoltativo) Per la stringa di deduplicazione, inserisci una stringa di deduplicazione. Incident Manager utilizza questa stringa per evitare che la stessa causa principale crei più incidenti nello stesso account.

    Una stringa di deduplicazione è un termine o una frase che il sistema utilizza per verificare la presenza di incidenti duplicati. Se si specifica una stringa di deduplicazione, Incident Manager cerca gli incidenti aperti che contengono la stessa stringa nel campo quando crea l'dedupeStringincidente. Se viene rilevato un duplicato, Incident Manager deduplica l'incidente più recente in quello esistente.

    Nota

    Per impostazione predefinita, Incident Manager deduplica automaticamente più incidenti creati dallo stesso allarme Amazon o dallo stesso evento Amazon. CloudWatch EventBridge Non è necessario inserire la propria stringa di deduplicazione per evitare la duplicazione per questi tipi di risorse.

  5. (Facoltativo) In Incident Tags, aggiungi le chiavi e i valori dei tag da assegnare agli incidenti creati da questo piano di risposta.

    È necessario disporre dell'TagResourceautorizzazione per consentire alla risorsa di registrazione degli incidenti di impostare i tag degli incidenti all'interno del piano di risposta.

  6. Continua specificando un canale di chat opzionale per consentire ai risolutori di comunicare tra loro in merito agli incidenti.

(Facoltativo) Specificare un canale di chat per la risposta agli incidenti

Quando includi un canale di chat in un piano di risposta, i soccorritori ricevono aggiornamenti sugli incidenti tramite il canale. Possono interagire con l'incidente direttamente dal canale di chat utilizzando i comandi della chat.

Utilizzando Amazon Q Developer nelle applicazioni di chat, puoi creare un canale per SlackMicrosoft Teams, per o per Amazon Chime da utilizzare nei tuoi piani di risposta. Per informazioni sulla creazione di un canale di chat in Amazon Q Developer in chat applications, consulta la Amazon Q Developer in chat applications Administrator Guide .

Importante

Incident Manager deve disporre delle autorizzazioni per pubblicare sull'argomento Amazon Simple Notification Service (Amazon SNS) di un canale di chat. Senza le autorizzazioni per la pubblicazione su quell'argomento SNS, non puoi aggiungerlo al piano di risposta. Incident Manager pubblica una notifica di prova sull'argomento SNS per verificare le autorizzazioni.

Per ulteriori informazioni sui canali di chat, consulta. Creazione e integrazione di canali di chat per i soccorritori in Incident Manager

Per specificare un canale di chat di risposta agli incidenti
  1. Per il canale Chat, seleziona un canale di chat delle applicazioni di chat di Amazon Q Developer in cui i soccorritori possono comunicare durante un incidente.

    Suggerimento

    Per creare un nuovo canale di chat in Amazon Q Developer nelle applicazioni di chat, scegli Configura nuovo client Chatbot.

  2. Per gli argomenti SNS del canale di chat, scegli argomenti SNS aggiuntivi su cui pubblicare durante l'incidente. L'aggiunta di più argomenti SNS Regioni AWS aumenta la ridondanza nel caso in cui una regione sia inattiva al momento dell'incidente.

  3. Continua selezionando i contatti, gli orari delle chiamate e i piani di escalation da coinvolgere durante un incidente.

(Facoltativo) Seleziona le risorse per impegnarti nella risposta agli incidenti

È importante identificare i soccorritori più appropriati quando si verifica un incidente. Come best practice, ti consigliamo di fare quanto segue:

  1. Aggiungi i contatti e gli orari delle chiamate come canali di escalation in un piano di escalation.

    Nota

    Attualmente, la possibilità di aggiungere un contatto condiviso da un altro account a un piano di risposta non è supportata.

  2. Scegli un piano di escalation come coinvolgimento in un piano di risposta.

Per ulteriori informazioni sui contatti e sui piani di escalation, consulta e. Creazione e configurazione dei contatti in Incident Manager Creazione di un piano di intensificazione per il coinvolgimento dei soccorritori in Incident Manager

Per selezionare le risorse per impegnarsi nella risposta agli incidenti
  1. Per Engagements, scegli un numero qualsiasi di piani di emergenza, orari di chiamata e contatti individuali.

  2. Continua specificando facoltativamente un runbook da eseguire come parte della mitigazione degli incidenti.

(Facoltativo) Specificare un runbook per la mitigazione degli incidenti

Puoi utilizzare i runbook di AWS Systems Manager Automation, uno strumento in AWS Systems Manager, per automatizzare le attività comuni delle applicazioni e dell'infrastruttura nel tuo ambiente. Cloud AWS

Ogni runbook definisce un flusso di lavoro del runbook. Un flusso di lavoro runbook include le azioni che Systems Manager esegue sui nodi gestiti o su altri tipi AWS di risorse. In Incident Manager, un runbook guida la risposta e la mitigazione degli incidenti.

Per ulteriori informazioni sull'utilizzo dei runbook nei piani di risposta,. Integrazione dei runbook di Systems Manager Automation in Incident Manager per la correzione degli incidenti

Per specificare un runbook per la mitigazione degli incidenti:

  1. Per Runbook, esegui una delle seguenti operazioni:

  2. Nell'area Parametri, fornisci tutti i parametri richiesti per il runbook selezionato.

    I parametri disponibili sono quelli specificati dal runbook. Un runbook potrebbe richiedere parametri diversi rispetto a un altro. Alcuni parametri potrebbero essere obbligatori e altri opzionali.

    In molti casi, puoi scegliere di inserire manualmente un valore statico per un parametro, ad esempio un elenco di ID di istanza Amazon EC2. Puoi anche lasciare che Incident Manager fornisca i valori dei parametri generati dinamicamente da un incidente.

  3. (Facoltativo) Per AutomationAssumeRole, specificare il ruolo AWS Identity and Access Management (IAM) da utilizzare. Questo ruolo deve disporre delle autorizzazioni necessarie per eseguire i singoli comandi specificati nel runbook.

    Nota

    Se non AssumeRole viene specificato, Incident Manager tenta di utilizzare il ruolo del servizio Runbook per eseguire i singoli comandi specificati nel runbook.

    Scegli tra le seguenti opzioni:

    • Inserisci il valore ARN: inserisci manualmente l'Amazon Resource Name (ARN) di un AssumeRole, nel formato. arn:aws:iam::account-id:role/assume-role-name Ad esempio, arn:aws:iam::123456789012:role/MyAssumeRole.

    • Usa il ruolo di servizio esistente: scegli un ruolo con le autorizzazioni richieste da un elenco di ruoli esistenti nel tuo account.

    • Crea un nuovo ruolo di servizio: scegli tra le politiche AWS gestite da allegare al tuo AssumeRole. Dopo aver selezionato questa opzione, per le politiche AWS gestite, scegli una o più politiche dall'elenco.

      Puoi accettare il nome predefinito suggerito per il nuovo ruolo o inserire un nome a tua scelta.

      Nota

      Questo nuovo ruolo del servizio Runbook è associato al runbook specifico selezionato. Non può essere utilizzato con runbook diversi. Questo perché la sezione Risorse della policy non supporterà altri runbook.

  4. Per il ruolo del servizio Runbook, specifica il ruolo IAM da utilizzare per fornire le autorizzazioni necessarie per accedere e avviare il flusso di lavoro per il runbook stesso.

    Come minimo, il ruolo deve consentire l'ssm:StartAutomationExecutionazione per il tuo runbook specifico. Affinché il runbook funzioni su tutti gli account, il ruolo deve consentire anche l'sts:AssumeRoleazione relativa al AWS-SystemsManager-AutomationExecutionRole ruolo che hai creato durante. Gestione degli incidenti in tutte Account AWS le regioni in Incident Manager

    Scegli tra le seguenti opzioni:

    • Crea un nuovo ruolo di servizio: Incident Manager crea per te un ruolo di servizio Runbook che include le autorizzazioni minime richieste per avviare il flusso di lavoro di Runbook.

      Per il nome del ruolo, puoi accettare il nome predefinito suggerito o inserire un nome a tua scelta. Ti consigliamo di utilizzare il nome suggerito o di mantenere il nome del runbook nel nome. Questo perché il nuovo AssumeRole è associato allo specifico runbook selezionato e potrebbe non includere le autorizzazioni richieste per altri runbook.

    • Usa il ruolo di servizio esistente: un ruolo IAM creato in precedenza da te o da Incident Manager concede le autorizzazioni necessarie.

      Per Nome del ruolo, seleziona il nome del ruolo esistente da utilizzare.

  5. Espandi le opzioni aggiuntive e scegli una delle seguenti opzioni per specificare Account AWS dove deve essere eseguito il flusso di lavoro del runbook.

    • Account del proprietario del piano di risposta: avvia il flusso di lavoro del runbook nel luogo in Account AWS cui lo ha creato.

    • Account interessato: avvia il flusso di lavoro di runbook nell'account che ha avviato o segnalato l'incidente.

      Scegli l'account interessato quando utilizzi Incident Manager per scenari con più account e il runbook deve accedere alle risorse dell'account interessato per porvi rimedio.

  6. Continua integrando facoltativamente un servizio nel piano di risposta. PagerDuty

(Facoltativo) Integrazione di un PagerDuty servizio nel piano di risposta

Integrare un PagerDuty servizio nel piano di risposta

Quando si integra Incident Manager con PagerDuty, PagerDuty crea un incidente corrispondente ogni volta che Incident Manager crea un incidente. L'incidente in PagerDuty utilizza il flusso di lavoro di paging e le politiche di escalation che hai definito in aggiunta a quelli in Incident Manager. PagerDuty allega gli eventi della cronologia di Incident Manager come note sull'incidente.

  1. Espandi Third-party le integrazioni, quindi seleziona la casella di controllo Abilita PagerDuty integrazione.

  2. Per Seleziona segreto, seleziona il segreto in AWS Secrets Manager cui memorizzi le credenziali per accedere al tuo PagerDuty account.

    Per informazioni sulla memorizzazione delle PagerDuty credenziali in un segreto di Secrets Manager, consulta. Archiviazione delle credenziali di PagerDuty accesso in modo segreto AWS Secrets Manager

  3. Per PagerDuty quanto riguarda l'assistenza, seleziona dal tuo PagerDuty account il servizio in cui desideri creare l' PagerDuty incidente.

  4. Continua aggiungendo tag opzionali e creando il piano di risposta.

Aggiungere tag e creare il piano di risposta

Per aggiungere tag e creare il piano di risposta
  1. (Facoltativo) Nell'area Tag, applica una o più name/value coppie di chiavi tag al piano di risposta.

    I tag sono metadati facoltativi assegnati a una risorsa. Con i tag, puoi classificare una risorsa in diversi modi, ad esempio per scopo, proprietario o ambiente. Ad esempio, potresti voler etichettare un piano di risposta per identificare il tipo di incidente che intende mitigare, i tipi di canali di escalation che contiene o il piano di escalation che sarà associato ad esso. Per ulteriori informazioni sull'etichettatura delle risorse di Incident Manager, vedere. Etichettatura delle risorse in Incident Manager

  2. Scegli Crea piano di risposta.