View a markdown version of this page

Grundlegendes zum Ablauf der Sprechersuche für das Amazon Chime SDK - Amazon Chime SDK

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Grundlegendes zum Ablauf der Sprechersuche für das Amazon Chime SDK

In diesem Abschnitt zeigen wir Ihnen ein Beispiel für einen Daten- und Programmablauf für eine Amazon Chime SDK-Lautsprechersuche.

Die Lautsprecher-Suchfunktion beinhaltet die Erstellung einer Spracheinbettung, mit der die Stimme eines Anrufers mit zuvor gespeicherten Sprachdaten verglichen werden kann. Für die Erfassung, Verwendung, Speicherung und Aufbewahrung biometrischer Identifikatoren und biometrischer Informationen in Form eines digitalen Stimmabdrucks kann die informierte Zustimmung des Anrufers in Form einer schriftlichen Mitteilung erforderlich sein. Eine solche Zustimmung ist nach verschiedenen staatlichen Gesetzen erforderlich, einschließlich der biometrischen Gesetze in Illinois, Texas, Washington und anderen staatlichen Datenschutzgesetzen. Bevor Sie die Sprecher-Suchfunktion verwenden können, müssen Sie alle Hinweise bereitstellen und alle Einwilligungen einholen, die nach geltendem Recht und gemäß den AWS-Servicebedingungen für Ihre Nutzung der Funktion erforderlich sind.

Das folgende Diagramm zeigt ein Beispiel für den Datenfluss bei einer Aufgabe zur Analyse der Sprechersuche. Die nummerierten Beschreibungen unter dem Diagramm beschreiben jeden Schritt des Prozesses. Das Diagramm geht davon aus, dass Sie bereits einen Amazon Chime SDK Voice Connector mit einer Anrufanalysekonfiguration konfiguriert haben, die über eine VoiceAnalyticsProcessor verfügt. Weitere Informationen finden Sie unter Aufzeichnen von Voice Connector-Anrufen.

Ein Diagramm, das den Datenfluss durch eine Sprechersuchanalyse zeigt.
  1. Sie oder ein Systemadministrator erstellen eine Sprachprofil-Domain zum Speichern von Spracheinbettungen und Stimmprofilen. Weitere Informationen zum Erstellen von Sprachprofil-Domains finden Sie unter Erstellen von Sprachprofil-Domains im Amazon Chime SDK-Administratorhandbuch. Sie können auch die CreateVoiceProfileDomain API verwenden.

  2. Ein Anrufer wählt sich über eine Telefonnummer ein, die einem Amazon Chime SDK Voice Connector zugewiesen ist. Oder ein Agent verwendet eine Voice Connector-Nummer, um einen ausgehenden Anruf zu tätigen.

  3. Der Amazon Chime SDK Voice Connector-Dienst erstellt eine Transaktions-ID und ordnet sie dem Anruf zu.

  4. Unter der Annahme, dass Ihre Anwendung EventBridge Ereignisse abonniert, ruft Ihre Anwendung die CreateMediaInsightsPipeline API mit der Media Insights-Pipeline-Konfiguration und den Kinesis Video Stream-ARNs für den Voice Connector-Aufruf auf.

    Weitere Informationen zur Verwendung EventBridge finden Sie unter. Grundlegendes zu Workflows für auf maschinellem Lernen basierende Analysen für das Amazon Chime SDK

  5. Ihre Anwendung — z. B. ein interaktives Sprachantwortsystem — oder Ihr Agent informiert den Anrufer über die Anrufaufzeichnung und die Verwendung von Spracheinbettungen für Sprachanalysen und bittet ihn um seine Zustimmung zur Teilnahme.

  6. Sobald der Anrufer seine Zustimmung erteilt hat, kann Ihre Anwendung oder Ihr Agent die StartSpeakerSearchTask API über das Voice SDK aufrufen, sofern Sie über einen Voice Connector und eine Transaktions-ID verfügen. Oder, wenn Sie eine Media Insights-Pipeline-ID anstelle einer Transaktions-ID haben, rufen Sie die StartSpeakerSearchTask API im Media Pipelines SDK auf.

    Sobald der Anrufer seine Zustimmung erteilt hat, ruft Ihre Anwendung oder Ihr Agent die API aufStartSpeakerSearchTask. Sie müssen die Voice Connector-ID, die Transaktions-ID und die Sprachprofil-Domänen-ID an die API übergeben. Zur Identifizierung der asynchronen Aufgabe wird eine Aufgaben-ID für die Sprechersuche zurückgegeben.

    Anmerkung

    Bevor Sie die StartSpeakerSearchTask API in einem der SDKs aufrufen, müssen Sie alle erforderlichen Hinweise bereitstellen und alle erforderlichen Einwilligungen einholen, wie es das Gesetz und die AWS-Servicebedingungen vorschreiben. https://aws.amazon.com/service-terms/

  7. Das System sammelt 10 Sekunden der Stimme des Anrufers. Der Anrufer muss mindestens so lange sprechen. Das System erfasst oder analysiert keine Stille.

  8. Die Media Insights Pipeline vergleicht die Sprache mit den Stimmprofilen in der Domain und listet die 10 Treffer auf, die am häufigsten mit hoher Konfidenz übereinstimmen. Wenn keine Übereinstimmung gefunden wird, erstellt der Voice Connector ein Stimmprofil.

  9. Der Media Insights Pipeline-Dienst sendet ein Benachrichtigungsereignis an die konfigurierten Benachrichtigungsziele.

  10. Der Anrufer spricht weiter und spricht weitere 10 Sekunden lang ohne Stummschaltung.

  11. Die Media Insights-Pipeline generiert eine Spracheinbettung für die Registrierung, mit der Sie ein Stimmprofil erstellen oder ein vorhandenes Stimmprofil aktualisieren können.

  12. Die Media Insights-Pipeline sendet eine VoiceprintGenerationSuccessful Benachrichtigung an die konfigurierten Benachrichtigungsziele.

  13. Ihre Anwendung ruft die CreateVoiceProfile oder UpdateVoiceProfile APIs auf, um das Profil zu erstellen oder zu aktualisieren.

  14. Ihre Anwendung ruft die GetSpeakerSearchTask API nach Bedarf auf, um den aktuellen Status der Sprechersuche abzurufen.