Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Best Practices für Agentic Voice
Amazon Connect Agentic Voice kombiniert erweiterte Spracherkennung (ASR) mit ausdrucksstarken, natürlich klingenden Stimmen, um ein umfassendes KI-Erlebnis zu bieten. Advanced ASR sorgt bei Gesprächen in Echtzeit für natürliche Abfolge mit niedriger Latenz, während die Sprachengine lebensechte Sprache an über 50 Orten wiedergibt. Zusammen ermöglichen diese Komponenten eine nahtlose, menschenähnliche Interaktion zwischen Anrufern und Amazon Connect AI-Agenten. In diesem Handbuch werden die Konfiguration und bewährte Methoden für beide Komponenten behandelt, damit Sie das volle Spracherlebnis von Agentic optimal nutzen können.
Anmerkung
Stellen Sie sicher, dass Amazon Connect-Kunde für Ihre Instance aktiviert ist, um die Funktionen von Amazon Connect für die Agentensprache nutzen zu können. Amazon Connect Agentic Voice ist der Standard-Sprachanbieter für Amazon Connect-Kunden.
Dieser Leitfaden behandelt:
Syntax der Sitzungsattribute für ASR-Steuerelemente.
Barge-in (Interrupt-) Verhalten und wann es deaktiviert werden muss.
End-of-turn Tuning für Advanced ASR.
Sprachhinweise für mehrsprachige Spracherkennung.
Umgang mit lang andauernden Toolaufrufen.
Bewährte Methoden zur Textformatierung für die Sprachausgabe.
Sprachsteuerungs-Tags für eine feinkörnige Sprachsteuerung.
Das System fordert Amazon Connect AI-Agenten auf.
Beispiele für Kontaktcenter.
Mehrsprachige Sprachkonfiguration für mehrsprachigen Support.
Bewährte Methoden für die erweiterte Spracherkennung (ASR)
Bei der Sprachmodell-Voreinstellung Advanced ASR handelt es sich um eine Streaming-Erkennung, die für natürliche Abfolge bei Echtzeitgesprächen mit niedriger Latenz entwickelt wurde. Anstatt sich nur auf ein festes Schweigefenster zu verlassen, bewertet es die Sprache des Anrufers während des Gesprächs und sagt voraus, wann der Anrufer das Gespräch beendet hat — das Ende der Runde (EOT).
Syntax der Sitzungsattribute
Die Steuerelemente in diesem Abschnitt sind mit den standardmäßigen Lex V2-Sitzungsattributen im x-amz-lex Namespace eingerichtet. Sie legen sie fest, wenn Sie eine Konversation beginnen, und Sie können sie in einer Lambda-Funktion überschreiben (z. B. um die Erkennung nur beim Erfassen eines sensiblen Werts zu vereinfachen).
Ordnen Sie jedes Attribut einer Absicht und einem Slot zu:
x-amz-lex:audio:<setting>:<intentName>:<slotToElicit>
Verwenden Sie
*ihn als Absicht- oder Slot-Namen, um eine Standardeinstellung festzulegen, die überall gilt.Jede absichts- oder slotspezifische Einstellung hat Vorrang vor einer Standardeinstellung.
*
Tun Sie:
Legen Sie konservative Werte nur für die Slots fest, die sie benötigen (z. B. für einen Slot mit Kontonummer), und belassen Sie alles andere auf den Standardwerten.
Setzen Sie entspannte Werte für den nächsten Slot zurück, nachdem eine sensible Erfassung abgeschlossen ist.
Tun Sie nicht:
Wende global eine einzige aggressive
*:*Standardeinstellung an, um einen Slot zu fixieren — das Tempo ändert sich mit jeder Runde im Bot.
Barge-in (Verhalten unterbrechen)
Barge-in lässt den Anrufer eine Aufforderung unterbrechen, die der Bot gerade abspielt. Es ist standardmäßig aktiviert, was normalerweise das ist, was Sie für eine natürliche Konversation benötigen. Du steuerst es mit:
x-amz-lex:allow-interrupt:<intentName>:<slotToElicit>
Standard: true
Deaktiviere barge-in (false), wenn:
Wir spielen eine Sprache aus den Bereichen Recht, Compliance oder Offenlegung von Aufzeichnungen, die vollständig gehört werden müssen.
Vorlesen einer Bestätigung, über die der Anrufer nicht sprechen sollte.
Lassen Sie Barge-In aktiviert, wenn:
Der Anrufer möchte den Bot möglicherweise während der Aufforderung korrigieren oder abkürzen — der normale Gesprächsfall.
Beispiel
Für einen KI-Agenten mit Self-Service sollten Sie Barge-In standardmäßig überall aktiviert lassen. Deaktivieren Sie es nur, wenn eine Aufforderung vollständig verstanden werden muss — zum Beispiel ein Haftungsausschluss aus rechtlichen Gründen oder zur Einhaltung gesetzlicher Vorschriften. Legen Sie die Attribute fest, wenn Sie die Konversation beginnen. Behalte die Standardeinstellung bei einem *:* Eintrag bei und schalte Barge-In nur für die Absicht aus, die im Disclaimer wiedergegeben wird:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:allow-interrupt:*:*": "true", "x-amz-lex:allow-interrupt:Disclaimer:*": "false" } } }
Die für die Absicht und den Slot spezifische Eingabe hat Vorrang vor der *:* Standardeinstellung, sodass der Anrufer überall unterbrechen kann, außer während die Absicht spricht. Disclaimer Wenn Sie das Disclaimer-Attribut stattdessen in einer Lambda-Funktion festlegen, stellen Sie es ein, bevor die Disclaimer-Eingabeaufforderung abgespielt wird. Setzen Sie es auf „truedanach“ zurück, damit der Rest der Konversation unterbrochen werden kann.
Anmerkung
Eine erneute Aufforderung aufgrund eines Timeouts ist kein wirklicher Einbruch. Ein häufiger Verwirrungspunkt: Wenn ein Anrufer verstummt und der Fallback am Ende des Zuges ausgelöst wird, kann der Bot den Zug beenden oder von selbst erneut auffordern. Das kann wie eine Unterbrechung aussehen, aber es ist die Erkennung am Ende des Zuges, nicht der einstürmende Anrufer. Die Lösung besteht fast immer darin, die Einstellungen für das Ende des Abbiegens zu optimieren — nicht die Markierung für das Zulassen von Unterbrechungen.
End-of-turn Tuning
Advanced ASR beendet eine Runde, wenn eine der Bedingungen zuerst erfüllt ist:
End-of-turn Vertrauensschwelle — Das Modell ist sich sicher genug, dass der Anrufer fertig ist. Dies ist das Hauptsignal und sorgt dafür, dass beim Abbiegen ein natürlicher Klang entsteht.
End-of-turn Timeout für die Stille — der Anrufer hat für die konfigurierte Zeit geschwiegen. Dies ist der Fallback (ein Anrufer, der nachlässt oder verstummt).
| Einstellung | Sitzungsattribut | Standard | Range |
|---|---|---|---|
| End-of-turn Vertrauensschwelle | x-amz-lex:audio:end-confidence-threshold |
0.7 | 0,5—0,9 |
| End-of-turn Zeitlimit für Stille | x-amz-lex:audio:end-timeout-ms |
5.000 ms | 500—10.000 ms |
Bei höheren Werten wartet der Bot länger und beendet Turns konservativer (weniger vorzeitige Cutoffs, etwas mehr Latenz). Niedrigere Werte beenden die Runde früher (geringere Latenz, höhere Wahrscheinlichkeit, dass ein Anrufer, der eine Pause einlegt, unterbrochen wird). Die Vertrauensschwelle ist der wichtigste Hebel. Das Timeout für die Stille spielt nur eine Rolle, wenn die Zuversicht nicht bereits beendet ist.
Out-of-range Verhalten:
end-confidence-thresholdOutside 0.5—0.9 wird aufgrund eines Fehlers mit einem ungültigen Sitzungsattribut abgelehnt.end-timeout-msWerte unter 500 oder über 10.000 werden stillschweigend auf den nächstgelegenen unterstützten Wert begrenzt.
Werte auswählen
| Szenario | Empfohlene Einstellungen | Hinweise |
|---|---|---|
| Natürliche Konversation | Standardwerte (0,7/5.000 ms) | Optimiert für reaktionsschnelles Allzweck-Abbiegen. |
| Sensible oder diktierte Eingaben (OTP, Kontonummer) | Schwellenwert: 0,9, Timeout: 6.000—8.000 ms | Toleriert Pausen. Wird nach der Erfassung auf den nächsten Slot zurückgesetzt. |
| Kurzer Austausch (yes/no, einzelnes Wort) | Schwellenwert: ~0,5, Timeout: ~500 ms | Schnellere Kurven. Testen Sie zuerst auf vorzeitige Grenzwerte. |
Beispiel
Konservative Erkennung am Ende des Zuges für den AccountNumber Slot, in dem die Absicht passiert ist: VerifyIdentity
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:VerifyIdentity:AccountNumber": "0.9", "x-amz-lex:audio:end-timeout-ms:VerifyIdentity:AccountNumber": "7000" } } }
Eine einzige Standardeinstellung für jeden Intent und Slot:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:*:*": "0.8", "x-amz-lex:audio:end-timeout-ms:*:*": "800" } } }
Sprachhinweise für mehrsprachige Erkennung
Advanced ASR erkennt mehrere Sprachen in derselben Konversation, ohne dass Ihnen mitgeteilt wird, welche Sprachen zu erwarten sind. Es erkennt die Sprache anhand der Sprache des Anrufers, sodass ein Anrufer auf Englisch beginnen und auf Spanisch wechseln kann. Die Transkription folgt. Dies ist das Standardverhalten und benötigt keine Konfiguration.
Wenn Sie bereits wissen, welche Sprachen Ihre Anrufer verwenden, können Sie die Erkennung mithilfe von Sprachhinweisen auf sie ausrichten. Hinweise helfen am meisten, wenn zwei Sprachen ähnlich klingen. Sie helfen auch, wenn kurze Äußerungen — ein einzelnes Wort, eine Ziffer, ein yes/no — dem Modell wenig Spielraum bieten. Du stellst sie ein mit:
x-amz-lex:audio:locale-override:<intentName>:<slotToElicit>
Standard: keine Hinweise — Advanced ASR erkennt die Sprache von selbst.
Definieren Sie das Attribut auf die gleiche Weise wie bei den anderen Steuerelementen in diesem Abschnitt. Verwenden Sie diese Option, *:* um jede Wendung der Konversation zu beeinflussen, oder benennen Sie eine Absicht und ein Zeitfenster, um nur die Abfolge zu beeinflussen, bei denen Sie die erwartete Sprache kennen.
Format des Werts
Stellen Sie den Wert auf die Sprachcodes ein, auf die Sie sich konzentrieren möchten, höchstwahrscheinlich zuerst. Verwenden Sie eine durch Kommas getrennte Liste, die optional in Klammern und Anführungszeichen eingeschlossen ist, wenn dies mit Ihrer Flow- oder Lambda-Funktion einfacher zu erstellen ist. Advanced ASR ignoriert umgebende Leerzeichen und behandelt Unterstriche als Bindestriche, sind also gleichwertig. pt_BR pt-BR
Die folgende Tabelle zeigt beispielhafte Attributwerte und die Sprachen, auf die Advanced ASR jeweils ausgerichtet ist.
| Wert des Attributs | Languages Advanced ASR ist voreingenommen in |
|---|---|
| Das Attribut ist nicht gesetzt | Keine. Advanced ASR erkennt die Sprache anhand der Sprache des Anrufers. |
es,en-US |
Spanisch, dann US-Englisch |
["ja"] |
Japanisch |
[ "es" , "en" ] |
Spanisch, dann Englisch |
fr, de , it |
Französisch, dann Deutsch, dann Italienisch |
Validierung
Jeder Eintrag muss ein gültiger Sprachcode sein. Verwenden Sie einen zwei- oder dreibuchstabigen Basiscode, optional gefolgt von einem Bindestrich und einem Untertag für die Region
es, z. B.,en-USoder.pt-BREinträge, die diesem Formular nicht entsprechen, werden gelöscht, und die verbleibenden gültigen Einträge werden trotzdem übernommen. Wenn kein gültiger Eintrag übrig bleibt, wird die Konversation ohne Hinweise fortgesetzt, anstatt dass sie fehlschlägt.
Advanced ASR durchläuft und ignoriert einen wohlgeformten Code, den es nicht erkennt. Der Code erzeugt keinen Fehler, führt aber auch nicht zu Verzerrungen bei der Erkennung. Überprüfen Sie daher die von Ihnen gesendeten Codes.
Advanced ASR entfernt Duplikate. Es wendet maximal 10 Hinweise an und ignoriert alle Hinweise, die über den zehnten hinausgehen.
Beispiel
Das folgende Beispiel verzerrt die Erkennung einer Leitung, deren Anrufer Spanisch oder Englisch sprechen, wobei Spanisch die gebräuchlichste Sprache ist:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:locale-override:*:*": "es,en-US" } } }
Tun
Lassen Sie das Attribut nicht gesetzt, es sei denn, Sie haben einen bestimmten Grund für eine verzerrte Erkennung. Die Erkennung verarbeitet die meisten mehrsprachigen Konversationen.
Listen Sie nur die Sprachen auf, die Ihre Anrufer tatsächlich sprechen, höchstwahrscheinlich zuerst.
Tun Sie das nicht
Listen Sie Sprachen auf, die Ihre Anrufer nicht tatsächlich sprechen. Eine lange Liste verwässert die Vorurteile und macht den Vorteil, Hinweise zu setzen, zunichte.
Senden Sie einen einzigen Hinweis, um die Konversation auf eine Sprache zu beschränken. Ein Hinweis beeinträchtigt die Erkennung; er schränkt sie nicht ein. Informationen zum Einschränken der Sprachen, in denen der AI-Agent antwortet, finden Sie unterBeschränkung auf bestimmte Sprachen.
Tipp
Sprachhinweise beeinflussen die Spracherkennung — also das, was der Bot hört. Sie ändern nicht, welche Sprache der Bot spricht. Verwenden Sie für die Antwortsprache die Eingabeaufforderung des AI-Agentensystems und eine mehrsprachige Stimme. Siehe Mehrsprachige Sprachkonfiguration.
Umgang mit lang andauernden Toolaufrufen
Wenn ein AI-Agent oder Lambda einen lang andauernden Toolaufruf tätigt (eine Backend-Suche, eine externe API, ein Modellaufruf), bevor der Bot bereit ist, zuzuhören, schweigt der Anrufer. Für den Anrufer kann sich das so anfühlen, als ob der Bot ins Stocken geraten ist oder über ihn gesprochen hat, wenn er endlich reagiert.
Abhilfemaßnahmen:
Schließen Sie die lang andauernde Arbeit ab, bevor der Bot das Mikrofon öffnet. Beenden Sie den Tool-Aufruf, bevor der Bot den nächsten Slot auswählt.
Spielen Sie eine Halte- oder Füllaufforderung ab („Einen Moment, während ich das hochziehe...“), damit der Anrufer nicht schweigend dasitzt.
Aktiviere die Tonwiedergabe beim Aufrufen des Werkzeugs oder nacheinander.
Lassen Sie durch diese Schritte die Option „Barge-In“ aktiviert sein, sodass der Anrufer, wenn er während einer Aufforderung zum Ausfüllen spricht, weitermachen kann.
Tipp
Überprüfen Sie die Latenz von Anfang bis Ende anhand Ihrer tatsächlichen Tool-Aufrufe. Das Ziel ist, dass der Anrufer niemals in einer toten Luft im Backend warten muss.
Kurzreferenz zum ASR-Sitzungsattribut
| Attribut | Standard | Hinweise |
|---|---|---|
x-amz-lex:allow-interrupt:<intent>:<slot> |
true | Barge-in. Auf false Haftungsausschlüsse eingestellt. |
x-amz-lex:audio:end-confidence-threshold:<intent>:<slot> |
0.7 | Primäres EOT-Signal. Bereich 0,5—0,9. Out-of-range abgelehnt. |
x-amz-lex:audio:end-timeout-ms:<intent>:<slot> |
5.000 ms | EOT-Fallback. Bereich 500—10.000 ms. Out-of-range geklemmt. |
x-amz-lex:audio:locale-override:<intent>:<slot> |
Nicht gesetzt | Sprachliche Hinweise beeinflussen die Erkennung. Comma-separated Codes, maximal 10. |
Häufige ASR-Fehler
| Irrtum | Warum ist es schlecht | Reparieren |
|---|---|---|
| Niedriger Konfidenzschwellenwert beim Erfassen diktierter Ziffern | Der Bot sperrt den Anrufer zwischen den Gruppen ab | Erhöhen Sie das Selbstvertrauen und setzen Sie das Timeout auf diesem Slot ein, setzen Sie es danach zurück. |
| Barge-In weltweit deaktivieren | Der Anrufer kann den Bot nirgends korrigieren | Nur bei disclaimer/compliance Eingabeaufforderungen deaktivieren. |
Anwenden einer *:* Standardeinstellung zur Fixierung eines Steckplatzes |
Ändert das Tempo für den gesamten Bot | Beschränken Sie das Attribut auf das Spezifische intent/slot. |
| Schwellenwert auf einen Wert außerhalb von 0,5—0,9 setzen | Die Anfrage wurde mit einem Fehler abgelehnt | Halte es in Reichweite. end-timeout-msKlemmt nur geräuschlos. |
| Lassen Sie das Eingabefenster während eines langen Werkzeugaufrufs geöffnet | Der Anrufer sitzt in der Luft | Beenden Sie zuerst den Werkzeugaufruf oder spielen Sie eine Eingabeaufforderung ab. |
| Behandeln Sie einen erneuten EOT-Prompt wie einen echten Einfall | Bei Allow-Interrupt wurde ein falscher Fix angewendet | Passen Sie stattdessen die Einstellungen für das Ende des Zuges an. |
Auflistung vieler Sprachen in locale-override |
Verwässert die Voreingenommenheit, die es bieten sollte | Listet nur die Sprachen auf, die Anrufer sprechen, höchstwahrscheinlich zuerst. |
Bewährte Methoden für Sprachkommunikation
Amazon Connect Agentic Voice bietet ausdrucksstarke, natürlich klingende Text-to-Speech-Übertragung an über 50 Standorten. Die Engine normalisiert geschriebenen Text automatisch in natürliche Sprache. In den meisten Fällen können Sie Text unverändert weitergeben und ohne spezielle Formatierung hervorragende Ergebnisse erzielen.
Text-Formatierung
Allgemeine Regeln
Übergeben Sie natürlichen, gut unterbrochenen Text. Vollständige Sätze mit normaler Groß- und Kleinschreibung und Interpunktion sorgen für das beste Tempo und die beste Intonation.
Tun Sie:
Verwenden Sie vollständige Sätze mit terminaler Interpunktion (.? !).
Verwenden Sie normale Groß- und Kleinschreibung.
Bewahren Sie Zahlen, Daten und gängige Formate in herkömmlicher Schriftform auf.
Beschränken Sie jede Generation auf mindestens einen vollständigen Satz oder eine vollständige Phrase. Sehr kurze Fragmente klingen in der Regel weniger natürlich.
Tun Sie nicht:
Entfernen Sie die Interpunktion oder erzwingen Sie ALLE GROSSBUCHSTABEN.
Verwende Markdown, rohes JSON, Emoji oder Sonderzeichen.
Senden Sie Zahlen, alphanumerische Zeichen oder Rechtschreib-Tags eigenständig ohne vollständigen Kontext.
Stellen Sie Text fett oder kursiv in Markdown-Schrift um — die Engine versucht, die Sternchen auszusprechen.
Verwenden Sie Klammern, geschweifte Klammern, spitze Klammern und Anführungszeichen.
Automatische Normalisierung
Die Engine liest gängige Schriftformate als natürliche Sprache. In den meisten Fällen müssen Sie sie nicht neu formatieren:
| Typ | Übergeben Sie das | Motor liest als |
|---|---|---|
| Große Zahlen | 1.234.567 | „eine Million zweihundertvierunddreißigtausend...“ |
| Telefonnummern | (415) 555-1212 | Natürliches Taktmuster von Telefonnummern |
| E-Mail-Adressen | user@example.com | „Benutzer bei example dot com“ |
| Datumsangaben | 04/20/2025 | Locale-appropriate Datum lesen |
| Times | 19.00 UHR | „19 Uhr“ |
| Akronyme | NASA, VEREINIGTE STAATEN | Wie erwartet gesprochen |
| Prozentsätze | 12% | „zwölf Prozent“ |
Tipp
E-Mail-Adressen lassen sich gut in schriftlicher Form lesen. Sie können Ihren Agenten auch anweisen, die gesprochene Form direkt auszugeben (z. B. „user at example dot com“), wenn Sie eine präzise Steuerung wünschen.
Schlagworte zur Sprachsteuerung
Die Sprachengine leitet aus dem Inhalt des Transkripts automatisch das richtige Tempo und die richtigen Emotionen ab. Verwenden Sie Kontroll-Tags nur für bestimmte Anwendungsfälle, in denen die Standardeinstellung nicht den Anforderungen entspricht. Alle Tags werden direkt im Protokoll platziert.
Geschwindigkeit
Kontrollieren Sie die Sprechgeschwindigkeit. Bereich: 0,6 (langsam) bis 1,5 (schnell). Standard: 1,0.
<speed ratio="0.85"/>This call may be recorded for quality purposes.
| Wert | Anwendungsfall |
|---|---|
| 0.8 | Lesen wichtiger Informationen oder Rechtssprache |
| 1,0 | Standard — natürliche Gesprächsgeschwindigkeit |
| 1.2 | Faster-paced Dialog |
Um die Geschwindigkeit nach dem Verlangsamen zurückzusetzen:
<speed ratio="0.85"/>Important notice.<speed ratio="1.0"/>Now, how can I help?
Volume
Steuern Sie die Lautstärke. Bereich: 0,5 (leise) bis 2,0 (laut) Standard: 1,0.
<volume ratio="0.5"/>I'll speak softly for this part.
Pausen
Pausen einfügen. Geben Sie die Dauer in Sekunden (s) oder Millisekunden (ms) an.
Your balance is $1,234.<break time="500ms"/>Your next payment is due June 15th.
Verwenden Sie Pausen für:
Tempo zwischen den einzelnen Informationen.
Vor der Rechts- oder Compliance-Sprache.
Zwischen den Menüoptionen in einer IVR.
Anmerkung
Natürliche Interpunktion sollte das erste Mittel zum Pausieren sein. Ein Komma oder ein Punkt ergibt normalerweise die richtige Pause. Pausentags eignen sich am besten für explizite Pausen mit einer bestimmten Dauer.
Spruch
Erzwingt das zeichenweise Auslesen von Codes, IDs, Telefonnummern oder einer beliebigen Zeichenfolge, die Buchstabe für Buchstabe gesprochen werden soll.
Your confirmation code is <spell>TKT4829XB</spell>.
Fügen Sie bei langen Sequenzen ein Leerzeichen in den Spell-Tag-Wrapper ein, um Pausen einzufügen:
Your phone number is <spell>(415)</spell><break time="200ms"/><spell>5551212</spell>.
Alternative Formate (ohne Tags):
Space-delimited: A B C 1 2 3
Gruppiert mit Kommas: A B C, 1 2 3.
Verlangsamt und ausgesprochen: A, B, C, 1, 2, 3
Anmerkung
Das Modell behandelt ALLE GROSSBUCHSTABEN genauso, als würde man ihn in <spell>Tags einwickeln — er wird Buchstabe für Buchstabe vorgelesen. Beispielsweise würde „ACME BANK“ als "“ gesprochen werden A-C-M-E B-A-N-K. Damit das Model es wie ein Wort spricht, verwenden Sie die Standardgroßschreibung: „Acme Bank“.
Emotion
Das Modell leitet auf natürliche Weise aus dem Inhalt den emotionalen Ton ab — in den meisten Fällen sind keine Schlagworte erforderlich. Emotion-Tags sind eine Beta-Funktion und funktionieren am zuverlässigsten, wenn die Emotion mit dem Transkript übereinstimmt.
<emotion value="sympathetic"/>I understand this is frustrating. Let me investigate that for you.
Primäre Emotionen: neutralangry,excited, contentsad, undscared.
Gelächter
Fügen Sie ein[laughter], um ein natürliches Lachen zu erzeugen.
Oh, I've actually heard that one before! [laughter] Alright, let's get this sorted out.
Tag-Referenz
| Markierung | Was macht es | Beispiel |
|---|---|---|
<speed ratio="X"/> |
Sprechgeschwindigkeit (0,6—1,5) | <speed ratio="0.85"/> |
<volume ratio="X"/> |
Lautstärke (0,5—2,0) | <volume ratio="1.5"/> |
<break time="Xs"/> |
Pause (Sekunden oder ms) | <break time="500ms"/> |
<spell>...</spell> |
Character-by-character Ablesung | <spell>AB12CD</spell> |
<emotion value="X"/> |
Emotionaler Ton | <emotion value="content"/> |
[laughter] |
Natürliches Lachen | [laughter] |
Falsch formatierte Tags
Well-formed Die im Matching enthaltenen Tags
<...>werden von der Engine korrekt verarbeitet.Falsch formatierte oder nicht geschlossene Tags werden nicht stillschweigend gelöscht — die Engine spricht den falsch formatierten Text laut vor.
Nicht unterstützte SSML-Wrapper wie
<speak>...</speak>sind nicht erforderlich und sollten nicht enthalten sein.
Tipp
Wenn die Engine auf ein Tag stößt, das sie nicht analysieren kann, versucht sie, den Rohtext einschließlich der Tag-Fragmente vorzulesen. Vergewissern Sie sich immer, dass Ihre Tags richtig geformt sind.
Mehrsprachige Sprachkonfiguration
Amazon Connect Agentic Voice umfasst mehrsprachige Stimmen, die mehrere Sprachen sprechen und während eines Gesprächs nahtlos zwischen ihnen wechseln können. Ein Anrufer kann auf Englisch beginnen, auf Spanisch wechseln, und der Agent folgt ihm — ohne dass Änderungen oder Unterbrechungen erforderlich sind. Im Block Set Voice sind diese Stimmen als polyglotte Stimmen gekennzeichnet. In diesem Handbuch wird der Begriff mehrsprachige Stimmen verwendet, um sie zu beschreiben. In diesem Abschnitt erfahren Sie, wie Sie mehrsprachige Stimmen konfigurieren und worauf Sie achten müssen.
Mehrsprachige Stimmen
Mehrsprachige Stimmen wechseln innerhalb einer einzigen Konversation nativ zwischen den unterstützten Sprachen. Verwenden Sie eine mehrsprachige Stimme, wenn Ihr Contact Center Anrufer bearbeiten muss, die verschiedene Sprachen sprechen oder während eines Anrufs die Sprache wechseln.
| Stimme | Gender | Unterstützte Sprachen |
|---|---|---|
| Katie | Feminin | Englisch, Deutsch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, Norwegisch, Portugiesisch, Russisch |
| Blake | Maskulin | Englisch, Deutsch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, Norwegisch, Portugiesisch, Russisch |
| Brooke | Feminin | Englisch, Deutsch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, Norwegisch, Portugiesisch, Russisch |
| Ronald | Maskulin | Englisch, Deutsch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, Norwegisch, Portugiesisch, Russisch |
| Gemma | feminin | Englisch, Deutsch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, Norwegisch, Portugiesisch, Russisch |
Konfiguration
Schritt 1: Erstellen Sie Ihren Amazon Lex-Bot in der Sprachumgebung der mehrsprachigen Stimme
Wenn Sie eine mehrsprachige Stimme verwenden, benötigen Sie nur ein einziges Amazon Lex-Bot-Gebietsschema. Erstellen Sie Ihren Bot in dem Gebietsschema, das der mehrsprachigen Stimme entspricht (z. B. en-US oder en-GB). Sie müssen nicht jede Sprache, die die mehrsprachige Stimme unterstützt, als separates Gebietsschema in Amazon Lex hinzufügen.
Tun Sie:
Erstellen Sie Ihren Bot in en-US (oder en-GB, wenn Sie eine mehrsprachige Stimme in britischem Englisch verwenden).
Verwenden Sie ein einziges Gebietsschema. Der KI-Agent und die mehrsprachige Sprachsteuerung wickeln mehrsprachige Konversationen ohne zusätzliche Amazon Lex-Gebietsschemas ab.
Tun Sie nicht:
Fügen Sie separate Amazon Lex-Bot-Gebietsschemas für jede Sprache hinzu, die die mehrsprachige Sprachausgabe unterstützt. Das ist unnötig — der AI-Agent kümmert sich um die Sprachumschaltung über die Eingabeaufforderung.
Wenn Sie eine Sprache unterstützen müssen, die nicht in der Liste der unterstützten Sprachen der mehrsprachigen Stimme aufgeführt ist (z. B. Thai oder Tagalog), erstellen Sie einen separaten Bot für dieses Gebietsschema und verwenden Sie eine landesspezifische Stimme. Siehe Verwendung einer nicht mehrsprachigen Agentenstimme in einer anderen Sprache als Englisch.
Schritt 2: Ordnen Sie das Lex-Bot-Gebietsschema dem Block Set Voice zu
Das im Set Voice-Block festgelegte Sprachattribut muss dem Gebietsschema Ihres Lex-Bot entsprechen. Wenn sie nicht übereinstimmen, gibt der Block „Kundeneingabe abrufen“ einen Fehler zurück. Aktualisiere die Blocksprache „Stimme einstellen“, sodass sie mit deinem Bot-Gebietsschema übereinstimmt.
Für mehrsprachige Stimmen, die auf einem englischen Gebietsschema basieren:
Wählen Sie im Block „Stimme festlegen“ die mehrsprachige Stimme aus (z. B. Brooke) und stellen Sie die Sprache auf Englisch (USA) ein.
Ihr Lex-Bot muss en-US als integriertes Gebietsschema haben.
First-turn Begrüßung
In der ersten Runde hat der AI-Agent keine Anrufereingabe erhalten. Ohne Eingabe kann der Agent die Sprache des Anrufers nicht erkennen. Die Stimme spricht den Begrüßungstext, der im Block „Kundeneingabe abrufen“ konfiguriert ist. Wenn Sie möchten, dass der Bot den Anrufer in einer bestimmten Sprache begrüßt, stellen Sie sicher, dass die Begrüßungsnachricht in diesem Block in dieser Sprache verfasst ist.
Wenn Ihre primäre Anruferbasis beispielsweise Spanisch spricht, konfigurieren Sie die Begrüßung Get Customer Input auf Spanisch:
Hola, gracias por llamar. ¿Cómo puedo ayudarle hoy?
Nach der ersten Runde übernimmt der KI-Agent und erkennt die Sprache des Anrufers und folgt ihr für den Rest der Konversation.
Schritt 3: Fügen Sie der Systemaufforderung des AI-Agenten Anweisungen zur Sprachverarbeitung hinzu
Fügen Sie der Systemaufforderung Ihres AI-Agenten einen Abschnitt zur Sprachbehandlung hinzu. Dieser Abschnitt bestimmt das mehrsprachige Verhalten. Der AI-Agent erkennt die Sprache des Anrufers anhand des Transkripts und antwortet in dieser Sprache.
Vorlage (an Ihren Anwendungsfall anpassen):
You are connected to a multilingual voice that supports the following languages: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Language handling rules: Detect the language of the caller's input from the transcription. If the caller speaks in one of the supported languages listed above, respond in that same language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in the supported languages. Always respond in one language at a time. Do not mix languages in a single response unless the caller mixes first. If the caller switches languages mid-conversation, follow their lead immediately. When responding in any non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting (for example, é, ñ, ü, ç). This ensures the voice engine produces natural pronunciation. Keep English brand names, product names, codes, and identifiers in English. Do not translate them.
Tipp
Listen Sie in der Eingabeaufforderung nur die Sprachen auf, die Ihre mehrsprachige Stimme tatsächlich unterstützt. Wenn Sie nicht unterstützte Sprachen auflisten, behauptet der Agent, er könne helfen, aber das TTS erzeugt eine unnatürliche Ausgabe.
Verwendung einer nicht mehrsprachigen Agentenstimme in einer anderen Sprache als Englisch
Wenn Sie eine Agentenstimme verwenden, die keine mehrsprachige Stimme ist (z. B. eine thailändische, koreanische oder portugiesische Stimme), müssen Sie das Sprachattribut explizit festlegen, damit das System an die richtige ASR-Engine weiterleitet.
Option A: Sprachblock einrichten
Wählen Sie Ihre Stimme, die nicht Englisch ist (z. B. eine thailändische Stimme für das T-te Gebietsschema).
Stellen Sie die Sprache auf das entsprechende Gebietsschema ein (z. B. Th-TH).
Erstellen Sie Ihren Lex-Bot mit einem passenden Gebietsschema (th-TH).
Option B: Legen Sie den Block „Kontaktattribute“ fest
Wenn im Block „Spracheinstellungen“ die Spracheinstellung für Ihre Konfiguration nicht angezeigt wird, können Sie die Sprache mithilfe des Blocks „Kontaktattribute festlegen“ vor dem Block „Kundeneingabe abrufen“ festlegen:
Typ — System
Attribut — Sprache
Wert — Der Gebietsschema-Code (z. B. tl-ph für Tagalog, th-TH für Thai)
Beschränkung auf bestimmte Sprachen
Wenn Ihr Kontaktzentrum nur eine Untergruppe von Sprachen unterstützt, vereinfachen Sie die Eingabeaufforderung:
You support English and Spanish on this line only. Detect the language of the caller's input. If the caller speaks English or Spanish, respond in that language. If the caller speaks any other language, respond in English: I apologize, but I can only assist in English or Spanish. How can I help you today? If the caller switches between English and Spanish, follow their lead. Use proper accent marks when responding in Spanish (á, é, í, ó, ú, ñ, ü). Keep brand names and codes in English.
Systemaufforderung für Amazon Connect AI-Agenten
Wenn Amazon Connect AI-Agenten Text generieren, der gesprochen wird, fügen Sie diese Anweisungen zur Sprachformatierung der Systemaufforderung Ihres Agenten hinzu. Kopieren Sie den folgenden Block und fügen Sie ihn direkt in Ihre Eingabeaufforderungskonfiguration ein.
Anmerkung
Diese Eingabeaufforderungen sind Vorlagen, um Ihnen den Einstieg zu erleichtern. Passen Sie sie an Ihren speziellen Anwendungsfall, Ihren Ton und Ihre Geschäftsanforderungen an.
Tipp
Anleitungen zur Optimierung Ihrer AI-Agent-Eingabeaufforderung im Hinblick auf Sprachleistung und Latenz finden Sie unterSchnelle technische Best Practices für KI-Agenten.
Aufforderung zur Formatierung der Sprachausgabe
Speech Output Formatting Everything you output will be spoken aloud by text-to-speech. Follow these rules: GENERAL FORMATTING Use full sentences with normal capitalization. Always end with . ? or ! Use conventional written forms for numbers, dates, acronyms, symbols. Do NOT use markdown, bullet points, headers, bold, raw JSON, emoji, or special characters. Write plain prose only. SPELLING OUT CODES AND IDS For codes or IDs that must be read character-by-character, except for phone numbers, wrap in <spell> tags: Example: Your confirmation code is <spell>TKT4829XB</spell>. Was that the account ending in <spell>1234</spell>? THINGS TO AVOID Do not output bullet points, numbered lists, or structured formatting. Do not use asterisks, hashtags, or markdown syntax. Do not include internal thoughts, reasoning, or meta-commentary. Do not use parentheses, brackets, curly braces, or quotation marks. NATURALNESS Respond as if speaking directly to the caller. Keep responses concise. Avoid long monologues. Use natural transitions like: Let me check that for you. Or: Here is what I found.
Mehrsprachiges Add-on
Wenn Ihr Bot eine mehrsprachige Stimme verwendet, fügen Sie Ihrer Systemaufforderung Folgendes hinzu, um mehrsprachige Antworten zu aktivieren:
Language Handling You are connected to a multilingual voice that supports: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Detect the language of the caller input from the transcription. If the caller speaks in one of the supported locales, respond in that language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in English. Always respond in one language at a time. Do not mix multiple languages in a single response. If the caller switches languages mid-conversation, follow their lead and switch your responses to match. When responding in a non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting. This ensures the voice engine produces natural, native-sounding pronunciation.
Beispiele für Contact-Center
IVR-Begrüßung
Hi, thanks for calling. How can I help you today?
Keine Tags erforderlich — die Engine verarbeitet Konversationsgrüße auf natürliche Weise.
Rechtlicher Hinweis (verlangsamt)
<speed ratio="0.85"/>This call may be recorded for quality assurance purposes. By continuing, you consent to recording.
Kombinieren Sie das Gerät mit deaktiviertem Barge-In auf der Flow-Ebene.
Eine Kontonummer zurücklesen
Mit Rechtschreib-Tags:
Your account number is <spell>1234</spell> <spell>5678</spell> <spell>9012</spell>.
Ohne Rechtschreib-Tags:
Your account number is 1 2 3 4, 5 6 7 8, 9 0 1 2.
Bestätigung mit Referenzcode
I've created your ticket. Your reference number is <spell>TKT4829XB</spell>. Is there anything else I can help with?
Menü-Optionen
Press 1 for billing.<break time="500ms"/>Press 2 for technical support.<break time="500ms"/>Press 3 to speak with an agent.
Buchstabieren Sie den Namen eines Kunden
Let me confirm — your last name is Smith, spelled <spell>SMITH</spell>. Is that correct?
Häufige Fehler bei der Sprachausgabe
| Irrtum | Warum ist es schlecht | Reparieren |
|---|---|---|
| Interpunktion entfernen | Ruiniert Tempo und Intonation | Behalte die natürliche Interpunktion bei. |
| TEXT IN GROSSBUCHSTABEN | Ändert, wie der Motor liest | Verwenden Sie normale Groß- und Kleinschreibung. |
| Einschließlich Abschlag | Die Engine spricht Formatierungszeichen | Vor dem Versand abziehen oder den Agenten anweisen, dies zu vermeiden. |
| Unvollständige Tags streamen | Schlagworte werden als Text vorgelesen | Puffern Sie vollständige Tag-Werte vor dem Senden. |
| Emotionen und Inhalt stimmen nicht überein | Erzeugt eine unnatürliche Leistung | Richten Sie Emotionen am Inhalt aus oder lassen Sie ihn weg. |
| Over-engineering die Aufforderung | Kann die Natürlichkeit reduzieren | Fangen Sie einfach an — fügen Sie Tags nur dort hinzu, wo sie benötigt werden. |
| Non-multilingual Stimme für mehrere Sprachen | Die Stimme behält den primären lokalen Akzent bei | Verwenden Sie eine mehrsprachige Stimme für die Muttersprache. |
| Text mit Markdown fett oder kursiv umschließen | Der Motor spricht die Sternchen laut vor | Entfernen Sie alle Markdown-Formatierungen. |
| Falsch formatierte oder nicht geschlossene Tags senden | Die Engine spricht unformatierten Tag-Text | Validate: Die Tags sind wohlgeformt und mit passenden Klammern versehen. |