Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Le migliori pratiche di Agentic Voice
La voce agentica di Amazon Connect combina il riconoscimento vocale avanzato (ASR) con voci espressive e dal suono naturale per offrire un'esperienza di intelligenza artificiale vocale completa. L'ASR avanzato consente di effettuare conversazioni in tempo reale in modo naturale e a bassa latenza, mentre il motore vocale offre un parlato realistico in oltre 50 lingue. Insieme, questi componenti favoriscono interazioni fluide e simili a quelle umane tra chi chiama e gli agenti AI di Amazon Connect. Questa guida illustra la configurazione e le best practice per entrambi i componenti, in modo da ottenere il massimo dall'esperienza vocale completa di un agente.
Nota
Per utilizzare le funzionalità vocali agentiche di Amazon Connect, assicurati che Amazon Connect Customer sia abilitato per la tua istanza. Amazon Connect agentic voice è il provider vocale predefinito per i clienti Amazon Connect.
Questa guida illustra:
Sintassi degli attributi di sessione per i controlli ASR.
Barge-in comportamento (interrupt) e quando disabilitarlo.
End-of-turn ottimizzazione per Advanced ASR.
Suggerimenti linguistici per il riconoscimento vocale multilingue.
Gestione delle chiamate agli strumenti di lunga durata.
Procedure consigliate per la formattazione del testo per l'output vocale.
Tag di controllo vocale per un controllo vocale dettagliato.
Richieste di sistema per gli agenti AI di Amazon Connect.
Esempi di contact center.
Configurazione vocale multilingue per il supporto multilingue.
Best practice per il riconoscimento vocale avanzato (ASR)
La preferenza per il modello vocale Advanced ASR è un riconoscimento di streaming progettato per effettuare turni naturali e a bassa latenza nelle conversazioni in tempo reale. Invece di affidarsi solo a una finestra fissa di silenzio, valuta il parlato del chiamante mentre parla e prevede quando il chiamante ha finito, ossia la fine del turno (EOT).
Sintassi degli attributi di sessione
I controlli in questa sezione sono impostati con gli attributi di sessione Lex V2 standard nello spazio dei x-amz-lex nomi. Li imposti quando inizi una conversazione e puoi sovrascriverli in una funzione Lambda (ad esempio, per rilassare il rilevamento solo mentre raccogli un valore sensibile).
Assegna ogni attributo a un intento e a uno slot:
x-amz-lex:audio:<setting>:<intentName>:<slotToElicit>
Usa
*come intento o nome dello slot per impostare un valore predefinito che si applica ovunque.Qualsiasi impostazione specifica per l'intento o lo slot ha la precedenza su quella predefinita.
*
Fai:
Imposta valori conservativi solo negli slot che ne hanno bisogno (ad esempio, uno slot con numeri di conto) e lascia tutto il resto sui valori predefiniti.
Reimposta i valori rilassati per lo slot successivo dopo il completamento di una raccolta sensibile.
Non:
Applica un'unica
*:*impostazione predefinita aggressiva a livello globale per correggere uno slot: il ritmo cambia a ogni turno del bot.
Barge-in (comportamento di interruzione)
Barge-in consente al chiamante di interrompere un prompt riprodotto dal bot. È abilitato per impostazione predefinita, che di solito è ciò che desideri per una conversazione naturale. Puoi controllarlo con:
x-amz-lex:allow-interrupt:<intentName>:<slotToElicit>
Impostazione predefinita: true
Disabilita barge-in () false quando:
Utilizzo di un linguaggio legale, di conformità o di divulgazione delle registrazioni che deve essere ascoltato integralmente.
Rileggendo una conferma secondo cui il chiamante non deve parlare.
Mantieni il barge-in abilitato quando:
Il chiamante potrebbe voler correggere o abbreviare il prompt intermedio del bot, una normale conversazione.
Esempio
Se sei un agente AI self-service, per impostazione predefinita lascia il barge-in ovunque. Disattivalo solo quando una richiesta deve essere ascoltata per intero, ad esempio una dichiarazione di non responsabilità legale o di conformità. Imposta gli attributi quando inizi la conversazione. Mantieni attiva l'impostazione predefinita con una *:* voce e disattiva il barge-in solo per l'intento che riproduce la dichiarazione di non responsabilità:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:allow-interrupt:*:*": "true", "x-amz-lex:allow-interrupt:Disclaimer:*": "false" } } }
La voce specifica dell'intento e dello slot ha la precedenza su quella *:* predefinita, quindi il chiamante può interrompere ovunque tranne mentre l'intento sta parlando. Disclaimer Se invece imposti l'attributo disclaimer in una funzione Lambda, impostalo prima che venga visualizzato il prompt del disclaimer. Reimpostalo su «truedopo» in modo che il resto della conversazione rimanga interrompibile.
Nota
Un nuovo prompt basato sul timeout non è un vero e proprio barge-in. Un punto di confusione comune: se un chiamante tace e il fallback di fine turno si attiva, il bot potrebbe terminare il turno o ripetere da solo. Può sembrare un'interruzione, ma si tratta del rilevamento di fine turno, non del chiamante che irrompe. La soluzione è quasi sempre l'ottimizzazione delle impostazioni di fine turno, non il flag allow-interrupt.
End-of-turn messa a punto
L'ASR avanzato termina un turno quando una delle due condizioni viene soddisfatta per prima:
End-of-turn soglia di confidenza: il modello è sufficientemente sicuro che il chiamante abbia terminato la chiamata. Questo è il segnale principale ed è ciò che rende naturale il suono del cambio di turno.
End-of-turn timeout di silenzio: il chiamante è rimasto in silenzio per il tempo configurato. Questo è il fallback (un chiamante che si interrompe o diventa silenzioso).
| Impostazione | attributo di sessione | Predefinita | Intervallo |
|---|---|---|---|
| End-of-turn soglia di confidenza | x-amz-lex:audio:end-confidence-threshold |
0.7 | 0,5—0,9 |
| End-of-turn timeout del silenzio | x-amz-lex:audio:end-timeout-ms |
5.000 ms | 500—10.000 ms |
Valori più alti inducono il bot ad attendere più a lungo e a terminare le virate in modo più prudente (meno interruzioni premature, latenza leggermente superiore). I valori più bassi terminano prima (minore latenza, maggiore possibilità di interrompere il chiamante che interrompe la chiamata). La soglia di confidenza è la leva principale; il timeout del silenzio è importante solo quando la fiducia non è già terminata.
Out-of-range comportamento:
end-confidence-thresholdun valore esterno a 0,5-0,9 viene rifiutato con un errore di attributo di sessione non valido.end-timeout-msinferiore a 500 o superiore a 10.000 viene bloccato silenziosamente al valore supportato più vicino.
Scelta dei valori
| Scenario | Impostazioni consigliate | Note |
|---|---|---|
| Conversazione naturale | Valori predefiniti (0,7/5.000 ms) | Ottimizzato per una presa di turno reattiva e generica. |
| Inserimento sensibile o dettato (OTP, numero di conto) | soglia: 0,9, timeout: 6.000-8.000 ms | Tollera le pause. Reimposta per lo slot successivo dopo la raccolta. |
| Scambi brevi (yes/no, una sola parola) | soglia: ~0,5, timeout: ~500 ms | Curve più veloci. Verifica prima i tagli prematuri. |
Esempio
Rilevamento conservativo di fine turno per lo slot dell'AccountNumberintento: VerifyIdentity
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:VerifyIdentity:AccountNumber": "0.9", "x-amz-lex:audio:end-timeout-ms:VerifyIdentity:AccountNumber": "7000" } } }
Un'unica impostazione predefinita per ogni intento e slot:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:*:*": "0.8", "x-amz-lex:audio:end-timeout-ms:*:*": "800" } } }
Suggerimenti linguistici per il riconoscimento multilingue
L'ASR avanzato riconosce più lingue nella stessa conversazione senza che gli venga detto quali lingue aspettarsi. Rileva la lingua dal parlato del chiamante, quindi un chiamante può iniziare in inglese e passare allo spagnolo e la trascrizione segue. Questo è il comportamento predefinito e non richiede alcuna configurazione.
Se conosci già le lingue utilizzate dai chiamanti, puoi orientare il riconoscimento verso di loro con suggerimenti sulla lingua. I suggerimenti sono di grande aiuto quando due lingue hanno un suono simile. Sono utili anche quando le espressioni brevi (una sola parola, una cifra, una a yes/no ) danno al modello poco su cui lavorare. Li imposti con:
x-amz-lex:audio:locale-override:<intentName>:<slotToElicit>
Impostazione predefinita: nessun suggerimento: Advanced ASR rileva la lingua da solo.
Definisci l'attributo nello stesso modo degli altri controlli in questa sezione. Usalo *:* per distorcere ogni turno della conversazione, oppure assegna un intento e uno slot per distorcere solo i turni in cui conosci la lingua prevista.
Formato del valore
Imposta il valore in base ai codici di lingua che desideri utilizzare, molto probabilmente per primi. Usa un elenco separato da virgole, facoltativamente racchiuso tra parentesi e virgolette se è più facile da produrre dal tuo flusso o dalla funzione Lambda. L'ASR avanzato ignora gli spazi bianchi circostanti e tratta i caratteri di sottolineatura come trattini, quindi sono equivalenti. pt_BR pt-BR
La tabella seguente mostra i valori degli attributi di esempio e le lingue verso cui ciascuno predilige Advanced ASR.
| Valore dell'attributo | Languages Advanced ASR è orientato verso |
|---|---|
| Attributo non impostato | Nessuna. L'ASR avanzato rileva la lingua dal parlato del chiamante. |
es,en-US |
Spagnolo, poi inglese americano |
["ja"] |
Giapponese |
[ "es" , "en" ] |
Spagnolo, poi inglese |
fr, de , it |
Francese, poi tedesco, poi italiano |
Convalida
Ogni voce deve contenere un codice linguistico valido. Utilizza un codice base di due o tre lettere, seguito facoltativamente da un trattino e da un sottotag regionale, ad esempio
es, o.en-USpt-BRLe voci che non corrispondono a quel modulo vengono eliminate e le restanti voci valide vengono comunque applicate. Se non rimane alcun elemento valido, la conversazione prosegue senza suggerimenti invece di fallire.
L'ASR avanzato trasmette e ignora un codice ben formato che non riconosce. Il codice non genera errori, ma non pregiudica nemmeno il riconoscimento, quindi verificate i codici inviati.
L'ASR avanzato rimuove i duplicati. Applica al massimo 10 suggerimenti e ignora quelli oltre il decimo.
Esempio
L'esempio seguente pregiudica il riconoscimento di una linea i cui chiamanti parlano spagnolo o inglese, dove lo spagnolo è la lingua più comune:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:locale-override:*:*": "es,en-US" } } }
Fai
Lascia l'attributo non impostato a meno che tu non abbia un motivo specifico per pregiudicare il riconoscimento. Il rilevamento gestisce la maggior parte delle conversazioni multilingue.
Elenca solo le lingue effettivamente parlate dai chiamanti, molto probabilmente per prime.
Non farlo
Elenca le lingue oltre a quelle effettivamente parlate dai tuoi chiamanti. Un lungo elenco attenua i pregiudizi ed elimina del tutto il vantaggio di impostare suggerimenti.
Invia un solo suggerimento per bloccare la conversazione in una lingua. Un suggerimento pregiudica il riconoscimento, non lo limita. Per limitare le lingue in cui risponde l'agente AI, vedi. Limitazione a lingue specifiche
Suggerimento
Suggerimenti linguistici: distorsioni, riconoscimento vocale: ciò che il bot sente. Non cambiano la lingua parlata dal bot. Per la lingua di risposta, utilizza il prompt del sistema dell'agente AI e una voce multilingue. Consulta Configurazione vocale multilingue.
Gestione delle chiamate agli strumenti di lunga durata
Quando un agente AI o Lambda effettua una lunga chiamata allo strumento (una ricerca nel backend, un'API esterna, una chiamata al modello) prima che il bot sia pronto ad ascoltare, il chiamante resta in silenzio. Al chiamante può sembrare che il bot si sia bloccato o abbia parlato di lui quando finalmente risponde.
Mitigazioni:
Completa il lungo lavoro prima che il bot apra il microfono. Termina la chiamata allo strumento prima che il bot ottenga lo slot successivo.
Riproduci un messaggio di attesa o di riempimento («Un momento mentre lo apro...») in modo che il chiamante non rimanga seduto in silenzio.
Attiva i suoni di riempimento durante le chiamate agli strumenti o turno dopo turno.
Mantieni abilitato il barge-in seguendo questi passaggi, in modo che se il chiamante parla durante una richiesta di riempimento, possa procedere con le operazioni.
Suggerimento
Convalida la latenza end-to-end con le chiamate effettive all'utensile. L'obiettivo è che il chiamante non venga mai lasciato in attesa nel backend.
Riferimento rapido agli attributi di sessione ASR
| Attributo | Predefinita | Note |
|---|---|---|
x-amz-lex:allow-interrupt:<intent>:<slot> |
true | Barge-in. Impostato false per le dichiarazioni di non responsabilità. |
x-amz-lex:audio:end-confidence-threshold:<intent>:<slot> |
0.7 | Segnale EOT primario. Intervallo 0,5—0,9. Out-of-range rifiutato. |
x-amz-lex:audio:end-timeout-ms:<intent>:<slot> |
5.000 ms | riserva EOT. Intervallo 500—10.000 ms. Out-of-range bloccato. |
x-amz-lex:audio:locale-override:<intent>:<slot> |
Non impostato | Il linguaggio suggerisce un riconoscimento distorto. Comma-separated codici, max 10. |
Errori ASR comuni
| Errore | Perché è brutto | Correggere |
|---|---|---|
| Soglia di confidenza bassa durante la raccolta di cifre dettate | Il bot interrompe il chiamante tra i gruppi | Aumenta la confidenza e il timeout in quello slot, ripristina dopo. |
| Disattivazione del barge-in a livello globale | Il chiamante non può correggere il bot da nessuna parte | Disabilita solo su richiesta disclaimer/compliance . |
Applicazione di un *:* valore predefinito per correggere uno slot |
Cambia il ritmo dell'intero bot | Assegna l'attributo allo specifico intent/slot. |
| Impostazione di una soglia diversa da 0,5-0,9 | La richiesta viene rifiutata con un errore | Tienila entro il raggio d'azione. Si end-timeout-ms blocca solo silenziosamente. |
| Lasciare aperta la finestra di immissione durante una lunga chiamata all'utensile | Il chiamante è seduto nell'aria morta | Termina prima la chiamata allo strumento o riproduci un prompt di riempimento. |
| Considerare un nuovo prompt EOT come un vero e proprio barge-in | Correzione errata applicata a allow-interrupt | Regola invece le impostazioni di fine turno. |
Elenca molte lingue in locale-override |
Diluisce la distorsione che era stata impostata | Elenca solo le lingue parlate dai chiamanti, molto probabilmente per prime. |
Le migliori pratiche vocali
La voce agentica di Amazon Connect offre una sintesi vocale espressiva e dal suono naturale in oltre 50 lingue. Il motore normalizza automaticamente il testo scritto in un linguaggio naturale. Nella maggior parte dei casi, è possibile passare il testo così com'è e ottenere ottimi risultati senza alcuna formattazione speciale.
Formattazione del testo
Regole generali
Passa un testo naturale e ben punteggiato. Le frasi complete con maiuscole e punteggiatura normali producono il ritmo e l'intonazione migliori.
Fai:
Usa frasi complete con punteggiatura terminale (.? !).
Usa le maiuscole normali.
Mantieni numeri, date e formati comuni nella forma scritta convenzionale.
Mantieni ogni generazione almeno una frase o frase completa. I frammenti molto brevi tendono a sembrare meno naturali.
Non:
Elimina la punteggiatura o forza TUTTO MAIUSCOLO.
Includi markdown, JSON grezzo, emoji o caratteri speciali.
Invia numeri, caratteri alfanumerici o tag ortografici da soli senza un contesto completo.
Inserisci il testo in grassetto o corsivo: il motore tenterà di pronunciare gli asterischi.
Usa parentesi, parentesi, parentesi graffe, parentesi angolari e virgolette.
Normalizzazione automatica
Il motore legge i formati scritti più comuni come linguaggio naturale. La maggior parte delle volte, non è necessario riformattarli:
| Tipo | Passa questo | Il motore legge come |
|---|---|---|
| Numeri grandi | 1.234.567 | «un milione duecentotrentaquattromila...» |
| Numeri di telefono | (415) 555-1212 | Spaziatura naturale dei numeri di telefono |
| Indirizzi e-mail | utente@esempio.com | «utente di esempio dot com» |
| Date: | 04/20/2025 | Locale-appropriate lettura della data |
| Volte | 19:00 | «sette del pomeriggio» |
| Acronimi | NASA, STATI UNITI | Parlato come previsto |
| Percentuali | 12% | «dodici percento» |
Suggerimento
Gli indirizzi e-mail si leggono bene in forma scritta. Puoi anche chiedere al tuo agente di inviare direttamente il modulo vocale (ad esempio, «user at example dot com») se desideri un controllo preciso.
Tag per il controllo vocale
Il motore vocale deduce automaticamente il ritmo e le emozioni appropriati dal contenuto della trascrizione. Utilizza i tag di controllo solo per casi d'uso specifici in cui l'impostazione predefinita non soddisfa. Tutti i tag vengono inseriti direttamente nella trascrizione.
Velocità
Controlla la velocità del parlato. Intervallo: da 0,6 (lento) a 1,5 (veloce). Predefinito: 1,0.
<speed ratio="0.85"/>This call may be recorded for quality purposes.
| Valore | Da usare quando |
|---|---|
| 0.8 | Lettura di informazioni importanti o di un linguaggio legale |
| 1.0 | Impostazione predefinita: velocità di conversazione naturale |
| 1.2 | Faster-paced dialogo |
Per ripristinare la velocità dopo il rallentamento:
<speed ratio="0.85"/>Important notice.<speed ratio="1.0"/>Now, how can I help?
Volume
Controlla il volume. Intervallo: da 0,5 (silenzioso) a 2,0 (alto). Predefinito: 1,0.
<volume ratio="0.5"/>I'll speak softly for this part.
Interruzioni
Inserisci pause. Specificate la durata in secondi (s) o millisecondi (ms).
Your balance is $1,234.<break time="500ms"/>Your next payment is due June 15th.
Usa le pause per:
Intervallo tra le informazioni.
Prima del linguaggio legale o di conformità.
Tra le opzioni di menu in un IVR.
Nota
La punteggiatura naturale dovrebbe essere il primo strumento per mettere in pausa. Una virgola o un punto di solito produce la pausa giusta. È meglio riservare i tag di interruzione ai silenzi espliciti di durata specifica.
Ortografia
Forza la lettura carattere per carattere di codici, ID, numeri di telefono o qualsiasi stringa che deve essere pronunciata lettera per lettera.
Your confirmation code is <spell>TKT4829XB</spell>.
Per sequenze lunghe, aggiungi uno spazio all'interno del wrapper del tag ortografico per inserire le pause:
Your phone number is <spell>(415)</spell><break time="200ms"/><spell>5551212</spell>.
Formati alternativi (senza tag):
Space-delimited: A B C 1 2 3
Raggruppato con virgole: A B C, 1 2 3.
Rallentato ed enunciato: A, B, C, 1, 2, 3
Nota
Il modello tratta il testo TUTTO MAIUSCOLO come se lo racchiudesse in <spell>tag: verrà letto lettera per lettera. Ad esempio, «ACME BANK» verrebbe pronunciato come "». A-C-M-E B-A-N-K Affinché il modello lo pronunci come una parola, usa le maiuscole standard: «Acme Bank».
Emozione
Il modello deduce naturalmente il tono emotivo dai contenuti: nella maggior parte dei casi non sono necessari tag. I tag emozionali sono una funzionalità beta e funzionano in modo più affidabile quando l'emozione corrisponde alla trascrizione.
<emotion value="sympathetic"/>I understand this is frustrating. Let me investigate that for you.
Emozioni primarie: neutralangry,,excited, contentsad, e. scared
Risate
Inseriscilo [laughter] per produrre una risata naturale.
Oh, I've actually heard that one before! [laughter] Alright, let's get this sorted out.
Riferimento al tag
| Tag | Cosa fa | Esempio |
|---|---|---|
<speed ratio="X"/> |
Velocità di conversazione (0,6-1,5) | <speed ratio="0.85"/> |
<volume ratio="X"/> |
Intensità acustica (0,5-2,0) | <volume ratio="1.5"/> |
<break time="Xs"/> |
Pausa (secondi o ms) | <break time="500ms"/> |
<spell>...</spell> |
Character-by-character leggere ad alta voce | <spell>AB12CD</spell> |
<emotion value="X"/> |
Tono emotivo | <emotion value="content"/> |
[laughter] |
Risate naturali | [laughter] |
Tag non validi
Well-formed i tag racchiusi nella corrispondenza
<...>vengono elaborati correttamente dal motore.I tag non validi o non chiusi non verranno eliminati automaticamente: il motore pronuncerà il testo non valido ad alta voce.
I wrapper SSML non supportati, ad esempio, non sono obbligatori e non devono essere inclusi.
<speak>...</speak>
Suggerimento
Se il motore incontra un tag che non è in grado di analizzare, tenterà di pronunciare il testo non elaborato, inclusi i frammenti di tag. Verifica sempre che i tag siano ben formati.
Configurazione vocale multilingue
La voce agentica di Amazon Connect include voci multilingue in grado di parlare più lingue e di passare facilmente da una all'altra durante una conversazione. Un chiamante può iniziare in inglese, passare allo spagnolo e l'agente la segue, senza dover cambiare o interrompere il flusso. Nel blocco Set Voice, queste voci sono etichettate come voci poliglotte. Questa guida utilizza il termine voci multilingue per descriverle. Questa sezione spiega come configurare le voci multilingue e a cosa prestare attenzione.
Voci multilingue
Le voci multilingue passano in modo nativo da una lingua all'altra all'interno di una singola conversazione. Usa una voce multilingue quando il tuo contact center deve gestire i chiamanti che parlano lingue diverse o cambiano lingua durante una chiamata.
| Voce | Gender | Lingue supportate |
|---|---|---|
| Katie | Femminile | Inglese, tedesco, spagnolo, francese, hindi, italiano, giapponese, norvegese, portoghese, russo |
| Blake | Mascolino | Inglese, tedesco, spagnolo, francese, hindi, italiano, giapponese, norvegese, portoghese, russo |
| Brooke | Femminile | Inglese, tedesco, spagnolo, francese, hindi, italiano, giapponese, norvegese, portoghese, russo |
| Ronald | Mascolino | Inglese, tedesco, spagnolo, francese, hindi, italiano, giapponese, norvegese, portoghese, russo |
| Gemma | Femminile | Inglese, tedesco, spagnolo, francese, hindi, italiano, giapponese, norvegese, portoghese, russo |
Configurazione
Passaggio 1: crea il tuo bot Amazon Lex nelle impostazioni locali della voce multilingue
Se utilizzi una voce multilingue, ti serve una sola locale del bot Amazon Lex. Crea il tuo bot nella lingua corrispondente alla voce multilingue (ad esempio, en-US o en-GB). Non è necessario aggiungere tutte le lingue supportate dalla voce multilingue come impostazioni locali separate in Amazon Lex.
Fai:
Crea il tuo bot in en-US (o en-GB se usi una voce multilingue inglese del Regno Unito).
Usa un'unica lingua. L'agente AI e la voce multilingue gestiscono le conversazioni multilingue senza impostazioni locali aggiuntive di Amazon Lex.
Non:
Aggiungi versioni locali dei bot di Amazon Lex separate per ogni lingua supportata dalla voce multilingue. Non è necessario: l'agente AI gestisce il cambio di lingua tramite il prompt.
Se devi supportare una lingua che non è presente nell'elenco delle lingue supportate dalla voce multilingue (ad esempio, tailandese o tagalog), crea un bot separato per quella lingua e utilizza una voce specifica per la lingua. Consulta Usare una voce agentica non multilingue in una lingua diversa dall'inglese.
Passo 2: Abbina la localizzazione del bot Lex al blocco Set Voice
L'attributo della lingua impostato nel blocco Set Voice deve corrispondere alla lingua del tuo bot Lex. Se non corrispondono, il blocco Get Customer Input restituisce un errore. Aggiorna la lingua del blocco vocale in modo che corrisponda alle impostazioni locali del bot.
Per le voci multilingue basate su una lingua inglese:
Nel blocco Set Voice, seleziona la voce multilingue (ad esempio, Brooke) e imposta la lingua su inglese (Stati Uniti).
Il tuo bot Lex deve avere en-US come locale integrato.
First-turn saluto
Al primo turno, l'agente AI non ha ricevuto alcun input dal chiamante. Senza input, l'agente non è in grado di rilevare la lingua del chiamante. La voce pronuncia il testo di saluto configurato nel blocco Get Customer Input. Se desideri che il bot saluti il chiamante in una lingua specifica, assicurati che il messaggio di saluto in quel blocco sia scritto in quella lingua.
Ad esempio, se la tua base di chiamate principale parla spagnolo, configura il messaggio di saluto Get Customer Input in spagnolo:
Hola, gracias por llamar. ¿Cómo puedo ayudarle hoy?
Dopo il primo turno, l'agente AI subentra e rileva e segue la lingua del chiamante per il resto della conversazione.
Passaggio 3: aggiungi le istruzioni per la gestione della lingua al prompt del sistema dell'agente AI
Aggiungi una sezione per la gestione della lingua al prompt di sistema del tuo agente AI. Questa sezione determina il comportamento multilingue. L'agente AI rileva la lingua del chiamante dalla trascrizione e risponde in quella lingua.
Modello (personalizzabile in base al tuo caso d'uso):
You are connected to a multilingual voice that supports the following languages: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Language handling rules: Detect the language of the caller's input from the transcription. If the caller speaks in one of the supported languages listed above, respond in that same language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in the supported languages. Always respond in one language at a time. Do not mix languages in a single response unless the caller mixes first. If the caller switches languages mid-conversation, follow their lead immediately. When responding in any non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting (for example, é, ñ, ü, ç). This ensures the voice engine produces natural pronunciation. Keep English brand names, product names, codes, and identifiers in English. Do not translate them.
Suggerimento
Nel prompt elenca solo le lingue effettivamente supportate dalla tua voce multilingue. L'elenco delle lingue non supportate fa sì che l'agente affermi che può essere utile, ma il TTS produce risultati innaturali.
Usare una voce agentica non multilingue in una lingua diversa dall'inglese
Se si utilizza una voce agentica che non è una voce multilingue (ad esempio, una voce tailandese, coreana o portoghese), è necessario impostare esplicitamente l'attributo language in modo che il sistema indirizzi il motore ASR corretto.
Opzione A: imposta il blocco vocale
Seleziona la tua voce non inglese (ad esempio, una voce tailandese per la decima lingua).
Imposta la lingua nella locale corrispondente (ad esempio, TH-esimo).
Crea il tuo bot Lex con una lingua corrispondente (th-th).
Opzione B: imposta il blocco degli attributi dei contatti
Se il blocco Set Voice non espone l'impostazione della lingua per la configurazione, puoi impostare la lingua utilizzando il blocco Set Contact Attributes prima del blocco Get Customer Input:
Tipo: sistema
Attributo — Lingua
Valore: il codice locale (ad esempio, TL-ph per il tagalog, TH-Th per il tailandese)
Limitazione a lingue specifiche
Se il tuo contact center supporta solo un sottoinsieme di lingue, semplifica la richiesta:
You support English and Spanish on this line only. Detect the language of the caller's input. If the caller speaks English or Spanish, respond in that language. If the caller speaks any other language, respond in English: I apologize, but I can only assist in English or Spanish. How can I help you today? If the caller switches between English and Spanish, follow their lead. Use proper accent marks when responding in Spanish (á, é, í, ó, ú, ñ, ü). Keep brand names and codes in English.
Richiesta di sistema per gli agenti AI di Amazon Connect
Quando gli agenti AI di Amazon Connect generano un testo da pronunciare, aggiungi queste istruzioni di formattazione vocale al prompt di sistema del tuo agente. Copia e incolla il blocco sottostante direttamente nella configurazione del prompt.
Nota
Questi prompt sono modelli per iniziare. Modificali in base al tuo caso d'uso, al tono e ai requisiti aziendali specifici.
Suggerimento
Per indicazioni su come ottimizzare le prestazioni vocali e la latenza del prompt degli agenti AI, consulta. Best practice ingegneristiche rapide per gli agenti di intelligenza artificiale
Richiesta di formattazione dell'output vocale
Speech Output Formatting Everything you output will be spoken aloud by text-to-speech. Follow these rules: GENERAL FORMATTING Use full sentences with normal capitalization. Always end with . ? or ! Use conventional written forms for numbers, dates, acronyms, symbols. Do NOT use markdown, bullet points, headers, bold, raw JSON, emoji, or special characters. Write plain prose only. SPELLING OUT CODES AND IDS For codes or IDs that must be read character-by-character, except for phone numbers, wrap in <spell> tags: Example: Your confirmation code is <spell>TKT4829XB</spell>. Was that the account ending in <spell>1234</spell>? THINGS TO AVOID Do not output bullet points, numbered lists, or structured formatting. Do not use asterisks, hashtags, or markdown syntax. Do not include internal thoughts, reasoning, or meta-commentary. Do not use parentheses, brackets, curly braces, or quotation marks. NATURALNESS Respond as if speaking directly to the caller. Keep responses concise. Avoid long monologues. Use natural transitions like: Let me check that for you. Or: Here is what I found.
Componente aggiuntivo multilingue
Se il bot utilizza una voce multilingue, aggiungi quanto segue al prompt di sistema per abilitare le risposte multilingue:
Language Handling You are connected to a multilingual voice that supports: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Detect the language of the caller input from the transcription. If the caller speaks in one of the supported locales, respond in that language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in English. Always respond in one language at a time. Do not mix multiple languages in a single response. If the caller switches languages mid-conversation, follow their lead and switch your responses to match. When responding in a non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting. This ensures the voice engine produces natural, native-sounding pronunciation.
Esempi di contact center
Saluto IVR
Hi, thanks for calling. How can I help you today?
Non sono necessari tag: il motore gestisce i saluti conversazionali in modo naturale.
Dichiarazione di non responsabilità legale (rallentata)
<speed ratio="0.85"/>This call may be recorded for quality assurance purposes. By continuing, you consent to recording.
Abbinalo al barge-in disabilitato a livello del flusso.
Rileggendo un numero di conto
Con tag ortografici:
Your account number is <spell>1234</spell> <spell>5678</spell> <spell>9012</spell>.
Senza tag ortografici:
Your account number is 1 2 3 4, 5 6 7 8, 9 0 1 2.
Conferma con codice di riferimento
I've created your ticket. Your reference number is <spell>TKT4829XB</spell>. Is there anything else I can help with?
Opzioni di menu
Press 1 for billing.<break time="500ms"/>Press 2 for technical support.<break time="500ms"/>Press 3 to speak with an agent.
Digitare il nome di un cliente
Let me confirm — your last name is Smith, spelled <spell>SMITH</spell>. Is that correct?
Errori di sintesi vocale comuni
| Errore | Perché è brutto | Correggere |
|---|---|---|
| Eliminazione della punteggiatura | Rovina il ritmo e l'intonazione | Mantieni la punteggiatura naturale. |
| Testo TUTTO IN MAIUSCOLO | Cambia la modalità di lettura del motore | Usa le maiuscole normali. |
| Markdown incluso | Il motore parla la formattazione dei caratteri | Spogliati prima dell'invio o chiedi all'agente di evitarlo. |
| Streaming di tag incompleti | I tag vengono letti ad alta voce come testo | Memorizza nel buffer i valori completi dei tag prima dell'invio. |
| Emozioni + contenuti non corrispondenti | Produce un output innaturale | Allinea l'emozione al contenuto o omettila. |
| Over-engineering il prompt | Può ridurre la naturalezza | Inizia in modo semplice: aggiungi tag solo dove necessario. |
| Non-multilingual voce per più lingue | La voce mantiene l'accento locale principale | Usa una voce multilingue per la pronuncia nativa. |
| Disporre il testo in markdown, grassetto o corsivo | Engine pronuncia gli asterischi ad alta voce | Rimuovi tutta la formattazione markdown. |
| Invio di tag non corretti o non chiusi | Il motore pronuncia il testo grezzo dei tag | I tag di convalida sono ben formati con parentesi corrispondenti. |