View a markdown version of this page

Osservabilità e controllo dei costi - Fondamento Amazon AgentCore

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Osservabilità e controllo dei costi

Questa pagina illustra il monitoraggio del cablaggio, il controllo dei costi di esecuzione e la gestione dei tag delle risorse.

Osservabilità

Ogni chiamata all'harness genera automaticamente tracce, log e metriche tramite Observability in. AgentCore CloudWatch Richiami di modelli, invocazioni di strumenti, operazioni di memoria, comandi di shell: ogni passaggio viene visualizzato con i dettagli di tempistica e payload. Nessuna configurazione aggiuntiva. Le tracce sono disponibili sin dalla prima chiamata.

Le tracce, i log e le metriche fluiscono CloudWatch attraverso il ruolo di esecuzione di Harness. Visualizzali nella dashboard di AgentCore Observability o esegui interrogazioni a livello di codice tramite i log e le API. CloudWatch X-Ray

Prima di vedere le tracce, abilita Transaction Search in CloudWatch (una tantum per account). Per i dettagli sulla configurazione, consulta AgentCore Observability getting started.

Per saperne di più: Panoramica dell'osservabilità · metriche · telemetria https://docs.aws.amazon.com/bedrock-agentcore/latest/devguide/observability-telemetry.html

CloudTrail

Le operazioni di Harness vengono registrate AWS CloudTrail come eventi di gestione (piano di controllo) ed eventi di dati (piano dati). In CloudTrail, le risorse Harness vengono visualizzate sotto il tipo di AWS::BedrockAgentCore::Runtime risorsa anziché in un tipo specifico dell'harness. Harness è un'astrazione gestita su AgentCore Runtime e CloudTrail gli eventi riflettono la risorsa di runtime sottostante per motivi di coerenza.

Tutti gli CloudTrail eventi harness utilizzano =. resources.type AWS::BedrockAgentCore::Runtime I nomi degli eventi sono:

  • CreateHarness,UpdateHarness,DeleteHarness,GetHarness, ListHarnesses (eventi di gestione)

  • InvokeAgentRuntime, InvokeAgentRuntimeCommand (eventi relativi ai dati)

Nota

Le operazioni del piano dati vengono visualizzate come InvokeAgentRuntime e InvokeAgentRuntimeCommand dentro CloudTrail, corrispondenti all'API Runtime sottostante. Il resources.ARN campo contiene l'harness ARN per gli eventi del piano di controllo e l'ARN di runtime per gli eventi del piano dati.

Comprendi i costi del cablaggio

Non sono previsti costi aggiuntivi per l'imbracatura stessa. Si pagano tariffe standard per le funzionalità sottostanti utilizzate dall'imbracatura. Per le tariffe correnti, consulta i AgentCore prezzi di Amazon Bedrock e la pagina dei prezzi del tuo fornitore di modelli.

La tabella seguente descrive le funzionalità che possono comportare costi quando si utilizza l'imbracatura.

Funzionalità Quando si applicano le spese Cosa determina l'utilizzo

AgentCore Runtime

AgentCore Runtime avvia una microVM per ogni sessione di harness.

AgentCore Il runtime fattura il consumo effettivo della CPU e il picco di memoria consumato ogni secondo dall'avvio alla chiusura della microVM, incluso il sovraccarico del sistema. I costi della CPU non vengono applicati durante l' I/O attesa del modello o dello strumento se nessun processo in background utilizza la CPU. La memoria rimane fatturabile durante l'esecuzione della sessione.

Inferenza del modello

Il fornitore del modello fattura ogni volta che l'agente chiama il modello configurato. Una chiamata al cablaggio può effettuare più chiamate al modello.

Il provider calcola gli addebiti in base ai token di input e output. L'input include il prompt del sistema, la cronologia delle conversazioni, la memoria recuperata, le istruzioni sulle abilità e le definizioni degli strumenti consentiti. Per informazioni generali sulla definizione degli strumenti, consulta. Tools (Strumenti)

AgentCore Memoria

AgentCore La memoria si attiva quando l'imbracatura scrive eventi o recupera record. La memoria gestita è abilitata per impostazione predefinita; i costi si applicano anche alla memoria collegata.

AgentCore La memoria misura i nuovi eventi a breve termine, i record di memoria a lungo termine archiviati e le richieste di recupero della memoria a lungo termine.

AgentCore Browser e interprete di codice

Browser e Code Interpreter fatturano quando l'agente utilizza questi strumenti configurati.

Ogni servizio misura il consumo attivo di CPU e memoria per le sue sessioni. Le definizioni dei loro strumenti possono comunque aggiungere token di input del modello quando consentito, anche se l'agente non li chiama.

AgentCore Gateway e Web Search

Il gateway fattura quando il dispositivo rileva o richiama strumenti, esegue ricerche o utilizza strumenti indicizzati. Web Search fattura quando l'harness invia una richiesta.

Gateway misura le operazioni API, le query di ricerca e gli strumenti indicizzati, a seconda dei casi. Web Search misura le proprie query separatamente.

Osservabilità

CloudWatch fattura le tracce, i log e le metriche emessi da ogni chiamata.

CloudWatch misura l'acquisizione, l'archiviazione e l'utilizzo delle query.

Archiviazione e rete

I servizi di archiviazione e rete vengono fatturati quando si utilizza un contenitore personalizzato, file system persistenti o trasferimento di dati.

Amazon ECR misura l'archiviazione delle immagini. Amazon S3 ed EFS misurano l'utilizzo delle risorse. Le velocità di trasferimento dati standard si applicano al traffico di rete.

Stima del costo di runtime

La fatturazione in fase di esecuzione utilizza il consumo attivo al secondo anziché il tempo di istanza assegnato:

CPU cost = consumed vCPU-seconds / 3,600 * vCPU-hour rate Memory cost = sum of peak GB consumed in each second / 3,600 * GB-hour rate

Non stimate il costo della CPU basandovi solo sull'orologio a parete o sulla durata della sessione. Le I/O attese di modelli e strumenti non comportano addebiti per la CPU se nessun altro processo utilizza la CPU. Tuttavia, il consumo di memoria rimane fatturabile. Un valore più breve idleRuntimeSessionTimeout può ridurre il tempo di fatturazione della memoria dopo l'ultima chiamata, al costo di avviamenti a freddo più frequenti.

Utilizzo di misure e attributi

  • Leggi metadata gli eventi nel flusso di invocazione per l'utilizzo del token del modello.

  • Usa le tracce AgentCore di osservabilità, CloudWatch i log e le X-Ray API per identificare le chiamate ai modelli, le chiamate agli strumenti, le operazioni di memoria e la loro durata. Observability spiega l'attività ma non è un rapporto di fatturazione.

  • Utilizza AWS Cost Explorer o il rapporto AWS sui costi e sull'utilizzo per l'utilizzo fatturato. Attiva i tag Harness come tag di allocazione dei costi per filtrare gli addebiti supportati.

I tag Harness si propagano al Runtime gestito, all'endpoint Runtime e alla memoria gestita creata per l'harness. Contrassegna in modo indipendente le risorse create separatamente, come Gateway, EFS, S3 o una risorsa Bring-Your-Own Memory.

Controlla i costi con limiti

Imposta dei limiti rigidi in modo che un agente in fuga non possa esaurire le risorse:

  • maxIterations- reasoning/action cicli per chiamata. Impostazione predefinita: 75.

  • timeoutSeconds- Timeout dell'orologio da parete per una singola chiamata. Impostazione predefinita: 3600.

  • maxTokens- budget in token per chiamata. Impostazione predefinita. N/A

  • idleRuntimeSessionTimeout- per quanto tempo una microVM inattiva rimane calda. Valore predefinito 900.

  • maxLifetime- durata massima di una sessione MicroVM. Valore predefinito 28800.

Tutti i limiti sono opzionali; omettili per utilizzare le impostazioni predefinite del servizio. Poiché harness è supportato da AgentCore Runtime, anche le chiamate di harness sono soggette alle quote di servizio Runtime. Per ulteriori informazioni, vedere AgentCore harness Service Quotas e Runtime Service Quotas. AgentCore

Esempio
AWS CLI/boto3
aws bedrock-agentcore-control update-harness \ --harness-id "MyHarness-UuFdkQoXSL" \ --max-iterations 50 \ --timeout-seconds 1800 \ --max-tokens 8192

Oppure esegui l'override su una singola chiamata passando, o inserendo. maxIterations timeoutSeconds maxTokens invoke_harness

AgentCore CLI

Imposta i valori predefiniti:

agentcore add harness --name bounded-agent \ --max-iterations 50 --timeout 1800 --max-tokens 8192 \ --truncation-strategy sliding_window \ --idle-timeout 600 --max-lifetime 14400 agentcore deploy

La --truncation-strategy bandiera accetta sliding_window o. summarization I --max-lifetime flag --idle-timeout and impostano i limiti del ciclo di vita in secondi.

Sostituisci una singola chiamata:

agentcore invoke --harness bounded-agent --max-iterations 20 --harness-timeout 600 \ "Quick lookup: what's the weather in Seattle?"

Tag

Applica dei tag alla tua imbracatura per l'allocazione dei costi e il controllo degli accessi.

Esempio
AWS CLI/boto3
aws bedrock-agentcore-control create-harness \ --harness-name "MyHarness" \ --execution-role-arn "arn:aws:iam::123456789012:role/MyHarnessRole" \ --tags '{"team": "platform", "environment": "staging"}'
AgentCore CLI

Imposta i tag in: harness.json

{ "tags": { "team": "platform", "environment": "staging" } }

Esegui agentcore deploy per candidarti.

I tag Harness si propagano al Runtime gestito, all'endpoint Runtime e alla memoria gestita creata per l'harness. Le risorse create separatamente mantengono i propri tag.