Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Evaluieren Sie mit Inspect AI Container
Der SageMaker Inspect AI-Container führt LLM-Modellevaluierungen für SageMaker Trainingsjobs durch. Der Container verwendet Inspect AI
Frühere Bewertungsansätze (basierend auf Lighteval
-Übersicht
Zu den wichtigsten Vorteilen gehören:
-
Bringen Sie Ihre eigenen Benchmarks mit — schreiben Sie Bewertungsaufgaben im Inspect AI-Format und fügen Sie dann domänenspezifische Bewertungsaufgaben ein, ohne auf ein zentrales Team angewiesen zu sein, um sie zu integrieren.
-
Evaluieren Sie mit verschiedenen Inferenzoptionen — funktioniert mit SageMaker Inference (vorhandener Endpunkt oder spontaner Erstellung), Amazon Bedrock und weiteren Inferenz-Backends.
-
Iterieren Sie schneller — gehen Sie ohne Änderungen an der Infrastruktur von der Benchmark-Entwicklung zur Evaluierung der Produktion über. Das Onboarding neuer Benchmarks, das zuvor Tage dauerte, erfolgt innerhalb von Minuten.
-
Skalierbare Ausführung — Verketten Sie mehrere Benchmarks in einem Job, kombinieren Sie Standard-Benchmarks aus der Inspect-Evals-Bibliothek mit Ihren eigenen benutzerdefinierten Aufgaben im selben Job.
-
Ein Ausgangspunkt für alle Trainingstechniken — unabhängig davon, ob Ihr Modell mit SFT (SMTJ, SMHP), CPT (SMHP) oder RFT (SMTJ, SMHP) optimiert wurde, der Container wertet es über dieselbe Schnittstelle aus. Die Auswertung von Checkpoints während des Trainings, die in bestimmten Schritten gespeichert wurden (z. B. Schritt 500, Schritt 1000), wird ebenfalls unterstützt, indem auf den Checkpoint-Pfad gezeigt wird.
model_s3_uri
Funktionsweise
Sie geben zwei Eingaben für den Container an:
-
Eine YAML-Konfigurationsdatei (Rezept), die den Inferenzanbieter, die Benchmarks und die Bewertungsparameter definiert
-
Benchmark-Dateien (Python-Skripte mit dem
@taskDecorator) wurden auf Amazon S3 hochgeladen
Der Container kümmert sich um die Endpunktverwaltung, die Evaluierungsausführung und die Ergebniserfassung. Wenn der Trainingsjob abgeschlossen ist, werden die Ergebnisse an den von Ihnen angegebenen S3-Ausgabeort geschrieben.
Container-Bild
In der folgenden Tabelle sind die URIs des Inspect AI-Container-Images nach AWS Region aufgeführt.
| Region | URI des Container-Images |
|---|---|
| us-east-1 | 763104351884.dkr.ecr.us-east-1.amazonaws.com/sagemaker-inspect-ai:latest |
| us-west-2 | 763104351884.dkr.ecr.us-west-2.amazonaws.com/sagemaker-inspect-ai:latest |
| eu-west-2 | 763104351884.dkr.ecr.eu-west-2.amazonaws.com/sagemaker-inspect-ai:latest |
Voraussetzungen
Bevor Sie beginnen, stellen Sie sicher, dass Sie über die folgenden Ressourcen und Zugriffsmöglichkeiten verfügen.
| Anforderung | Description |
|---|---|
| AWS Konto mit SageMaker Zugriff | Ein aktives Konto AWS-Konto mit Berechtigungen zum Erstellen von SageMaker Ausbildungsjobs |
| S3-Bucket | Ein Bucket zum Speichern Ihrer Bewertungsrezepte, Benchmark-Dateien und Ausgabeergebnisse |
| Rolle bei der IAM-Ausführung | Eine Rolle, die SageMaker Sie für den Zugriff auf Ihre Ressourcen übernehmen können |
| SageMaker Inferenzendpunkt oder Zugriff auf Amazon Bedrock | Ein bereitgestellter Modellendpunkt oder ein Amazon Bedrock-Modellzugriff für das Modell, das Sie evaluieren möchten |
| AWS CLI oder SageMaker Python SDK | Tools zum Einreichen von Schulungsjobs und zum Verwalten von Ressourcen |
| Kapazitätsreservierung (große Modelle) | Für Modelle, die beschleunigte Instances benötigen (z. B. p5 für Nova Lite 2), wenden Sie sich an den AWS Support, um Kapazität für SageMaker Inference oder Amazon Bedrock zu reservieren |
Schritt 1: IAM-Berechtigungen einrichten
Der SageMaker Trainingsjob wird unter einer Ausführungsrolle ausgeführt, die Sie angeben. Diese Rolle benötigt Berechtigungen, um Benchmarks aus S3 zu lesen, Ergebnisse zu schreiben, den Inferenzendpunkt aufzurufen und Protokolle zu schreiben. CloudWatch
1.1 Erstellen Sie die Vertrauensrichtlinie
Speichern Sie Folgendes untertrust_policy.json:
{ "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Principal": { "Service": "sagemaker.amazonaws.com" }, "Action": "sts:AssumeRole" } ] }
1.2 Erstellen Sie die Rolle
aws iam create-role \ --role-name InspectLensEvalRole \ --assume-role-policy-document file://trust_policy.json
1.3 Hängen Sie die Berechtigungsrichtlinie an
Speichern Sie Folgendes unter eval_policy.json und ersetzen Sie dabei alle Platzhalterwerte (REGIONACCOUNT_ID, Bucket-Namen) durch Ihre Werte:
Umfang der verwendeten Ressourcen
Beschränken Sie jeden Ressourcen-ARN auf die Ressourcen, die Sie benötigen. Die folgende Richtlinie bietet eine Startvorlage — beschränken Sie Bucket-Namen, Endpunkt-ARNs und andere Ressourcen entsprechend Ihrer Umgebung.
{ "Version": "2012-10-17", "Statement": [ { "Sid": "S3ReadBenchmarkData", "Effect": "Allow", "Action": ["s3:GetObject", "s3:ListBucket"], "Resource": [ "arn:aws:s3:::YOUR_BENCHMARK_BUCKET", "arn:aws:s3:::YOUR_BENCHMARK_BUCKET/*" ] }, { "Sid": "S3WriteResults", "Effect": "Allow", "Action": ["s3:GetObject", "s3:PutObject", "s3:ListBucket"], "Resource": [ "arn:aws:s3:::YOUR_RESULTS_BUCKET", "arn:aws:s3:::YOUR_RESULTS_BUCKET/*" ] }, { "Sid": "SageMakerInvokeExistingEndpoint", "Effect": "Allow", "Action": [ "sagemaker:InvokeEndpoint", "sagemaker:InvokeEndpointWithResponseStream", "sagemaker:DescribeEndpoint" ], "Resource": "arn:aws:sagemaker:REGION:ACCOUNT_ID:endpoint/*" }, { "Sid": "BedrockInference", "Effect": "Allow", "Action": [ "bedrock:InvokeModel", "bedrock:InvokeModelWithResponseStream" ], "Resource": [ "arn:aws:bedrock:REGION::foundation-model/*", "arn:aws:bedrock:REGION:ACCOUNT_ID:inference-profile/*", "arn:aws:bedrock:REGION:ACCOUNT_ID:provisioned-model/*", "arn:aws:bedrock:REGION:ACCOUNT_ID:custom-model/*", "arn:aws:bedrock:REGION:ACCOUNT_ID:imported-model/*", "arn:aws:bedrock:REGION:ACCOUNT_ID:custom-model-deployment/*" ] }, { "Sid": "BedrockCustomModelAccess", "Effect": "Allow", "Action": [ "bedrock:GetCustomModel", "bedrock:GetImportedModel", "bedrock:GetProvisionedModelThroughput", "bedrock:GetCustomModelDeployment", "bedrock:GetInferenceProfile" ], "Resource": [ "arn:aws:bedrock:REGION:ACCOUNT_ID:custom-model/*", "arn:aws:bedrock:REGION:ACCOUNT_ID:imported-model/*", "arn:aws:bedrock:REGION:ACCOUNT_ID:provisioned-model/*", "arn:aws:bedrock:REGION:ACCOUNT_ID:custom-model-deployment/*", "arn:aws:bedrock:REGION:ACCOUNT_ID:inference-profile/*" ] }, { "Sid": "SageMakerCreateEndpointLifecycle", "Effect": "Allow", "Action": [ "sagemaker:CreateModel", "sagemaker:DescribeModel", "sagemaker:DeleteModel", "sagemaker:CreateEndpointConfig", "sagemaker:DescribeEndpointConfig", "sagemaker:DeleteEndpointConfig", "sagemaker:CreateEndpoint", "sagemaker:DescribeEndpoint", "sagemaker:DeleteEndpoint", "sagemaker:InvokeEndpoint", "sagemaker:InvokeEndpointWithResponseStream" ], "Resource": [ "arn:aws:sagemaker:REGION:ACCOUNT_ID:model/*", "arn:aws:sagemaker:REGION:ACCOUNT_ID:endpoint/*", "arn:aws:sagemaker:REGION:ACCOUNT_ID:endpoint-config/*" ] }, { "Sid": "ECRAuth", "Effect": "Allow", "Action": "ecr:GetAuthorizationToken", "Resource": "*" }, { "Sid": "PassRoleToSageMaker", "Effect": "Allow", "Action": "iam:PassRole", "Resource": "arn:aws:iam::ACCOUNT_ID:role/InspectLensEvalRole", "Condition": { "StringEquals": { "iam:PassedToService": "sagemaker.amazonaws.com" } } }, { "Sid": "VPCNetworkingForEndpoint", "Effect": "Allow", "Action": [ "ec2:CreateNetworkInterface", "ec2:CreateNetworkInterfacePermission", "ec2:DeleteNetworkInterface", "ec2:DeleteNetworkInterfacePermission", "ec2:DescribeNetworkInterfaces", "ec2:DescribeVpcs", "ec2:DescribeDhcpOptions", "ec2:DescribeSubnets", "ec2:DescribeSecurityGroups" ], "Resource": "*" }, { "Sid": "CloudWatchLogs", "Effect": "Allow", "Action": [ "logs:CreateLogGroup", "logs:CreateLogStream", "logs:PutLogEvents", "logs:DescribeLogStreams" ], "Resource": [ "arn:aws:logs:REGION:ACCOUNT_ID:log-group:/aws/sagemaker/TrainingJobs:*", "arn:aws:logs:REGION:ACCOUNT_ID:log-group:/aws/sagemaker/Endpoints/*" ] }, { "Sid": "MLflowTrackingServer", "Effect": "Allow", "Action": [ "sagemaker:DescribeMlflowTrackingServer", "sagemaker:CreatePresignedMlflowTrackingServerUrl" ], "Resource": "arn:aws:sagemaker:REGION:ACCOUNT_ID:mlflow-tracking-server/*" }, { "Sid": "MLflowTrackingOperations", "Effect": "Allow", "Action": [ "sagemaker-mlflow:AccessUI", "sagemaker-mlflow:CreateExperiment", "sagemaker-mlflow:GetExperiment", "sagemaker-mlflow:GetExperimentByName", "sagemaker-mlflow:SearchExperiments", "sagemaker-mlflow:CreateRun", "sagemaker-mlflow:GetRun", "sagemaker-mlflow:UpdateRun", "sagemaker-mlflow:SearchRuns", "sagemaker-mlflow:LogMetric", "sagemaker-mlflow:LogParam", "sagemaker-mlflow:LogBatch", "sagemaker-mlflow:SetTag", "sagemaker-mlflow:LogArtifact", "sagemaker-mlflow:ListArtifacts" ], "Resource": "arn:aws:sagemaker:REGION:ACCOUNT_ID:mlflow-tracking-server/*" }, { "Sid": "KMSForVolumeEncryption", "Effect": "Allow", "Action": [ "kms:Encrypt", "kms:Decrypt", "kms:GenerateDataKey", "kms:CreateGrant", "kms:DescribeKey" ], "Resource": "arn:aws:kms:REGION:ACCOUNT_ID:key/*" } ] }
Fügen Sie die Richtlinie an die Rolle an:
aws iam put-role-policy \ --role-name InspectLensEvalRole \ --policy-name InspectLensEvalPolicy \ --policy-document file://eval_policy.json
Schritt 2: Schreiben Sie Ihr Testrezept
Das Eval-Rezept ist eine YAML-Konfigurationsdatei, die definiert, wie der Container Ihre Auswertungen ausführt. Das Rezept spezifiziert den Inferenzanbieter, Benchmarks, Bewertungsparameter und Ausgabeeinstellungen.
Vollständige Beispiele finden Sie in den folgenden Notizbüchern im Amazon Nova
Option A: Evaluieren Sie einen vorhandenen Endpunkt SageMaker
Verwenden Sie diese Option, wenn Sie bereits ein Modell auf einem SageMaker Inferenzendpunkt bereitgestellt haben.
inference_provider: sagemaker_endpoint: endpoint_name: "my-existing-endpoint" region: "us-east-1" benchmarks: s3_path: "s3://your-bucket/benchmarks/my_benchmarks/" tasks: - name: mmlu eval: max_connections: 10 max_retries: 100 timeout: 600 output: s3_path: "s3://your-bucket/eval-results/"
Option B: Endpunkt erstellen, auswerten und dann bereinigen
Verwenden Sie diese Option, damit der Container ein Amazon Nova-Basismodell oder ein fein abgestimmtes Modell bereitstellt, Evaluierungen durchführt und den Endpunkt automatisch herunterfährt. Dies ist der empfohlene Ansatz für einmalige Testläufe. Rufen Sie den neuesten SageMaker Inferenzcontainer aus der Dokumentation zu den Amazon Nova SageMaker Inference-Container-Images ab.
inference_provider: sagemaker_endpoint: endpoint_name: null # null = create new endpoint model_s3_uri: "s3://your-bucket/models/nova-micro/" inference_image_uri: "708977205387.dkr.ecr.us-east-1.amazonaws.com/nova-inference-repo:SM-Inference-latest" instance_type: "ml.p5.48xlarge" instance_count: 1 execution_role_arn: "arn:aws:iam::ACCOUNT_ID:role/InspectLensEvalRole" region: "us-east-1" context_length: "16000" max_concurrency: "32" cleanup_endpoint: true # Auto-delete after eval benchmarks: s3_path: "s3://your-bucket/benchmarks/my_benchmarks/" tasks: - name: mmlu_pro - name: arc_c - name: boolq eval: fail_on_error: false decoding: temperature: 0.0 top_p: 1.0 top_k: -1 max_tokens: 16000 reasoning_effort: null max_connections: 16 max_retries: 100 timeout: 600 extra_args: - "-M" - "completion_mode=True" - "--logprobs" - "--top-logprobs" - "5" output: s3_path: "s3://your-bucket/eval-results/"
Hinweis zu model_s3_uri
-
Amazon Nova GA-Modelle (Basis-Checkpoints): Zum Beispiel
s3://escrow-nova-model-708977205387-us-east-1/nova-lite-2/prod/— SageMaker verwaltet den Zugriff automatisch, es sind keine zusätzlichen S3-Berechtigungen erforderlich. -
Maßgeschneiderte Amazon Nova-Modelle (Checkpoints nach dem Training):
s3://customer-escrow-ACCOUNT_ID-SUFFIX/YOUR_RUN_NAME/outputs/checkpoints/step_N/— Dies ist der Treuhandpfad, den Sie von Ihren Trainingsaufträgen erhalten haben.
Verwaltete Endpunkt-Ressourcen
Erteilen Sie Ihrer Ausführungsrolle die folgende optionale Berechtigung, damit der Container verwaltete Inferenzressourcen mit dem Namen und dem ARN des ursprünglichen Trainingsauftrags kennzeichnen kann. Zu den markierten Ressourcen gehören der Endpunkt, die Endpunktkonfiguration und das Modell. Dies hilft bei der Identifizierung von Ressourcen, falls die Bereinigung unterbrochen wird. Der Container wendet nur Tags an, wenn er als SageMaker Trainingsjob ausgeführt wird.
{ "Sid": "SageMakerTagManagedResources", "Effect": "Allow", "Action": "sagemaker:AddTags", "Resource": [ "arn:aws:sagemaker:REGION:ACCOUNT_ID:model/*", "arn:aws:sagemaker:REGION:ACCOUNT_ID:endpoint/*", "arn:aws:sagemaker:REGION:ACCOUNT_ID:endpoint-config/*" ] }
Der Container wendet die folgenden Tags auf verwaltete Ressourcen an:
| Tag-Schlüssel | Beispielwert |
|---|---|
sagemaker-inspect-ai:TrainingJobName |
my-eval-job-20260828-145940 |
sagemaker-inspect-ai:TrainingJobArn |
arn:aws:sagemaker:us-east-1:123456789012:training-job/my-eval-job-20260828-145940 |
Externe Quellen können die Ressourcenverwaltung während der Laufzeit unterbrechen. Hinweise zum Umgang mit übrig gebliebenen Ressourcen finden Sie unter. Fehlerbehebung
Option C: Evaluieren Sie mithilfe von Amazon Bedrock Runtime
Verwenden Sie diese Option, um ein über Amazon Bedrock Runtime verfügbares Modell zu evaluieren, ohne einen Endpunkt zu verwalten. Weitere Informationen zu Amazon Bedrock-Endpunktoptionen finden Sie unter Amazon Bedrock-Endpunkte.
inference_provider: bedrock: model_id: amazon.nova-pro-v1:0 region: us-east-1 benchmarks: - name: mmlu path: benchmarks/mmlu_pro.py limit: 100 eval: fail_on_error: false decoding: temperature: 0.0 top_p: 1.0 top_k: -1 max_tokens: 8192 reasoning_effort: null max_connections: 10 max_retries: 50 timeout: 600 extra_args: - "--display" - "plain" output: s3_path: s3://your-bucket/eval/output/
Option D: Evaluieren Sie mithilfe von Amazon Bedrock Mantle
Amazon Bedrock Mantle bietet einen OpenAI -kompatiblen Inferenzendpunkt für Modelle, die über Amazon Bedrock erhältlich sind. Für diese Option sind keine gespeicherten Anmeldeinformationen erforderlich. Der Container generiert aus den IAM-Anmeldeinformationen Ihrer Ausführungsrolle ein kurzlebiges Träger-Token und aktualisiert es automatisch zwischen den Benchmarks.
inference_provider: openai_compatible_endpoint: auth: "bedrock_mantle" region: "us-east-1" model_name: "us.amazon.nova-pro-v1:0" benchmarks: s3_path: "s3://your-bucket/benchmarks/my_benchmarks/" tasks: - name: mmlu eval: max_connections: 10 max_retries: 50 timeout: 600 output: s3_path: s3://your-bucket/eval/output/
Fügen Sie Ihrer Ausführungsrolle die folgende Berechtigung hinzu (siehe): Schritt 1: IAM-Berechtigungen einrichten
{ "Sid": "BedrockMantleInference", "Effect": "Allow", "Action": [ "bedrock-mantle:CreateInference", "bedrock-mantle:CallWithBearerToken" ], "Resource": "*" }
Hinweise zu Berechtigungen finden Sie in der Amazon Bedrock-Dokumentation unter Amazon Bedrock-Inferenzberechtigungen und API-Schlüsselberechtigungssteuerung.
Option E: Evaluieren Sie eine OpenAI-kompatibler Endpunkt
Verwenden Sie diese Option, um mithilfe eines beliebigen OpenAI -kompatiblen API-Endpunkts — einschließlich SageMaker Inference Authorization Header sendet. Inarer-Token werden standardmäßig nicht protokolliert.
Anleitung für Token-Anbieter
Informieren Sie sich immer in der Dokumentation Ihres Token-Anbieters über die empfohlenen wichtigsten Verwaltungspraktiken, Rotationsrichtlinien und Sicherheitsrichtlinien, bevor Sie die Bereitstellung von Anmeldeinformationen konfigurieren.
HTTPS-Anforderung
HTTPS ist für alle Endpunkte erforderlich, die die Bearer-Token-Authentifizierung verwenden. HTTP ist nur für Localhost-Adressen zulässig.
Verwenden AWS Secrets Manager (empfohlen)
AWS Secrets Manager bietet verschlüsselten Speicher, Zugriffsprüfungen CloudTrail und automatische Rotation von API-Schlüsseln und anderen Geheimnissen. Speichern Sie den API-Schlüssel in Secrets Manager und verweisen Sie im Rezept per ARN darauf. Der Container ruft den Schlüssel zur Laufzeit ab und aktualisiert ihn automatisch zwischen den Benchmarks.
inference_provider: openai_compatible_endpoint: model_name: "my-model" base_url: "https://my-endpoint/v1" auth: api_key api_key_secret_arn: "arn:aws:secretsmanager:us-east-1:123456789012:secret:prod/my-api-key" region: "us-east-1" benchmarks: s3_path: "s3://your-bucket/benchmarks/my_benchmarks/" tasks: - name: mmlu eval: max_connections: 10 max_retries: 50 timeout: 600 output: s3_path: s3://your-bucket/eval/output/
Fügen Sie Ihrer Ausführungsrolle die folgende Berechtigung hinzu (siehe): Schritt 1: IAM-Berechtigungen einrichten
{ "Sid": "GetApiKeySecret", "Effect": "Allow", "Action": "secretsmanager:GetSecretValue", "Resource": "arn:aws:secretsmanager:REGION:ACCOUNT_ID:secret:YOUR_SECRET_NAME" }
Verwenden von -Umgebungsvariablen
Der API-Schlüssel kann über die Umgebungsvariable übergeben werdenINFERENCE_API_KEY. Informieren Sie sich in der Dokumentation Ihrer Laufzeitumgebung darüber, wie Umgebungsvariablen übergeben werden und welche Auswirkungen dies auf die Sicherheit hat. Bei SageMaker Trainingsjobs sind Umgebungsvariablen in DescribeTrainingJob API-Antworten sichtbar und auf 512 Zeichen begrenzt. Weitere Informationen finden Sie unter SageMaker Training Job-Umgebungsvariablen.
inference_provider: openai_compatible_endpoint: model_name: "my-model" base_url: "https://my-endpoint/v1" auth: api_key # No key source specified — reads from INFERENCE_API_KEY environment variable benchmarks: s3_path: "s3://your-bucket/benchmarks/my_benchmarks/" tasks: - name: mmlu eval: max_connections: 10 max_retries: 50 timeout: 600 output: s3_path: s3://your-bucket/eval/output/
Zum Beispiel zu SageMaker Ausbildungsjobs:
aws sagemaker create-training-job \ ... --environment '{"INFERENCE_API_KEY": "your-api-key"}'
Konfiguration von Benchmarks
Der benchmarks Abschnitt definiert, welche Bewertungsaufgaben ausgeführt werden sollen. Sie können mehrere Benchmarks in einem einzigen Job verketten.
| Feld | Erforderlich | Standard | Description |
|---|---|---|---|
name |
Ja | — | Ein aussagekräftiger Name für den Benchmark-Lauf |
path |
Ja | — | Relativer Pfad zur Benchmark-Python-Datei in Ihrem S3-Benchmarks-Verzeichnis |
limit |
Nein | Keine (alle Beispiele) | Maximale Anzahl der auszuwertenden Proben. Zum Testen vor vollständigen Durchläufen verwenden. |
epochs |
Nein | 1 | Häufigkeit, mit der die Auswertung im Hinblick auf statistische Signifikanz wiederholt werden soll |
task_args |
Nein | — | Key-value Paare, die als Argumente an die Benchmark-Task-Funktion übergeben wurden |
Konfiguration evaluieren
Der eval Abschnitt steuert, wie der Container Auswertungen ausführt.
| Parameter | Erforderlich | Standard | Description |
|---|---|---|---|
fail_on_error |
Nein | false | Stoppen Sie die Auswertung, wenn eine Probe fehlschlägt. trueFür eine strikte Validierung auf setzen. |
max_connections |
Nein | 10 | Anzahl paralleler Anfragen an den Inferenzendpunkt |
max_retries |
Nein | 3 | Anzahl der Wiederholungsversuche für fehlgeschlagene Inferenzanforderungen |
timeout |
Nein | 600 | Anforderungstimeout in Sekunden für jeden Inferenzaufruf |
extra_args |
Nein | — | Zusätzliche Schlüssel-Wert-Paare werden direkt an den Befehl Inspect AI eval übergeben |
Parameter dekodieren
Konfigurieren Sie die Parameter für die Modelldekodierung im folgenden Abschnitteval.decoding:
| Parameter | Erforderlich | Standard | Description |
|---|---|---|---|
temperature |
Nein | 0.0 | Steuert die Zufälligkeit bei der Generierung. Wird 0.0 für deterministische, reproduzierbare Benchmark-Ergebnisse verwendet. |
top_p |
Nein | 1,0 | Schwellenwert für die Kernprobenahme. 1.0bedeutet keine Beschränkung. |
top_k |
Nein | -1 | Beschränkt die Wortwahl auf die K der wahrscheinlichsten Tokens. -1deaktiviert diesen Filter. |
max_tokens |
Nein | 8192 | Maximale Anzahl von Tokens, die pro Antwort generiert werden sollen. Erhöhung für Benchmarks, die lange Argumentationsketten erfordern. |
reasoning_effort |
Nein | Null | Steuert die Argumentationstiefe für Modelle, die dies unterstützen (z. B. Amazon Nova-Modelle mit erweitertem Denkvermögen). Optionen: lowhigh, oder null zum Deaktivieren. |
Konfiguration der Ausgabe
Der output Abschnitt definiert, wo und wie die Bewertungsergebnisse gespeichert werden.
| Feld | Erforderlich | Standard | Description |
|---|---|---|---|
s3_path |
Ja | — | S3-URI, in den die Bewertungsergebnisse geschrieben werden |
output_format |
Nein | Eval | Format für Ergebnisdateien. Optionen finden Sie in der folgenden Tabelle. |
Die folgenden Ausgabeformate sind verfügbar:
| Format | Description |
|---|---|
eval |
Natives Inspect AI-Format. Kompatibel mit inspect view für interaktive Analysen. |
csv |
Comma-separated Werte. Geeignet für Tabellenkalkulationsanalysen und Datenpipelines. |
jsonl |
JSON-Zeilenformat. Ein JSON-Objekt pro Zeile für die Streaming-Verarbeitung. |
json |
Standard-JSON-Format. Vollständige Ergebnisse in einer einzigen strukturierten Datei. |
MLflow-Konfiguration
Optional können Sie Bewertungsmetriken auf einem MLflow-Tracking-Server protokollieren. Fügen Sie den tracking Abschnitt zu Ihrem Rezept hinzu:
tracking: mlflow_tracking_arn: null # ARN of SageMaker MLflow tracking server mlflow_experiment_name: "inspectlens" # experiment name mlflow_tracing: true # log full request/response traces mlflow_log_artifacts: true # upload .eval files to MLflow
| Feld | Erforderlich | Standard | Description |
|---|---|---|---|
mlflow_tracking_arn |
Nein | Null | ARN Ihres SageMaker MLFlow-Tracking-Servers. Wenn Sie dies einstellen, wird die MLflow-Protokollierung aktiviert. Lassen Sie es aus oder setzen Sie es auf, um es null zu deaktivieren. |
mlflow_experiment_name |
Nein | Linse inspizieren | Name des MLFlow-Experiments, unter dem Läufe protokolliert werden sollen. |
mlflow_tracing |
Nein | true | Wenntrue, protokolliert die vollständigen request/response Traces für jede Probe. |
mlflow_log_artifacts |
Nein | true | Wanntrue, lädt .eval Protokolldateien als MLFlow-Artefakte hoch. |
Vollständige Rezeptreferenz
Das folgende Beispiel zeigt ein vollständiges Rezept mit allen verfügbaren Konfigurationsoptionen:
inference_provider: sagemaker_endpoint: endpoint_name: my-nova-endpoint model_s3_uri: s3://your-bucket/models/my-model/ inference_image_uri: "708977205387.dkr.ecr.us-east-1.amazonaws.com/nova-inference-repo:SM-Inference-latest" instance_type: ml.g5.12xlarge cleanup_endpoint: true region: us-west-2 benchmarks: - name: mmlu path: benchmarks/mmlu_pro.py limit: 100 epochs: 3 task_args: subject: math - name: truthfulqa path: benchmarks/truthfulqa.py limit: 50 eval: fail_on_error: false decoding: temperature: 0.0 top_p: 1.0 top_k: -1 max_tokens: 8192 reasoning_effort: null max_connections: 256 max_retries: 50 timeout: 600 extra_args: - "--display" - "plain" output: s3_path: s3://your-bucket/eval/output/ output_format: eval tracking: mlflow_tracking_arn: "arn:aws:sagemaker:us-west-2:123456789012:mlflow-tracking-server/my-server" mlflow_experiment_name: "inspectlens" mlflow_tracing: true mlflow_log_artifacts: true
Schritt 3: Benchmark-Dateien vorbereiten
Benchmarks sind Python-Dateien, die den Inspect @task AI-Decorator verwenden, um Bewertungsaufgaben zu definieren. Das Inspect-Evalus-Repository
Beispiel für einen Benchmark
Das folgende Beispiel zeigt einen minimalen Benchmark, der die Multiple-Choice-Leistung für einen Datensatz bewertet: HuggingFace
from inspect_ai import task, Task from inspect_ai.dataset import hf_dataset from inspect_ai.scorer import choice from inspect_ai.solver import multiple_choice @task def my_benchmark(): return Task( dataset=hf_dataset( path="cais/mmlu", name="abstract_algebra", split="test", ), solver=multiple_choice(), scorer=choice(), )
Abhängigkeiten
Wenn Ihr Benchmark zusätzliche Abhängigkeiten benötigt, fügen Sie ein pyproject.toml oder requirements.txt in dasselbe S3-Verzeichnis ein:
[project] name = "my-benchmark" version = "0.1.0" requires-python = ">=3.12" dependencies = [ "datasets>=2.14.0", ]
Pre-installed Pakete
Der Container enthält die folgenden Pakete. Sie müssen diese nicht in Ihrem auflistenpyproject.toml.
| Package | Version |
|---|---|
| Python | 3.12 |
| Luft inspizieren | 0.3.220 |
| boto3 | 1,40,61 |
| ein Iobot 3 | 15,5,0 |
| openai | 2.36.0 |
| mlflow | 3.12.0 |
| pyyaml | 6.0.3 |
Auswahl der Aufgabe
Das tasks Feld in Ihrem Rezept steuert, welche Aufgaben in einer Benchmark-Datei ausgeführt werden sollen.
| Konfiguration | Beispiel | Behavior |
|---|---|---|
Leer tasks |
tasks: [] |
Führt alle in der Benchmark-Datei definierten Aufgaben aus |
| Namensfilter | tasks: ["algebra"] |
Führt Aufgaben aus, deren Name die Teilzeichenfolge „Algebra“ enthält |
limit |
limit: 50 |
Überschreitet die Anzahl der pro Aufgabe ausgewerteten Stichproben |
epochs |
epochs: 3 |
Wiederholt die Auswertung mehrmals, um die Varianz zu messen |
Schritt 4: Bereiten Sie Ihre S3-Struktur vor
Die folgende Struktur ist eine Empfehlung für die Organisation von Konfigurationen, Benchmarks und Ergebnissen. Sie können den Container auf einen beliebigen S3-Standort richten — die Struktur selbst ist nicht erforderlich.
s3://your-bucket/ ├── config/ │ └── inspect_config.yaml # Your eval recipe ├── benchmarks/ │ └── my_benchmarks/ # Your benchmark Python files │ ├── pyproject.toml # Optional: benchmark dependencies │ ├── my_task.py # @task decorated functions │ └── _helpers.py # Shared utilities └── output/ # Results written here
Laden Sie Ihre Dateien auf S3 hoch:
# Upload benchmark files aws s3 cp my_benchmarks/ s3://your-bucket/benchmarks/my_benchmarks/ --recursive # Upload your eval recipe aws s3 cp inspect_config.yaml s3://your-bucket/config/inspect_config.yaml
Schritt 5: Reichen Sie den Trainingsjob ein
Reichen Sie einen SageMaker Schulungsjob ein, um Ihre Bewertung durchzuführen. Sie können das AWS CLI oder das SageMaker Python-SDK verwenden.
Option A: AWS CLI
aws sagemaker create-training-job \ --training-job-name inspect-eval-$(date +%Y%m%d-%H%M%S) \ --algorithm-specification \ TrainingImage=763104351884.dkr.ecr.us-east-1.amazonaws.com/sagemaker-inspect-ai:latest,TrainingInputMode=File \ --role-arn arn:aws:iam::123456789012:role/SageMakerInspectAIRole \ --resource-config \ InstanceType=ml.m5.large,InstanceCount=1,VolumeSizeInGB=30 \ --stopping-condition MaxRuntimeInSeconds=86400 \ --input-data-config '[ { "ChannelName": "config", "DataSource": { "S3DataSource": { "S3DataType": "S3Prefix", "S3Uri": "s3://your-bucket/eval/config/", "S3DataDistributionType": "FullyReplicated" } } } ]' \ --output-data-config S3OutputPath=s3://your-bucket/eval/output/ \ --region us-west-2
Option B: SageMaker Python-SDK v3
from sagemaker.train.evaluate import InspectAIEvaluator evaluator = InspectAIEvaluator( model="nova-textgeneration-lite-v2", bedrock_model_id="us.amazon.nova-lite-v2:0", benchmarks_path="s3://your-bucket/benchmarks/my_benchmarks/", tasks=[{"name": "my_task", "limit": 100}], s3_output_path="s3://your-bucket/eval/output/", instance_type="ml.m5.large", ) execution = evaluator.evaluate() execution.wait() execution.show_results()
Die wichtigsten Parameter
| Parameter | Wert | Description |
|---|---|---|
TrainingImage |
763104351884.dkr.ecr.us-east-1.amazonaws.com/sagemaker-inspect-ai:latest |
Das Inspect AI-Container-Image |
InstanceType |
ml.m5.large |
Orchestrator-Instanztyp (nicht die Inferenzinstanz) |
VolumeSizeInGB |
30 |
Speicher für Benchmark-Daten und -Protokolle |
MaxRuntimeInSeconds |
86400 |
Maximale Auftragsdauer (24 Stunden) |
ChannelName |
config |
Eingangskanal, der Ihre Rezept- und Benchmark-Dateien enthält |
Anleitung zum Orchestrator-Instanztyp
Die Trainingsauftragsinstanz führt die Evaluierungs-Orchestrierungslogik aus, nicht die Modellinferenz. Wählen Sie einen Instanztyp, der auf Ihrer Evaluierungsarbeitslast basiert.
| Instance-Typ | Anwendungsfall | Empfehlung |
|---|---|---|
ml.m5.large |
Empfohlene Standardeinstellung | Ausreichend für die meisten Evaluierungs-Workloads mit mäßiger Parallelität |
ml.m5.4xlarge |
Große Benchmark-Suiten | Wird verwendet, wenn viele Benchmarks mit hohen max_connections Werten ausgeführt werden |
ml.c5.large |
Cost-sensitive | Kostengünstigere Alternative für einfache Auswertungen mit geringer Parallelität |
Umgebungsvariablen
Sie können Umgebungsvariablen zur Authentifizierung oder Konfiguration an den Container übergeben. Fügen Sie den --environment Parameter dem AWS CLI Befehl hinzu:
aws sagemaker create-training-job \ ... --environment '{ "HF_TOKEN": "hf_your_token_here", "HF_HUB_DOWNLOAD_TIMEOUT": "300" }'
Schritt 6: Überwachen Sie den Job
Nachdem Sie den Trainingsjob eingereicht haben, können Sie seinen Fortschritt mithilfe der AWS CLI oder CloudWatch Logs verfolgen.
Überprüfen Sie den Jobstatus
aws sagemaker describe-training-job \ --training-job-name your-job-name \ --query "TrainingJobStatus" \ --output text
Streamen Sie Protokolle
aws logs tail /aws/sagemaker/TrainingJobs \ --log-stream-name-prefix your-job-name \ --follow
Was ist in Protokollen zu erwarten
Die Container-Protokolle zeigen den Fortschritt in den folgenden Phasen:
-
Start — Container-Initialisierung und Konfigurationsvalidierung
-
Benchmark-Download — Benchmark-Dateien herunterladen und Abhängigkeiten installieren
-
Endpunkt-Setup — Den Inferenzendpunkt erstellen oder eine Verbindung zu ihm herstellen
-
Bewertung — Durchführung von Benchmark-Aufgaben mit Fortschrittsindikatoren
-
Ergebnisse hochladen — Ergebnisse in S3 schreiben und optional in MLflow protokollieren
-
Aufräumen — Löschen temporärer Endpunkte, wenn
cleanup_endpoint: true
Voraussichtlicher Zeitrahmen
| Stage | Geschätzte Dauer |
|---|---|
| Starten des Containers | 2—5 Minuten |
| Erstellung von Endpunkten (falls zutreffend) | 15—30 Minuten |
| Bewertung | Variiert je nach Benchmark-Größe und Modelllatenz |
| Bereinigen | 1—2 Minuten |
Schritt 7: Ergebnisse anzeigen und interpretieren
Sehen Sie sich nach Abschluss des Jobs Ihre Bewertungsergebnisse an.
Mit Inspect AI anzeigen
Verwenden Sie den Inspect AI Viewer, um Ergebnisse direkt aus S3 interaktiv zu untersuchen:
inspect view --log-dir s3://your-bucket/eval-results/
Mit diesem Befehl wird eine lokale Weboberfläche geöffnet, auf der Sie die Ergebnisse durchsuchen, einzelne Stichproben ansehen und Durchläufe vergleichen können.
Herunterladen und teilen
So laden Sie Ergebnisse lokal herunter:
aws s3 cp s3://your-bucket/eval/output/ ./results/ --recursive INSPECT_LOG_DIR=./results inspect view
VS Code-Erweiterung
Mit der Inspect AI VS Code-Erweiterung
-
Installieren Sie die Erweiterung vom VS Code-Marktplatz (suchen Sie nach „Inspect AI“)
-
Suchen Sie in der Inspect-Aktivitätsleiste den Bereich „Protokolle“ und wählen Sie das Ordnersymbol
-
Geben Sie Ihren S3-Pfad ein:
s3://your-bucket/eval-results/
Struktur der Ausgabe
Jede Auswertung erzeugt eine .eval Protokolldatei, die die folgenden Abschnitte enthält:
-
results.scores— Aggregierte Ergebnisse für jede Metrik -
samples— Einzelne Bewertungsstichproben mit Eingaben, Ausgaben und Ergebnissen -
stats— Laufzeitstatistiken einschließlich Token-Nutzung und Latenz -
eval.config— Die für den Testlauf verwendete Konfiguration
Ergebnisse in MLflow anzeigen (optional)
Wenn Sie MLflow in Ihrem Rezept konfiguriert haben, generieren Sie eine vorsignierte URL, um auf den Tracking-Server zuzugreifen:
aws sagemaker create-presigned-mlflow-tracking-server-url \ --tracking-server-name my-server \ --region us-west-2
Öffnen Sie die zurückgegebene URL in Ihrem Browser, um Kennzahlen anzuzeigen, Durchläufe zu vergleichen und Trends in verschiedenen Auswertungen zu analysieren.
Verfügbare Benchmarks
Der Inspect AI-Container funktioniert mit jedem Benchmark, der im Inspect AI-Aufgabenformat geschrieben wurde. Das Inspect-Evalus-Repository
Informationen zum Schreiben Ihrer eigenen Benchmarks finden Sie in der Dokumentation zum Schreiben von Inspect AI-Aufgaben. https://inspect.aisi.org.uk/tasks.html
Agentische Evaluierungen
Agentische Benchmarks testen die Fähigkeit eines Modells, mehrstufige Aufgaben zu erledigen, die den Einsatz von Tools, Planung und iteratives Denken erfordern. Diese Bewertungen simulieren reale Szenarien, in denen das Modell Werkzeuge aufrufen, Ergebnisse interpretieren und über die nächsten Maßnahmen entscheiden muss.
Anforderungen an Endpunkte
Für die Evaluierung durch Agentic sind Endgeräte erforderlich, die die folgenden Funktionen unterstützen:
-
Aufruf von Tools — Der Endpunkt muss Funktionsaufrufe unterstützen, damit das Modell während der Evaluierung Tools aufrufen kann
-
Große Kontextgröße — Multi-turn Konversationen mit Tool-Ergebnissen benötigen eine ausreichende Kontextlänge, um den Gesprächsverlauf beizubehalten
SageMaker Konfiguration des Inferenzendpunkts
Wenn Sie einen SageMaker Inferenzendpunkt für agentische Evaluierungen verwenden, konfigurieren Sie die folgenden Umgebungsvariablen auf Ihrem Endpunkt:
| Umgebungsvariable | Wert | Description |
|---|---|---|
ENABLE_TOOL_CALLING |
True |
Aktiviert die Unterstützung für Tool-Calls auf dem Inferenz-Endpunkt |
CONTEXT_LENGTH |
Ausreichend für Multiturn | Stellen Sie einen Wert ein, der groß genug ist, um Konversationen mit mehreren Runden und Tool-Ergebnissen zu ermöglichen |
Informationen zur Einrichtung von Amazon Nova-Endpunkten auf SageMaker Inference finden Sie unter Bereitstellen von Amazon Nova-Modellen auf. SageMaker Informationen zu den Funktionen und der Konfiguration von Containern finden Sie unter Container-Funktionen.
Amazon Bedrock-Endpunkte
Für Amazon Bedrock-Endpunkte wird das Aufrufen von Tools für kompatible Modelle nativ unterstützt. Weitere Informationen finden Sie unter Verwendung von Tools mit Amazon Bedrock.
Erste Schritte mit agentischen Evaluierungen
Um agentische Evaluierungen durchzuführen, müssen die folgenden Voraussetzungen erfüllt sein:
-
Stellen Sie einen Endpunkt mit aktiviertem Toolaufruf bereit
-
Wählen Sie einen agentischen Benchmark aus dem inspect-evals-Repository
(suchen Sie nach Benchmarks, die Tool-Calling-Solver verwenden) -
Konfiguriere dein Rezept mit passenden Endwerten für Interaktionen mit mehreren Zügen
timeoutmax_tokens
Amazon Bedrock-Endpunkt
-
Die vollständige Einrichtung und Bereitstellung finden Sie unter Amazon Bedrock-Endpunkte.
-
Informationen zur Unterstützung beim Aufrufen von Tools finden Sie im Abschnitt zum clientseitigen Aufrufen von Tools unter Verwendung von Tools mit Amazon Bedrock.
Beispiel für Notizbücher
Das folgende Notizbuch zeigt die Ausführung eines Agenten-Benchmarks zum Aufrufen von Tools mit dem Inspect AI-Container:
-
tau-bench (auftragsbezogen)
— Evaluieren Sie mithilfe des Inspect AI-Containers das durch Tools gestützte Argumentation bei Kundendienstaufgaben
Verwenden Sie für agentische Benchmarks, für die eine Docker-Sandbox erforderlich ist, das Inspect AI SDK:
-
SWE-bench mit dem Inspect AI SDK
— Evaluieren Sie die Funktionen der Softwareentwicklung mithilfe der Docker-Sandbox
Wichtig
Agentische Benchmarks, für die eine Docker-Sandbox erforderlich ist (z. B. SWE-bench), werden im Inspect AI-Container-Erlebnis nicht unterstützt. Die SageMaker Training Job-Umgebung bietet keine Funktionen. Docker-in-Docker Um diese Benchmarks auszuführen, verwenden Sie das Inspect AI SDK in einer Rechenumgebung mit Docker-Zugriff (z. B. einer Amazon EC2-Instance oder einem SageMaker Notebook mit installiertem Docker).
Fehlerbehebung
Dieser Abschnitt enthält Lösungen für häufig auftretende Probleme bei der Durchführung von Evaluierungen mit dem Inspect AI-Container.
Tipp zur schnellen Iteration
Bevor Sie einen SageMaker Schulungsjob einreichen, testen Sie Ihre Benchmarks lokal mit dem Inspect AI SDK. Führen Sie es inspect eval my_benchmark.py auf Ihrem lokalen Computer aus, um Aufgabendefinitionen, Abhängigkeiten und Bewertungslogik zu überprüfen, bevor Sie es in großem Maßstab ausführen.
InsufficientInstanceCapacity error
Dieser Fehler tritt auf, wenn AWS die Kapazität für den angeforderten Instance-Typ in Ihrer Region nicht ausreicht.
-
Versuchen Sie es mit einem anderen Instance-Typ oder reichen Sie den Job in einer anderen AWS Region ein
-
Verwenden Sie einen anderen Instanztyp (z. B.
ml.m5.xlargeanstelle vonml.m5.large) -
Versuchen Sie die Anfrage nach ein paar Minuten erneut
AccessDenied error
Wenn der Trainingsjob mit der Fehlermeldung „Zugriff verweigert“ fehlschlägt, überprüfen Sie Folgendes:
-
Der Rollen-ARN in Ihrer Jobkonfiguration ist korrekt
-
Die Vertrauenspolitik ermöglicht es
sagemaker.amazonaws.com, die Rolle zu übernehmen -
Ihr Benutzer oder Ihre Rolle hat die
iam:PassRoleBerechtigung für die Ausführungsrolle -
Die Ausführungsrolle verfügt über Berechtigungen für den Zugriff auf den S3-Bucket, den Inferenzendpunkt oder das Amazon Bedrock-Modell
Die Endpoint-Erstellung schlägt fehl
Bei Verwendung cleanup_endpoint: true mit der automatischen Endpunkterstellung können die folgenden Probleme auftreten:
| Fehler | Lösung |
|---|---|
| ResourceLimitExceeded | Fordern Sie eine Erhöhung des Dienstkontingents für den Inferenzinstanztyp in Ihrer Region an |
| OutOfMemoryError | Verwenden Sie einen größeren Inferenzinstanztyp oder reduzieren Sie die Modellgröße |
Falsch model_s3_uri |
Stellen Sie sicher, dass der S3-Pfad auf ein gültiges Modellartefaktverzeichnis verweist |
| Falscher URI für das Inferenzbild | Stellen Sie sicher, dass der Image-URI für Ihre Region und Ihr Modell-Framework korrekt ist |
| Endpunkt bleibt beim Erstellen hängen | Überprüfen Sie die CloudWatch Protokolle für den Endpunkt. Das Modell besteht möglicherweise die Integritätsprüfungen nicht. Erhöhen MaxRuntimeInSeconds Sie, wenn der Endpunkt mehr Zeit benötigt. |
Manuelles Bereinigen der verwalteten Ressourcen
Wenn verwaltete Endpunkte aktiviert sind, werden Informationen zu verwalteten Ressourcen CloudWatch mit dem Filterbegriff INFRA protokolliert. Die Protokolle enthalten AWS CLI Befehle für die manuelle Bereinigung, falls der Container den Teardown nicht abschließen kann. Führen Sie die Schritte zum manuellen Beenden nur aus, wenn der Job nicht mehr ausgeführt wird.
Beispiel für eine Protokollausgabe:
[WARNING] [INFRA] Managed SMI resources created; auto-deleted on normal completion or stop. If this job is force-killed or stopped mid-creation, delete them manually: aws sagemaker delete-endpoint --endpoint-name inspectlens-ep-1787856688 --region us-east-1 aws sagemaker delete-endpoint-config --endpoint-config-name inspectlens-config-1787856688 --region us-east-1 aws sagemaker delete-model --model-name inspectlens-model-1787856688 --region us-east-1
Beim manuellen Beenden des Jobs durch Stop-Training-Job führt der Container innerhalb der Kulanzzeit von 120 Sekunden eine Bereinigung der verwalteten Ressourcen nach besten Kräften durch. Wenn Ressourcen nicht bereinigt werden können, endet der Job mit einem Fehlerstatus. Wenn die Bereinigung erfolgreich abgeschlossen wurde, endet der Auftrag im Status „Beendet“.
HuggingFace Timeouts beim Herunterladen
Wenn Benchmarks, die Datensätze vom HuggingFace Hub herunterladen, eine Zeitüberschreitung haben, setzen Sie die HF_HUB_DOWNLOAD_TIMEOUT Umgebungsvariable auf einen höheren Wert (in Sekunden):
--environment '{"HF_HUB_DOWNLOAD_TIMEOUT": "600"}'
Konflikte zwischen der Benchmark-Abhängigkeit
Wenn ein Benchmark aufgrund von Abhängigkeitskonflikten mit vorinstallierten Paketen fehlschlägt, erstellen Sie pyproject.toml im Benchmark-Verzeichnis einen mit expliziten Versionsbeschränkungen. Der Container installiert Benchmark-Abhängigkeiten isoliert, um Konflikte zu minimieren.
Die Evaluierungsergebnisse sehen falsch aus
Wenn die Bewertungsergebnisse unerwartet niedrig oder inkonsistent sind, überprüfen Sie die folgenden Einstellungen in Ihrem Rezept:
-
Temperatur —
0.0Für deterministische, reproduzierbare Ergebnisse auf -
max_tokens — Stellen Sie sicher, dass der Wert groß genug ist, damit das Modell seine Antwort vervollständigen kann
-
completion_mode — Für Basismodelle (ohne Chat) geben Sie
completion_mode: truein Ihrem Rezept an, dass Eingabeaufforderungen im Abschlussstil anstelle des Chat-Formats verwendet werden
Datenschutz
Ihre Bewertungsdaten werden je nach verwendetem Inferenzanbieter unterschiedlich behandelt.
SageMaker Endpunkt
Wenn Sie einen SageMaker Inferenzendpunkt verwenden, bleiben alle Daten in Ihrem. AWS-Konto Aufforderungen zur Bewertung und Antworten des Modells werden nicht außerhalb Ihres Kontos gesendet und nicht zur Verbesserung AWS der Dienste verwendet. Es ist keine Opt-Out-Richtlinie erforderlich.
Amazon Bedrock
Wenn Sie Amazon Bedrock als Inferenzanbieter verwenden, unterliegen Ihre Daten der AWS Opt-Out KI-Services-Richtlinie. Um zu verhindern, dass Ihre Daten zur Verbesserung der AWS KI-Dienste verwendet werden, aktivieren Sie die Opt-Out-Richtlinie auf AWS Organisationsebene. Weitere Informationen finden Sie in den Opt-Out-Richtlinien für KI-Dienste.
| Inferenz-Anbieter | Opt-out erforderlich | Details |
|---|---|---|
| SageMaker Endpunkt | Nein | Die Daten bleiben in Ihrem Konto. Nicht durch die AI-Opt-Out-Richtlinie abgedeckt. |
| Amazon Bedrock | Ja | Aktivieren Sie die AWS Opt-Out KI-Servicerichtlinie auf Unternehmensebene, um zu verhindern, dass Daten zur Serviceverbesserung verwendet werden. |