管理数据集
本主题介绍创建、检索、列出、更新和删除数据集。
创建数据集
CreateDatasetAPI 会创建一个新的评估数据集。这是一种异步操作 (HTTP 202) — 提取ACTIVE完成后CREATING,数据集将从变为。
必填参数:datasetName(仅限字母数字和下划线、^[a-zA-Z][a-zA-Z0-9_]{0,47}$)schemaType、和source(行内示例或 S3 URI)。
可选参数:description,kmsKeyArn(客户管理的加密密钥,创建后不可变——参见数据集加密)、。tags
以下示例说明如何创建数据集:
例
- AgentCore CLI
-
-
# Add a dataset to your project agentcore add dataset --name my_eval_dataset \ --schema-type AGENTCORE_EVALUATION_PREDEFINED_V1 # Edit the generated JSONL file with your scenarios # File location: agentcore/datasets/my_eval_dataset.jsonl # Deploy to create the dataset in your AWS account agentcore deploy这将创建一个本地 JSONL 文件并在您的项目配置中注册该数据集。运行
agentcore deploy以创建数据集资源并将示例同步到服务。注意
在 AgentCore 项目目录(使用创建
agentcore create)中运行它。
-
- AgentCore SDK
-
-
from bedrock_agentcore.evaluation import DatasetClient client = DatasetClient(region_name="us-west-2") # Create with inline examples (polls until ACTIVE) ds = client.create_dataset_and_wait( datasetName="customer_support_scenarios", schemaType="AGENTCORE_EVALUATION_PREDEFINED_V1", source={ "inlineExamples": { "examples": [ { "scenario_id": "TC-01", "turns": [{"input": "What is my balance?", "expected_response": "Your balance is $50."}], "assertions": ["Response includes a dollar amount"], } ] } }, ) print(f"Dataset ID: {ds['datasetId']}, Status: {ds['status']}") # Create with S3 source ds = client.create_dataset_and_wait( datasetName="my_s3_dataset", schemaType="AGENTCORE_EVALUATION_PREDEFINED_V1", source={"s3Source": {"s3Uri": "s3://my-bucket/scenarios.jsonl"}}, )注意
对于 S3 提取,JSONL 文件中的每一行都必须包含一个字段。
exampleId必须能够使用调用者的凭据访问 S3 存储桶。
-
- AWS SDK
-
-
import boto3 import time client = boto3.client('bedrock-agentcore-control') response = client.create_dataset( datasetName='customer_support_scenarios', schemaType='AGENTCORE_EVALUATION_PREDEFINED_V1', source={ 'inlineExamples': { 'examples': [ { 'scenario_id': 'TC-01', 'turns': [{'input': 'What is my balance?', 'expected_response': 'Your balance is $50.'}], 'assertions': ['Response includes a dollar amount'], } ] } } ) dataset_id = response['datasetId'] # Create with S3 source response = client.create_dataset( datasetName='my_s3_dataset', schemaType='AGENTCORE_EVALUATION_PREDEFINED_V1', source={ 's3Source': {'s3Uri': 's3://my-bucket/scenarios.jsonl'} } ) # Poll until ACTIVE while True: ds = client.get_dataset(datasetId=dataset_id) if ds['status'] in ('ACTIVE', 'CREATE_FAILED'): break time.sleep(2)
-
- AWS CLI
-
-
# Create with inline examples aws bedrock-agentcore-control create-dataset \ --dataset-name "customer_support_scenarios" \ --schema-type AGENTCORE_EVALUATION_PREDEFINED_V1 \ --source '{"inlineExamples": {"examples": [{"scenario_id": "TC-01", "turns": [{"input": "What is my balance?", "expected_response": "Your balance is $50."}], "assertions": ["Response includes a dollar amount"]}]}}' # Create with S3 source aws bedrock-agentcore-control create-dataset \ --dataset-name "my_s3_dataset" \ --schema-type AGENTCORE_EVALUATION_PREDEFINED_V1 \ --source '{"s3Source": {"s3Uri": "s3://my-bucket/scenarios.jsonl"}}' # Poll until ACTIVE aws bedrock-agentcore-control get-dataset \ --dataset-id my-dataset-id
-
获取数据集
GetDatasetAPI 检索数据集元数据、状态、示例计数以及数据集内容的预签名下载网址。默认情况下,读取草稿;datasetVersion为已发布版本指定。
downloadUrl是完整dataset.jsonl文件的预签名 S3 网址。您可以使用不带身份验证标头的纯 HTTP GET 请求下载它。
以下示例说明如何获取数据集:
例
- AgentCore CLI
-
-
# Show dataset deployment status and metadata agentcore status --type dataset # Download dataset content to your local JSONL file (default: Draft) agentcore dataset download --name my_eval_dataset # Download a specific published version agentcore dataset download --name my_eval_dataset --version 1
-
- AgentCore SDK
-
-
from bedrock_agentcore.evaluation import DatasetClient client = DatasetClient(region_name="us-west-2") # Get dataset (default: Draft) ds = client.get_dataset(datasetId="my-dataset-id") print(f"Status: {ds['status']}, Examples: {ds['exampleCount']}") print(f"Download URL: {ds['downloadUrl']}") # Get a specific published version ds_v1 = client.get_dataset(datasetId="my-dataset-id", datasetVersion="1")
-
- AWS SDK
-
-
import boto3 client = boto3.client('bedrock-agentcore-control') response = client.get_dataset(datasetId='my-dataset-id') print(f"Status: {response['status']}, Examples: {response['exampleCount']}") # Download the dataset content via presigned URL if 'downloadUrl' in response: import requests data = requests.get(response['downloadUrl']) print(data.text) # Get a specific published version response = client.get_dataset(datasetId='my-dataset-id', datasetVersion='1')
-
- AWS CLI
-
-
# Get dataset (default: Draft) aws bedrock-agentcore-control get-dataset \ --dataset-id my-dataset-id # Get a specific published version aws bedrock-agentcore-control get-dataset \ --dataset-id my-dataset-id \ --dataset-version 1
-
列出数据集
ListDatasetsAPI 会返回您的账户和地区中数据集的分页列表。
以下示例说明如何列出数据集:
例
- AgentCore CLI
-
-
agentcore status --type dataset
-
- AgentCore SDK
-
-
from bedrock_agentcore.evaluation import DatasetClient client = DatasetClient(region_name="us-west-2") response = client.list_datasets() for dataset in response["datasets"]: print(f" {dataset['datasetName']} ({dataset['status']})")
-
- AWS SDK
-
-
import boto3 client = boto3.client('bedrock-agentcore-control') response = client.list_datasets() for dataset in response['datasets']: print(f" {dataset['datasetName']} ({dataset['status']})")
-
- AWS CLI
-
-
aws bedrock-agentcore-control list-datasets
-
更新数据集
UpdateDatasetAPI 更新数据集元数据。这是一个同步操作 (HTTP 200)。仅description且tags可以更新。 datasetName、schemaType、和kmsKeyArn在创建之后是不可变的。
数据集必须处于ACTIVEUPDATE_FAILED、或CREATE_FAILED状态。
以下示例说明如何更新数据集元数据:
例
- AgentCore CLI
-
-
要 AgentCore 使用 CLI 更新数据集,请直接编辑
agentcore.json文件中的数据集配置,然后重新部署:agentcore deploy打开
agentcore.json,在datasets数组中找到数据集,对其进行修改description,然后运行agentcore deploy。更改将在部署后生效。注意
在 AgentCore 项目目录(使用创建
agentcore create)中运行它。
-
- AgentCore SDK
-
-
from bedrock_agentcore.evaluation import DatasetClient client = DatasetClient(region_name="us-west-2") client.update_dataset(datasetId="my-dataset-id", description="Updated description")
-
- AWS SDK
-
-
import boto3 client = boto3.client('bedrock-agentcore-control') client.update_dataset(datasetId='my-dataset-id', description='Updated description')
-
- AWS CLI
-
-
aws bedrock-agentcore-control update-dataset \ --dataset-id my-dataset-id \ --description "Updated description"
-
删除数据集
DeleteDatasetAPI 会删除数据集。这是一个异步操作 (HTTP 202)。
-
完全删除(省略
datasetVersion):删除所有版本、草稿和数据集记录。 -
Version-specific 删除(指定
datasetVersion为整数):仅删除已发布的版本。
数据集必须处于ACTIVECREATE_FAILED、UPDATE_FAILED、或DELETE_FAILED状态。
注意
仅接受整数版本号进行版本特定的删除。
以下示例说明如何删除数据集:
例
- AgentCore CLI
-
-
# Delete a specific published version agentcore dataset remove-version 1 --name my_eval_dataset # Delete entire dataset agentcore remove dataset --name my_eval_dataset agentcore deploy
-
- AgentCore SDK
-
-
from bedrock_agentcore.evaluation import DatasetClient client = DatasetClient(region_name="us-west-2") # Delete a specific published version client.delete_dataset_and_wait(datasetId="my-dataset-id", datasetVersion="1") # Delete entire dataset (polls until complete) client.delete_dataset_and_wait(datasetId="my-dataset-id")
-
- AWS SDK
-
-
import boto3 client = boto3.client('bedrock-agentcore-control') # Delete a specific published version client.delete_dataset(datasetId='my-dataset-id', datasetVersion='1') # Delete entire dataset client.delete_dataset(datasetId='my-dataset-id')
-
- AWS CLI
-
-
# Delete a specific published version aws bedrock-agentcore-control delete-dataset \ --dataset-id my-dataset-id \ --dataset-version 1 # Delete entire dataset aws bedrock-agentcore-control delete-dataset \ --dataset-id my-dataset-id
-