View a markdown version of this page

스킬 평가자 - Amazon Bedrock AgentCore

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

스킬 평가자

스킬은 에이전트가 작업을 돕기 위해 런타임에 로드하는 재사용 가능한 SKILL.md 명령 파일입니다. 스킬은 스킬 파일 구조에 대한 열린 에이전트 스킬 표준을 따릅니다. 용어에 대해서는 Skill을 참조하세요.

AgentCore Evaluations는 기술을 사용하는 에이전트를 위한 두 가지 기본 제공 평가자를 제공합니다. 둘 다 도구 수준 평가자입니다. AgentCore Evaluations는 스킬 호출당 하나의 결과를 내보내고 각 결과를 스킬을 로드한 도구 호출 범위에 고정합니다. 스킬 호출이 3개인 세션은 평가자당 3개의 결과를 생성합니다.

이러한 평가자는 온디맨드, 배치 및 온라인 평가와 함께 사용할 수 있습니다. 정확한 프롬프트 본문은 프롬프트 템플릿 페이지의 다음 스킬 선택 정확도 및 스킬 지침을 참조하세요.

Builtin.SkillSelectionAccuracy

스킬 선택 정확도 평가자(Builtin.SkillSelectionAccuracy)는 사용 가능한 스킬 카탈로그를 고려하여 에이전트가 로드한 스킬이 작업에 적합한지 여부를 판단합니다. Yes (1.0) 또는 No (0.0)을 반환합니다.

평가자가 사용하는 자리 표시자:

  • invoked_skill - 에이전트가이 도구 호출에서 로드한 스킬의 이름입니다.

  • available_skills - 에이전트가 런타임에 선택할 수 있는 스킬의 카탈로그입니다. 모든 프레임워크가 카탈로그를 노출하는 것은 아닙니다. 카탈로그가 추적에 없는 경우이 자리 표시자는 비어 있으며 평가자는 사용자 요청 및 대화 컨텍스트에만 대해 호출된 스킬을 판단합니다.

  • user_message - 스킬 호출을 트리거한 턴의 사용자 요청입니다.

  • context - 이전는 평가 중인 도구 호출로 전환됩니다.

AgentCore Evaluations가 스킬 호출을 감지할 때마다 평가자가 실행됩니다. 에이전트가 스킬을 얼마나 잘 실행했는지가 아니라 선택 결정에 중점을 둡니다.

Builtin.SkillInstructionFollowing

평가자(Builtin.SkillInstructionFollowing)를 따르는 스킬 지침은 에이전트가 로드된 스킬의 규정된 단계를 얼마나 완전히 따랐는지 판단합니다. Fully Followed (1.0), Mostly Followed (0.75), Partially Followed (0.5), Minimally Followed (0.25) 또는 Not Followed (0.0)을 반환합니다.

평가자가 사용하는 자리 표시자:

  • invoked_skill - 에이전트가이 도구 호출에서 로드한 스킬의 이름입니다.

  • skill_content - 로드된 스킬 SKILL.md 지침의 전체 본문입니다.

  • context - 전체 세션 컨텍스트 - 세션 시작부터 세션 종료까지 모든 턴. 에이전트는 스킬을 로드한 후 언제든지 규정된 단계를 수행할 수 있으므로 판사는 도구 호출을 활성화할 뿐만 아니라 전체 세션이 필요합니다.

평가자는 호출된 스킬과 SKILL.md 본문이 모두 트레이스에 있는 경우에만 실행됩니다. 판사는 스킬 본문에서 규정된 단계를 식별한 다음 각 단계에 대해 대화 레코드에서 단계가 완전히 수행되었는지, 부분적으로 수행되었는지 또는 건너뛰었는지 결정하고 단계별 분석과 일치하는 전체 등급을 생성합니다.

프레임워크 지원

AgentCore Evaluations는 SKILL.md 파일의 파일 시스템 읽기와 프레임워크의 네이티브 스킬 로드 도구라는 두 가지 종류의 트레이스 신호에서 스킬 호출을 감지합니다. 파일 시스템 읽기 신호는 모든 프레임워크에서 작동합니다. 네이티브 도구 신호는 다음 표의 두 번째 행에 있는 특정 프레임워크에 적용됩니다.

감지 방법

프레임워크

SKILL.md 파일 읽기(범용)

LlamaIndex, OpenAI 에이전트 및 일반 파일 읽기 도구를 SKILL.md 통해 읽는 모든 에이전트.

네이티브 스킬 로드 도구(파일 읽기 외에)

Strands Agents, LangGraph Deep Agents, Google ADK, Claude Agent SDK.

파일 읽기 경로의 경우, AgentCore Evaluations는 파라미터에 로 끝나는 경로가 포함되어 /SKILL.md 있고 도구 결과 본문이 올바른 형식의 SKILL.md 파일( name 및 description 필드가 있는 프런트미터, 지침 본문)인 경우 도구 호출을 스킬 로드와 일치시킵니다.

가용 스킬 카탈로그는 기본적으로 Strands Agents, LangGraph Deep Agents 및 Google ADK에서 내보냅니다. Claude Agent SDK 및 파일 읽기 에이전트는 카탈로그를 내보내지 않습니다.는 Builtin.SkillSelectionAccuracy 여전히 available_skills 자리 표시자가 비어 있는 해당 에이전트에서 실행됩니다.

일반적인 계측 설정 및 프레임 작업당 범위 이름은 지원되는 에이전트 프레임워크를 참조하세요.

동작 건너뛰기

AgentCore Evaluations는 트레이스가 invoked_skill 또는 skill_content를 노출할 때 도구 호출을 스킬 호출로 분류합니다. 신호가 없는 경우 AgentCore Evaluations는 해당 호출에 대한 두 스킬 평가자를 모두 건너뛰고 결과를 내보냅니다. 에이전트가 스킬을 로드하지 않는 경우 두 평가자 모두 세션에 대해 0개의 결과를 생성합니다. 이는 오류가 아니라 예상된 결과입니다.

에이전트가 로드 스킬을 사용하지만 평가자가 여전히 결과를 반환하지 않는 경우 진단 스킬 소스에서 진단 스킬을 실행하여 트레이스가 예상 신호를 전달하는지 확인합니다.

사용자 지정 평가자를 위한 스킬 자리 표시자

에이전트가 로드한 스킬에 대한 이유가 되는 사용자 지정 TOOL_CALL 평가자를 작성할 수 있습니다. 위에 설명된 스킬 자리 표시자(invoked_skill, skill_content, available_skills, user_message)는 표준 도구 수준 자리 표시자(context, available_tools, )와 함께 모든 사용자 지정 TOOL_CALL 평가자가 사용할 수 있습니다tool_turn. 세션 수준 및 트레이스 수준 사용자 지정 평가자는 이러한 자리 표시자를 사용할 수 없습니다.

AgentCore 평가의 동작 방식은 사용자 지정 평가자가 참조하는 스킬 자리 표시자에 따라 달라집니다.

  • 를 참조하는 평가자는 Builtin.SkillSelectionAccuracy와 같은 invoked_skill 동작을 합니다. 즉, 스킬 호출 도구 호출에서만 실행되고 표준 사전 호출 스냅샷을 {context} 렌더링합니다.

  • 를 참조하는 평가자는와 같은 skill_content 동작을 합니다Builtin.SkillInstructionFollowing. 즉, SKILL.md 본문을 사용할 수 있는 스킬 호출 도구 호출에서만 실행되고 세션 시작부터 세션 종료까지 모든 턴을 통해 전체 세션 컨텍스트를 {context} 렌더링합니다. 이는 표준 도구 수준과 다릅니다context.

어느 경우든 AgentCore Evaluations는 스킬 호출당 하나의 결과를 내보냅니다. 사용자 지정 평가자 작성은 평가자 생성을 참조하세요.