Skip to main content
실제 통화의 한 에이전트 턴을 검증 예시로 고정합니다. 여기에는 해당 턴까지의 대화, 관련 발신자 오디오, 에이전트가 실제로 수행한 작업, 그리고 수행해야 할 작업의 정답 기준이 포함됩니다. 현재 초안에 대해 세트를 재생하면 추가 통화를 연결하지 않고도 회귀를 포착할 수 있습니다. 조직 전체의 검증 세트 페이지 (/dashboard/validation)를 사용하여 데이터세트를 구축하고 검토합니다. 개별 에이전트의 검증 탭을 사용하여 세트를 실행하고 실행 기록을 확인합니다.

통화 기록에서 예시 추가

1

예시 추가 선택

예시로 동작을 검증할 에이전트를 선택합니다. 워크스페이스에는 해당 에이전트의 최근 비시뮬레이션 통화가 최대 25개 표시됩니다.
2

통화 및 에이전트 턴 선택

트랜스크립트를 읽고, 보존하려는 에이전트 턴 위에 마우스를 올린 다음 체크리스트 작업을 선택합니다. 해당 턴까지의 대화와 발신자 오디오 구간이 검증 데이터세트에 복사됩니다.
3

기대 동작 검토

ThunderPhone이 올바른 동작에 대한 설명 초안을 생성합니다. 구체적이고 테스트할 수 있도록 수정하고, 필요에 따라 허용되는 예시 응답과 예상 도구 호출도 수정합니다.
4

저장 또는 활성화

초안 저장을 선택하면 예시가 검토 필요 상태로 유지됩니다. 저장 및 활성화를 선택하면 이후 검증 실행에 포함됩니다.
동일한 턴을 두 번 승격하면 복사본 두 개를 만드는 대신 기존 예시를 재사용합니다.

예시 유형 및 상태

유형은 예시가 존재하는 이유를 설명합니다. 상태는 수명 주기를 제어합니다.

데이터세트 탐색 및 개선

조직 데이터세트를 에이전트, 상태 또는 유형으로 필터링합니다. 예시를 선택하면 다음이 표시됩니다.
  • 고정된 대화 컨텍스트와 재생 가능한 발신자 오디오 구간
  • 원본 통화와 원래 응답
  • 정답 기준 기대 동작, 허용되는 음성 응답 및 도구 호출
  • 원래 동작 및 예상 동작과 함께 표시되는 최신 재생 결과
  • 제공되는 경우 최신 판정 및 평가자 설명
정답 기준 편집을 선택하여 기대 동작이나 허용되는 응답을 수정합니다. 초안에 대해 재생을 선택하여 전체 실행을 시작하지 않고 해당 예시만 테스트합니다. 재생에는 배포된 구성과 다를 수 있는 에이전트의 현재 초안이 사용됩니다.

검증 세트 실행

에이전트의 검증 탭에서 모든 활성 예시에 대해 실행을 시작합니다. 각 예시는 다음 판정 중 하나를 받습니다.
  • 통과 — 응답이 기대 동작과 발신자 오디오를 충족합니다.
  • 경고 — 응답은 사용할 수 있지만 하나의 검사에서 불확실성이 발견되었습니다.
  • 실패 — 오디오와 모순되거나 필수 동작을 누락했습니다.
  • 건너뜀 — 필요한 발신자 오디오를 불러올 수 없어 통과율 분모에서 제외됩니다.
  • 오류 — 재생 또는 평가를 완료할 수 없습니다.
실행 요약에는 통과, 경고, 실패 및 건너뜀 수, 통과율, 예상 비용, 그리고 이전에 완료된 실행 이후 통과에서 실패로 바뀐 회귀가 보고됩니다. 에이전트당 한 번에 하나의 검증 실행만 활성화할 수 있습니다.

검증 근거와 함께 배포하기

에이전트에 검증 예시가 있으면 배포 대화 상자에 최신 완료 실행이 현재 초안과 일치하는지 표시됩니다. 다음을 수행할 수 있습니다.
  • 표시된 통과율과 회귀 수를 기준으로 배포합니다.
  • 일치하는 실행이 없으면 먼저 검증을 실행합니다.
  • 결과를 검토한 경우 의도적으로 그대로 배포합니다.
검증은 근거이자 배포 확인 절차이며, 프로덕션 트래픽을 자동으로 분할하지는 않습니다. 실시간 비교에는 실험(A/B 테스트)을 사용합니다.

API 자동화

검증 세트 API는 턴 승격, 예시 관리, 고정된 오디오 스트리밍, 개별 재생, 일괄 실행, 실행 결과, 배포 시점 상태 및 조직 개요를 제공합니다.