> ## Documentation Index
> Fetch the complete documentation index at: https://docs.thunderphone.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 검증 세트: 배포 전에 실제 통화 턴 재생

> 실제 ThunderPhone 통화의 특정 순간을 재사용 가능한 검증 예시로 전환하고, 예상 동작을 검토하며, 에이전트 초안을 대상으로 재생하고, 배포 전에 회귀를 포착합니다.

실제 통화의 한 에이전트 턴을 **검증 예시**로 고정합니다. 여기에는 해당 턴까지의
대화, 관련 발신자 오디오, 에이전트가 실제로 수행한 작업, 그리고 수행해야 할 작업의
정답 기준이 포함됩니다. 현재 초안에 대해 세트를 재생하면 추가 통화를 연결하지 않고도
회귀를 포착할 수 있습니다.

조직 전체의 **검증 세트** 페이지
(`/dashboard/validation`)를 사용하여 데이터세트를 구축하고 검토합니다. 개별
에이전트의 **검증** 탭을 사용하여 세트를 실행하고 실행 기록을 확인합니다.

## 통화 기록에서 예시 추가

<Steps>
  <Step title="예시 추가 선택">
    예시로 동작을 검증할 에이전트를 선택합니다. 워크스페이스에는 해당 에이전트의
    최근 비시뮬레이션 통화가 최대 25개 표시됩니다.
  </Step>

  <Step title="통화 및 에이전트 턴 선택">
    트랜스크립트를 읽고, 보존하려는 에이전트 턴 위에 마우스를 올린 다음
    체크리스트 작업을 선택합니다. 해당 턴까지의 대화와 발신자 오디오 구간이
    검증 데이터세트에 복사됩니다.
  </Step>

  <Step title="기대 동작 검토">
    ThunderPhone이 올바른 동작에 대한 설명 초안을 생성합니다. 구체적이고 테스트할 수
    있도록 수정하고, 필요에 따라 허용되는 예시 응답과 예상 도구 호출도 수정합니다.
  </Step>

  <Step title="저장 또는 활성화">
    **초안 저장**을 선택하면 예시가 **검토 필요** 상태로 유지됩니다.
    **저장 및 활성화**를 선택하면 이후 검증 실행에 포함됩니다.
  </Step>
</Steps>

동일한 턴을 두 번 승격하면 복사본 두 개를 만드는 대신 기존 예시를 재사용합니다.

## 예시 유형 및 상태

유형은 예시가 존재하는 이유를 설명합니다.

| 유형     | 용도                             |
| ------ | ------------------------------ |
| **실패** | 방지하려는 동작을 드러낸 실제 응답입니다.        |
| **골든** | 보존할 가치가 있는, 정상 동작이 확인된 응답입니다.  |
| **수동** | 어느 범주에도 속하지 않는 수동으로 선별한 사례입니다. |

상태는 수명 주기를 제어합니다.

| 상태          | 의미                                      |
| ----------- | --------------------------------------- |
| **검토 필요**   | 정답 기준을 아직 검토 중이며 실행에서 제외됩니다.            |
| **활성**      | 검증 실행에 포함됩니다.                           |
| **오래됨**     | 예시를 고정한 이후 프롬프트가 변경되었습니다. 기대 동작을 검토합니다. |
| **호환되지 않음** | 현재 구성으로 예시를 재생할 수 없습니다.                 |
| **보관됨**     | 기록을 위해 보존되지만 실행에서는 제외됩니다.               |

## 데이터세트 탐색 및 개선

조직 데이터세트를 **에이전트**, **상태** 또는 **유형**으로 필터링합니다. 예시를
선택하면 다음이 표시됩니다.

* 고정된 대화 컨텍스트와 재생 가능한 발신자 오디오 구간
* 원본 통화와 원래 응답
* 정답 기준 기대 동작, 허용되는 음성 응답 및 도구 호출
* 원래 동작 및 예상 동작과 함께 표시되는 최신 재생 결과
* 제공되는 경우 최신 판정 및 평가자 설명

**정답 기준 편집**을 선택하여 기대 동작이나 허용되는 응답을 수정합니다.
**초안에 대해 재생**을 선택하여 전체 실행을 시작하지 않고 해당 예시만 테스트합니다.
재생에는 배포된 구성과 다를 수 있는 에이전트의 현재 초안이 사용됩니다.

## 검증 세트 실행

에이전트의 **검증** 탭에서 모든 활성 예시에 대해 실행을 시작합니다. 각 예시는 다음
판정 중 하나를 받습니다.

* **통과** — 응답이 기대 동작과 발신자 오디오를 충족합니다.
* **경고** — 응답은 사용할 수 있지만 하나의 검사에서 불확실성이 발견되었습니다.
* **실패** — 오디오와 모순되거나 필수 동작을 누락했습니다.
* **건너뜀** — 필요한 발신자 오디오를 불러올 수 없어 통과율 분모에서 제외됩니다.
* **오류** — 재생 또는 평가를 완료할 수 없습니다.

실행 요약에는 통과, 경고, 실패 및 건너뜀 수, 통과율, 예상 비용, 그리고 이전에 완료된
실행 이후 통과에서 실패로 바뀐 회귀가 보고됩니다. 에이전트당 한 번에 하나의 검증 실행만
활성화할 수 있습니다.

## 검증 근거와 함께 배포하기

에이전트에 검증 예시가 있으면 배포 대화 상자에 최신 완료 실행이 현재 초안과 일치하는지 표시됩니다. 다음을 수행할 수 있습니다.

* 표시된 통과율과 회귀 수를 기준으로 배포합니다.
* 일치하는 실행이 없으면 먼저 검증을 실행합니다.
* 결과를 검토한 경우 의도적으로 그대로 배포합니다.

검증은 근거이자 배포 확인 절차이며, 프로덕션 트래픽을 자동으로 분할하지는 않습니다. 실시간 비교에는
[실험(A/B 테스트)](/ko/guides/experiments-ab-testing)을 사용합니다.

## API 자동화

[검증 세트 API](/api-reference/validation-sets)는 턴 승격, 예시 관리, 고정된 오디오 스트리밍, 개별 재생, 일괄 실행, 실행 결과, 배포 시점 상태 및 조직 개요를 제공합니다.
