> ## Documentation Index
> Fetch the complete documentation index at: https://docs.thunderphone.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Conjuntos de validación: reproduce turnos reales de llamadas antes del despliegue

> Convierte momentos reales de llamadas de ThunderPhone en ejemplos de validación reutilizables, revisa el comportamiento esperado, reprodúcelos con un borrador del agente y detecta regresiones antes de desplegar.

Un **ejemplo de validación** fija un turno del agente de una llamada real: la
conversación previa, el audio relevante de quien llama, lo que el agente
realmente hizo y la referencia de lo que debería hacer. Reproducir un conjunto
con el borrador actual detecta regresiones sin realizar otra llamada.

Usa la página de **Conjuntos de validación** de toda la organización
(`/dashboard/validation`) para crear y revisar el conjunto de datos. Usa la
pestaña **Validación** de un agente individual para ejecutar el conjunto e
inspeccionar el historial de ejecuciones.

## Agregar ejemplos desde el historial de llamadas

<Steps>
  <Step title="Elige Agregar ejemplos">
    Selecciona el agente cuyo comportamiento debe validar el ejemplo. El espacio
    de trabajo muestra hasta 25 llamadas recientes que no son simulaciones para ese agente.
  </Step>

  <Step title="Selecciona una llamada y un turno del agente">
    Lee la transcripción, coloca el cursor sobre el turno del agente que quieres conservar y selecciona
    la acción de lista de verificación. La conversación hasta ese turno y sus
    segmentos de audio de quien llama se copian al conjunto de datos de validación.
  </Step>

  <Step title="Revisa la expectativa">
    ThunderPhone redacta una descripción del comportamiento correcto. Edítala para que sea
    específica y comprobable y, de forma opcional, edita la respuesta de ejemplo aceptada
    y las llamadas esperadas a herramientas.
  </Step>

  <Step title="Guarda o activa">
    **Guardar borrador** deja el ejemplo en **Necesita revisión**.
    **Guardar y activar** lo incluye en futuras ejecuciones de validación.
  </Step>
</Steps>

Promover el mismo turno dos veces reutiliza el ejemplo existente en lugar de crear
dos copias.

## Tipos y estados de ejemplos

Los tipos describen por qué existe un ejemplo:

| Tipo              | Uso                                                                            |
| ----------------- | ------------------------------------------------------------------------------ |
| **Fallo**         | Una respuesta real que expuso un comportamiento que quieres evitar.            |
| **De referencia** | Una respuesta comprobada y correcta que vale la pena conservar.                |
| **Manual**        | Un caso seleccionado manualmente que no pertenece a ninguna de las categorías. |

Los estados controlan el ciclo de vida:

| Estado                | Significado                                                           |
| --------------------- | --------------------------------------------------------------------- |
| **Necesita revisión** | La referencia aún se está revisando; se excluye de las ejecuciones.   |
| **Activo**            | Se incluye en las ejecuciones de validación.                          |
| **Obsoleto**          | El prompt cambió desde que se fijó el ejemplo; revisa su expectativa. |
| **Incompatible**      | El ejemplo no se puede reproducir con la configuración actual.        |
| **Archivado**         | Se conserva para el historial, pero se excluye de las ejecuciones.    |

## Explora y perfecciona el conjunto de datos

Filtra el conjunto de datos de la organización por **agente**, **estado** o
**tipo**. Al seleccionar un ejemplo, se muestra:

* Contexto de conversación fijado y segmentos reproducibles de audio de quien llama.
* La llamada de origen y la respuesta original.
* La expectativa de referencia, la respuesta hablada aceptada y las llamadas a herramientas.
* La reproducción más reciente junto al comportamiento original y esperado.
* El veredicto más reciente y las explicaciones del evaluador, cuando estén disponibles.

Elige **Editar referencia** para revisar la expectativa o la respuesta aceptada.
Elige **Reproducir con el borrador** para probar solo ese ejemplo sin iniciar una
ejecución completa. Las reproducciones usan el borrador actual del agente, no
necesariamente su configuración implementada.

## Ejecuta un conjunto de validación

Desde la pestaña **Validación** del agente, inicia una ejecución con todos los ejemplos activos. Cada
ejemplo recibe uno de estos veredictos:

* **Aprobado** — la respuesta cumple la expectativa y el audio de quien llama.
* **Advertencia** — la respuesta se puede usar, pero una comprobación detectó incertidumbre.
* **Fallido** — contradice el audio o no cumple el comportamiento requerido.
* **Omitido** — no se pudo cargar el audio requerido de quien llama; se excluye del
  denominador de la tasa de aprobación.
* **Error** — no se pudo completar la reproducción o la evaluación.

El resumen de la ejecución informa los conteos de aprobados, advertencias, fallidos y omitidos, la tasa
de aprobación, el costo estimado y cualquier regresión de aprobado a fallido desde la ejecución
completada anterior. Solo una ejecución de validación por agente puede estar activa a la vez.

## Despliega con evidencia de validación

Cuando un agente tiene ejemplos de validación, el diálogo de despliegue indica si la
última ejecución completada coincide con el borrador actual. Puedes:

* Desplegar con la tasa de aprobación y el recuento de regresiones mostrados.
* Ejecutar la validación primero si no existe una ejecución coincidente.
* Desplegar de todos modos deliberadamente cuando el resultado se haya revisado.

La validación es evidencia y una comprobación de despliegue, no una división automática
del tráfico de producción. Para comparaciones en vivo, usa
[Experimentos (pruebas A/B)](/es/guides/experiments-ab-testing).

## Automatización de API

La [API de conjuntos de validación](/api-reference/validation-sets) abarca la promoción de
turnos, la gestión de ejemplos, la transmisión de audio fijado, las repeticiones
individuales, las ejecuciones por lotes, los resultados de ejecución, el estado al
momento del despliegue y la vista general de la organización.
