> ## Documentation Index
> Fetch the complete documentation index at: https://docs.thunderphone.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Jeux de validation : rejouez de vrais tours d'appel avant le déploiement

> Transformez de vrais moments d'appels ThunderPhone en exemples de validation réutilisables, examinez le comportement attendu, rejouez-les avec une version préliminaire de l'agent et détectez les régressions avant le déploiement.

Un **exemple de validation** fige un tour d'agent issu d'un appel réel : la
conversation qui y mène, l'audio pertinent de l'appelant, ce que l'agent a
réellement fait et la vérité terrain de ce qu'il devrait faire. Rejouer un jeu
avec le brouillon actuel permet de détecter les régressions sans passer un autre appel.

Utilisez la page **Jeux de validation** de l'organisation
(`/dashboard/validation`) pour créer et examiner le jeu de données. Utilisez
l'onglet **Validation** d'un agent individuel pour exécuter le jeu et consulter
l'historique des exécutions.

## Ajouter des exemples depuis l'historique des appels

<Steps>
  <Step title="Choisir Ajouter des exemples">
    Sélectionnez l'agent dont le comportement doit être validé par l'exemple. L'espace de travail
    affiche jusqu'à 25 appels récents non simulés pour cet agent.
  </Step>

  <Step title="Sélectionner un appel et un tour d'agent">
    Lisez la transcription, survolez le tour d'agent que vous souhaitez conserver, puis sélectionnez
    l'action de la liste de contrôle. La conversation jusqu'à ce tour et ses
    segments audio de l'appelant sont copiés dans le jeu de données de validation.
  </Step>

  <Step title="Examiner l'attente">
    ThunderPhone rédige une description du comportement correct. Modifiez-la afin qu'elle soit
    précise et testable, puis modifiez éventuellement la réponse exemple acceptée
    et les appels d'outils attendus.
  </Step>

  <Step title="Enregistrer ou activer">
    **Enregistrer le brouillon** laisse l'exemple dans l'état **À examiner**.
    **Enregistrer et activer** l'inclut dans les futures exécutions de validation.
  </Step>
</Steps>

L'ajout du même tour deux fois réutilise l'exemple existant au lieu de créer
deux copies.

## Types et statuts des exemples

Les types décrivent la raison d'être d'un exemple :

| Type          | Utilisation                                                                    |
| ------------- | ------------------------------------------------------------------------------ |
| **Échec**     | Une réponse réelle qui a révélé un comportement que vous souhaitez éviter.     |
| **Référence** | Une réponse connue comme correcte qu'il est utile de préserver.                |
| **Manuel**    | Un cas sélectionné manuellement qui n'appartient à aucune des deux catégories. |

Les statuts contrôlent le cycle de vie :

| Statut           | Signification                                                              |
| ---------------- | -------------------------------------------------------------------------- |
| **À examiner**   | La vérité terrain est encore en cours d'examen ; exclu des exécutions.     |
| **Actif**        | Inclus dans les exécutions de validation.                                  |
| **Obsolète**     | Le prompt a changé depuis que l'exemple a été figé ; examinez son attente. |
| **Incompatible** | L'exemple ne peut pas être rejoué avec la configuration actuelle.          |
| **Archivé**      | Conservé pour l'historique, mais exclu des exécutions.                     |

## Parcourir et affiner le jeu de données

Filtrez le jeu de données de l'organisation par **agent**, **statut** ou **type**. La sélection
d'un exemple affiche :

* Le contexte de conversation figé et les segments audio de l'appelant lisibles.
* L'appel source et la réponse d'origine.
* L'attente de vérité terrain, la réponse orale acceptée et les appels d'outils.
* La dernière réexécution à côté du comportement d'origine et attendu.
* Le dernier verdict et les explications du juge, lorsqu'ils sont disponibles.

Choisissez **Modifier la vérité terrain** pour réviser l'attente ou la réponse acceptée.
Choisissez **Rejouer avec le brouillon** pour tester uniquement cet exemple sans lancer une
exécution complète. Les réexécutions utilisent le brouillon actuel de l'agent, et pas nécessairement sa
configuration déployée.

## Exécuter un jeu de validation

Depuis l'onglet **Validation** de l'agent, lancez une exécution sur chaque exemple actif. Chaque
exemple reçoit l'un des verdicts suivants :

* **Réussi** — la réponse satisfait l'attente et l'audio de l'appelant.
* **Avertissement** — la réponse est utilisable, mais une vérification a relevé une incertitude.
* **Échec** — elle contredit l'audio ou ne respecte pas le comportement requis.
* **Ignoré** — l'audio requis de l'appelant n'a pas pu être chargé ; il est exclu du
  dénominateur du taux de réussite.
* **Erreur** — la réexécution ou l'évaluation n'a pas pu aboutir.

Le résumé de l'exécution indique les nombres de réussites, d'avertissements, d'échecs et d'exemples ignorés, le taux
de réussite, le coût estimé et toute régression d'une réussite à un échec depuis l'exécution
terminée précédente. Une seule exécution de validation par agent peut être active à la fois.

## Déployer avec des preuves de validation

Lorsqu’un agent dispose d’exemples de validation, la boîte de dialogue de déploiement indique si la dernière exécution terminée correspond au brouillon actuel. Vous pouvez :

* Déployer avec le taux de réussite et le nombre de régressions affichés.
* Exécuter d’abord la validation si aucune exécution correspondante n’existe.
* Déployer délibérément malgré tout lorsque le résultat a été examiné.

La validation constitue une preuve et une vérification de déploiement, et non une répartition automatique du trafic de production. Pour les comparaisons en direct, utilisez les
[Expériences (tests A/B)](/fr/guides/experiments-ab-testing).

## Automatisation via API

L’[API des ensembles de validation](/api-reference/validation-sets) couvre la promotion des tours, la gestion des exemples, le streaming d’audio épinglé, les relectures individuelles, les exécutions par lot, les résultats d’exécution, l’état au moment du déploiement et la vue d’ensemble de l’organisation.
