> ## Documentation Index
> Fetch the complete documentation index at: https://docs.thunderphone.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Validatiesets: speel echte gespreksbeurten opnieuw af vóór implementatie

> Zet echte gespreksmomenten van ThunderPhone om in herbruikbare validatievoorbeelden, beoordeel het verwachte gedrag, speel ze opnieuw af tegen een agentconcept en ontdek regressies vóór implementatie.

Een **validatievoorbeeld** legt één agentbeurt uit een echte oproep vast: het
voorafgaande gesprek, de relevante beller-audio, wat de agent daadwerkelijk
deed en de referentie voor wat de agent zou moeten doen. Door een set opnieuw
uit te voeren op basis van het huidige concept, ontdek je regressies zonder nog
een oproep te plaatsen.

Gebruik de organisatiebrede pagina **Validatiesets**
(`/dashboard/validation`) om de dataset samen te stellen en te beoordelen.
Gebruik het tabblad **Validatie** van een afzonderlijke agent om de set uit te
voeren en de uitvoeringsgeschiedenis te bekijken.

## Voorbeelden toevoegen vanuit de oproepgeschiedenis

<Steps>
  <Step title="Kies Voorbeelden toevoegen">
    Kies de agent waarvan het voorbeeld het gedrag moet valideren. De werkruimte
    toont maximaal 25 recente niet-gesimuleerde oproepen voor die agent.
  </Step>

  <Step title="Selecteer een oproep en agentbeurt">
    Lees het transcript, wijs de agentbeurt aan die je wilt behouden en selecteer
    de checklistactie. Het gesprek tot en met die beurt en de bijbehorende
    audiofragmenten van de beller worden gekopieerd naar de validatiedataset.
  </Step>

  <Step title="Beoordeel de verwachting">
    ThunderPhone stelt een beschrijving van het juiste gedrag op. Bewerk deze
    zodat die specifiek en toetsbaar is, en bewerk eventueel de geaccepteerde
    voorbeeldreactie en verwachte toolaanroepen.
  </Step>

  <Step title="Opslaan of activeren">
    **Concept opslaan** laat het voorbeeld in **Moet worden beoordeeld**.
    **Opslaan en activeren** neemt het op in toekomstige validatieruns.
  </Step>
</Steps>

Als je dezelfde beurt twee keer promoveert, wordt het bestaande voorbeeld
hergebruikt in plaats van twee kopieën te maken.

## Soorten voorbeelden en statussen

Soorten beschrijven waarom een voorbeeld bestaat:

| Soort                | Gebruik                                                                  |
| -------------------- | ------------------------------------------------------------------------ |
| **Fout**             | Een echte reactie die gedrag blootlegde dat je wilt voorkomen.           |
| **Gouden standaard** | Een bewezen goede reactie die het behouden waard is.                     |
| **Handmatig**        | Een handmatig samengesteld geval dat in geen van beide categorieën valt. |

Statussen bepalen de levenscyclus:

| Status                     | Betekenis                                                                             |
| -------------------------- | ------------------------------------------------------------------------------------- |
| **Moet worden beoordeeld** | De referentie wordt nog beoordeeld; uitgesloten van runs.                             |
| **Actief**                 | Opgenomen in validatieruns.                                                           |
| **Verouderd**              | De prompt is gewijzigd sinds het voorbeeld werd vastgelegd; beoordeel de verwachting. |
| **Incompatibel**           | Het voorbeeld kan niet opnieuw worden uitgevoerd met de huidige configuratie.         |
| **Gearchiveerd**           | Bewaard voor de geschiedenis, maar uitgesloten van runs.                              |

## De dataset bekijken en verfijnen

Filter de organisatiedataset op **agent**, **status** of **soort**. Als je een
voorbeeld selecteert, zie je:

* Vastgelegde gesprekscontext en afspeelbare audiofragmenten van de beller.
* De bronoep en de oorspronkelijke reactie.
* De referentieverwachting, geaccepteerde gesproken reactie en toolaanroepen.
* De meest recente herhaling naast het oorspronkelijke en verwachte gedrag.
* Het meest recente oordeel en toelichtingen van de beoordelaar, indien beschikbaar.

Kies **Referentie bewerken** om de verwachting of geaccepteerde reactie te
herzien. Kies **Opnieuw uitvoeren met concept** om alleen dat voorbeeld te
testen zonder een volledige run te starten. Herhalingen gebruiken het huidige
concept van de agent, niet noodzakelijk de geïmplementeerde configuratie.

## Een validatieset uitvoeren

Start vanuit het tabblad **Validatie** van de agent een run voor elk actief
voorbeeld. Elk voorbeeld krijgt een van deze oordelen:

* **Geslaagd** — de reactie voldoet aan de verwachting en de beller-audio.
* **Waarschuwing** — de reactie is bruikbaar, maar één controle constateerde onzekerheid.
* **Mislukt** — de reactie is in tegenspraak met de audio of mist vereist gedrag.
* **Overgeslagen** — vereiste beller-audio kon niet worden geladen; dit voorbeeld
  is uitgesloten van de noemer van het slagingspercentage.
* **Fout** — opnieuw uitvoeren of beoordelen kon niet worden voltooid.

De samenvatting van de run bevat aantallen geslaagd, waarschuwingen, mislukt en
overgeslagen, het slagingspercentage, de geschatte kosten en eventuele regressie
van geslaagd naar mislukt sinds de voorgaande voltooide run. Er kan per agent
slechts één validatierun tegelijk actief zijn.

## Implementeren met validatiebewijs

Wanneer een agent validatievoorbeelden heeft, geeft het implementatievenster aan of de
meest recente voltooide uitvoering overeenkomt met het huidige concept. Je kunt:

* Implementeren met het weergegeven slagingspercentage en aantal regressies.
* Eerst validatie uitvoeren als er geen overeenkomende uitvoering bestaat.
* Toch bewust implementeren wanneer het resultaat is beoordeeld.

Validatie is bewijs en een implementatiecontrole, geen automatische verdeling van
productieverkeer. Gebruik voor livevergelijkingen
[Experimenten (A/B-testen)](/nl/guides/experiments-ab-testing).

## API-automatisering

De [API voor validatiesets](/api-reference/validation-sets) ondersteunt het promoveren
van beurten, het beheren van voorbeelden, het streamen van vastgezette audio,
afzonderlijke herhalingen, batchuitvoeringen, uitvoeringsresultaten, status tijdens
implementatie en het organisatieoverzicht.
