Geef je de voorkeur aan het dashboard? Dezelfde functionaliteit vind je in Simulations
(
/dashboard/simulations), inclusief het genereren van AI-scenario’s — zie
Een oproep simuleren. Deze pagina behandelt de
programmatische route.- Smooktests vóór implementatie na elke promptwijziging
- Regressiesuites gekoppeld aan CI (koppel de webhook
test-call.completed→ laat de build mislukken als de score daalt) - Het stresstesten van gelijktijdigheidslimieten
Eenmalig: één uitvoering
Het antwoord is een testoproep-uitvoeringsobject
met
status="queued". Poll totdat status completed of
failed wordt; zodra call_id is ingesteld, laad je het transcript via
GET /v1/calls/{call_id}/transcript.
Batches: parallelle scenario’s
Voer N scenario’s gelijktijdig uit — handig voor regressiesuites die elk bekend randgeval parallel testen:run_ids-lijst met id’s van onderliggende uitvoeringen. Haal de batch-
status op:
run_count is beperkt tot 20; stagger_seconds spreidt het starten
om te voorkomen dat de agent wordt overbelast (0–60 s).
Koppel het aan CI
Maak een releasegatesuite op de pagina Simulaties (/dashboard/simulations) — kies de agent, voeg scenario’s handmatig toe of
klik op Scenario’s genereren met AI om ze op te stellen vanuit de
prompt van de agent (met een optionele controle op randgevallen), en groepeer ze
in een suite. Een suite legt de scenario’s en agent vast, plus een minimale
slagingsratio en een optionele regel voor nul kritieke fouten. Geslaagde runs worden
de geaccepteerde referentie; latere overgangen van geslaagd→mislukt worden als regressies
geretourneerd.
Gebruik een organisatie-API-sleutel in CI.
Dit script start de suite, pollt totdat beoordeling en vergelijking zijn
voltooid, en sluit af met een niet-nulstatus tenzij het oordeel pass is:
POST /v1/orgs/{org_id}/suites/{suite_id}/run retourneert 202 met de
run-ID. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} retourneert
status, verdict, pass_rate, critical_failure_count en de
referentielijst regressions. Beide endpoints koppelen de organisatie in de URL
aan de organisatie van de API-sleutel.
Patronen
Regressiecorpus per prompt
Beheer een JSON-bestand met tuples van{name, scenario_prompt, expected_outcome}.
Voer bij elke promptwijziging de volledige set als batch uit; vergelijk de
transcripties en beoordelingen met de vorige run.
Smoketest per release
Een enkele batch van vijf scenario’s voor het ideale pad die je na elke implementatie uitvoert. Gevoelig voor latentie, dus houdstagger_seconds: 0.
Latentieb benchmarking
Voer identieke scenario’s uit voor verschillende productpakketten (spark,
bolt, storm-base). Vergelijk de scores van call.graded en de
duration_seconds uit elk resulterend oproeplogboek.
Volgende stappen
Referentie voor testoproepen
Elke queryparameter, statuscode en batchstructuur.
AI-beoordeling
Beoordeel elke testrun automatisch om de kwaliteit in de loop van de tijd te volgen.
Probleemmeldingen
Markeer specifieke tests voor menselijke beoordeling.
test-call.completed-webhook
Stuur resultaten door naar je CI / Slack / PagerDuty.