Foretrekker du dashbordet? Den samme funksjonaliteten finnes i Simuleringer
(
/dashboard/simulations), inkludert KI-generering av scenarioer — se
Simuler en samtale. Denne siden dekker den
programmatiske fremgangsmåten.- Røykttester før distribusjon etter hver promptendring
- Regresjonssuiter koblet til CI (koble til
test-call.completed-webhooken → la byggingen feile hvis poengsummen faller) - Belastningstesting av samtidighetsgrenser
Éngangskjøring: enkeltkjøring
Responsen er et objekt for testkjøring
med
status="queued". Poll til status blir completed eller
failed; når call_id er angitt, laster du inn transkripsjonen via
GET /v1/calls/{call_id}/transcript.
Batchkjøringer: parallelle scenarioer
Kjør N scenarioer samtidig — nyttig for regresjonssuiter som treffer alle kjente randtilfeller parallelt:run_ids-liste med ID-er for underkjøringer. Hent batch-
status:
run_count er begrenset til 20; stagger_seconds fordeler oppstartene
for å unngå å overbelaste agenten (0–60 s).
Koble det til CI
Opprett en suite for utgivelsesporten på siden Simuleringer (/dashboard/simulations) — velg agenten, legg til scenarioer manuelt eller
klikk på Generer scenarioer med AI for å utarbeide dem fra agentens
prompt (med en valgfri gjennomgang av kanttilfeller), og grupper dem i en suite.
En suite låser scenarioene og agenten, samt en minimumsbeståttandel og en
valgfri regel om null kritiske feil. Beståtte kjøringer blir den godkjente
baselinjen; senere overganger fra bestått til ikke bestått returneres som regresjoner.
Bruk en API-nøkkel for organisasjonen i CI.
Dette skriptet utløser suiten, spør kontinuerlig til vurderingen og sammenligningen er
fullført, og avslutter med en verdi ulik null med mindre resultatet er pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run returnerer 202 med
kjørings-ID-en. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} returnerer
status, verdict, pass_rate, critical_failure_count og
baselinjens regressions-liste. Begge endepunktene binder organisasjonen i URL-en
til API-nøkkelens organisasjon.
Mønstre
Regresjonskorpus per prompt
Vedlikehold en JSON-fil med tupler av{name, scenario_prompt, expected_outcome}.
Ved hver endring av prompten kjører du hele settet som en batch; sammenlign
transkripsjonene og vurderingene med forrige kjøring.
Røyktest per utgivelse
En enkelt batch med fem scenarioer for normalflyt som du kjører etter hver utrulling. Denne er latenssensitiv, så beholdstagger_seconds: 0.
Latensbenchmarking
Kjør identiske scenarioer mot ulike produktnivåer (spark,
bolt, storm-base). Sammenlign call.graded-poengene og
duration_seconds fra hver resulterende samtalelogg.
Neste steg
Referanse for testsamtaler
Alle spørringsparametere, statuskoder og batchformater.
AI-vurdering
Gi automatisk poeng til hver testkjøring for å spore kvalitet over tid.
Problemmeldinger
Marker spesifikke tester for menneskelig gjennomgang.
test-call.completed-webhook
Strøm resultater til CI / Slack / PagerDuty.