Skip to main content
Foretrekker du dashbordet? Den samme funksjonaliteten finnes i Simuleringer (/dashboard/simulations), inkludert KI-generering av scenarioer — se Simuler en samtale. Denne siden dekker den programmatiske fremgangsmåten.
Å iterere på en KI-agent betyr å iterere på prompten, verktøyene og måten den håndterer randtilfeller på. test-calls API-et kjører ekte (bot-til-bot- eller SIP-loopback-) samtaler mot en agent ved hjelp av en scenarioprompt du oppgir — hver kjøring produserer en ekte samtalelogg med transkripsjon, vurdering og fakturering, slik at du ser nøyaktig hvordan agenten oppfører seg og hva den koster. Bruk det til:
  • Røykttester før distribusjon etter hver promptendring
  • Regresjonssuiter koblet til CI (koble til test-call.completed-webhooken → la byggingen feile hvis poengsummen faller)
  • Belastningstesting av samtidighetsgrenser

Éngangskjøring: enkeltkjøring

Felt: Responsen er et objekt for testkjøring med status="queued". Poll til status blir completed eller failed; når call_id er angitt, laster du inn transkripsjonen via GET /v1/calls/{call_id}/transcript.

Batchkjøringer: parallelle scenarioer

Kjør N scenarioer samtidig — nyttig for regresjonssuiter som treffer alle kjente randtilfeller parallelt:
Responsen inneholder en run_ids-liste med ID-er for underkjøringer. Hent batch- status:
run_count er begrenset til 20; stagger_seconds fordeler oppstartene for å unngå å overbelaste agenten (0–60 s).

Koble det til CI

Opprett en suite for utgivelsesporten på siden Simuleringer (/dashboard/simulations) — velg agenten, legg til scenarioer manuelt eller klikk på Generer scenarioer med AI for å utarbeide dem fra agentens prompt (med en valgfri gjennomgang av kanttilfeller), og grupper dem i en suite. En suite låser scenarioene og agenten, samt en minimumsbeståttandel og en valgfri regel om null kritiske feil. Beståtte kjøringer blir den godkjente baselinjen; senere overganger fra bestått til ikke bestått returneres som regresjoner. Bruk en API-nøkkel for organisasjonen i CI. Dette skriptet utløser suiten, spør kontinuerlig til vurderingen og sammenligningen er fullført, og avslutter med en verdi ulik null med mindre resultatet er pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run returnerer 202 med kjørings-ID-en. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} returnerer status, verdict, pass_rate, critical_failure_count og baselinjens regressions-liste. Begge endepunktene binder organisasjonen i URL-en til API-nøkkelens organisasjon.

Mønstre

Regresjonskorpus per prompt

Vedlikehold en JSON-fil med tupler av {name, scenario_prompt, expected_outcome}. Ved hver endring av prompten kjører du hele settet som en batch; sammenlign transkripsjonene og vurderingene med forrige kjøring.

Røyktest per utgivelse

En enkelt batch med fem scenarioer for normalflyt som du kjører etter hver utrulling. Denne er latenssensitiv, så behold stagger_seconds: 0.

Latensbenchmarking

Kjør identiske scenarioer mot ulike produktnivåer (spark, bolt, storm-base). Sammenlign call.graded-poengene og duration_seconds fra hver resulterende samtalelogg.

Neste steg

Referanse for testsamtaler

Alle spørringsparametere, statuskoder og batchformater.

AI-vurdering

Gi automatisk poeng til hver testkjøring for å spore kvalitet over tid.

Problemmeldinger

Marker spesifikke tester for menneskelig gjennomgang.

test-call.completed-webhook

Strøm resultater til CI / Slack / PagerDuty.