Foretrækker du dashboardet? Den samme funktion findes under Simuleringer
(
/dashboard/simulations), inklusive AI-generering af scenarier — se
Simuler et opkald. Denne side dækker den
programmatisk metode.- Smoke-tests før implementering efter hver promptændring
- Regressionstestpakker koblet til CI (tilslut webhookpen
test-call.completed→ lad buildet fejle, hvis scoren falder) - Stresstest af samtidighedsgrænser
Enkeltkørsel: enkelt kørsel
Svaret er et Test call run-objekt
med
status="queued". Forespørg gentagne gange, indtil status bliver completed eller
failed; når call_id er angivet, skal du hente transskriptionen via
GET /v1/calls/{call_id}/transcript.
Batches: parallelle scenarier
Kør N scenarier samtidigt — nyttigt til regressionstestpakker, der rammer alle kendte randtilfælde parallelt:run_ids-liste med underkørsels-id’er. Hent
batchstatus:
run_count er begrænset til 20; stagger_seconds fordeler opstartene
for at undgå at overbelaste agenten (0–60 s).
Kobl det til CI
Opret en suite med udgivelsesgate på siden Simuleringer (/dashboard/simulations) — vælg agenten, tilføj scenarier manuelt, eller
klik på Generer scenarier med AI for at udarbejde dem ud fra agentens
prompt (med en valgfri gennemgang af randtilfælde), og gruppér dem i en suite.
En suite fastlåser sine scenarier og sin agent samt en minimumsbeståelsesrate og
en valgfri regel om nul kritiske fejl. Beståede kørsler bliver den accepterede
baseline; senere overgange fra bestået til fejlet returneres som regressioner.
Brug en API-nøgle for organisationen i CI.
Dette script udløser suiten, forespørger løbende, indtil bedømmelse og
sammenligning er fuldført, og afslutter med en anden status end nul, medmindre
afgørelsen er pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run returnerer 202 med
kørsels-id’et. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} returnerer
status, verdict, pass_rate, critical_failure_count og baseline-listen
regressions. Begge endpoints knytter organisationen i URL’en til API-nøglens
organisation.
Mønstre
Regressionskorpus pr. prompt
Vedligehold en JSON-fil med tuplerne{name, scenario_prompt, expected_outcome}.
Kør hele sættet som en batch ved hver promptændring; sammenlign transskriptionerne
og bedømmelserne med den forrige kørsel.
Smoke-test pr. udgivelse
En enkelt batch med fem scenarier for den normale brugerrejse, som du kører efter hver deploy. Den er latensfølsom, så beholdstagger_seconds: 0.
Latensbenchmarking
Kør identiske scenarier mod forskellige produktniveauer (spark,
bolt, storm-base). Sammenlign scorerne for call.graded og
duration_seconds fra hver resulterende opkaldslog.
Næste trin
Reference til testopkald
Alle queryparametre, statuskoder og batchformater.
AI-bedømmelse
Giv automatisk score til hver testkørsel for at følge kvaliteten over tid.
Problemrapporter
Markér specifikke tests til menneskelig gennemgang.
test-call.completed-webhook
Stream resultater til din CI / Slack / PagerDuty.