Föredrar du dashboarden? Samma funktion finns i Simulations
(
/dashboard/simulations), inklusive AI-generering av scenarier — se
Simulera ett samtal. Den här sidan beskriver den
programmatiska vägen.- Smoke-tester före driftsättning efter varje promptändring
- Regressionstester kopplade till CI (anslut webhooken
test-call.completed→ låt bygget misslyckas om poängen sjunker) - Belastningstestning av samtidighetsgränser
Engångskörning: en enskild körning
Svaret är ett objekt för testsamtalskörning
med
status="queued". Polla tills status blir completed eller
failed; när call_id har angetts laddar du transkriptionen via
GET /v1/calls/{call_id}/transcript.
Batchar: parallella scenarier
Kör N scenarier samtidigt — användbart för regressionstester som träffar alla kända specialfall parallellt:run_ids-lista med underordnade körnings-id:n. Hämta
batchstatus:
run_count är begränsat till 20; stagger_seconds fördelar starterna
för att undvika att överbelasta agenten (0–60 s).
Koppla in det i CI
Skapa en svit för releasegrindar på sidan Simuleringar (/dashboard/simulations) — välj agenten, lägg till scenarier manuellt eller
klicka på Generera scenarier med AI för att utforma dem utifrån agentens
prompt (med en valfri genomgång av gränsfall) och gruppera dem i en svit.
En svit låser sina scenarier och sin agent, samt en lägsta godkännandegrad och
en valfri regel om noll kritiska fel. Godkända körningar blir den accepterade
baslinjen; senare övergångar från godkänt till underkänt returneras som regressioner.
Använd en API-nyckel för organisationen i CI.
Det här skriptet utlöser sviten, frågar tills betygsättning och jämförelse är
klara och avslutas med ett värde som inte är noll om inte domen är pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run returnerar 202 med
körnings-id:t. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} returnerar
status, verdict, pass_rate, critical_failure_count och baslinjens lista
över regressions. Båda slutpunkterna kopplar organisationen i URL:en till
API-nyckelns organisation.
Mönster
Regressionskorpus per prompt
Underhåll en JSON-fil med tuplerna{name, scenario_prompt, expected_outcome}.
Kör hela uppsättningen som en batch vid varje promptändring; jämför
transkripten och betygen med den föregående körningen.
Röktest per release
En enda batch med fem scenarier för normala flöden som du kör efter varje driftsättning. Latenskänsligt, så behållstagger_seconds: 0.
Latensbenchmarking
Kör identiska scenarier mot olika produktnivåer (spark,
bolt, storm-base). Jämför poängen för call.graded och
duration_seconds från varje resulterande samtalslogg.
Nästa steg
Referens för testsamtal
Varje frågeparameter, statuskod och batchformat.
AI-betygsättning
Poängsätt varje testkörning automatiskt för att följa kvaliteten över tid.
Ärenderapporter
Markera specifika tester för mänsklig granskning.
Webhook för test-call.completed
Strömma resultat till din CI / Slack / PagerDuty.