Skip to main content
Föredrar du dashboarden? Samma funktion finns i Simulations (/dashboard/simulations), inklusive AI-generering av scenarier — se Simulera ett samtal. Den här sidan beskriver den programmatiska vägen.
Att iterera på en AI-agent innebär att iterera på dess prompt, dess verktyg och hur den hanterar specialfall. test-calls API kör verkliga (bot-till-bot- eller SIP-loopback-) samtal mot en agent med hjälp av en scenarioprompt som du anger — varje körning skapar en verklig samtalslogg med transkription, bedömning och debitering, så att du ser exakt hur agenten beter sig och vad den kostar. Använd det för:
  • Smoke-tester före driftsättning efter varje promptändring
  • Regressionstester kopplade till CI (anslut webhooken test-call.completed → låt bygget misslyckas om poängen sjunker)
  • Belastningstestning av samtidighetsgränser

Engångskörning: en enskild körning

Fält: Svaret är ett objekt för testsamtalskörning med status="queued". Polla tills status blir completed eller failed; när call_id har angetts laddar du transkriptionen via GET /v1/calls/{call_id}/transcript.

Batchar: parallella scenarier

Kör N scenarier samtidigt — användbart för regressionstester som träffar alla kända specialfall parallellt:
Svaret innehåller en run_ids-lista med underordnade körnings-id:n. Hämta batchstatus:
run_count är begränsat till 20; stagger_seconds fördelar starterna för att undvika att överbelasta agenten (0–60 s).

Koppla in det i CI

Skapa en svit för releasegrindar på sidan Simuleringar (/dashboard/simulations) — välj agenten, lägg till scenarier manuellt eller klicka på Generera scenarier med AI för att utforma dem utifrån agentens prompt (med en valfri genomgång av gränsfall) och gruppera dem i en svit. En svit låser sina scenarier och sin agent, samt en lägsta godkännandegrad och en valfri regel om noll kritiska fel. Godkända körningar blir den accepterade baslinjen; senare övergångar från godkänt till underkänt returneras som regressioner. Använd en API-nyckel för organisationen i CI. Det här skriptet utlöser sviten, frågar tills betygsättning och jämförelse är klara och avslutas med ett värde som inte är noll om inte domen är pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run returnerar 202 med körnings-id:t. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} returnerar status, verdict, pass_rate, critical_failure_count och baslinjens lista över regressions. Båda slutpunkterna kopplar organisationen i URL:en till API-nyckelns organisation.

Mönster

Regressionskorpus per prompt

Underhåll en JSON-fil med tuplerna {name, scenario_prompt, expected_outcome}. Kör hela uppsättningen som en batch vid varje promptändring; jämför transkripten och betygen med den föregående körningen.

Röktest per release

En enda batch med fem scenarier för normala flöden som du kör efter varje driftsättning. Latenskänsligt, så behåll stagger_seconds: 0.

Latensbenchmarking

Kör identiska scenarier mot olika produktnivåer (spark, bolt, storm-base). Jämför poängen för call.graded och duration_seconds från varje resulterande samtalslogg.

Nästa steg

Referens för testsamtal

Varje frågeparameter, statuskod och batchformat.

AI-betygsättning

Poängsätt varje testkörning automatiskt för att följa kvaliteten över tid.

Ärenderapporter

Markera specifika tester för mänsklig granskning.

Webhook för test-call.completed

Strömma resultat till din CI / Slack / PagerDuty.