Skip to main content
Foretrækker du dashboardet? Den samme funktion findes under Simuleringer (/dashboard/simulations), inklusive AI-generering af scenarier — se Simuler et opkald. Denne side dækker den programmatisk metode.
At iterere på en AI-agent betyder at iterere på dens prompt, dens værktøjer og den måde, den håndterer randtilfælde på. test-calls-API’et udfører reelle (bot-til-bot- eller SIP-loopback-)opkald mod en agent ved hjælp af en scenarioprompt, du angiver — hver kørsel producerer en reel opkaldslog med transskription, bedømmelse og fakturering, så du præcist kan se, hvordan agenten opfører sig, og hvad den koster. Brug det til:
  • Smoke-tests før implementering efter hver promptændring
  • Regressionstestpakker koblet til CI (tilslut webhookpen test-call.completed → lad buildet fejle, hvis scoren falder)
  • Stresstest af samtidighedsgrænser

Enkeltkørsel: enkelt kørsel

Felter: Svaret er et Test call run-objekt med status="queued". Forespørg gentagne gange, indtil status bliver completed eller failed; når call_id er angivet, skal du hente transskriptionen via GET /v1/calls/{call_id}/transcript.

Batches: parallelle scenarier

Kør N scenarier samtidigt — nyttigt til regressionstestpakker, der rammer alle kendte randtilfælde parallelt:
Svaret indeholder en run_ids-liste med underkørsels-id’er. Hent batchstatus:
run_count er begrænset til 20; stagger_seconds fordeler opstartene for at undgå at overbelaste agenten (0–60 s).

Kobl det til CI

Opret en suite med udgivelsesgate på siden Simuleringer (/dashboard/simulations) — vælg agenten, tilføj scenarier manuelt, eller klik på Generer scenarier med AI for at udarbejde dem ud fra agentens prompt (med en valgfri gennemgang af randtilfælde), og gruppér dem i en suite. En suite fastlåser sine scenarier og sin agent samt en minimumsbeståelsesrate og en valgfri regel om nul kritiske fejl. Beståede kørsler bliver den accepterede baseline; senere overgange fra bestået til fejlet returneres som regressioner. Brug en API-nøgle for organisationen i CI. Dette script udløser suiten, forespørger løbende, indtil bedømmelse og sammenligning er fuldført, og afslutter med en anden status end nul, medmindre afgørelsen er pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run returnerer 202 med kørsels-id’et. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} returnerer status, verdict, pass_rate, critical_failure_count og baseline-listen regressions. Begge endpoints knytter organisationen i URL’en til API-nøglens organisation.

Mønstre

Regressionskorpus pr. prompt

Vedligehold en JSON-fil med tuplerne {name, scenario_prompt, expected_outcome}. Kør hele sættet som en batch ved hver promptændring; sammenlign transskriptionerne og bedømmelserne med den forrige kørsel.

Smoke-test pr. udgivelse

En enkelt batch med fem scenarier for den normale brugerrejse, som du kører efter hver deploy. Den er latensfølsom, så behold stagger_seconds: 0.

Latensbenchmarking

Kør identiske scenarier mod forskellige produktniveauer (spark, bolt, storm-base). Sammenlign scorerne for call.graded og duration_seconds fra hver resulterende opkaldslog.

Næste trin

Reference til testopkald

Alle queryparametre, statuskoder og batchformater.

AI-bedømmelse

Giv automatisk score til hver testkørsel for at følge kvaliteten over tid.

Problemrapporter

Markér specifikke tests til menneskelig gennemgang.

test-call.completed-webhook

Stream resultater til din CI / Slack / PagerDuty.