Preferați tabloul de bord? Aceeași funcționalitate este disponibilă în Simulări
(
/dashboard/simulations), inclusiv generarea de scenarii cu AI — consultați
Simulați un apel. Această pagină acoperă
metoda programatică.- Teste smoke înainte de implementare, după fiecare modificare a promptului
- Suite de regresie integrate în CI (conectați webhookul
test-call.completed→ eșuați buildul dacă scorul scade) - Testarea la stres a limitelor de simultaneitate
O singură execuție
Răspunsul este un obiect de execuție a unui apel de test
cu
status="queued". Interogați periodic până când status devine completed sau
failed; după setarea lui call_id, încărcați transcrierea prin
GET /v1/calls/{call_id}/transcript.
Loturi: scenarii paralele
Rulați N scenarii simultan — util pentru suite de regresie care acoperă în paralel fiecare caz-limită cunoscut:run_ids cu ID-urile execuțiilor copil. Preluați starea
lotului:
run_count este limitat la 20; stagger_seconds distanțează lansările
pentru a evita suprasolicitarea agentului (0–60 s).
Integrați-l în CI
Creați o suită de validare a lansării în pagina Simulări (/dashboard/simulations) — alegeți agentul, adăugați scenarii manual sau
faceți clic pe Generați scenarii cu AI pentru a le redacta din
promptul agentului (cu o parcurgere opțională pentru cazuri-limită) și
grupați-le într-o suită. O suită fixează scenariile și agentul, precum și
o rată minimă de reușită și o regulă opțională de zero eșecuri critice.
Rulările reușite devin baza de referință acceptată; tranzițiile ulterioare
de la reușită la eșec sunt returnate ca regresii.
Utilizați o cheie API de organizație în CI.
Acest script declanșează suita, interoghează până când evaluarea și comparația
sunt finalizate și se încheie cu un cod diferit de zero dacă verdictul nu este pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run returnează 202 cu ID-ul
rulării. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} returnează
status, verdict, pass_rate, critical_failure_count și lista de
referință regressions. Ambele endpointuri leagă organizația din URL
de organizația cheii API.
Modele
Corpus de regresie per prompt
Mențineți un fișier JSON cu tupluri{name, scenario_prompt, expected_outcome}.
La fiecare modificare a promptului, rulați întregul set ca lot; comparați
transcrierile și evaluările cu rularea anterioară.
Test smoke per lansare
Un singur lot de cinci scenarii pe parcursul fericit, pe care îl rulați după fiecare implementare. Sensibil la latență, deci păstrațistagger_seconds: 0.
Evaluarea comparativă a latenței
Rulați scenarii identice pentru diferite niveluri de produs (spark,
bolt, storm-base). Comparați scorurile call.graded și
duration_seconds din fiecare jurnal de apel rezultat.
Pașii următori
Referință pentru apeluri de test
Fiecare parametru de interogare, cod de stare și structură de lot.
Evaluare cu AI
Evaluați automat fiecare rulare de test pentru a urmări calitatea în timp.
Rapoarte de probleme
Marcați teste specifice pentru revizuire umană.
Webhook test-call.completed
Transmiteți rezultatele către CI / Slack / PagerDuty.