Skip to main content
Preferați tabloul de bord? Aceeași funcționalitate este disponibilă în Simulări (/dashboard/simulations), inclusiv generarea de scenarii cu AI — consultați Simulați un apel. Această pagină acoperă metoda programatică.
Iterarea asupra unui agent AI înseamnă iterarea asupra promptului său, a instrumentelor sale și a modului în care gestionează cazurile-limită. API-ul pentru apeluri de test efectuează apeluri reale (bot-la-bot sau cu buclă SIP) către un agent folosind un prompt de scenariu furnizat de dumneavoastră — fiecare execuție produce un jurnal de apel real cu transcriere, evaluare și facturare, astfel încât să vedeți exact cum se comportă agentul și cât costă. Utilizați-l pentru:
  • Teste smoke înainte de implementare, după fiecare modificare a promptului
  • Suite de regresie integrate în CI (conectați webhookul test-call.completed → eșuați buildul dacă scorul scade)
  • Testarea la stres a limitelor de simultaneitate

O singură execuție

Câmpuri: Răspunsul este un obiect de execuție a unui apel de test cu status="queued". Interogați periodic până când status devine completed sau failed; după setarea lui call_id, încărcați transcrierea prin GET /v1/calls/{call_id}/transcript.

Loturi: scenarii paralele

Rulați N scenarii simultan — util pentru suite de regresie care acoperă în paralel fiecare caz-limită cunoscut:
Răspunsul conține o listă run_ids cu ID-urile execuțiilor copil. Preluați starea lotului:
run_count este limitat la 20; stagger_seconds distanțează lansările pentru a evita suprasolicitarea agentului (0–60 s).

Integrați-l în CI

Creați o suită de validare a lansării în pagina Simulări (/dashboard/simulations) — alegeți agentul, adăugați scenarii manual sau faceți clic pe Generați scenarii cu AI pentru a le redacta din promptul agentului (cu o parcurgere opțională pentru cazuri-limită) și grupați-le într-o suită. O suită fixează scenariile și agentul, precum și o rată minimă de reușită și o regulă opțională de zero eșecuri critice. Rulările reușite devin baza de referință acceptată; tranzițiile ulterioare de la reușită la eșec sunt returnate ca regresii. Utilizați o cheie API de organizație în CI. Acest script declanșează suita, interoghează până când evaluarea și comparația sunt finalizate și se încheie cu un cod diferit de zero dacă verdictul nu este pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run returnează 202 cu ID-ul rulării. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} returnează status, verdict, pass_rate, critical_failure_count și lista de referință regressions. Ambele endpointuri leagă organizația din URL de organizația cheii API.

Modele

Corpus de regresie per prompt

Mențineți un fișier JSON cu tupluri {name, scenario_prompt, expected_outcome}. La fiecare modificare a promptului, rulați întregul set ca lot; comparați transcrierile și evaluările cu rularea anterioară.

Test smoke per lansare

Un singur lot de cinci scenarii pe parcursul fericit, pe care îl rulați după fiecare implementare. Sensibil la latență, deci păstrați stagger_seconds: 0.

Evaluarea comparativă a latenței

Rulați scenarii identice pentru diferite niveluri de produs (spark, bolt, storm-base). Comparați scorurile call.graded și duration_seconds din fiecare jurnal de apel rezultat.

Pașii următori

Referință pentru apeluri de test

Fiecare parametru de interogare, cod de stare și structură de lot.

Evaluare cu AI

Evaluați automat fiecare rulare de test pentru a urmări calitatea în timp.

Rapoarte de probleme

Marcați teste specifice pentru revizuire umană.

Webhook test-call.completed

Transmiteți rezultatele către CI / Slack / PagerDuty.