Dáváte přednost dashboardu? Stejná funkce je k dispozici v části Simulace
(
/dashboard/simulations), včetně generování scénářů pomocí AI — viz
Simulace hovoru. Tato stránka popisuje
programatický postup.- Smoke testy před nasazením po každé úpravě promptu
- Regresní sady napojené na CI (připojte webhook
test-call.completed→ sestavení selže, pokud skóre klesne) - Zátěžové testování limitů souběžnosti
Jednorázově: jedno spuštění
Odpovědí je objekt spuštění testovacího hovoru
se stavem
status="queued". Dotazujte se, dokud se status nezmění na completed nebo
failed; jakmile je nastaveno call_id, načtěte přepis pomocí
GET /v1/calls/{call_id}/transcript.
Dávky: paralelní scénáře
Spusťte N scénářů souběžně — užitečné pro regresní sady, které paralelně pokrývají všechny známé okrajové případy:run_ids s ID podřízených spuštění. Načtěte stav
dávky:
run_count je omezena na 20; stagger_seconds rozestupuje spouštění,
aby nedošlo k přetížení agenta (0–60 s).
Zapojte do CI
Na stránce Simulace (/dashboard/simulations) vytvořte sadu pro bránu vydání — vyberte agenta, přidejte scénáře ručně nebo
klikněte na Generovat scénáře pomocí AI, aby se navrhly podle výzvy agenta
(s volitelným průchodem okrajových případů), a seskupte je do sady.
Sada připne své scénáře a agenta, minimální míru úspěšnosti a volitelné pravidlo nulového počtu kritických selhání. Úspěšné běhy se stanou přijatou referenční hodnotou; pozdější přechody z úspěchu na selhání se vracejí jako regrese.
V CI použijte organizační klíč API.
Tento skript spustí sadu, dotazuje se, dokud není dokončeno hodnocení a porovnání,
a skončí s nenulovým kódem, pokud verdikt není pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run vrací 202 s ID
běhu. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} vrací
status, verdict, pass_rate, critical_failure_count a seznam
regresí referenční hodnoty regressions. Oba endpointy vážou organizaci v URL
k organizaci klíče API.
Vzory
Korpus regresí pro každou výzvu
Udržujte soubor JSON s n-ticemi{name, scenario_prompt, expected_outcome}.
Při každé změně výzvy spusťte celou sadu jako dávku; porovnejte
přepisy a hodnocení s předchozím během.
Rychlý test pro každé vydání
Jedna dávka pěti scénářů standardního průchodu, kterou spustíte po každém nasazení. Je citlivá na latenci, proto ponechtestagger_seconds: 0.
Benchmarking latence
Spusťte stejné scénáře pro různé produktové úrovně (spark,
bolt, storm-base). Porovnejte skóre call.graded a
duration_seconds z každého výsledného protokolu hovoru.
Další kroky
Referenční dokumentace k testovacím hovorům
Každý parametr dotazu, stavový kód a struktura dávky.
Hodnocení AI
Automaticky vyhodnocujte každý testovací běh a sledujte kvalitu v čase.
Hlášení problémů
Označte konkrétní testy ke kontrole člověkem.
test-call.completed webhook
Odesílejte výsledky do CI / Slack / PagerDuty.