Preferisci la dashboard? La stessa funzionalità è disponibile in Simulazioni
(
/dashboard/simulations), inclusa la generazione di scenari con IA — consulta
Simulare una chiamata. Questa pagina descrive il
percorso programmatico.- Test smoke pre-distribuzione dopo ogni modifica al prompt
- Suite di regressione integrate nella CI (collega il webhook
test-call.completed→ fai fallire la build se il punteggio diminuisce) - Testare sotto stress i limiti di concorrenza
Esecuzione singola
La risposta è un oggetto di esecuzione della chiamata di test
con
status="queued". Interroga finché status non diventa completed o
failed; una volta impostato call_id, carica la trascrizione tramite
GET /v1/calls/{call_id}/transcript.
Batch: scenari paralleli
Esegui N scenari contemporaneamente — utile per le suite di regressione che coprono ogni caso limite noto in parallelo:run_ids di ID delle esecuzioni figlie. Recupera
lo stato del batch:
run_count è limitato a 20; stagger_seconds distanzia gli avvii
per evitare di sovraccaricare l’agente (0–60 s).
Collegalo alla CI
Crea una suite di gate di rilascio nella pagina Simulazioni (/dashboard/simulations): scegli l’agente, aggiungi scenari manualmente oppure
fai clic su Genera scenari con l’IA per crearne una bozza dal prompt
dell’agente (con un passaggio facoltativo sui casi limite) e raggruppali in una suite.
Una suite fissa i relativi scenari e agente, oltre a una percentuale minima di superamento
e a una regola facoltativa di zero errori critici. Le esecuzioni superate diventano il
riferimento accettato; le successive transizioni da superato a non superato vengono restituite come regressioni.
Usa una chiave API dell’organizzazione nella CI.
Questo script attiva la suite, esegue il polling finché la valutazione e il confronto non sono
completi ed esce con un codice diverso da zero a meno che il verdetto non sia pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run restituisce 202 con l’ID
dell’esecuzione. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} restituisce
status, verdict, pass_rate, critical_failure_count e l’elenco di
riferimento regressions. Entrambi gli endpoint associano l’organizzazione nell’URL
all’organizzazione della chiave API.
Modelli
Corpus di regressione per prompt
Mantieni un file JSON di tuple{name, scenario_prompt, expected_outcome}.
A ogni modifica del prompt, esegui l’intero set come batch; confronta le
trascrizioni e le valutazioni con l’esecuzione precedente.
Smoke test per rilascio
Un singolo batch di cinque scenari di percorso ideale da eseguire dopo ogni distribuzione. È sensibile alla latenza, quindi mantienistagger_seconds: 0.
Benchmark della latenza
Esegui scenari identici su diversi livelli di prodotto (spark,
bolt, storm-base). Confronta i punteggi call.graded e
duration_seconds di ciascun log delle chiamate risultante.
Passaggi successivi
Riferimento delle chiamate di test
Ogni parametro di query, codice di stato e struttura del batch.
Valutazione IA
Assegna automaticamente un punteggio a ogni esecuzione di test per monitorare la qualità nel tempo.
Segnalazioni di problemi
Contrassegna test specifici per la revisione umana.
Webhook test-call.completed
Trasmetti i risultati alla tua CI / Slack / PagerDuty.