Skip to main content
Preferisci la dashboard? La stessa funzionalità è disponibile in Simulazioni (/dashboard/simulations), inclusa la generazione di scenari con IA — consulta Simulare una chiamata. Questa pagina descrive il percorso programmatico.
Iterare su un agente IA significa iterare sul suo prompt, sui suoi strumenti e sul modo in cui gestisce i casi limite. L’API test-calls esegue chiamate reali (bot-to-bot o loopback SIP) su un agente usando un prompt di scenario fornito da te — ogni esecuzione produce un registro chiamate reale con trascrizione, valutazione e fatturazione, così puoi vedere esattamente come si comporta l’agente e quanto costa. Usala per:
  • Test smoke pre-distribuzione dopo ogni modifica al prompt
  • Suite di regressione integrate nella CI (collega il webhook test-call.completed → fai fallire la build se il punteggio diminuisce)
  • Testare sotto stress i limiti di concorrenza

Esecuzione singola

Campi: La risposta è un oggetto di esecuzione della chiamata di test con status="queued". Interroga finché status non diventa completed o failed; una volta impostato call_id, carica la trascrizione tramite GET /v1/calls/{call_id}/transcript.

Batch: scenari paralleli

Esegui N scenari contemporaneamente — utile per le suite di regressione che coprono ogni caso limite noto in parallelo:
La risposta contiene un elenco run_ids di ID delle esecuzioni figlie. Recupera lo stato del batch:
run_count è limitato a 20; stagger_seconds distanzia gli avvii per evitare di sovraccaricare l’agente (0–60 s).

Collegalo alla CI

Crea una suite di gate di rilascio nella pagina Simulazioni (/dashboard/simulations): scegli l’agente, aggiungi scenari manualmente oppure fai clic su Genera scenari con l’IA per crearne una bozza dal prompt dell’agente (con un passaggio facoltativo sui casi limite) e raggruppali in una suite. Una suite fissa i relativi scenari e agente, oltre a una percentuale minima di superamento e a una regola facoltativa di zero errori critici. Le esecuzioni superate diventano il riferimento accettato; le successive transizioni da superato a non superato vengono restituite come regressioni. Usa una chiave API dell’organizzazione nella CI. Questo script attiva la suite, esegue il polling finché la valutazione e il confronto non sono completi ed esce con un codice diverso da zero a meno che il verdetto non sia pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run restituisce 202 con l’ID dell’esecuzione. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} restituisce status, verdict, pass_rate, critical_failure_count e l’elenco di riferimento regressions. Entrambi gli endpoint associano l’organizzazione nell’URL all’organizzazione della chiave API.

Modelli

Corpus di regressione per prompt

Mantieni un file JSON di tuple {name, scenario_prompt, expected_outcome}. A ogni modifica del prompt, esegui l’intero set come batch; confronta le trascrizioni e le valutazioni con l’esecuzione precedente.

Smoke test per rilascio

Un singolo batch di cinque scenari di percorso ideale da eseguire dopo ogni distribuzione. È sensibile alla latenza, quindi mantieni stagger_seconds: 0.

Benchmark della latenza

Esegui scenari identici su diversi livelli di prodotto (spark, bolt, storm-base). Confronta i punteggi call.graded e duration_seconds di ciascun log delle chiamate risultante.

Passaggi successivi

Riferimento delle chiamate di test

Ogni parametro di query, codice di stato e struttura del batch.

Valutazione IA

Assegna automaticamente un punteggio a ogni esecuzione di test per monitorare la qualità nel tempo.

Segnalazioni di problemi

Contrassegna test specifici per la revisione umana.

Webhook test-call.completed

Trasmetti i risultati alla tua CI / Slack / PagerDuty.