¿Prefieres el dashboard? La misma funcionalidad está disponible en Simulaciones
(
/dashboard/simulations), incluida la generación de escenarios con IA; consulta
Simular una llamada. Esta página cubre la
vía programática.- Pruebas de humo previas al despliegue después de cada edición del prompt
- Suites de regresión conectadas a CI (conecta el webhook
test-call.completed→ haz que falle la compilación si baja la puntuación) - Pruebas de estrés de los límites de concurrencia
Ejecución única: una sola ejecución
La respuesta es un objeto de ejecución de llamada de prueba
con
status="queued". Consulta periódicamente hasta que status sea completed o
failed; una vez que se establezca call_id, carga la transcripción mediante
GET /v1/calls/{call_id}/transcript.
Lotes: escenarios en paralelo
Ejecuta N escenarios de forma simultánea; resulta útil para suites de regresión que cubren en paralelo todos los casos límite conocidos:run_ids con los ID de las ejecuciones secundarias. Obtén el
estado del lote:
run_count tiene un límite de 20; stagger_seconds separa los inicios
para evitar saturar al agente (0–60 s).
Intégralo en CI
Crea un conjunto de validación de lanzamiento en la página Simulaciones (/dashboard/simulations): elige el agente, agrega escenarios manualmente o
haz clic en Generar escenarios con IA para redactarlos a partir del
prompt del agente (con una pasada opcional para casos límite) y agrúpalos en
un conjunto. Un conjunto fija sus escenarios y agente, además de una tasa
mínima de aprobación y una regla opcional de cero fallas críticas. Las
ejecuciones aprobadas se convierten en la referencia aceptada; las
transiciones posteriores de aprobado→fallido se devuelven como regresiones.
Usa una clave API de organización en CI.
Este script activa el conjunto, consulta el estado hasta que la calificación y
la comparación se completen, y devuelve un código distinto de cero a menos que
el veredicto sea pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run devuelve 202 con el ID de la
ejecución. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} devuelve
status, verdict, pass_rate, critical_failure_count y la lista de
referencia regressions. Ambos endpoints vinculan la organización de la URL
con la organización de la clave API.
Patrones
Corpus de regresiones por prompt
Mantén un archivo JSON de tuplas{name, scenario_prompt, expected_outcome}.
Con cada cambio de prompt, ejecuta el conjunto completo como un lote; compara
las transcripciones y calificaciones con la ejecución anterior.
Prueba rápida por lanzamiento
Un único lote de cinco escenarios de flujo ideal que ejecutas después de cada despliegue. Es sensible a la latencia, así que manténstagger_seconds: 0.
Evaluación comparativa de latencia
Ejecuta escenarios idénticos en distintos niveles de producto (spark,
bolt, storm-base). Compara las puntuaciones de call.graded y
duration_seconds de cada registro de llamada resultante.
Próximos pasos
Referencia de llamadas de prueba
Cada parámetro de consulta, código de estado y estructura de lote.
Calificación con IA
Califica automáticamente cada ejecución de prueba para monitorear la calidad a lo largo del tiempo.
Reportes de problemas
Marca pruebas específicas para revisión humana.
webhook de test-call.completed
Transmite resultados a tu CI / Slack / PagerDuty.