Skip to main content
¿Prefieres el dashboard? La misma funcionalidad está disponible en Simulaciones (/dashboard/simulations), incluida la generación de escenarios con IA; consulta Simular una llamada. Esta página cubre la vía programática.
Iterar en un agente de IA implica iterar en su prompt, sus herramientas y la forma en que maneja los casos límite. La API de llamadas de prueba realiza llamadas reales (de bot a bot o con loopback SIP) contra un agente mediante un prompt de escenario que proporcionas; cada ejecución genera un registro de llamada real con transcripción, evaluación y facturación, para que veas exactamente cómo se comporta el agente y cuánto cuesta. Úsala para:
  • Pruebas de humo previas al despliegue después de cada edición del prompt
  • Suites de regresión conectadas a CI (conecta el webhook test-call.completed → haz que falle la compilación si baja la puntuación)
  • Pruebas de estrés de los límites de concurrencia

Ejecución única: una sola ejecución

Campos: La respuesta es un objeto de ejecución de llamada de prueba con status="queued". Consulta periódicamente hasta que status sea completed o failed; una vez que se establezca call_id, carga la transcripción mediante GET /v1/calls/{call_id}/transcript.

Lotes: escenarios en paralelo

Ejecuta N escenarios de forma simultánea; resulta útil para suites de regresión que cubren en paralelo todos los casos límite conocidos:
La respuesta incluye una lista run_ids con los ID de las ejecuciones secundarias. Obtén el estado del lote:
run_count tiene un límite de 20; stagger_seconds separa los inicios para evitar saturar al agente (0–60 s).

Intégralo en CI

Crea un conjunto de validación de lanzamiento en la página Simulaciones (/dashboard/simulations): elige el agente, agrega escenarios manualmente o haz clic en Generar escenarios con IA para redactarlos a partir del prompt del agente (con una pasada opcional para casos límite) y agrúpalos en un conjunto. Un conjunto fija sus escenarios y agente, además de una tasa mínima de aprobación y una regla opcional de cero fallas críticas. Las ejecuciones aprobadas se convierten en la referencia aceptada; las transiciones posteriores de aprobado→fallido se devuelven como regresiones. Usa una clave API de organización en CI. Este script activa el conjunto, consulta el estado hasta que la calificación y la comparación se completen, y devuelve un código distinto de cero a menos que el veredicto sea pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run devuelve 202 con el ID de la ejecución. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} devuelve status, verdict, pass_rate, critical_failure_count y la lista de referencia regressions. Ambos endpoints vinculan la organización de la URL con la organización de la clave API.

Patrones

Corpus de regresiones por prompt

Mantén un archivo JSON de tuplas {name, scenario_prompt, expected_outcome}. Con cada cambio de prompt, ejecuta el conjunto completo como un lote; compara las transcripciones y calificaciones con la ejecución anterior.

Prueba rápida por lanzamiento

Un único lote de cinco escenarios de flujo ideal que ejecutas después de cada despliegue. Es sensible a la latencia, así que mantén stagger_seconds: 0.

Evaluación comparativa de latencia

Ejecuta escenarios idénticos en distintos niveles de producto (spark, bolt, storm-base). Compara las puntuaciones de call.graded y duration_seconds de cada registro de llamada resultante.

Próximos pasos

Referencia de llamadas de prueba

Cada parámetro de consulta, código de estado y estructura de lote.

Calificación con IA

Califica automáticamente cada ejecución de prueba para monitorear la calidad a lo largo del tiempo.

Reportes de problemas

Marca pruebas específicas para revisión humana.

webhook de test-call.completed

Transmite resultados a tu CI / Slack / PagerDuty.