Skip to main content
Prefere o dashboard? A mesma capacidade está disponível em Simulações (/dashboard/simulations), incluindo geração de cenários por IA — consulte Simular uma chamada. Esta página aborda o caminho programático.
Iterar em um agente de IA significa iterar em seu prompt, suas ferramentas e na forma como ele lida com casos extremos. A API test-calls executa chamadas reais (bot para bot ou loopback SIP) contra um agente usando um prompt de cenário fornecido por você — cada execução produz um registro de chamada real com transcrição, avaliação e cobrança, para que você veja exatamente como o agente se comporta e quanto custa. Use-a para:
  • Testes de fumaça antes da implantação após cada edição de prompt
  • Suítes de regressão integradas ao CI (conecte o webhook test-call.completed → falhe o build se a pontuação cair)
  • Testar sob estresse os limites de concorrência

Execução única: uma execução

Campos: A resposta é um objeto de execução de chamada de teste com status="queued". Consulte-o até que status se torne completed ou failed; depois que call_id for definido, carregue a transcrição por meio de GET /v1/calls/{call_id}/transcript.

Lotes: cenários em paralelo

Execute N cenários simultaneamente — útil para suítes de regressão que cobrem todos os casos extremos conhecidos em paralelo:
A resposta contém uma lista run_ids de IDs de execuções filhas. Consulte o status do lote:
run_count é limitado a 20; stagger_seconds espaça as inicializações para evitar sobrecarregar o agente (0–60 s).

Integre ao CI

Crie uma suíte de gate de release na página Simulações (/dashboard/simulations) — escolha o agente, adicione cenários manualmente ou clique em Gerar cenários com IA para elaborá-los a partir do prompt do agente (com uma etapa opcional de casos extremos) e agrupe-os em uma suíte. Uma suíte fixa seus cenários e agente, além de uma taxa mínima de aprovação e uma regra opcional de zero falhas críticas. Execuções aprovadas se tornam a linha de base aceita; transições posteriores de aprovação→falha são retornadas como regressões. Use uma chave de API da organização no CI. Este script aciona a suíte, consulta o status até que a avaliação e a comparação sejam concluídas e sai com código diferente de zero, a menos que o veredito seja pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run retorna 202 com o ID da execução. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} retorna status, verdict, pass_rate, critical_failure_count e a lista de regressions da linha de base. Ambos os endpoints vinculam a organização na URL à organização da chave de API.

Padrões

Corpus de regressão por prompt

Mantenha um arquivo JSON com tuplas de {name, scenario_prompt, expected_outcome}. A cada alteração de prompt, execute o conjunto completo em lote; compare as transcrições e avaliações com a execução anterior.

Teste de fumaça por release

Um único lote de cinco cenários de caminho ideal executado após cada deploy. Sensível à latência, portanto mantenha stagger_seconds: 0.

Benchmark de latência

Execute cenários idênticos em diferentes níveis de produto (spark, bolt, storm-base). Compare as pontuações de call.graded e duration_seconds de cada log de chamada resultante.

Próximas etapas

Referência de chamadas de teste

Todos os parâmetros de consulta, códigos de status e formatos de lote.

Avaliação por IA

Avalie automaticamente cada execução de teste para acompanhar a qualidade ao longo do tempo.

Relatórios de problemas

Sinalize testes específicos para revisão humana.

Webhook test-call.completed

Transmita resultados para seu CI / Slack / PagerDuty.