Prefere o dashboard? A mesma capacidade está disponível em Simulações
(
/dashboard/simulations), incluindo geração de cenários por IA — consulte
Simular uma chamada. Esta página aborda o caminho
programático.- Testes de fumaça antes da implantação após cada edição de prompt
- Suítes de regressão integradas ao CI (conecte o webhook
test-call.completed→ falhe o build se a pontuação cair) - Testar sob estresse os limites de concorrência
Execução única: uma execução
A resposta é um objeto de execução de chamada de teste
com
status="queued". Consulte-o até que status se torne completed ou
failed; depois que call_id for definido, carregue a transcrição por meio de
GET /v1/calls/{call_id}/transcript.
Lotes: cenários em paralelo
Execute N cenários simultaneamente — útil para suítes de regressão que cobrem todos os casos extremos conhecidos em paralelo:run_ids de IDs de execuções filhas. Consulte o
status do lote:
run_count é limitado a 20; stagger_seconds espaça as inicializações
para evitar sobrecarregar o agente (0–60 s).
Integre ao CI
Crie uma suíte de gate de release na página Simulações (/dashboard/simulations) — escolha o agente, adicione cenários manualmente ou
clique em Gerar cenários com IA para elaborá-los a partir do prompt do
agente (com uma etapa opcional de casos extremos) e agrupe-os em uma suíte.
Uma suíte fixa seus cenários e agente, além de uma taxa mínima de aprovação e
uma regra opcional de zero falhas críticas. Execuções aprovadas se tornam a
linha de base aceita; transições posteriores de aprovação→falha são retornadas
como regressões.
Use uma chave de API da organização no CI.
Este script aciona a suíte, consulta o status até que a avaliação e a comparação
sejam concluídas e sai com código diferente de zero, a menos que o veredito seja
pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run retorna 202 com o ID da
execução. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} retorna
status, verdict, pass_rate, critical_failure_count e a lista de
regressions da linha de base. Ambos os endpoints vinculam a organização na
URL à organização da chave de API.
Padrões
Corpus de regressão por prompt
Mantenha um arquivo JSON com tuplas de{name, scenario_prompt, expected_outcome}.
A cada alteração de prompt, execute o conjunto completo em lote; compare as
transcrições e avaliações com a execução anterior.
Teste de fumaça por release
Um único lote de cinco cenários de caminho ideal executado após cada deploy. Sensível à latência, portanto mantenhastagger_seconds: 0.
Benchmark de latência
Execute cenários idênticos em diferentes níveis de produto (spark,
bolt, storm-base). Compare as pontuações de call.graded e
duration_seconds de cada log de chamada resultante.
Próximas etapas
Referência de chamadas de teste
Todos os parâmetros de consulta, códigos de status e formatos de lote.
Avaliação por IA
Avalie automaticamente cada execução de teste para acompanhar a qualidade ao longo do tempo.
Relatórios de problemas
Sinalize testes específicos para revisão humana.
Webhook test-call.completed
Transmita resultados para seu CI / Slack / PagerDuty.