Предпочитаете панель управления? Эта же возможность доступна в разделе Simulations
(
/dashboard/simulations), включая генерацию сценариев с помощью ИИ — см.
Смоделировать звонок. На этой странице описан
программный способ.- Дымовых тестов перед развёртыванием после каждого изменения промпта
- Регрессионных наборов, подключённых к CI (подключите вебхук
test-call.completed→ завершайте сборку с ошибкой при снижении оценки) - Нагрузочного тестирования ограничений параллелизма
Однократный запуск: один тест
Ответ представляет собой объект запуска тестового звонка
со значением
status="queued". Выполняйте опрос, пока status не станет completed или
failed; после установки call_id загрузите расшифровку через
GET /v1/calls/{call_id}/transcript.
Пакеты: параллельные сценарии
Запускайте N сценариев одновременно — это полезно для регрессионных наборов, которые параллельно проверяют каждый известный нестандартный случай:run_ids идентификаторов дочерних запусков. Получите
статус пакета:
run_count ограничено 20; stagger_seconds распределяет запуски
во времени, чтобы не перегружать агента (0–60 с).
Подключите к CI
Создайте набор для контрольной проверки релиза на странице Simulations (/dashboard/simulations) — выберите агента, добавьте сценарии вручную или
нажмите Generate scenarios with AI, чтобы создать их черновики на основе промпта
агента (с дополнительной проверкой пограничных случаев), а затем сгруппируйте их в набор.
Набор фиксирует сценарии и агента, а также минимальный процент успешного прохождения
и необязательное правило отсутствия критических сбоев. Успешные запуски становятся
принятым базовым уровнем; последующие переходы от успешного прохождения к сбою
возвращаются как регрессии.
Используйте API-ключ организации в CI.
Этот скрипт запускает набор, опрашивает его до завершения оценки и сравнения
и завершается с ненулевым кодом, если вердикт не равен pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run возвращает 202 с идентификатором
запуска. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} возвращает
status, verdict, pass_rate, critical_failure_count и базовый список
regressions. Обе конечные точки связывают организацию в URL с организацией
API-ключа.
Шаблоны
Корпус регрессий для каждого промпта
Поддерживайте JSON-файл с кортежами{name, scenario_prompt, expected_outcome}.
При каждом изменении промпта запускайте полный набор как пакет; сравнивайте
расшифровки и оценки с предыдущим запуском.
Дымовой тест для каждого релиза
Один пакет из пяти сценариев успешного пути, который вы запускаете после каждого деплоя. Чувствителен к задержке, поэтому используйтеstagger_seconds: 0.
Сравнительный анализ задержки
Запускайте идентичные сценарии на разных тарифах продукта (spark,
bolt, storm-base). Сравнивайте оценки call.graded и
duration_seconds из каждого полученного журнала звонка.
Следующие шаги
Справочник по тестовым звонкам
Все параметры запроса, коды состояния и форматы пакетов.
Оценка с помощью ИИ
Автоматически оценивайте каждый тестовый запуск, чтобы отслеживать качество со временем.
Отчёты о проблемах
Отмечайте конкретные тесты для проверки человеком.
Вебхук test-call.completed
Передавайте результаты в CI / Slack / PagerDuty.