Wolisz panel? Ta sama funkcja jest dostępna w sekcji Symulacje
(
/dashboard/simulations), w tym generowanie scenariuszy przez AI — zobacz
Symulowanie połączenia. Ta strona opisuje
sposób programistyczny.- Testów smoke przed wdrożeniem po każdej zmianie promptu
- Zestawów testów regresji podłączonych do CI (podłącz webhook
test-call.completed→ zakończ kompilację niepowodzeniem, jeśli wynik spadnie) - Testowania obciążeniowego limitów współbieżności
Jednorazowo: pojedyncze uruchomienie
Odpowiedzią jest obiekt uruchomienia połączenia testowego
ze stanem
status="queued". Odpytuj go, aż status zmieni się na completed lub
failed; po ustawieniu call_id wczytaj transkrypcję przez
GET /v1/calls/{call_id}/transcript.
Partie: równoległe scenariusze
Uruchom jednocześnie N scenariuszy — przydatne w zestawach testów regresji, które równolegle obejmują każdy znany przypadek brzegowy:run_ids identyfikatorów uruchomień podrzędnych. Pobierz
stan partii:
run_count jest ograniczona do 20; stagger_seconds rozdziela uruchamianie
w czasie, aby nie przeciążać agenta (0–60 s).
Podłącz do CI
Utwórz zestaw bramki wydania na stronie Symulacje (/dashboard/simulations) — wybierz agenta, dodaj scenariusze ręcznie lub
kliknij Generuj scenariusze z AI, aby utworzyć ich wersje robocze na podstawie
promptu agenta (z opcjonalnym przebiegiem przypadków brzegowych), a następnie
pogrupuj je w zestaw. Zestaw przypina swoje scenariusze i agenta, a także
minimalny wskaźnik zaliczeń oraz opcjonalną regułę zerowej liczby błędów krytycznych.
Zaliczone uruchomienia stają się zaakceptowaną bazą odniesienia; późniejsze przejścia
ze stanu zaliczenia do niezaliczenia są zwracane jako regresje.
Użyj klucza API organizacji w CI.
Ten skrypt uruchamia zestaw, odpytaje API do czasu ukończenia oceniania i porównania,
a następnie kończy działanie z kodem niezerowym, chyba że werdykt to pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run zwraca 202 z
identyfikatorem uruchomienia. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} zwraca
status, verdict, pass_rate, critical_failure_count oraz
listę regresji bazy odniesienia regressions. Oba endpointy wiążą organizację
w adresie URL z organizacją klucza API.
Wzorce
Korpus regresji dla każdego promptu
Utrzymuj plik JSON z krotkami{name, scenario_prompt, expected_outcome}.
Przy każdej zmianie promptu uruchamiaj pełny zestaw jako partię; porównuj
transkrypcje i oceny z poprzednim uruchomieniem.
Test smoke dla każdego wydania
Pojedyncza partia pięciu scenariuszy ścieżki pozytywnej, uruchamiana po każdym wdrożeniu. Jest wrażliwa na opóźnienia, dlatego zachowajstagger_seconds: 0.
Benchmarking opóźnień
Uruchamiaj identyczne scenariusze dla różnych wariantów produktu (spark,
bolt, storm-base). Porównuj wyniki call.graded oraz
duration_seconds z każdego powstałego dziennika połączeń.
Kolejne kroki
Dokumentacja wywołań testowych
Każdy parametr zapytania, kod stanu i format partii.
Ocenianie AI
Automatycznie oceniaj każde uruchomienie testowe, aby śledzić jakość w czasie.
Raporty problemów
Oznaczaj konkretne testy do weryfikacji przez człowieka.
Webhook test-call.completed
Przesyłaj wyniki do CI / Slack / PagerDuty.