Bevorzugen Sie das Dashboard? Dieselbe Funktion finden Sie unter Simulationen
(
/dashboard/simulations), einschließlich KI-Szenariogenerierung — siehe
Einen Anruf simulieren. Diese Seite beschreibt den
programmgesteuerten Weg.- Smoke-Tests vor dem Deployment nach jeder Prompt-Änderung
- In CI eingebundene Regressionstests (Webhook
test-call.completedeinbinden → Build fehlschlagen lassen, wenn die Bewertung sinkt) - Belastungstests von Parallelitätslimits
Einmalig: einzelner Durchlauf
Die Antwort ist ein Testanruf-Durchlaufobjekt
mit
status="queued". Fragen Sie ab, bis status zu completed oder
failed wird; sobald call_id gesetzt ist, laden Sie das Transkript über
GET /v1/calls/{call_id}/transcript.
Stapel: parallele Szenarien
Führen Sie N Szenarien gleichzeitig aus — nützlich für Regressionstest-Suites, die jeden bekannten Sonderfall parallel prüfen:run_ids-Liste mit IDs untergeordneter Durchläufe. Rufen Sie den
Stapelstatus ab:
run_count ist auf 20 begrenzt; stagger_seconds verteilt die Starts,
um den Agenten nicht zu überlasten (0–60 s).
In CI einbinden
Erstellen Sie auf der Seite Simulationen (/dashboard/simulations) eine Release-Gate-Suite — wählen Sie den Agenten aus, fügen Sie Szenarien manuell hinzu oder
klicken Sie auf Szenarien mit KI generieren, um sie anhand des
Prompts des Agenten zu entwerfen (mit optionaler Prüfung auf Grenzfälle), und gruppieren Sie sie in einer Suite.
Eine Suite fixiert ihre Szenarien und den Agenten sowie eine Mindestbestehensquote und eine
optionale Regel ohne kritische Fehler. Erfolgreiche Durchläufe werden zur akzeptierten
Baseline; spätere Übergänge von bestanden zu fehlgeschlagen werden als Regressionen zurückgegeben.
Verwenden Sie einen Organisations-API-Schlüssel in CI.
Dieses Skript startet die Suite, fragt ab, bis Bewertung und Vergleich
abgeschlossen sind, und beendet sich mit einem von null verschiedenen Status, sofern das Urteil nicht pass lautet:
POST /v1/orgs/{org_id}/suites/{suite_id}/run gibt 202 mit der
Durchlauf-ID zurück. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} gibt
status, verdict, pass_rate, critical_failure_count und die
Baseline-Liste regressions zurück. Beide Endpunkte ordnen die Organisation in der URL
der Organisation des API-Schlüssels zu.
Muster
Regressionskorpus pro Prompt
Pflegen Sie eine JSON-Datei mit Tupeln aus{name, scenario_prompt, expected_outcome}.
Führen Sie bei jeder Prompt-Änderung die vollständige Menge als Batch aus; vergleichen Sie die
Transkripte und Bewertungen mit dem vorherigen Durchlauf.
Smoke-Test pro Release
Ein einzelner Batch mit fünf Happy-Path-Szenarien, den Sie nach jedem Deployment ausführen. Latenzempfindlich, daher solltestagger_seconds: 0 beibehalten werden.
Latenz-Benchmarking
Führen Sie identische Szenarien für verschiedene Produkttarife (spark,
bolt, storm-base) aus. Vergleichen Sie die Bewertungen call.graded und die
duration_seconds aus jedem resultierenden Anrufprotokoll.
Nächste Schritte
Referenz für Testanrufe
Alle Abfrageparameter, Statuscodes und Batch-Strukturen.
KI-Bewertung
Bewerten Sie jeden Testdurchlauf automatisch, um die Qualität im Zeitverlauf zu verfolgen.
Problemberichte
Markieren Sie bestimmte Tests zur menschlichen Überprüfung.
Webhook test-call.completed
Leiten Sie Ergebnisse an Ihre CI / Slack / PagerDuty weiter.