Skip to main content
Bevorzugen Sie das Dashboard? Dieselbe Funktion finden Sie unter Simulationen (/dashboard/simulations), einschließlich KI-Szenariogenerierung — siehe Einen Anruf simulieren. Diese Seite beschreibt den programmgesteuerten Weg.
Die Iteration eines KI-Agenten bedeutet, seinen Prompt, seine Tools und den Umgang mit Sonderfällen zu iterieren. Die Testanrufe-API führt echte (Bot-zu-Bot- oder SIP-Loopback-)Anrufe mit einem Agenten aus, basierend auf einem von Ihnen bereitgestellten Szenario-Prompt — jeder Durchlauf erzeugt ein echtes Anrufprotokoll mit Transkript, Bewertung und Abrechnung, sodass Sie genau sehen, wie sich der Agent verhält und was er kostet. Verwenden Sie sie für:
  • Smoke-Tests vor dem Deployment nach jeder Prompt-Änderung
  • In CI eingebundene Regressionstests (Webhook test-call.completed einbinden → Build fehlschlagen lassen, wenn die Bewertung sinkt)
  • Belastungstests von Parallelitätslimits

Einmalig: einzelner Durchlauf

Felder: Die Antwort ist ein Testanruf-Durchlaufobjekt mit status="queued". Fragen Sie ab, bis status zu completed oder failed wird; sobald call_id gesetzt ist, laden Sie das Transkript über GET /v1/calls/{call_id}/transcript.

Stapel: parallele Szenarien

Führen Sie N Szenarien gleichzeitig aus — nützlich für Regressionstest-Suites, die jeden bekannten Sonderfall parallel prüfen:
Die Antwort enthält eine run_ids-Liste mit IDs untergeordneter Durchläufe. Rufen Sie den Stapelstatus ab:
run_count ist auf 20 begrenzt; stagger_seconds verteilt die Starts, um den Agenten nicht zu überlasten (0–60 s).

In CI einbinden

Erstellen Sie auf der Seite Simulationen (/dashboard/simulations) eine Release-Gate-Suite — wählen Sie den Agenten aus, fügen Sie Szenarien manuell hinzu oder klicken Sie auf Szenarien mit KI generieren, um sie anhand des Prompts des Agenten zu entwerfen (mit optionaler Prüfung auf Grenzfälle), und gruppieren Sie sie in einer Suite. Eine Suite fixiert ihre Szenarien und den Agenten sowie eine Mindestbestehensquote und eine optionale Regel ohne kritische Fehler. Erfolgreiche Durchläufe werden zur akzeptierten Baseline; spätere Übergänge von bestanden zu fehlgeschlagen werden als Regressionen zurückgegeben. Verwenden Sie einen Organisations-API-Schlüssel in CI. Dieses Skript startet die Suite, fragt ab, bis Bewertung und Vergleich abgeschlossen sind, und beendet sich mit einem von null verschiedenen Status, sofern das Urteil nicht pass lautet:
POST /v1/orgs/{org_id}/suites/{suite_id}/run gibt 202 mit der Durchlauf-ID zurück. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} gibt status, verdict, pass_rate, critical_failure_count und die Baseline-Liste regressions zurück. Beide Endpunkte ordnen die Organisation in der URL der Organisation des API-Schlüssels zu.

Muster

Regressionskorpus pro Prompt

Pflegen Sie eine JSON-Datei mit Tupeln aus {name, scenario_prompt, expected_outcome}. Führen Sie bei jeder Prompt-Änderung die vollständige Menge als Batch aus; vergleichen Sie die Transkripte und Bewertungen mit dem vorherigen Durchlauf.

Smoke-Test pro Release

Ein einzelner Batch mit fünf Happy-Path-Szenarien, den Sie nach jedem Deployment ausführen. Latenzempfindlich, daher sollte stagger_seconds: 0 beibehalten werden.

Latenz-Benchmarking

Führen Sie identische Szenarien für verschiedene Produkttarife (spark, bolt, storm-base) aus. Vergleichen Sie die Bewertungen call.graded und die duration_seconds aus jedem resultierenden Anrufprotokoll.

Nächste Schritte

Referenz für Testanrufe

Alle Abfrageparameter, Statuscodes und Batch-Strukturen.

KI-Bewertung

Bewerten Sie jeden Testdurchlauf automatisch, um die Qualität im Zeitverlauf zu verfolgen.

Problemberichte

Markieren Sie bestimmte Tests zur menschlichen Überprüfung.

Webhook test-call.completed

Leiten Sie Ergebnisse an Ihre CI / Slack / PagerDuty weiter.