Skip to main content
Lebih memilih dashboard? Kemampuan yang sama tersedia di Simulations (/dashboard/simulations), termasuk pembuatan skenario AI — lihat Simulasikan panggilan. Halaman ini membahas jalur terprogram.
Mengiterasi agen AI berarti mengiterasi Prompt, alatnya, dan cara agen menangani kasus tepi. test-calls API menjalankan panggilan nyata (bot-ke-bot atau loopback SIP) terhadap agen menggunakan Prompt skenario yang Anda berikan — setiap eksekusi menghasilkan log panggilan nyata dengan transkrip, penilaian, dan penagihan, sehingga Anda dapat melihat secara tepat bagaimana agen berperilaku dan berapa biayanya. Gunakan untuk:
  • Pengujian smoke sebelum deployment setelah setiap pengeditan Prompt
  • Rangkaian regresi yang terhubung ke CI (hubungkan webhook test-call.completed → gagalkan build jika skor menurun)
  • Pengujian stres batas konkurensi

Sekali jalan: satu eksekusi

Kolom: Respons berupa objek eksekusi panggilan pengujian dengan status="queued". Poll hingga status menjadi completed atau failed; setelah call_id ditetapkan, muat transkrip melalui GET /v1/calls/{call_id}/transcript.

Batch: skenario paralel

Jalankan N skenario secara bersamaan — berguna untuk rangkaian regresi yang menguji setiap kasus tepi yang diketahui secara paralel:
Respons memuat daftar run_ids berisi ID eksekusi anak. Ambil status batch:
run_count dibatasi hingga 20; stagger_seconds memberi jeda antar pembuatan eksekusi agar agen tidak menerima beban berlebihan (0–60 dtk).

Hubungkan ke CI

Buat rangkaian gerbang rilis di halaman Simulasi (/dashboard/simulations) — pilih agen, tambahkan skenario secara manual atau klik Buat skenario dengan AI untuk menyusunnya dari Prompt agen (dengan opsi pemeriksaan kasus tepi), lalu kelompokkan ke dalam rangkaian. Sebuah rangkaian mengunci skenario dan agennya, beserta tingkat kelulusan minimum dan opsi aturan tanpa kegagalan kritis. Proses yang lulus menjadi baseline yang diterima; transisi lulus→gagal berikutnya dikembalikan sebagai regresi. Gunakan kunci API organisasi di CI. Skrip ini memicu rangkaian, melakukan polling hingga penilaian dan perbandingan selesai, lalu keluar dengan nilai bukan nol kecuali putusannya adalah pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run mengembalikan 202 dengan ID proses. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} mengembalikan status, verdict, pass_rate, critical_failure_count, dan daftar baseline regressions. Kedua endpoint mengikat organisasi pada URL ke organisasi milik kunci API.

Pola

Korpus regresi per Prompt

Pertahankan file JSON berisi tuple {name, scenario_prompt, expected_outcome}. Pada setiap perubahan Prompt, jalankan seluruh set sebagai batch; bandingkan transkrip dan nilai dengan proses sebelumnya.

Uji asap per rilis

Satu batch berisi lima skenario jalur sukses yang Anda jalankan setelah setiap deploy. Sensitif terhadap latensi, jadi pertahankan stagger_seconds: 0.

Benchmarking latensi

Jalankan skenario yang identik terhadap tingkat produk yang berbeda (spark, bolt, storm-base). Bandingkan skor call.graded dan duration_seconds dari setiap log panggilan yang dihasilkan.

Langkah berikutnya

Referensi panggilan pengujian

Setiap parameter kueri, kode status, dan bentuk batch.

Penilaian AI

Nilai otomatis setiap proses pengujian untuk melacak kualitas dari waktu ke waktu.

Laporan masalah

Tandai pengujian tertentu untuk ditinjau manusia.

Webhook test-call.completed

Alirkan hasil ke CI / Slack / PagerDuty Anda.