Lebih memilih dashboard? Kemampuan yang sama tersedia di Simulations
(
/dashboard/simulations), termasuk pembuatan skenario AI — lihat
Simulasikan panggilan. Halaman ini membahas
jalur terprogram.- Pengujian smoke sebelum deployment setelah setiap pengeditan Prompt
- Rangkaian regresi yang terhubung ke CI (hubungkan webhook
test-call.completed→ gagalkan build jika skor menurun) - Pengujian stres batas konkurensi
Sekali jalan: satu eksekusi
Respons berupa objek eksekusi panggilan pengujian
dengan
status="queued". Poll hingga status menjadi completed atau
failed; setelah call_id ditetapkan, muat transkrip melalui
GET /v1/calls/{call_id}/transcript.
Batch: skenario paralel
Jalankan N skenario secara bersamaan — berguna untuk rangkaian regresi yang menguji setiap kasus tepi yang diketahui secara paralel:run_ids berisi ID eksekusi anak. Ambil status
batch:
run_count dibatasi hingga 20; stagger_seconds memberi jeda antar pembuatan
eksekusi agar agen tidak menerima beban berlebihan (0–60 dtk).
Hubungkan ke CI
Buat rangkaian gerbang rilis di halaman Simulasi (/dashboard/simulations) — pilih agen, tambahkan skenario secara manual atau
klik Buat skenario dengan AI untuk menyusunnya dari
Prompt agen (dengan opsi pemeriksaan kasus tepi), lalu kelompokkan ke dalam rangkaian.
Sebuah rangkaian mengunci skenario dan agennya, beserta tingkat kelulusan minimum dan
opsi aturan tanpa kegagalan kritis. Proses yang lulus menjadi baseline yang diterima;
transisi lulus→gagal berikutnya dikembalikan sebagai regresi.
Gunakan kunci API organisasi di CI.
Skrip ini memicu rangkaian, melakukan polling hingga penilaian dan perbandingan
selesai, lalu keluar dengan nilai bukan nol kecuali putusannya adalah pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run mengembalikan 202 dengan
ID proses. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} mengembalikan
status, verdict, pass_rate, critical_failure_count, dan daftar baseline
regressions. Kedua endpoint mengikat organisasi pada URL
ke organisasi milik kunci API.
Pola
Korpus regresi per Prompt
Pertahankan file JSON berisi tuple{name, scenario_prompt, expected_outcome}.
Pada setiap perubahan Prompt, jalankan seluruh set sebagai batch; bandingkan
transkrip dan nilai dengan proses sebelumnya.
Uji asap per rilis
Satu batch berisi lima skenario jalur sukses yang Anda jalankan setelah setiap deploy. Sensitif terhadap latensi, jadi pertahankanstagger_seconds: 0.
Benchmarking latensi
Jalankan skenario yang identik terhadap tingkat produk yang berbeda (spark,
bolt, storm-base). Bandingkan skor call.graded dan
duration_seconds dari setiap log panggilan yang dihasilkan.
Langkah berikutnya
Referensi panggilan pengujian
Setiap parameter kueri, kode status, dan bentuk batch.
Penilaian AI
Nilai otomatis setiap proses pengujian untuk melacak kualitas dari waktu ke waktu.
Laporan masalah
Tandai pengujian tertentu untuk ditinjau manusia.
Webhook test-call.completed
Alirkan hasil ke CI / Slack / PagerDuty Anda.