Bạn thích dùng dashboard hơn? Khả năng tương tự có trong Simulations
(
/dashboard/simulations), bao gồm tạo kịch bản bằng AI — xem
Mô phỏng cuộc gọi. Trang này trình bày
cách thực hiện bằng lập trình.- Kiểm thử smoke trước khi triển khai sau mỗi lần chỉnh sửa prompt
- Bộ kiểm thử hồi quy tích hợp với CI (kết nối webhook
test-call.completed→ làm hỏng bản dựng nếu điểm số giảm) - Kiểm tra áp lực giới hạn đồng thời
Một lần chạy: một lượt duy nhất
Phản hồi là một đối tượng lượt chạy cuộc gọi kiểm thử
ở
status="queued". Thăm dò cho đến khi status trở thành completed hoặc
failed; sau khi call_id được đặt, tải bản chép lời qua
GET /v1/calls/{call_id}/transcript.
Lô: kịch bản song song
Chạy đồng thời N kịch bản — hữu ích cho các bộ kiểm thử hồi quy kiểm tra song song mọi trường hợp biên đã biết:run_ids gồm ID các lượt chạy con. Lấy
trạng thái lô:
run_count được giới hạn ở 20; stagger_seconds giãn khoảng thời gian tạo lượt chạy
để tránh gây quá tải cho tác nhân (0–60 giây).
Tích hợp vào CI
Tạo một bộ kiểm thử chặn phát hành trên trang Mô phỏng (/dashboard/simulations) — chọn tác nhân AI, thêm kịch bản thủ công hoặc
nhấp Tạo kịch bản bằng AI để soạn thảo từ prompt của tác nhân AI
(với tùy chọn kiểm tra trường hợp biên), rồi nhóm chúng thành một bộ kiểm thử.
Một bộ kiểm thử cố định các kịch bản và tác nhân AI của nó, cùng tỷ lệ đạt tối thiểu và
quy tắc không có lỗi nghiêm trọng tùy chọn. Các lần chạy đạt trở thành
đường cơ sở được chấp nhận; các chuyển đổi đạt→không đạt sau đó được trả về dưới dạng hồi quy.
Dùng khóa API tổ chức trong CI.
Script này kích hoạt bộ kiểm thử, thăm dò cho đến khi chấm điểm và so sánh
hoàn tất, rồi thoát với mã khác 0 trừ khi kết luận là pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run trả về 202 cùng với
ID lần chạy. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} trả về
status, verdict, pass_rate, critical_failure_count và danh sách
regressions của đường cơ sở. Cả hai endpoint đều liên kết tổ chức trong URL
với tổ chức của khóa API.
Mẫu
Kho hồi quy theo từng prompt
Duy trì một tệp JSON gồm các bộ{name, scenario_prompt, expected_outcome}.
Mỗi khi prompt thay đổi, chạy toàn bộ tập hợp dưới dạng một lô; so sánh
bản chép lời và điểm đánh giá với lần chạy trước.
Kiểm thử smoke theo từng bản phát hành
Một lô duy nhất gồm năm kịch bản luồng thành công mà bạn chạy sau mỗi lần triển khai. Nhạy cảm với độ trễ, vì vậy hãy giữstagger_seconds: 0.
Đánh giá độ trễ
Chạy các kịch bản giống hệt nhau trên các gói sản phẩm khác nhau (spark,
bolt, storm-base). So sánh điểm call.graded và
duration_seconds từ mỗi nhật ký cuộc gọi kết quả.
Bước tiếp theo
Tài liệu tham khảo về cuộc gọi kiểm thử
Mọi tham số truy vấn, mã trạng thái và cấu trúc lô.
Chấm điểm AI
Tự động chấm điểm mọi lần chạy kiểm thử để theo dõi chất lượng theo thời gian.
Báo cáo sự cố
Đánh dấu các kiểm thử cụ thể để con người xem xét.
Webhook test-call.completed
Truyền kết quả vào CI / Slack / PagerDuty của bạn.