Skip to main content
Bạn thích dùng dashboard hơn? Khả năng tương tự có trong Simulations (/dashboard/simulations), bao gồm tạo kịch bản bằng AI — xem Mô phỏng cuộc gọi. Trang này trình bày cách thực hiện bằng lập trình.
Lặp lại cải tiến một tác nhân AI đồng nghĩa với lặp lại cải tiến prompt, công cụ và cách tác nhân xử lý các trường hợp biên. API test-calls thực hiện các cuộc gọi thực (bot với bot hoặc vòng lặp SIP) đến một tác nhân bằng prompt kịch bản do bạn cung cấp — mỗi lần chạy tạo ra nhật ký cuộc gọi thực kèm bản chép lời, chấm điểm và tính phí, để bạn thấy chính xác tác nhân hoạt động như thế nào và chi phí là bao nhiêu. Dùng API này để:
  • Kiểm thử smoke trước khi triển khai sau mỗi lần chỉnh sửa prompt
  • Bộ kiểm thử hồi quy tích hợp với CI (kết nối webhook test-call.completed → làm hỏng bản dựng nếu điểm số giảm)
  • Kiểm tra áp lực giới hạn đồng thời

Một lần chạy: một lượt duy nhất

Các trường: Phản hồi là một đối tượng lượt chạy cuộc gọi kiểm thửstatus="queued". Thăm dò cho đến khi status trở thành completed hoặc failed; sau khi call_id được đặt, tải bản chép lời qua GET /v1/calls/{call_id}/transcript.

Lô: kịch bản song song

Chạy đồng thời N kịch bản — hữu ích cho các bộ kiểm thử hồi quy kiểm tra song song mọi trường hợp biên đã biết:
Phản hồi chứa danh sách run_ids gồm ID các lượt chạy con. Lấy trạng thái lô:
run_count được giới hạn ở 20; stagger_seconds giãn khoảng thời gian tạo lượt chạy để tránh gây quá tải cho tác nhân (0–60 giây).

Tích hợp vào CI

Tạo một bộ kiểm thử chặn phát hành trên trang Mô phỏng (/dashboard/simulations) — chọn tác nhân AI, thêm kịch bản thủ công hoặc nhấp Tạo kịch bản bằng AI để soạn thảo từ prompt của tác nhân AI (với tùy chọn kiểm tra trường hợp biên), rồi nhóm chúng thành một bộ kiểm thử. Một bộ kiểm thử cố định các kịch bản và tác nhân AI của nó, cùng tỷ lệ đạt tối thiểu và quy tắc không có lỗi nghiêm trọng tùy chọn. Các lần chạy đạt trở thành đường cơ sở được chấp nhận; các chuyển đổi đạt→không đạt sau đó được trả về dưới dạng hồi quy. Dùng khóa API tổ chức trong CI. Script này kích hoạt bộ kiểm thử, thăm dò cho đến khi chấm điểm và so sánh hoàn tất, rồi thoát với mã khác 0 trừ khi kết luận là pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run trả về 202 cùng với ID lần chạy. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} trả về status, verdict, pass_rate, critical_failure_count và danh sách regressions của đường cơ sở. Cả hai endpoint đều liên kết tổ chức trong URL với tổ chức của khóa API.

Mẫu

Kho hồi quy theo từng prompt

Duy trì một tệp JSON gồm các bộ {name, scenario_prompt, expected_outcome}. Mỗi khi prompt thay đổi, chạy toàn bộ tập hợp dưới dạng một lô; so sánh bản chép lời và điểm đánh giá với lần chạy trước.

Kiểm thử smoke theo từng bản phát hành

Một lô duy nhất gồm năm kịch bản luồng thành công mà bạn chạy sau mỗi lần triển khai. Nhạy cảm với độ trễ, vì vậy hãy giữ stagger_seconds: 0.

Đánh giá độ trễ

Chạy các kịch bản giống hệt nhau trên các gói sản phẩm khác nhau (spark, bolt, storm-base). So sánh điểm call.gradedduration_seconds từ mỗi nhật ký cuộc gọi kết quả.

Bước tiếp theo

Tài liệu tham khảo về cuộc gọi kiểm thử

Mọi tham số truy vấn, mã trạng thái và cấu trúc lô.

Chấm điểm AI

Tự động chấm điểm mọi lần chạy kiểm thử để theo dõi chất lượng theo thời gian.

Báo cáo sự cố

Đánh dấu các kiểm thử cụ thể để con người xem xét.

Webhook test-call.completed

Truyền kết quả vào CI / Slack / PagerDuty của bạn.