Skip to main content
Kiểm thử A/B trả lời câu hỏi “prompt mới có thực sự tốt hơn không?” bằng dữ liệu thay vì cảm tính: cuộc gọi đến được phân bổ giữa các biến thể của tác nhân AI, mỗi cuộc gọi vẫn được chấm điểm như thường lệ và bạn so sánh tỷ lệ thành công theo từng biến thể. Có hai nơi:
  • Theo từng tác nhân AI — kiểm thử được cấu hình và tinh chỉnh trong trình tạo của từng tác nhân AI, tại tab A/B (/dashboard/agents/<id>?tab=variants). Đây là nơi tạo biến thể và bật kiểm thử.
  • Tổng quan liên tác nhân AI — trang Thử nghiệm (/dashboard/experiments, trong Chất lượng & Kiểm thử) tổng hợp kiểm thử của mọi tác nhân AI vào một bảng.

Thiết lập kiểm thử

Trên trang Thử nghiệm, nhấp Thiết lập kiểm thử A/B và chọn một tác nhân AI — bạn sẽ đến tab A/B của tác nhân AI đó, nơi bạn tạo các cấu hình biến thể (một biến thể được đánh dấu là đối chứng) và bật kiểm thử phân chia. Xem Xây dựng tác nhân AI để tìm hiểu về trình tạo.

Đọc phần tổng quan

Với mỗi tác nhân AI có kiểm thử, bảng Thử nghiệm hiển thị:
  • Trạng thái — Đang hoạt động (đã bật kiểm thử phân chia) hoặc Đã tạm dừng.
  • Biến thể — mọi biến thể dưới dạng thẻ, với biến thể đối chứng được gắn nhãn.
  • Đang dẫn đầu — biến thể có tỷ lệ thành công tốt nhất hiện tại, kèm tỷ lệ phần trăm. Cho đến khi các biến thể có cuộc gọi đã chấm điểm, mục này hiển thị Chưa đủ dữ liệu — đừng chọn bên thắng cuộc chỉ dựa trên vài cuộc gọi.
  • Cuộc gọi — tổng số cuộc gọi trên các biến thể của kiểm thử.
Các tác nhân AI chưa có kiểm thử được liệt kê bên dưới dưới dạng lời nhắc một lần nhấp để bắt đầu kiểm thử. Nhấp vào bất kỳ hàng nào để chuyển đến tab A/B của tác nhân AI đó nhằm tinh chỉnh hoặc kết thúc kiểm thử.
Biến thể xử lý một cuộc gọi được ghi lại ngay trên cuộc gọi đó, vì vậy bạn có thể lọc và kiểm tra ngẫu nhiên bản chép lời của từng bên trong lịch sử cuộc gọi.
Ưu tiên tính năng tích hợp này thay vì tự xây dựng việc phân bổ A/B trong webhook cấu hình động — bạn có sẵn việc phân bổ, số liệu theo từng biến thể và chấm điểm.

Bước tiếp theo

Xây dựng tác nhân AI

Tạo biến thể trong tab A/B của tác nhân AI.

Mô phỏng

Kiểm thử trước khi phát hành với người gọi AI, trước khi lưu lượng thực tế quyết định.