מעדיפים את לוח הבקרה? אותה יכולת זמינה ב-סימולציות
(
/dashboard/simulations), כולל יצירת תרחישים באמצעות AI — ראו
סימולציית שיחה. דף זה עוסק
בנתיב התכנותי.- בדיקות עשן לפני פריסה לאחר כל עריכת הנחיה
- מערכי רגרסיה המחוברים ל-CI (חברו webhook של
test-call.completed→ הכשילו את ה-build אם הציון יורד) - בדיקת עומס של מגבלות מקביליות
הרצה חד-פעמית: הרצה יחידה
התגובה היא אובייקט הרצת שיחת בדיקה
ב-
status="queued". בצעו polling עד ש-status הופך ל-completed או
ל-failed; לאחר שהוגדר call_id, טענו את התמלול באמצעות
GET /v1/calls/{call_id}/transcript.
אצוות: תרחישים מקבילים
הפעילו N תרחישים במקביל — שימושי עבור מערכי רגרסיה שבודקים כל מקרה קצה מוכר במקביל:run_ids של מזהי הרצות צאצא. אחזרו את סטטוס
האצווה:
run_count יש תקרה של 20; stagger_seconds מרווח את יצירת ההרצות
כדי להימנע מהעמסת יתר על הסוכן (0–60 שניות).
חברו אותו ל-CI
צרו חבילת שער שחרור בדף סימולציות (/dashboard/simulations) — בחרו את הסוכן, הוסיפו תרחישים ידנית או
לחצו על יצירת תרחישים באמצעות AI כדי לנסח אותם מתוך
הפרומפט של הסוכן (עם מעבר אופציונלי למקרי קצה), וקבצו אותם לחבילה.
חבילה מקבעת את התרחישים ואת הסוכן שלה, לצד שיעור הצלחה מינימלי וכלל
אופציונלי של אפס כשלים קריטיים. הרצות שעוברות הופכות לקו הבסיס המאושר;
מעברים מאוחרים יותר ממעבר לכישלון מוחזרים כרגרסיות.
השתמשו במפתח API של הארגון ב-CI.
סקריפט זה מפעיל את החבילה, מבצע polling עד שהדירוג וההשוואה
מושלמים, ויוצא עם קוד שאינו אפס אלא אם פסק הדין הוא pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run מחזיר 202 עם מזהה
ההרצה. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} מחזיר
את status, verdict, pass_rate, critical_failure_count ורשימת
ה-regressions של קו הבסיס. שתי נקודות הקצה מקשרות את הארגון שבכתובת
ה-URL לארגון של מפתח ה-API.
דפוסים
מאגר רגרסיות לכל פרומפט
תחזקו קובץ JSON של צמדים מסוג{name, scenario_prompt, expected_outcome}.
בכל שינוי בפרומפט, הריצו את כל הקבוצה כאצווה; השוו את התמלילים והדירוגים
להרצה הקודמת.
בדיקת smoke לכל שחרור
אצווה יחידה של חמישה תרחישים במסלול תקין שאתם מריצים לאחר כל פריסה. רגישה לזמן אחזור, לכן השאירו אתstagger_seconds: 0.
השוואת ביצועי זמן אחזור
הריצו תרחישים זהים מול רמות מוצר שונות (spark,
bolt, storm-base). השוו את ציוני call.graded ואת
duration_seconds מכל יומן שיחה שנוצר.
השלבים הבאים
הפניה לשיחות בדיקה
כל פרמטר שאילתה, קוד סטטוס ומבנה אצווה.
דירוג AI
דרגו אוטומטית כל הרצת בדיקה כדי לעקוב אחר האיכות לאורך זמן.
דוחות בעיות
סמנו בדיקות ספציפיות לבדיקה אנושית.
webhook של test-call.completed
הזרימו תוצאות אל ה-CI / Slack / PagerDuty שלכם.