Skip to main content
מעדיפים את לוח הבקרה? אותה יכולת זמינה ב-סימולציות (/dashboard/simulations), כולל יצירת תרחישים באמצעות AI — ראו סימולציית שיחה. דף זה עוסק בנתיב התכנותי.
איטרציה על סוכן AI משמעה איטרציה על ההנחיה שלו, הכלים שלו והאופן שבו הוא מטפל במקרי קצה. ה-API test-calls מפעיל שיחות אמיתיות (בוט-לבוט או לולאת SIP) מול סוכן באמצעות הנחיית תרחיש שאתם מספקים — כל הרצה מפיקה יומן שיחה אמיתי עם תמלול, דירוג וחיוב, כך שתוכלו לראות בדיוק כיצד הסוכן מתנהג ומה עלותו. השתמשו בו עבור:
  • בדיקות עשן לפני פריסה לאחר כל עריכת הנחיה
  • מערכי רגרסיה המחוברים ל-CI (חברו webhook של test-call.completed → הכשילו את ה-build אם הציון יורד)
  • בדיקת עומס של מגבלות מקביליות

הרצה חד-פעמית: הרצה יחידה

שדות: התגובה היא אובייקט הרצת שיחת בדיקה ב-status="queued". בצעו polling עד ש-status הופך ל-completed או ל-failed; לאחר שהוגדר call_id, טענו את התמלול באמצעות GET /v1/calls/{call_id}/transcript.

אצוות: תרחישים מקבילים

הפעילו N תרחישים במקביל — שימושי עבור מערכי רגרסיה שבודקים כל מקרה קצה מוכר במקביל:
התגובה כוללת רשימת run_ids של מזהי הרצות צאצא. אחזרו את סטטוס האצווה:
ל-run_count יש תקרה של 20; stagger_seconds מרווח את יצירת ההרצות כדי להימנע מהעמסת יתר על הסוכן (0–60 שניות).

חברו אותו ל-CI

צרו חבילת שער שחרור בדף סימולציות (/dashboard/simulations) — בחרו את הסוכן, הוסיפו תרחישים ידנית או לחצו על יצירת תרחישים באמצעות AI כדי לנסח אותם מתוך הפרומפט של הסוכן (עם מעבר אופציונלי למקרי קצה), וקבצו אותם לחבילה. חבילה מקבעת את התרחישים ואת הסוכן שלה, לצד שיעור הצלחה מינימלי וכלל אופציונלי של אפס כשלים קריטיים. הרצות שעוברות הופכות לקו הבסיס המאושר; מעברים מאוחרים יותר ממעבר לכישלון מוחזרים כרגרסיות. השתמשו במפתח API של הארגון ב-CI. סקריפט זה מפעיל את החבילה, מבצע polling עד שהדירוג וההשוואה מושלמים, ויוצא עם קוד שאינו אפס אלא אם פסק הדין הוא pass:
POST /v1/orgs/{org_id}/suites/{suite_id}/run מחזיר 202 עם מזהה ההרצה. GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} מחזיר את status, verdict, pass_rate, critical_failure_count ורשימת ה-regressions של קו הבסיס. שתי נקודות הקצה מקשרות את הארגון שבכתובת ה-URL לארגון של מפתח ה-API.

דפוסים

מאגר רגרסיות לכל פרומפט

תחזקו קובץ JSON של צמדים מסוג {name, scenario_prompt, expected_outcome}. בכל שינוי בפרומפט, הריצו את כל הקבוצה כאצווה; השוו את התמלילים והדירוגים להרצה הקודמת.

בדיקת smoke לכל שחרור

אצווה יחידה של חמישה תרחישים במסלול תקין שאתם מריצים לאחר כל פריסה. רגישה לזמן אחזור, לכן השאירו את stagger_seconds: 0.

השוואת ביצועי זמן אחזור

הריצו תרחישים זהים מול רמות מוצר שונות (spark, bolt, storm-base). השוו את ציוני call.graded ואת duration_seconds מכל יומן שיחה שנוצר.

השלבים הבאים

הפניה לשיחות בדיקה

כל פרמטר שאילתה, קוד סטטוס ומבנה אצווה.

דירוג AI

דרגו אוטומטית כל הרצת בדיקה כדי לעקוב אחר האיכות לאורך זמן.

דוחות בעיות

סמנו בדיקות ספציפיות לבדיקה אנושית.

webhook של test-call.completed

הזרימו תוצאות אל ה-CI / Slack / PagerDuty שלכם.