डैशबोर्ड पसंद है? यही क्षमता सिमुलेशन
(
/dashboard/simulations) में उपलब्ध है, जिसमें AI सिनेरियो जनरेशन भी शामिल है — देखें
कॉल सिमुलेट करें। यह पेज
प्रोग्रामेटिक तरीके को कवर करता है।- हर प्रॉम्प्ट एडिट के बाद प्री-डिप्लॉय स्मोक टेस्ट के लिए
- CI में जोड़े गए रिग्रेशन सूट के लिए (
test-call.completedवेबहुक हुक करें → स्कोर घटने पर बिल्ड फेल करें) - कॉन्करेंसी सीमाओं का स्ट्रेस टेस्ट करने के लिए
वन-शॉट: एकल रन
रिस्पॉन्स में
status="queued" वाला एक टेस्ट कॉल रन ऑब्जेक्ट
होता है। status के completed या
failed होने तक पोल करें; call_id सेट होने के बाद, ट्रांसक्रिप्ट को
GET /v1/calls/{call_id}/transcript के जरिए लोड करें।
बैच: समानांतर सिनेरियो
N सिनेरियो एक साथ चलाएँ — उन रिग्रेशन सूट के लिए उपयोगी है जो हर ज्ञात एज केस को समानांतर रूप से हिट करते हैं:run_ids सूची होती है। बैच
स्टेटस प्राप्त करें:
run_count की सीमा 20 है; एजेंट पर अत्यधिक लोड से बचने के लिए stagger_seconds स्पॉन के बीच
अंतर रखता है (0–60 सेकंड)।
इसे CI में जोड़ें
सिमुलेशन पेज (/dashboard/simulations) पर एक रिलीज़ गेट सूट बनाएं — एजेंट चुनें, मैन्युअल रूप से सिनेरियो जोड़ें या एजेंट के
प्रॉम्प्ट से उनके ड्राफ्ट बनाने के लिए AI के साथ सिनेरियो जनरेट करें पर क्लिक करें
(वैकल्पिक एज-केस पास के साथ), और उन्हें एक सूट में समूहित करें।
एक सूट अपने सिनेरियो और एजेंट, साथ ही न्यूनतम पास रेट और
वैकल्पिक शून्य-क्रिटिकल-फेल्योर नियम को पिन करता है। पास होने वाले रन स्वीकार किए गए
बेसलाइन बन जाते हैं; बाद के pass→fail ट्रांज़िशन रिग्रेशन के रूप में लौटाए जाते हैं।
CI में एक संगठन API key का उपयोग करें।
यह स्क्रिप्ट सूट को ट्रिगर करती है, ग्रेडिंग और तुलना पूरी होने तक पोल करती है,
और वर्डिक्ट pass न होने पर नॉनज़ीरो एग्ज़िट करती है:
POST /v1/orgs/{org_id}/suites/{suite_id}/run रन id के साथ 202 लौटाता है।
GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} status, verdict,
pass_rate, critical_failure_count, और बेसलाइन regressions सूची लौटाता है।
दोनों एंडपॉइंट URL संगठन को API key के संगठन से बाइंड करते हैं।
पैटर्न
प्रति-प्रॉम्प्ट रिग्रेशन कॉर्पस
{name, scenario_prompt, expected_outcome} ट्यूपल्स की एक JSON फ़ाइल बनाए रखें।
हर प्रॉम्प्ट बदलाव पर, पूरे सेट को बैच के रूप में चलाएं; ट्रांसक्रिप्ट और ग्रेड को
पिछले रन से डिफ करें।
प्रति-रिलीज़ स्मोक टेस्ट
पांच हैपी-पाथ सिनेरियो का एक बैच, जिसे आप हर डिप्लॉय के बाद चलाते हैं। यह लेटेंसी-संवेदनशील है, इसलिएstagger_seconds: 0 रखें।
लेटेंसी बेंचमार्किंग
अलग-अलग प्रोडक्ट टियर्स (spark,
bolt, storm-base) के विरुद्ध समान सिनेरियो चलाएं। call.graded स्कोर और
हर परिणामी कॉल लॉग से duration_seconds की तुलना करें।
अगले चरण
टेस्ट कॉल्स रेफरेंस
हर क्वेरी पैरामीटर, स्टेटस कोड और बैच शेप।
AI ग्रेडिंग
समय के साथ क्वालिटी ट्रैक करने के लिए हर टेस्ट रन को ऑटो-स्कोर करें।
इश्यू रिपोर्ट्स
मानवीय समीक्षा के लिए विशिष्ट टेस्ट फ्लैग करें।
test-call.completed वेबहुक
परिणामों को अपने CI / Slack / PagerDuty में स्ट्रीम करें।