Skip to main content
डैशबोर्ड पसंद है? यही क्षमता सिमुलेशन (/dashboard/simulations) में उपलब्ध है, जिसमें AI सिनेरियो जनरेशन भी शामिल है — देखें कॉल सिमुलेट करें। यह पेज प्रोग्रामेटिक तरीके को कवर करता है।
AI एजेंट पर इटरेट करने का मतलब उसके प्रॉम्प्ट, उसके टूल्स, और एज केस को संभालने के तरीके पर इटरेट करना है। test-calls API आपके दिए गए सिनेरियो प्रॉम्प्ट का उपयोग करके एजेंट के विरुद्ध वास्तविक (bot-to-bot या SIP लूपबैक) कॉल चलाता है — हर रन ट्रांसक्रिप्ट, ग्रेडिंग और बिलिंग के साथ एक वास्तविक कॉल लॉग बनाता है, ताकि आप ठीक-ठीक देख सकें कि एजेंट कैसे व्यवहार करता है और उसकी लागत कितनी है। इसका उपयोग करें:
  • हर प्रॉम्प्ट एडिट के बाद प्री-डिप्लॉय स्मोक टेस्ट के लिए
  • CI में जोड़े गए रिग्रेशन सूट के लिए (test-call.completed वेबहुक हुक करें → स्कोर घटने पर बिल्ड फेल करें)
  • कॉन्करेंसी सीमाओं का स्ट्रेस टेस्ट करने के लिए

वन-शॉट: एकल रन

फ़ील्ड: रिस्पॉन्स में status="queued" वाला एक टेस्ट कॉल रन ऑब्जेक्ट होता है। status के completed या failed होने तक पोल करें; call_id सेट होने के बाद, ट्रांसक्रिप्ट को GET /v1/calls/{call_id}/transcript के जरिए लोड करें।

बैच: समानांतर सिनेरियो

N सिनेरियो एक साथ चलाएँ — उन रिग्रेशन सूट के लिए उपयोगी है जो हर ज्ञात एज केस को समानांतर रूप से हिट करते हैं:
रिस्पॉन्स में चाइल्ड रन id की run_ids सूची होती है। बैच स्टेटस प्राप्त करें:
run_count की सीमा 20 है; एजेंट पर अत्यधिक लोड से बचने के लिए stagger_seconds स्पॉन के बीच अंतर रखता है (0–60 सेकंड)।

इसे CI में जोड़ें

सिमुलेशन पेज (/dashboard/simulations) पर एक रिलीज़ गेट सूट बनाएं — एजेंट चुनें, मैन्युअल रूप से सिनेरियो जोड़ें या एजेंट के प्रॉम्प्ट से उनके ड्राफ्ट बनाने के लिए AI के साथ सिनेरियो जनरेट करें पर क्लिक करें (वैकल्पिक एज-केस पास के साथ), और उन्हें एक सूट में समूहित करें। एक सूट अपने सिनेरियो और एजेंट, साथ ही न्यूनतम पास रेट और वैकल्पिक शून्य-क्रिटिकल-फेल्योर नियम को पिन करता है। पास होने वाले रन स्वीकार किए गए बेसलाइन बन जाते हैं; बाद के pass→fail ट्रांज़िशन रिग्रेशन के रूप में लौटाए जाते हैं। CI में एक संगठन API key का उपयोग करें। यह स्क्रिप्ट सूट को ट्रिगर करती है, ग्रेडिंग और तुलना पूरी होने तक पोल करती है, और वर्डिक्ट pass न होने पर नॉनज़ीरो एग्ज़िट करती है:
POST /v1/orgs/{org_id}/suites/{suite_id}/run रन id के साथ 202 लौटाता है। GET /v1/orgs/{org_id}/suites/{suite_id}/runs/{run_id} status, verdict, pass_rate, critical_failure_count, और बेसलाइन regressions सूची लौटाता है। दोनों एंडपॉइंट URL संगठन को API key के संगठन से बाइंड करते हैं।

पैटर्न

प्रति-प्रॉम्प्ट रिग्रेशन कॉर्पस

{name, scenario_prompt, expected_outcome} ट्यूपल्स की एक JSON फ़ाइल बनाए रखें। हर प्रॉम्प्ट बदलाव पर, पूरे सेट को बैच के रूप में चलाएं; ट्रांसक्रिप्ट और ग्रेड को पिछले रन से डिफ करें।

प्रति-रिलीज़ स्मोक टेस्ट

पांच हैपी-पाथ सिनेरियो का एक बैच, जिसे आप हर डिप्लॉय के बाद चलाते हैं। यह लेटेंसी-संवेदनशील है, इसलिए stagger_seconds: 0 रखें।

लेटेंसी बेंचमार्किंग

अलग-अलग प्रोडक्ट टियर्स (spark, bolt, storm-base) के विरुद्ध समान सिनेरियो चलाएं। call.graded स्कोर और हर परिणामी कॉल लॉग से duration_seconds की तुलना करें।

अगले चरण

टेस्ट कॉल्स रेफरेंस

हर क्वेरी पैरामीटर, स्टेटस कोड और बैच शेप।

AI ग्रेडिंग

समय के साथ क्वालिटी ट्रैक करने के लिए हर टेस्ट रन को ऑटो-स्कोर करें।

इश्यू रिपोर्ट्स

मानवीय समीक्षा के लिए विशिष्ट टेस्ट फ्लैग करें।

test-call.completed वेबहुक

परिणामों को अपने CI / Slack / PagerDuty में स्ट्रीम करें।