> ## Documentation Index
> Fetch the complete documentation index at: https://docs.thunderphone.com/llms.txt
> Use this file to discover all available pages before exploring further.

# वैलिडेशन सेट्स: डिप्लॉयमेंट से पहले वास्तविक कॉल टर्न्स को रीप्ले करें

> वास्तविक ThunderPhone कॉल मोमेंट्स को दोबारा इस्तेमाल किए जा सकने वाले वैलिडेशन उदाहरणों में बदलें, अपेक्षित व्यवहार की समीक्षा करें, उन्हें एजेंट ड्राफ्ट के विरुद्ध रीप्ले करें, और डिप्लॉय से पहले रिग्रेशन पकड़ें।

एक **वैलिडेशन उदाहरण** वास्तविक कॉल से एक एजेंट टर्न को फ्रीज़ करता है: उससे पहले की
बातचीत, संबंधित कॉलर ऑडियो, एजेंट ने वास्तव में क्या किया, और उसे क्या करना चाहिए इसका
ग्राउंड ट्रुथ। वर्तमान ड्राफ्ट के विरुद्ध एक सेट को रीप्ले करने से दूसरी कॉल किए बिना
रिग्रेशन का पता चलता है।

डेटासेट बनाने और रिव्यू करने के लिए संगठन-व्यापी **वैलिडेशन सेट** पेज
(`/dashboard/validation`) का उपयोग करें। सेट चलाने और रन हिस्ट्री देखने के लिए किसी
व्यक्तिगत एजेंट के **वैलिडेशन** टैब का उपयोग करें।

## कॉल हिस्ट्री से उदाहरण जोड़ें

<Steps>
  <Step title="उदाहरण जोड़ें चुनें">
    उस एजेंट को चुनें जिसके व्यवहार को उदाहरण से वैलिडेट करना है। वर्कस्पेस
    उस एजेंट के लिए हाल की अधिकतम 25 गैर-सिमुलेशन कॉल दिखाता है।
  </Step>

  <Step title="कॉल और एजेंट टर्न चुनें">
    ट्रांसक्रिप्ट पढ़ें, जिस एजेंट टर्न को सुरक्षित रखना है उस पर होवर करें, और
    चेकलिस्ट कार्रवाई चुनें। उस टर्न तक की बातचीत और उसके कॉलर ऑडियो स्पैन
    वैलिडेशन डेटासेट में कॉपी हो जाते हैं।
  </Step>

  <Step title="अपेक्षा का रिव्यू करें">
    ThunderPhone सही व्यवहार का एक विवरण ड्राफ्ट करता है। उसे विशिष्ट और टेस्ट करने योग्य
    बनाने के लिए एडिट करें, और वैकल्पिक रूप से स्वीकृत उदाहरण रिस्पॉन्स तथा अपेक्षित
    टूल कॉल को एडिट करें।
  </Step>

  <Step title="सेव करें या सक्रिय करें">
    **ड्राफ्ट सेव करें** उदाहरण को **रिव्यू आवश्यक** स्थिति में रखता है।
    **सेव करें और सक्रिय करें** इसे भविष्य के वैलिडेशन रन में शामिल करता है।
  </Step>
</Steps>

एक ही टर्न को दो बार प्रमोट करने पर दो कॉपी बनाने के बजाय मौजूदा उदाहरण का फिर से उपयोग होता है।

## उदाहरण के प्रकार और स्थितियां

प्रकार बताते हैं कि कोई उदाहरण क्यों मौजूद है:

| प्रकार       | उपयोग                                                                   |
| ------------ | ----------------------------------------------------------------------- |
| **विफलता**   | एक वास्तविक रिस्पॉन्स जिसने ऐसा व्यवहार दिखाया जिसे आप रोकना चाहते हैं। |
| **गोल्डन**   | एक ज्ञात रूप से अच्छा रिस्पॉन्स जिसे सुरक्षित रखना चाहिए।               |
| **मैन्युअल** | मैन्युअली क्यूरेट किया गया ऐसा केस जो इनमें से किसी श्रेणी में नहीं है। |

स्थितियां लाइफसाइकल नियंत्रित करती हैं:

| स्थिति               | अर्थ                                                                             |
| -------------------- | -------------------------------------------------------------------------------- |
| **रिव्यू आवश्यक**    | ग्राउंड ट्रुथ का अभी रिव्यू हो रहा है; रन से बाहर रखा जाता है।                   |
| **सक्रिय**           | वैलिडेशन रन में शामिल।                                                           |
| **पुराना**           | उदाहरण फ्रीज़ किए जाने के बाद प्रॉम्प्ट बदल गया है; इसकी अपेक्षा का रिव्यू करें। |
| **असंगत**            | उदाहरण को वर्तमान कॉन्फ़िगरेशन के साथ रीप्ले नहीं किया जा सकता।                  |
| **आर्काइव किया गया** | हिस्ट्री के लिए सुरक्षित है, लेकिन रन से बाहर रखा जाता है।                       |

## डेटासेट ब्राउज़ और परिष्कृत करें

संगठन डेटासेट को **एजेंट**, **स्थिति**, या **प्रकार** के अनुसार फ़िल्टर करें। किसी
उदाहरण को चुनने पर यह दिखता है:

* फ्रीज़ किया गया बातचीत कॉन्टेक्स्ट और चलाने योग्य कॉलर ऑडियो स्पैन।
* स्रोत कॉल और मूल रिस्पॉन्स।
* ग्राउंड-ट्रुथ अपेक्षा, स्वीकृत बोले गए रिस्पॉन्स, और टूल कॉल।
* मूल और अपेक्षित व्यवहार के साथ नवीनतम रीप्ले।
* उपलब्ध होने पर नवीनतम निर्णय और जज के स्पष्टीकरण।

अपेक्षा या स्वीकृत रिस्पॉन्स को संशोधित करने के लिए **ग्राउंड ट्रुथ एडिट करें** चुनें।
पूरा रन शुरू किए बिना केवल उस उदाहरण को टेस्ट करने के लिए **ड्राफ्ट के विरुद्ध रीप्ले करें**
चुनें। रीप्ले एजेंट के वर्तमान ड्राफ्ट का उपयोग करते हैं, जरूरी नहीं कि उसके डिप्लॉय किए गए
कॉन्फ़िगरेशन का।

## वैलिडेशन सेट चलाएं

एजेंट के **वैलिडेशन** टैब से, हर सक्रिय उदाहरण पर एक रन शुरू करें। प्रत्येक
उदाहरण को इनमें से एक निर्णय मिलता है:

* **पास** — रिस्पॉन्स अपेक्षा और कॉलर ऑडियो को पूरा करता है।
* **चेतावनी** — रिस्पॉन्स उपयोग योग्य है, लेकिन एक जांच में अनिश्चितता मिली।
* **विफल** — यह ऑडियो का विरोध करता है या आवश्यक व्यवहार से चूकता है।
* **स्किप किया गया** — आवश्यक कॉलर ऑडियो लोड नहीं किया जा सका; इसे
  पास-रेट डिनॉमिनेटर से बाहर रखा जाता है।
* **त्रुटि** — रीप्ले या ग्रेडिंग पूरी नहीं हो सकी।

रन सारांश पास, चेतावनी, विफलता और स्किप किए गए काउंट, पास रेट,
अनुमानित लागत, और पिछले पूर्ण रन के बाद पास से विफल में हुए किसी भी रिग्रेशन की रिपोर्ट करता है।
एक समय में प्रति एजेंट केवल एक वैलिडेशन रन सक्रिय हो सकता है।

## वैलिडेशन एविडेंस के साथ डिप्लॉय करें

जब किसी एजेंट में वैलिडेशन उदाहरण होते हैं, तो डिप्लॉय डायलॉग बताता है कि
नवीनतम पूर्ण रन वर्तमान ड्राफ़्ट से मेल खाता है या नहीं। आप:

* दिखाए गए पास रेट और रिग्रेशन काउंट के साथ डिप्लॉय कर सकते हैं।
* अगर कोई मेल खाता रन मौजूद नहीं है, तो पहले वैलिडेशन चलाएँ।
* परिणाम की समीक्षा हो जाने पर जानबूझकर फिर भी डिप्लॉय करें।

वैलिडेशन एविडेंस और डिप्लॉयमेंट जाँच है, कोई ऑटोमैटिक प्रोडक्शन
ट्रैफ़िक स्प्लिट नहीं। लाइव तुलनाओं के लिए,
[एक्सपेरिमेंट्स (A/B टेस्टिंग)](/hi/guides/experiments-ab-testing) का उपयोग करें।

## API ऑटोमेशन

[वैलिडेशन सेट्स API](/api-reference/validation-sets) टर्न को प्रमोट करने,
उदाहरण मैनेज करने, पिन किए गए ऑडियो को स्ट्रीम करने, व्यक्तिगत रीप्ले, बैच
रन, रन परिणाम, डिप्लॉयमेंट-समय स्टेटस, और संगठन ओवरव्यू को कवर करता है।
