LiveKit के साथ AI इंटरव्यूअर को self-host करना: आर्किटेक्चर
Real-time voice AI में latency ही सब कुछ है। देखिए कैसे हम self-hosted LiveKit, streaming speech और LLM को जोड़कर आपके अपने सर्वर पर स्वाभाविक इंटरव्यू चलाते हैं।
टेक्स्ट chatbot जवाब देने में दो सेकंड ले, तो किसी को फ़र्क नहीं पड़ता। लेकिन वॉइस बातचीत में दो सेकंड की चुप्पी ऐसी लगती है जैसे कॉल कट गई हो। इसलिए ऐसा AI इंटरव्यूअर बनाना, जो उम्मीदवारों को स्वाभाविक लगे, मुख्य रूप से latency घटाने की कवायद है — और साथ ही संवेदनशील ऑडियो को आपके अपने नियंत्रण वाले इंफ्रास्ट्रक्चर में रखना।
LiveKit को self-host क्यों करें?
LiveKit एक ओपन-सोर्स WebRTC मीडिया सर्वर है। इसे ख़ुद होस्ट करने का मतलब है कि उम्मीदवार का ऑडियो और वीडियो कभी किसी थर्ड-पार्टी मीडिया क्लाउड से होकर नहीं गुज़रता, डेटा-सेंटर रीजन आप ख़ुद चुनते हैं, और आप उन प्राइवेसी रिव्यू को भी पास कर सकते हैं जो किसी SaaS टूल को रोक देते। बड़े पैमाने पर यह प्रति-मिनट मीडिया शुल्क भी ख़त्म कर देता है।
पाइपलाइन
- Room: उम्मीदवार ब्राउज़र से ही LiveKit room में जुड़ता है — कुछ भी इंस्टॉल करने की ज़रूरत नहीं।
- Agent: एक सर्वर-साइड agent उसी room में प्रतिभागी के रूप में जुड़ता है और उम्मीदवार के ऑडियो ट्रैक को subscribe करता है।
- सुनना: स्ट्रीमिंग speech-to-text उम्मीदवार के बोलते-बोलते ही आंशिक ट्रांसक्रिप्ट बनाता है; voice-activity detection तय करता है कि उन्होंने बोलना कब ख़त्म किया।
- सोचना: LLM को ट्रांसक्रिप्ट के साथ रोल का rubric और बातचीत की स्थिति मिलती है, और वह अगला प्रश्न स्ट्रीम करके लौटाता है।
- बोलना: स्ट्रीमिंग text-to-speech पूरा वाक्य बनने से पहले ही शुरुआती शब्द बोलना शुरू कर देता है।
मिलीसेकंड कहाँ खर्च होते हैं
महसूस होने वाली latency में सबसे बड़ा हिस्सा end-of-turn detection, मॉडल के पहले टोकन और speech synthesis की पहली ऑडियो बाइट का होता है। हम हर भाषा के लिए turn detection को अलग से ट्यून करते हैं, prompts को संक्षिप्त और cache-friendly रखते हैं, और हर चरण को स्ट्रीम करते हैं ताकि वे कतार में इंतज़ार करने के बजाय साथ-साथ चलें।
निष्पक्ष और ऑडिट-योग्य बनाना
हर प्रश्न एक संरचित rubric पर आधारित होता है, हर स्कोर ट्रांसक्रिप्ट के उस पल का हवाला देता है जो उसे सही ठहराता है, और मानवीय समीक्षा के लिए रिकॉर्डिंग सुरक्षित रखी जाती हैं। AI स्क्रीन करता है और दस्तावेज़ बनाता है; फ़ैसला इंसान लेते हैं।
Production में चलाना
LiveKit, agent workers और एप्लिकेशन Nginx के पीछे चलते हैं — प्रतिबंधित नेटवर्क के लिए TURN, इंटरव्यू की भीड़ के लिए agents की horizontal scaling, और turn latency पर observability के साथ, ताकि कोई भी गिरावट उम्मीदवारों के नोटिस करने से पहले ही पकड़ ली जाए।
- #LiveKit
- #Voice AI
- #WebRTC
- #Architecture
आगे पढ़ें
ERP और ऑपरेशंस5 मिनट में पढ़ें
चैटबॉट से सहकर्मी तक: एक HR असिस्टेंट जो सुरक्षित तरीके से काम करता है
AIVCJ HR सिर्फ़ छुट्टी के सवालों का जवाब नहीं देता — यह छुट्टी अप्लाई करता है, अप्रूवल आगे भेजता है और HR लेटर ड्राफ़्ट करता है। यहाँ बताया है कि हमने AI को काम करने दिया, पर नियम बनाने नहीं दिए: कोड में पॉलिसी इंजन, हर काम से पहले कन्फ़र्मेशन कार्ड, रोल के हिसाब से अनुमतियाँ और ऑडिट लॉग। एक स्क्रिप्टेड और एक ब्लाइंड टेस्ट सेट पर मापा गया।
और पढ़ें2 मिनट में पढ़ें
RAG क्या है — और आपके बिज़नेस को सच में इसकी ज़रूरत कब है?
Retrieval-augmented generation से AI अंदाज़ा लगाने के बजाय आपके अपने डॉक्यूमेंट्स से जवाब देता है। जानिए यह कैसे काम करता है, कहाँ सबसे कारगर है, और किन संकेतों से पता चलता है कि आप इसके लिए तैयार हैं।
और पढ़ें
AI और RAG5 मिनट में पढ़ें
ज़्यादातर कंपनी चैटबॉट गलत जवाब क्यों गढ़ते हैं — और हमने स्रोत बताने वाला चैटबॉट कैसे बनाया
AIVCJ Knowledge के पीछे की कहानी: हाइब्रिड रिट्रीवल, क्वेरी प्लानिंग, हर जवाब पर ग्राउंडिंग जाँच, और दो सार्वजनिक टेस्ट सेट — जिनमें एक ब्लाइंड सेट उसी तरह लिखा गया जैसे असली लोग टाइप करते हैं। सैंपल HR, प्रोडक्ट और GST दस्तावेज़ों पर, या अपनी PDF पर लाइव आज़माएँ।
और पढ़ें