Einen KI-Interviewer mit LiveKit selbst hosten: die Architektur
Echtzeit-Sprach-KI ist ein Spiel mit der Latenz. Ein Blick darauf, wie wir selbst gehostetes LiveKit, Streaming-Sprache und ein LLM kombinieren, um natürliche Interviews auf Ihren eigenen Servern zu führen.
Ein Text-Chatbot darf zwei Sekunden für eine Antwort brauchen – das stört niemanden. In einem Sprachgespräch wirkt eine Pause von zwei Sekunden, als wäre die Verbindung abgebrochen. Einen KI-Interviewer zu bauen, den Bewerbende als natürlich empfinden, heißt deshalb vor allem: Latenz einsparen – und sensible Audiodaten in einer Infrastruktur halten, die Sie selbst kontrollieren.
Warum LiveKit selbst hosten?
LiveKit ist ein Open-Source-WebRTC-Medienserver. Wenn Sie ihn selbst hosten, laufen Audio und Video der Bewerbenden nie über eine fremde Medien-Cloud, Sie wählen die Rechenzentrumsregion selbst und bestehen Datenschutzprüfungen, an denen ein SaaS-Tool scheitern würde. Zudem entfallen bei hohem Volumen die minutenbasierten Mediengebühren.
Die Pipeline
- Raum: Die bewerbende Person betritt einen LiveKit-Raum direkt im Browser – ohne Installation.
- Agent: Ein serverseitiger Agent tritt demselben Raum als Teilnehmer bei und abonniert die Audiospur der Person.
- Zuhören: Streaming-Spracherkennung erzeugt Teiltranskripte, während die Person noch spricht; eine Sprachaktivitätserkennung entscheidet, wann sie fertig ist.
- Denken: Das LLM erhält das Transkript samt Bewertungsraster der Rolle und Gesprächszustand und streamt die nächste Frage zurück.
- Sprechen: Streaming-Sprachsynthese spielt die ersten Wörter ab, bevor der vollständige Satz generiert ist.
Wo die Millisekunden bleiben
Die Erkennung des Sprecherwechsels, das erste Token des Modells und das erste Audio-Byte der Sprachsynthese bestimmen die wahrgenommene Latenz. Wir optimieren die Sprecherwechsel-Erkennung pro Sprache, halten Prompts kompakt und cache-freundlich und streamen jede Stufe, damit sie sich überlappen, statt sich anzustauen.
Fair und nachvollziehbar
Jede Frage basiert auf einem strukturierten Bewertungsraster, jede Bewertung verweist auf die Transkriptstelle, die sie begründet, und Aufzeichnungen werden für die menschliche Prüfung aufbewahrt. Die KI sichtet und dokumentiert; Menschen entscheiden.
Betrieb in der Produktion
LiveKit, die Agent-Worker und die Anwendung laufen hinter Nginx mit TURN für restriktive Netzwerke, horizontaler Agent-Skalierung für Interview-Spitzen und Monitoring der Antwortlatenz, damit Verschlechterungen auffallen, bevor Bewerbende sie bemerken.
- #LiveKit
- #Voice AI
- #WebRTC
- #Architecture
KI-Interviewer
Sprachinterviews in Echtzeit, auf Ihren eigenen Servern.
Weiterlesen
ERP & Betrieb5 Min. Lesezeit
Vom Chatbot zum Kollegen: ein HR-Assistent, der sicher handelt
AIVCJ HR beantwortet nicht nur Urlaubsfragen – er beantragt Urlaub, leitet Genehmigungen weiter und entwirft HR-Schreiben. So haben wir eine KI handeln lassen, ohne sie die Regeln machen zu lassen: eine Policy-Engine im Code, eine Bestätigungskarte vor jeder Aktion, Rollenrechte und ein Audit-Log. Gemessen an einem geskripteten und einem Blind-Testset.
Weiterlesen2 Min. Lesezeit
Was ist RAG – und wann braucht Ihr Unternehmen es wirklich?
Mit Retrieval-Augmented Generation antwortet KI aus Ihren eigenen Dokumenten, statt zu raten. So funktioniert es, hier glänzt es – und daran erkennen Sie, dass Sie bereit dafür sind.
Weiterlesen
KI & RAG4 Min. Lesezeit
Warum die meisten Firmen-Chatbots Antworten erfinden – und wie wir einen gebaut haben, der seine Quellen nennt
Ein Blick hinter die Kulissen von AIVCJ Knowledge: hybride Suche, Abfrageplanung, eine Faktenprüfung jeder Antwort und zwei öffentliche Testsets – darunter ein Blind-Set, geschrieben so, wie echte Menschen tippen. Live testen mit Beispieldokumenten aus HR, Produkt und GST – oder mit Ihrem eigenen PDF.
Weiterlesen