Zum Inhalt springen
Engineering

Einen KI-Interviewer mit LiveKit selbst hosten: die Architektur

Echtzeit-Sprach-KI ist ein Spiel mit der Latenz. Ein Blick darauf, wie wir selbst gehostetes LiveKit, Streaming-Sprache und ein LLM kombinieren, um natürliche Interviews auf Ihren eigenen Servern zu führen.

1 Min. Lesezeit

Ein Text-Chatbot darf zwei Sekunden für eine Antwort brauchen – das stört niemanden. In einem Sprachgespräch wirkt eine Pause von zwei Sekunden, als wäre die Verbindung abgebrochen. Einen KI-Interviewer zu bauen, den Bewerbende als natürlich empfinden, heißt deshalb vor allem: Latenz einsparen – und sensible Audiodaten in einer Infrastruktur halten, die Sie selbst kontrollieren.

Warum LiveKit selbst hosten?

LiveKit ist ein Open-Source-WebRTC-Medienserver. Wenn Sie ihn selbst hosten, laufen Audio und Video der Bewerbenden nie über eine fremde Medien-Cloud, Sie wählen die Rechenzentrumsregion selbst und bestehen Datenschutzprüfungen, an denen ein SaaS-Tool scheitern würde. Zudem entfallen bei hohem Volumen die minutenbasierten Mediengebühren.

Die Pipeline

  1. Raum: Die bewerbende Person betritt einen LiveKit-Raum direkt im Browser – ohne Installation.
  2. Agent: Ein serverseitiger Agent tritt demselben Raum als Teilnehmer bei und abonniert die Audiospur der Person.
  3. Zuhören: Streaming-Spracherkennung erzeugt Teiltranskripte, während die Person noch spricht; eine Sprachaktivitätserkennung entscheidet, wann sie fertig ist.
  4. Denken: Das LLM erhält das Transkript samt Bewertungsraster der Rolle und Gesprächszustand und streamt die nächste Frage zurück.
  5. Sprechen: Streaming-Sprachsynthese spielt die ersten Wörter ab, bevor der vollständige Satz generiert ist.

Wo die Millisekunden bleiben

Die Erkennung des Sprecherwechsels, das erste Token des Modells und das erste Audio-Byte der Sprachsynthese bestimmen die wahrgenommene Latenz. Wir optimieren die Sprecherwechsel-Erkennung pro Sprache, halten Prompts kompakt und cache-freundlich und streamen jede Stufe, damit sie sich überlappen, statt sich anzustauen.

Fair und nachvollziehbar

Jede Frage basiert auf einem strukturierten Bewertungsraster, jede Bewertung verweist auf die Transkriptstelle, die sie begründet, und Aufzeichnungen werden für die menschliche Prüfung aufbewahrt. Die KI sichtet und dokumentiert; Menschen entscheiden.

Betrieb in der Produktion

LiveKit, die Agent-Worker und die Anwendung laufen hinter Nginx mit TURN für restriktive Netzwerke, horizontaler Agent-Skalierung für Interview-Spitzen und Monitoring der Antwortlatenz, damit Verschlechterungen auffallen, bevor Bewerbende sie bemerken.

  • #LiveKit
  • #Voice AI
  • #WebRTC
  • #Architecture
LinkedInWhatsApp
Sie möchten das umsetzen lassen?

KI-Interviewer

Sprachinterviews in Echtzeit, auf Ihren eigenen Servern.

Weiterlesen