Aller au contenu
Ingénierie

Auto-héberger un intervieweur IA avec LiveKit : l’architecture

L’IA vocale en temps réel est une course contre la latence. Découvrez comment nous combinons LiveKit auto-hébergé, voix en streaming et un LLM pour mener des entretiens naturels sur vos propres serveurs.

2 min de lecture

Un chatbot textuel peut mettre deux secondes à répondre sans que personne ne s’en offusque. Dans une conversation vocale, une pause de deux secondes donne l’impression que la ligne a coupé. Concevoir un intervieweur IA que les candidats trouvent naturel consiste donc surtout à gagner sur la latence — tout en gardant l’audio sensible au sein d’une infrastructure que vous maîtrisez.

Pourquoi auto-héberger LiveKit ?

LiveKit est un serveur média WebRTC open source. En l’hébergeant vous-même, l’audio et la vidéo des candidats ne transitent jamais par un cloud média tiers, vous choisissez la région du data center et vous pouvez satisfaire des audits de confidentialité qui bloqueraient un outil SaaS. Cela supprime aussi les frais média à la minute lorsque les volumes augmentent.

Le pipeline

  1. Salle : le candidat rejoint une salle LiveKit depuis son navigateur — sans installation.
  2. Agent : un agent côté serveur rejoint la même salle en tant que participant et s’abonne à la piste audio du candidat.
  3. Écouter : la reconnaissance vocale en streaming produit des transcriptions partielles pendant que le candidat parle encore ; la détection d’activité vocale détermine quand il a terminé.
  4. Réfléchir : le LLM reçoit la transcription, la grille d’évaluation du poste et l’état de la conversation, puis renvoie en streaming la question suivante.
  5. Parler : la synthèse vocale en streaming commence à prononcer les premiers mots avant même que la phrase complète ne soit générée.

Où passent les millisecondes

La détection de fin de tour de parole, le premier token du modèle et le premier octet audio de la synthèse vocale dominent la latence perçue. Nous ajustons la détection de fin de tour pour chaque langue, gardons des prompts compacts et compatibles avec le cache, et diffusons chaque étape en streaming pour qu’elles se chevauchent au lieu de s’enchaîner.

Équitable et auditable

Chaque question s’appuie sur une grille d’évaluation structurée, chaque note cite le passage de la transcription qui la justifie, et les enregistrements sont conservés pour une revue humaine. L’IA présélectionne et documente ; les humains décident.

En production

LiveKit, les workers d’agents et l’application tournent derrière Nginx avec TURN pour les réseaux restrictifs, une mise à l’échelle horizontale des agents pour absorber les pics d’entretiens, et une observabilité de la latence des tours de parole pour détecter les régressions avant que les candidats ne les remarquent.

  • #LiveKit
  • #Voice AI
  • #WebRTC
  • #Architecture
LinkedInWhatsApp
Besoin de le faire développer ?

AI Interviewer

Des entretiens vocaux en temps réel, sur vos propres serveurs.

À lire aussi