Saltar al contenido
Ingeniería

Autoalojar un entrevistador con IA con LiveKit: la arquitectura

La IA de voz en tiempo real es una cuestión de latencia. Así combinamos LiveKit autoalojado, voz en streaming y un LLM para realizar entrevistas naturales en tus propios servidores.

2 min de lectura

Un chatbot de texto puede tardar dos segundos en responder y a nadie le importa. En una conversación de voz, una pausa de dos segundos parece que se cortó la llamada. Por eso, crear un entrevistador con IA que a los candidatos les resulte natural consiste sobre todo en recortar la latencia, manteniendo el audio sensible dentro de una infraestructura que tú controlas.

¿Por qué alojar LiveKit en tu propia infraestructura?

LiveKit es un servidor de medios WebRTC de código abierto. Alojarlo tú mismo significa que el audio y el video de los candidatos nunca pasan por una nube de medios de terceros, que eliges la región del centro de datos y que puedes superar revisiones de privacidad que bloquearían una herramienta SaaS. Además, elimina las tarifas por minuto de medios a gran escala.

El pipeline

  1. Sala: el candidato se une a una sala de LiveKit desde el navegador, sin instalar nada.
  2. Agente: un agente del lado del servidor se une a la misma sala como participante y se suscribe a la pista de audio del candidato.
  3. Escuchar: la conversión de voz a texto en streaming genera transcripciones parciales mientras el candidato aún habla; la detección de actividad de voz decide cuándo ha terminado.
  4. Pensar: el LLM recibe la transcripción junto con la rúbrica del puesto y el estado de la conversación, y devuelve en streaming la siguiente pregunta.
  5. Hablar: la síntesis de voz en streaming empieza a reproducir las primeras palabras antes de que se genere la frase completa.

En qué se van los milisegundos

La detección del fin de turno, el primer token del modelo y el primer byte de audio de la síntesis de voz dominan la latencia percibida. Ajustamos la detección de turnos por idioma, mantenemos los prompts compactos y aptos para caché, y hacemos streaming en cada etapa para que se solapen en lugar de hacer cola.

Justo y auditable

Cada pregunta se basa en una rúbrica estructurada, cada puntuación cita el momento de la transcripción que la justifica y las grabaciones se conservan para revisión humana. La IA filtra y documenta; las personas deciden.

En producción

LiveKit, los workers de agentes y la aplicación se ejecutan detrás de Nginx con TURN para redes restrictivas, escalado horizontal de agentes para picos de entrevistas y observabilidad de la latencia de turnos, para detectar regresiones antes de que los candidatos las noten.

  • #LiveKit
  • #Voice AI
  • #WebRTC
  • #Architecture
LinkedInWhatsApp
¿Necesitas desarrollarlo?

AI Interviewer

Entrevistas de voz en tiempo real, en tus propios servidores.

Sigue leyendo