Volver al blog

ProCat Solutions

Abigel.ai Teacher: aprendizaje de idiomas basado en conversación con un profesor de IA

Cómo el pipeline de voz del Virtual Assistant se convirtió en profesor: 26 idiomas, niveles A1-B2, escenarios reales, modo KIDS, paquete docente y corrección.

ProCat Solutions abigelteacheraprendizaje-de-idiomasvoice-aillmdimop
Abigel.ai Teacher: aprendizaje de idiomas basado en conversación con un profesor de IA

Abigel.ai Teacher nació de una observación: la mayoría de quienes aprenden un idioma no tienen problemas con la gramática, sino con atreverse a hablar. Quien lleva un año estudiando español a menudo sabe leer, pero no se atreve a pedir en un restaurante. Un profesor de IA por voz entrena exactamente esa situación: hay que hablar, en tiempo real, y los errores reciben una respuesta inmediata. El producto está disponible en la página abigel.ai/teacher y es el segundo producto de nuestro proyecto subvencionado DIMOP Plusz.

Qué sabe hacer el profesor

Teacher enseña en 26 idiomas y se adapta al nivel del alumno, de A1 a B2. El nivel no ajusta solo el vocabulario: en A1 el profesor habla más despacio, con frases más cortas, repregunta a menudo y permite que el alumno pida ayuda en su lengua materna; en B2 la conversación fluye a ritmo natural, con giros más complejos, y el profesor ayuda menos y corrige más.

El aprendizaje se organiza en torno a escenarios. En el catálogo hay situaciones de la vida real: hacer el check-in en un hotel, pedir cita con el médico, una entrevista de trabajo, una reclamación por una compra, pedir indicaciones, una conversación con un vecino. Cada escenario tiene un objetivo (qué hay que conseguir al final de la conversación) y el profesor interpreta un papel: es el recepcionista, el asistente del médico, el entrevistador. El alumno no hace un examen de vocabulario, sino que resuelve una situación.

Retroalimentación y corrección inmediatas

Durante la conversación el profesor corrige de dos maneras. Los errores menores (conjugación, orden de las palabras, artículos) los repite correctamente integrados en su propia respuesta, como hace un buen profesor, sin interrumpir la conversación. Ante errores mayores o frases incomprensibles se detiene y explica brevemente cuál era el problema.

Al final de la conversación se genera un resumen detallado: las frases del alumno, su versión corregida, los tipos de error recurrentes y algunas expresiones que conviene usar en la siguiente sesión. Con el tiempo, este resumen se convierte en un diario personal de errores en el que se ve qué ha mejorado y qué no.

Modo KIDS

El modo pensado para niños recibió un diseño propio. La voz y el estilo del profesor son más lúdicos, los escenarios son más cortos y con tono de cuento (una visita al zoo, la búsqueda de un juguete perdido), y la retroalimentación es siempre alentadora: la corrección no aparece como un error, sino en forma de “también se puede decir así”. En el modo KIDS el contenido está estrictamente filtrado: el profesor no se sale del escenario y no habla de temas que el padre o la madre no haya autorizado. Los padres ven desde su propia cuenta las conversaciones y el progreso del niño.

Paquete docente, grupos de alumnos, clasificación

En el paquete diseñado para profesores de idiomas, un profesor puede gestionar a varios alumnos. Puede asignar escenarios como deberes, ver los resúmenes y el diario de errores de las conversaciones de sus alumnos, y a partir de ahí sabe a qué conviene dedicar tiempo en la siguiente clase. Esto no sustituye la clase presencial, sino que la complementa: la práctica oral, que en clase es lo más caro porque solo puede hablar un alumno a la vez, aquí se hace en paralelo y sin límite de tiempo.

Dentro de los grupos, una clasificación muestra el tiempo dedicado a practicar y los escenarios completados. Deliberadamente no basamos la clasificación en la “ausencia de errores”, porque eso jugaría en contra de atreverse a hablar; premia la cantidad de práctica y el progreso.

Cómo el recepcionista se convirtió en profesor

La mayor ganancia en el desarrollo de Teacher fue no tener que reconstruir el pipeline de voz. En el Virtual Assistant ya existían el reconocimiento de voz en streaming, el modelo de lenguaje transmitido token a token, la síntesis de voz por fragmentos de frase, el barge-in (el alumno puede interrumpir), la detección del idioma de quien llama y el fallback entre varios proveedores. El mismo pipeline corre bajo Teacher; solo cambia el cliente: navegador y aplicación móvil en lugar de teléfono, WebRTC en lugar de SIP.

Lo que fue nuevo:

  • la capa docente: el modelo de lenguaje recibió un rol de “corrector” independiente, que analiza la frase del alumno antes de responder y transmite los errores de forma estructurada para que lleguen también al resumen;
  • el ajuste del reconocimiento de voz a la pronunciación de los alumnos: el recepcionista estaba optimizado para hablantes nativos, pero el alumno habla con pronunciación incorrecta, con acento, con frases a medias, y el sistema no debe “corregirlo”, sino transcribirlo con exactitud; de lo contrario el profesor no ve el error;
  • la gradación por niveles: la longitud, el ritmo y el vocabulario de las respuestas del profesor los regula el nivel configurado, y esto lo sigue no solo el prompt, sino también la velocidad del TTS;
  • el motor de escenarios: los elementos del catálogo son descripciones estructuradas (roles, objetivo, giros esperados, errores típicos) desde las que arranca la conversación, y el sistema comprueba al final de la conversación si se ha cumplido el objetivo.

Construir dos productos sobre la misma base en tiempo real es para nosotros la lección más importante: el pipeline de voz es infraestructura, y si está bien separado del caso de uso, el siguiente producto es en gran parte solo cuestión de contenido y reglas.

QR Code