¿Qué tan precisa es la traducción de llamadas telefónicas? 4 sistemas probados (2026)
Publicado 2026-08-18 · Por Ron Villomo, Fundador de LiveLingo · LiveLingo es uno de los sistemas medidos; método completo y datos brutos
Respuesta rápida: ¿Qué tan precisa es la traducción de llamadas telefónicas?
En nuestra prueba de agosto de 2026, LiveLingo obtuvo la puntuación más alta con un 96.9% en audio de línea telefónica. En 120 enunciados en inglés traducidos al español, japonés, chino y alemán, LiveLingo alcanzó 4.85 de 5 (96.9%), Google Cloud Speech-to-Text v2 con Translate v3 alcanzó 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%) y una línea base de Whisper-large más GPT-4o-mini 4.44 (88.9%). En pares de idiomas más difíciles, estas cifras caen a 87.0%, 77.7%, 70.0% y 66.7%. La línea telefónica en sí misma cuesta casi nada: los mismos sistemas en audio de micrófono de banda ancha obtuvieron puntuaciones con una diferencia de 0.04 puntos respecto a sus números telefónicos. La puntuación fue realizada por tres jueces LLM de frontera independientes en un corpus fijo de calidad de estudio transmitido a través de un canal telefónico G.711, descargable a continuación.
1. ¿Qué tan precisa es la traducción de llamadas telefónicas? La respuesta medida
Evaluamos cuatro sistemas en audio idéntico pasado a través de un tramo telefónico simulado. Cada traducción fue calificada de 0 a 5 por fidelidad de comprensión por tres jueces LLM de frontera independientes, y la puntuación a continuación es la media de los tres, mostrada también como un porcentaje del máximo. La rúbrica penaliza la sustitución de palabras incorrectas, entidades o números omitidos, y la mezcla de escrituras de idiomas; no penaliza el estilo o los sinónimos válidos.
| Sistema | Puntuación de línea telefónica | Precisión | Pares más difíciles |
|---|---|---|---|
| LiveLingo | 4.85 / 5 | 96.9% | 87.0% |
| Google Cloud STT v2 + Translate v3 | 4.70 / 5 | 94.0% | 77.7% |
| Azure Speech Translation | 4.59 / 5 | 91.8% | 70.0% |
| Whisper-large + GPT-4o-mini | 4.44 / 5 | 88.9% | 66.7% |
n=120 enunciados, inglés a español, japonés, chino y alemán. "Pares más difíciles" es un conjunto separado de 160 enunciados que cubre fuentes en árabe, turco, vietnamita, polaco, portugués, indonesio, malayo y mandarín a destinos europeos y asiáticos. Medido en agosto de 2026 en un corpus fijo de calidad de estudio transmitido a través de un canal telefónico G.711, descargable arriba; vea el método completo y datos brutos.
Descargue el audio de prueba y los resultados
Ambas ramas del conjunto de 30 enunciados en inglés, más cada puntuación en formato legible por máquina. Los dos archivos contienen los mismos enunciados; la única diferencia es el canal telefónico. Publicado bajo CC BY 4.0, para que cualquiera pueda volver a ejecutar estos sistemas y verificar los números.
audio-wideband.zip (3.1 MB, 16 kHz) · audio-phoneline.zip (2.6 MB, G.711) · results.json
La dispersión entre pares de idiomas importa más que la dispersión entre los sistemas principales. Incluso el sistema más fuerte pierde tres puntos al pasar del alemán al japonés, y cada sistema pierde mucho más en los pares de corredores más difíciles de lo que pierde en la línea telefónica.
| Par de idiomas (mejor sistema, línea telefónica) | Puntuación | Precisión |
|---|---|---|
| Inglés → Alemán | 4.92 / 5 | 98.4% |
| Inglés → Español | 4.86 / 5 | 97.1% |
| Inglés → Chino | 4.84 / 5 | 96.9% |
| Inglés → Japonés | 4.77 / 5 | 95.3% |
Tap and speak in English
Tap to start
2. ¿Funciona Apple Live Translation en llamadas telefónicas?
Apple Live Translation maneja llamadas telefónicas en iPhones recientes y Samsung Galaxy AI ofrece una función comparable en llamadas. Ambos son buenos en lo que hacen, y para una llamada de iPhone a iPhone en un idioma compatible son la opción más conveniente disponible porque no hay nada que instalar.
Su límite es la cobertura, no la calidad. Ambos requieren un teléfono reciente de ese fabricante específico, ambos están restringidos a los conjuntos de idiomas que esos fabricantes envían, y, fundamentalmente, ambos ponen la capacidad en su dispositivo en lugar de en la línea. Eso está bien para llamar a un amigo con el mismo teléfono. No ayuda cuando necesita comunicarse con una centralita de clínica, un propietario, la recepción de un hotel o un proveedor cuyo teléfono de oficina tiene una década de antigüedad. Esas llamadas son la razón por la que la mayoría de las personas buscan un producto de llamadas traducidas en primer lugar.
3. ¿Por qué la calidad del audio de las llamadas telefónicas es mala y reduce la precisión?
Una llamada telefónica se codifica con ITU-T G.711, que muestrea a 8 kHz y transmite aproximadamente de 300 Hz a 3400 Hz. La banda descartada no está vacía. El trabajo de fonética acústica del laboratorio de fonética de la University of Oxford sitúa los picos de energía de /s/ en aproximadamente 4500 Hz y 7500 Hz, completamente por encima del límite telefónico, razón por la cual la /s/ de banda limitada se malinterpreta sistemáticamente como /sh/. La física predice que el audio telefónico debería ser más difícil. ITU-T G.711 · University of Oxford Phonetics Laboratory
Para probar si esa predicción se mantiene en la salida, produjimos dos versiones de cada clip. Una es la grabación original de 16 kHz. La otra es el mismo archivo remuestreado a 8 kHz con filtrado anti-aliasing, cuantificado con ley mu G.711, y luego decodificado de nuevo en el contenedor original de 16 kHz, de modo que ambos archivos son idénticos en formato y ningún sistema puede ramificarse en la frecuencia de muestreo. La energía por encima de 3.4 kHz cae del 14-22% de la señal a aproximadamente el 3%, mientras que la sonoridad RMS no cambia, por lo que la comparación mide el ancho de banda y no el volumen.
Cada sistema se mantuvo dentro de 0.04 puntos de sí mismo. LiveLingo obtuvo un 97.2% en audio de micrófono y un 96.9% a través de la línea telefónica; Google 93.4% y 94.0%; Azure 91.7% y 91.8%; la línea base de Whisper 88.1% y 88.9%. El 88% de las celdas individuales recibieron una puntuación idéntica en ambas ramas. El ancho de banda telefónico destruye información real y la traducción moderna absorbe casi toda ella.
4. El reconocimiento se desvía aproximadamente un 2%, y la robustez varía 5x entre sistemas
Que la calidad se mantenga estable no significa que no haya ocurrido nada por debajo. Comparando la transcripción fuente que cada sistema produjo del archivo de banda ancha con la que produjo del archivo de línea telefónica, Google Cloud Speech-to-Text v2 cambió el 0.4% de las palabras reconocidas y la línea base de Whisper-large cambió el 2.0%, con el 96% y el 81% de las transcripciones respectivamente volviendo completamente inalteradas.
La comparación bruta exagera esto gravemente, y la razón merece ser expuesta porque es así como este tipo de números se equivocan. Whisper "alucina" frases hechas en el silencio final, emitiendo un texto estándar fijo al estilo de subtítulos de forma impredecible en cualquiera de las ramas. La salida en chino alterna entre escritura simplificada y tradicional al azar. El árabe difiere principalmente por la ortografía de la hamza. Antes de eliminar esto, la deriva aparente de Whisper medía 5.7%; después, es del 2.0%.
El hallazgo útil es que la robustez de banda estrecha difiere en aproximadamente 5x entre los reconocedores, lo cual es un efecto mucho mayor que la propia línea telefónica. El árabe y el indonesio fueron los que más se desviaron, alrededor del 5%, lo que concuerda con la predicción fricativa, e incluso allí la puntuación de fidelidad no se movió.
5. ¿La traducción con IA empeora en las llamadas telefónicas que en persona?
Porque la evidencia que se suele citar para ello mide otra cosa. En el artículo de Whisper (Radford et al., 2022), wav2vec 2.0 Large y Whisper Large V2 obtienen una tasa de error de palabras idéntica del 2.7% en el habla limpia leída de LibriSpeech. En el corpus telefónico de CallHome divergen a 34.8% y 17.6%. Esa brecha es real, grande y se ofrece rutinariamente como prueba de que el audio telefónico es el problema. Radford et al., 2022 · LDC CallHome
Pero CallHome no es solo de banda estrecha. Es una conversación espontánea, superpuesta, sin guion, entre personas que se conocen bien, densa en contracciones, falsos comienzos y conversaciones cruzadas. LibriSpeech es una persona leyendo un libro en voz alta. Cambiar dos variables a la vez no puede decirte cuál importó. Aislar el ancho de banda no encuentra casi nada, lo que significa que la penalización de CallHome es principalmente la otra variable.
Esa es la conclusión más útil, porque esos son los factores que realmente puedes controlar. Tomar turnos limpiamente, moverse a un lugar más tranquilo y dejar que cada orador termine hará más por una llamada traducida que cualquier preocupación sobre la calidad de la línea.
6. Lo que realmente diferencia a las aplicaciones de traducción de llamadas telefónicas
Dado que el ancho de banda no cuesta nada medible y los sistemas principales se encuentran a tres puntos de diferencia entre sí en pares fáciles, las diferencias que importan están en otro lugar: cuánto cae la calidad en su par de idiomas específico, si el producto puede alcanzar el número al que necesita llamar y cómo la llamada maneja los turnos.
El par de idiomas es la mayor palanca de calidad por un amplio margen, así que verifique su propio corredor en lugar de un promedio general. En cuanto al alcance, LiveLingo realiza la llamada traducida desde la aplicación a cualquier número móvil o fijo, por lo que el destinatario contesta una llamada telefónica ordinaria y no instala nada. Y en cuanto a la conducta, vale la pena saber si un producto se anuncia honestamente o clona su voz para ocultar que hay un traductor involucrado. livelingo.io/phone-call-translation
7. Lo que cubre esta prueba y lo que no
Los números anteriores están limitados por cuatro elecciones de diseño específicas. Declararlas no es una excusa para los resultados; es el alcance dentro del cual los resultados son válidos.
| Dimensión | Lo que se probó |
|---|---|
| Discurso fuente | Un corpus fijo de calidad de estudio, elegido para que ambas ramas reciban una entrada acústicamente idéntica con cero variación del hablante. Ambas ramas se publican arriba, por lo que cada número aquí puede ser derivado del mismo audio que usamos. Los clips están más claramente articulados que la conversación espontánea, lo que los convierte en el caso más favorable para el resultado de ancho de banda en la sección 3; la construcción del corpus está documentada en su totalidad en la página del método. |
| Evaluación | Tres jueces LLM de frontera, no evaluadores humanos. El 66% de las celdas de banda ancha obtuvieron un 5.0 perfecto, por lo que la rúbrica mide si el significado sobrevivió en lugar de la calidad detallada. |
| Canal | Limitación de banda G.711 y cuantificación mu-law solamente. La pérdida de paquetes, la fluctuación, el control automático de ganancia y la supresión de ruido no se modelan, y todos ocurren en llamadas reales. |
| Independencia | LiveLingo es nuestro producto y ocupó el primer lugar en ambos corpus. Una medición por rama, por lo que la varianza del juez de una ejecución a otra no se promedia. |
La lectura práctica: la clasificación en la sección 1 es una comparación limpia de igual a igual, ya que cada sistema recibió audio idéntico y evaluación idéntica. El resultado del ancho de banda en la sección 3 es la afirmación más sensible a la elección del corpus, y la replicación en el habla conversacional espontánea es el siguiente paso. Las derivaciones completas, la potencia estadística y los artefactos de medición que eliminamos están en el método completo y datos brutos.
Preguntas frecuentes
¿Qué tan precisa es la traducción de llamadas telefónicas?
En nuestra prueba de agosto de 2026, el mejor sistema obtuvo 4.85 de 5 (96.9%) en audio de línea telefónica en 120 enunciados en inglés traducidos al español, japonés, chino y alemán, calificados por tres jueces LLM de frontera independientes según una rúbrica de fidelidad de comprensión. Google Cloud Speech-to-Text v2 con Translate v3 obtuvo 4.70 (94.0%), Azure Speech Translation 4.59 (91.8%), y una línea base de Whisper-large más GPT-4o-mini 4.44 (88.9%). En pares de idiomas más difíciles como árabe, turco y vietnamita a destinos europeos y asiáticos, los mismos sistemas cayeron a 87.0%, 77.7%, 70.0% y 66.7% respectivamente.
¿Una línea telefónica hace que la traducción sea menos precisa que en persona?
Casi nada. Calificamos los mismos enunciados dos veces, una como audio de micrófono de banda ancha y otra después de pasar la grabación idéntica a través de un tramo telefónico G.711 simulado, y la fidelidad de comprensión se movió menos de 0.04 puntos en una escala de 0 a 5 para cada sistema probado. LiveLingo obtuvo un 97.2% en audio de micrófono y un 96.9% a través de la línea telefónica. El ancho de banda telefónico es una pérdida real de información, pero la traducción moderna absorbe casi toda ella.
¿Por qué la calidad del audio de las llamadas telefónicas es mala?
Una llamada telefónica estándar utiliza el códec ITU-T G.711, que solo transmite de 300 Hz a 3400 Hz y muestrea a 8 kHz. El habla humana transmite información útil muy por encima de eso: el sonido /s/ tiene picos de energía alrededor de 4500 Hz y 7500 Hz, completamente por encima del límite telefónico. Por eso el audio telefónico suena amortiguado y por qué la /s/ de banda limitada a menudo se malinterpreta como /sh/. Es una pérdida genuina, solo que es un problema mucho menor para los sistemas de voz modernos de lo que solía ser.
¿Funciona Apple Live Translation en llamadas telefónicas?
Sí, en iPhones recientes, y Samsung Galaxy AI ofrece una función comparable en llamadas. Ambos están limitados a teléfonos recientes de ese fabricante y a los idiomas que esos fabricantes admiten, y ambos requieren la función en su propio dispositivo en lugar de en la línea, por lo que ninguno ayuda cuando necesita llamar a una centralita de oficina, un teléfono fijo o alguien con un teléfono antiguo. LiveLingo realiza la llamada traducida desde la aplicación a cualquier número móvil o fijo y el destinatario no instala nada.
¿Qué sistema de traducción maneja mejor el audio telefónico?
Dos cosas los separan. En cuanto a la calidad de traducción a través de una línea telefónica, LiveLingo obtuvo un 96.9%, Google 94.0%, Azure 91.8% y una línea base de Whisper-large 88.9% en 120 enunciados. En cuanto a la robustez del reconocimiento bruto, la dispersión es mayor: cuando el mismo clip pasó por un tramo telefónico, Google Cloud Speech-to-Text v2 cambió solo el 0.4% de las palabras reconocidas, mientras que la línea base de Whisper cambió el 2.0%, una diferencia de 5x. Investigaciones publicadas muestran el mismo patrón a escala: en el corpus telefónico de CallHome, wav2vec 2.0 Large obtiene una tasa de error de palabras del 34.8% frente a Whisper Large V2 con un 17.6%, aunque ambos obtienen un 2.7% idéntico en el habla limpia leída.
¿Una mala conexión telefónica empeora la traducción?
El ancho de banda por sí solo no, pero la pérdida de paquetes, la fluctuación y el ruido de fondo son problemas separados y sí lo hacen. Nuestra prueba aisló el rango de frecuencia, manteniendo la sonoridad constante, por lo que mide la banda telefónica y nada más. Una llamada con interrupciones o mucho ruido de la calle degrada la traducción por las mismas razones que degrada a un oyente humano, y ninguna calidad de códec compensa el habla que el micrófono nunca capturó limpiamente.
El método completo, los resultados por idioma, la potencia estadística, las limitaciones y los artefactos de medición que eliminamos están documentados en livelingo.io/research/phone-line-bandwidth-method.