IA

xAI lanza Grok Voice Transcribe 2.0 con el doble de precisión y soporte multilingüe

xAI presentó Grok Voice Transcribe 2.0, su nuevo modelo de conversión de voz a texto accesible vía API. El sistema duplica la precisión de la versión anterior manteniendo la misma tarifa, e introduce mejoras drásticas en la detección de idioma y transcripción multilingüe.

Guardar
Compartir
Photo by Mariia Berezovsky / Unsplash

    La empresa de inteligencia artificial xAI ha anunciado el lanzamiento oficial de Grok Voice Transcribe 2.0, la versión más reciente de su modelo de procesamiento de audio a texto (speech-to-text). La nueva arquitectura promete duplicar la precisión de su antecesora en la transcripción de conversaciones complejas, mantenimiento de llamadas de soporte y comandos de voz de corta duración, manteniendo exactamente la misma estructura de precios para desarrolladores.

    El modelo está optimizado para procesar tanto archivos de audio grabados en lote como flujos de voz en tiempo real a través de su interfaz de programación de aplicaciones (API), situándose a la cabeza de benchmarks de la industria en entornos con ruido de fondo y compresión telefónica.

    Optimización multilingüe y procesamiento en tiempo real

    Las mejoras implementadas en Grok Voice Transcribe 2.0 abordan los principales desafíos de la conversión de voz a texto en escenarios reales:

    • Detección automática de idioma y comandos cortos: La tasa de error en frases breves e indicaciones de voz disminuyó drásticamente del 20,6% al 6,8%, permitiendo identificar el idioma de origen incluso sin contexto previo prolongado.
    • Transmisión e interoperabilidad vía API: Admite transcripción por lotes a través de archivos o enlaces, así como transmisión de audio en tiempo real mediante WebSockets, facilitando la integración en asistentes virtuales y centros de atención telefónica.
    • Herramientas de etiquetado sin costo adicional: Incluye marca de tiempo precisa a nivel de palabra, identificación automatizada de hablantes (diarización) y formateo inteligente para números, fechas, correos electrónicos y direcciones.

    Continuidad comercial y adopción en la industria

    El lanzamiento mantiene las tarifas de desarrollo sin incrementos: 0,10 dólares por hora de audio para procesamiento por lotes y 0,20 dólares por hora para transmisiones de voz en tiempo real, permitiendo a las aplicaciones existentes actualizar sus capacidades de manera automática.

    Empresas e integradores del sector han comenzado a adoptar el sistema dentro de plataformas de captura de video y herramientas de desarrollo, mientras que la tecnología de fondo continúa alimentando los asistentes conversacionales en productos del ecosistema corporativo y de consumo masivo de la firma.