ElevenLabs presenta los modelos de voz v4 con clonación de voz más rápida y mayor compatibilidad lingüística
ElevenLabs lanzó el lunes dos nuevos modelos de voz: ElevenLabs v4 y v4 Turbo. Los modelos ofrecen un mayor control sobre la expresión vocal, una menor latencia para los agentes de voz y compatibilidad con más de 90 idiomas.
Nueva arquitectura y clonación de voz más rápida
Tras lanzar su modelo v3 el año pasado y presentar un avance de su sucesor en un evento celebrado en Varsovia a principios de este año, ElevenLabs ha introducido una nueva arquitectura para la generación v4. El diseño actualizado proporciona un control más preciso y una clonación de voz más rápida, lo que permite a los usuarios replicar una voz con solo 10 segundos de audio.
Mejor expresión y comprensión del contexto
Para aplicaciones creativas, v4 mantiene la identidad de la voz de forma más consistente en pasajes largos. También tiene en cuenta el contexto textual al leer en voz alta, lo que permite realizar cambios de expresión más adecuados.
ElevenLabs introdujo etiquetas de expresión integradas con v3. En v4, esta función se ha ampliado para que los usuarios puedan combinar varias etiquetas y el modelo las siga de forma secuencial.
Compatibilidad con más de 90 idiomas
El modelo anterior admitía 70 idiomas, mientras que v4 amplía la cobertura a más de 90. Según ElevenLabs, las mayores mejoras de calidad se observaron en japonés, portugués de Brasil, chino mandarín y cantonés.
Menor latencia para agentes de voz empresariales
ElevenLabs ha ampliado rápidamente su negocio de llamadas empresariales durante el último año, y las grandes empresas representan ahora más del 55 % de su negocio. La empresa afirma que v4 es especialmente adecuado para los agentes de voz, ya que su menor latencia permite conversaciones más fluidas y naturales.
El modelo puede comenzar a generar audio en cuanto el modelo de lenguaje de gran tamaño subyacente empieza a producir una respuesta. También puede responder de forma diferente ante confrontaciones, situaciones que se agravan y llamadas en espera, lo que permite resolver los problemas de manera más eficaz.
Crece la competencia en la IA de voz
La competencia en el mercado de los modelos de voz se ha intensificado a medida que empresas emergentes como Cartesia, Deepgram, Fish Audio, Boson y WellSaid Labs desarrollan sistemas cada vez más expresivos. Grandes empresas tecnológicas como Google y OpenAI también han seguido mejorando sus modelos de voz.
Financiación, crecimiento de los ingresos y expansión
A principios de este año, ElevenLabs recaudó 500 millones de dólares en una ronda de financiación liderada por Sequoia que valoró la empresa en 11.000 millones de dólares. Desde entonces, han surgido rumores sobre una ronda posterior que podría duplicar su valoración hasta los 22.000 millones de dólares.
La tasa anualizada de ingresos de la empresa ha aumentado desde aproximadamente 330 millones de dólares a principios de año hasta más de 600 millones de dólares. ElevenLabs también ha intensificado las contrataciones en mercados como India, Europa y Brasil, elevando su plantilla a más de 800 empleados.
Posibles planes de salida a bolsa
El cofundador y director ejecutivo Mati Staniszewski afirmó recientemente que ElevenLabs tiene como objetivo realizar una oferta pública inicial “en los próximos años”, aunque no proporcionó un calendario específico.
