El creador de música con IA Suno ahora crea letras habladas

Suno se está diversificando del mundo de la música con inteligencia artificial y lanzando una nueva función que genera sonidos hablados basados ​​en textos o descripciones solicitados. El discurso ya está disponible Está en versión beta pública en las plataformas web y móviles de Suno y te permite crear voces en off y música de fondo para acompañarlas al mismo tiempo.

"La música siempre estará en el corazón de Suno y de lo que construimos. Al mismo tiempo, nuestra visión siempre se ha extendido a otras formas de expresión humana", dijo el director de producción de Suno. Jack Brody dijo En el anuncio. "Hoy, estamos ampliando lo que es posible en Suno con Speech: el primer modelo de audio que genera sonido y música juntos como una pista cohesiva".

El habla generada por IA no es nueva, DeepMind ha estado experimentando con ella Aprendizaje profundo para síntesis de voz Durante una década, Adobe Suno tiene una herramienta de conversión de texto a voz y ElevenLabs se ha convertido en una de sus plataformas más populares desde su lanzamiento en 2023. Suno acaba de lanzarse al ring, probablemente en un intento de diversificar la plataforma, ya que su generador de música ha atraído muchas demandas.

Combinar música de IA con voces generadas es la versión de Suno de las herramientas de conversión de texto a voz. Es opcional, lo que significa que puedes apagar fácilmente la música de fondo con un interruptor si solo quieres un habla clara, pero la idea es que complementará ciertos casos de uso para la palabra hablada generativa, como tener una banda sonora relajante para poemas o algo más enérgico para voces en off dramáticas y discursos alentadores.

Para usar la función, seleccione la pestaña Crear y vaya a la opción Discurso. Hay dos modos: modo simple, que le permite describir lo que desea crear a través del cuadro de diálogo provisto (como "El capitán pirata reúne a su tripulación"), o modo avanzado, que le permite agregar texto personalizado si ya sabe exactamente lo que quiere que diga. La configuración avanzada también le permite ajustar el género de la voz de la IA, el patrón de voz y la diversidad de cada generación de voz. La duración máxima del discurso es de unos ocho minutos.

Suno admite que la función está lejos de ser perfecta, pero dice que seguirá mejorando el habla en términos de comentarios de los usuarios. "Beta realmente significa beta", dijo Brody. "A veces, los acentos británicos pueden viajar hasta Australia y regresar. Las pausas dramáticas pueden ser bastante dramáticas. Seguramente descubrirás usos para esto en los que nunca habías pensado".