Estudio Austral

Glosario

Text-to-audio (texto a audio)

Text-to-audio (o “texto a audio”) es la generación de sonido a partir de una descripción escrita: escribes lo que quieres oír y un modelo produce el audio. Es el mecanismo que hay detrás de casi todas las herramientas de música con IA —de Suno y Udio a Stable Audio— y abarca música, efectos de sonido y, en el caso de la voz, habla y canto.

La mecánica

El modelo se entrena con pares de audio y descripciones, y aprende a asociar palabras con características sonoras: “guitarra criolla”, “90 bpm”, “voz cercana”. Cuando le das un texto, traduce esa descripción en audio coherente con lo aprendido. Es el mismo principio que el texto-a-imagen, aplicado al sonido: la calidad del resultado depende enormemente de la especificidad de la descripción —el prompt. Conviene distinguirlo de otras técnicas cercanas: el text-to-speech genera voz hablada a partir de texto, mientras que el text-to-audio abarca también música y efectos; y a diferencia de la clonación de voz, no imita una voz concreta, sino que crea sonido nuevo a partir de una descripción general.

Por qué importa al producir

Saber que la herramienta traduce lenguaje a sonido explica por qué el vocabulario con que describes importa tanto. Cuanto más preciso y “sonoro” sea tu texto —géneros, instrumentos, descriptores de producción—, más control tienes sobre lo que sale. El text-to-audio convierte tu capacidad de describir sonido en tu capacidad de dirigirlo: es, en la práctica, una nueva forma de instrumento.

En una frase

Text-to-audio es generar sonido a partir de palabras —y por eso saber describir con precisión lo que quieres oír es la habilidad central para usar bien la música con IA.

Relacionado: música generativa · clonación de voz · prompts para música