Ir directamente a la información del producto
1 de 1

enjoyitstudios

CURSO PRODUCCIÓN MUSICAL EXPRESS ESTILO MAKINA - Clase 11 - Voz cantada, generación con IA, edición vocal, Trackspacer y desarrollo 65–97

CURSO PRODUCCIÓN MUSICAL EXPRESS ESTILO MAKINA - Clase 11 - Voz cantada, generación con IA, edición vocal, Trackspacer y desarrollo 65–97

Precio habitual €9,90 EUR
Precio habitual Precio de oferta €9,90 EUR
Oferta Agotado
Impuestos incluidos. Los gastos de envío se calculan en la pantalla de pago.
Cantidad
Ver todos los detalles

CLASE 11

La undécima clase del Curso Express de Producción Mákina supone un punto importante en el desarrollo de la producción. El proyecto ya ha alcanzado aproximadamente el compás 65, y la sesión comienza siguiendo una metodología que se ha repetido durante el curso: después de descansar los oídos, se vuelve a escuchar todo lo realizado para comprobar si las decisiones anteriores continúan funcionando con una percepción más fresca. La premisa es corregir únicamente aquello que realmente lo necesita y no forzar cambios sobre elementos que ya funcionan correctamente. 
Durante esta primera revisión se confirma que la voz Rap introducida anteriormente ya tiene suficiente potencia y funciona correctamente. Sin embargo, algunos de los pitidos y efectos habían quedado demasiado reducidos, por lo que se recupera ligeramente su presencia. También se continúa trabajando con pequeños fragmentos de la voz, desplazando palabras y sílabas, cambiando posiciones y reorganizando partes para conseguir un resultado más natural y rítmicamente interesante.
El verdadero punto de inflexión aparece al llegar al compás 65. Desde ahí hasta el compás 97 existen aproximadamente 32 compases de desarrollo musical. Los contras, refuerzos, armonías y melodía funcionan, pero mantener durante 32 compases una evolución fundamentalmente instrumental puede resultar demasiado largo. Aunque se podrían añadir efectos, paradas y pequeños detalles, se considera que esto no solucionaría completamente el problema de variedad. 
Por este motivo vuelve a plantearse la posibilidad de utilizar una voz cantada. La idea consiste en utilizar aproximadamente 16 compases vocales antes de dejar protagonismo a la melodía, combinando una zona con carácter de estrofa y otra más cercana al estribillo. De esta manera, el desarrollo armónico adquiere una evolución mucho más variada.
A partir de aquí comienza uno de los experimentos más importantes de la clase: crear una voz femenina mediante inteligencia artificial a partir de una idea melódica previamente imaginada. Se graba vocalmente una referencia de la melodía utilizando sílabas y se utiliza Suno para intentar convertirla en una interpretación femenina completa.
Para definir el resultado se plantea una canción Mákina a 165 BPM, en Sol mayor, con una estrofa de 16 compases y un estribillo de otros 16, manteniendo la melodía proporcionada como referencia. La letra debe estar cantada por una chica en inglés y transmitir un mensaje relacionado con compartir energías positivas a través de una música contundente y rápida para sacar lo mejor de uno mismo. Además, se especifica claramente que no debe contener elementos de Reggaetón, Trap ni estilos urbanos. 
Se genera también la letra y posteriormente se utiliza la función de Cover para intentar mantener la referencia melódica. La primera propuesta no convence, pero la segunda genera una reacción completamente diferente: la interpretación vocal, el carácter y la musicalidad encajan con la dirección que estaba buscando la producción.
Una vez encontrada una generación interesante comienza un proceso fundamental: la IA proporciona material, pero ese material todavía debe convertirse en parte de la producción.
La voz se extrae y se abre en Suno Studio para trabajar con los stems. Se intenta disponer tanto de la versión procesada como de una versión seca, sin efectos, ya que esta última permitirá realizar posteriormente un tratamiento vocal propio.
Antes de integrar la voz se advierte de un problema habitual en este tipo de herramientas: aunque se especifique un BPM concreto, la generación no siempre mantiene exactamente el tempo solicitado. Por esta razón, una vez importado el audio al proyecto y convertida su frecuencia de muestreo, se comprueba manualmente su sincronización. 
Se buscan puntos de anclaje y se utiliza Time Stretch para corregir pequeñas desviaciones. Además, se realizan cortes en puntos avanzados para evitar que cualquier pequeño error temporal se vaya acumulando a medida que avanza la voz. Finalmente se comprueba el resultado mediante claqueta y se confirma que la interpretación queda correctamente sincronizada con la rejilla. 
A continuación se eliminan los elementos innecesarios y se conservan únicamente las Lead Vocals, trasladándolas a la zona real de trabajo alrededor del compás 65. En este momento se descubre que Suno ha generado más voz y más duración de la solicitada. Sin embargo, esto no supone necesariamente un problema: proporciona más material del que posteriormente se pueden seleccionar los mejores fragmentos. 
Al escuchar la voz dentro de la producción se produce una decisión artística importante. Inicialmente se había contemplado que el tema no fuese demasiado cantado, pero esta nueva interpretación cambia el planteamiento porque sí funciona dentro de la identidad de la canción. Por tanto, se decide continuar con ella.
Se selecciona la versión seca y se crea una pista denominada “Voz Cantada 1”. Sobre ella se aplica el tratamiento vocal propio, utilizando una cadena de presets, compresión y un De-Esser configurado para voz femenina. 
El siguiente problema ya no es sonoro, sino estructural. La canción generada por IA tiene su propia organización de estrofa y estribillo, pero esa estructura no coincide exactamente con la estructura del tema Mákina que se está produciendo. Mantener toda la segunda parte de la estrofa impediría que el estribillo coincidiese correctamente con la entrada de la melodía.
Por ello comienza una reconstrucción manual del material vocal. Se realizan cortes, se seleccionan frases y se desplazan diferentes fragmentos. Una de las frases utilizadas es “Let the music”, que sirve para preparar determinados puntos de entrada. Se comprueba cuidadosamente dónde empieza la melodía —especialmente alrededor de los compases 81 y 97— para adaptar la voz a esos puntos estructurales.
Finalmente se toma una decisión clara: eliminar la segunda parte de la estrofa generada e introducir antes el estribillo, adaptando la canción creada por IA a la estructura propia de la producción. El material descartado no se elimina definitivamente, sino que se conserva apartado por si posteriormente puede resultar útil. 
Una escucha ampliada desde los compases anteriores confirma que la nueva dirección funciona especialmente bien. Sin embargo, aparece un nuevo problema: una de las frecuencias de otro elemento de la producción entra en conflicto con la voz.
Para solucionarlo se utiliza Trackspacer. En lugar de bajar permanentemente todo el volumen del sonido que molesta, la voz se utiliza como señal de referencia para que Trackspacer reduzca dinámicamente únicamente las frecuencias que entran en conflicto cuando la voz está presente. De esta manera se crea espacio para la cantante sin vaciar innecesariamente el resto del sonido. 
Después se continúan añadiendo pequeños detalles de arreglo. Se eliminan elementos en determinados momentos para dejar la voz prácticamente sola, consiguiendo que tenga más protagonismo y que la siguiente entrada gane impacto. Posteriormente reaparecen progresivamente contras, acordes y demás elementos.
También se recupera un Down FX, que se adapta desde sus 128 BPM originales hasta los 165 BPM del proyecto. Se procesa mediante ecualización, cadena de presets y reducción de volumen para utilizarlo como elemento de transición.
La parte final de la clase vuelve a centrarse en la voz alrededor del compás 81. Se buscan frases concretas que puedan generar un momento especialmente reconocible antes de la melodía. Aparecen fragmentos como “In your power, in your soul” y “Feel the power”, que se cortan, desplazan y alargan para intentar hacerlos coincidir con la estructura.
Aquí aparece una limitación importante: cuando una frase vocal se estira demasiado mediante Time Stretch, empieza a percibirse que el audio ha sido forzado. Por ello se realizan diferentes pruebas para encontrar un equilibrio entre la duración necesaria y la naturalidad de la interpretación. 
La clase termina dejando establecida la idea general de esta sección vocal, aunque todavía queda pendiente perfeccionar algunos de estos alargamientos. En la siguiente sesión habrá que corregir especialmente el fragmento “In the power / in your soul”, buscando que el Time Stretch resulte menos evidente y valorando recursos como el vibrato para disimular la manipulación. 
Puntos de Conocimiento
1. Revisar después de descansar los oídos
•    Una producción puede percibirse de forma diferente después de unas horas. 
•    La fatiga auditiva afecta al criterio. 
•    Conviene escuchar desde el principio antes de continuar. 
•    Principio: corregir únicamente aquello que realmente lo necesita. 
•    No modificar algo que funciona simplemente por seguir trabajando. 
2. Evitar secciones excesivamente largas
•    Problema: 32 compases con un planteamiento similar pueden resultar monótonos. 
•    Los FX y pequeños arreglos ayudan, pero pueden no ser suficientes. 
•    Solución planteada: introducir una sección vocal. 
•    Objetivo: aumentar la variedad sin abandonar la misma progresión armónica. 
3. Dividir un desarrollo de 32 compases
La propuesta pasa a ser:
1.    Primera parte vocal. 
2.    Desarrollo de la estrofa. 
3.    Entrada de elementos de estribillo. 
4.    Aparición de la melodía principal. 
Así se mantiene el mismo recorrido armónico, pero cambia la percepción estructural.
4. Utilizar una idea cantada como referencia para IA
•    No es necesario disponer inicialmente de una cantante. 
•    Se puede grabar una referencia mediante sílabas. 
•    Lo importante es transmitir la melodía deseada. 
•    La herramienta generativa se utiliza posteriormente para buscar una interpretación vocal. 
5. Definir claramente las condiciones de generación
En esta clase se especifican:
•    Estilo: Mákina. 
•    Tempo: 165 BPM. 
•    Tonalidad: Sol mayor. 
•    Voz: Femenina. 
•    Idioma: Inglés. 
•    Estrofa: 16 compases. 
•    Estribillo: 16 compases. 
•    Concepto: Energía positiva a través de música rápida y contundente. 
•    Exclusiones: Reggaetón, Trap y estilos urbanos. 
6. Generar varias opciones antes de decidir
•    La primera generación puede no funcionar. 
•    Una segunda propuesta puede cambiar completamente el resultado. 
•    Principio: no valorar la utilidad de una herramienta generativa basándose únicamente en el primer resultado. 
7. La IA genera material; el productor construye la canción
La generación no se utiliza directamente como producto terminado.
Después hay que:
•    Extraer. 
•    Escuchar. 
•    Seleccionar. 
•    Cuantizar. 
•    Cortar. 
•    Reordenar. 
•    Procesar. 
•    Mezclar. 
•    Adaptar a la estructura. 
La decisión final continúa siendo del productor.
8. Trabajar con una voz seca
•    La versión generada puede incorporar efectos. 
•    Extraer una versión Dry proporciona mayor control. 
•    Permite aplicar posteriormente el tratamiento vocal propio. 
•    También puede conservarse la versión procesada como referencia. 
9. No confiar automáticamente en el BPM generado
•    Una IA puede recibir la instrucción de trabajar a 165 BPM. 
•    Esto no garantiza una sincronización perfecta. 
•    Las pequeñas desviaciones se acumulan con el tiempo. 
•    Comprobación obligatoria: rejilla y claqueta. 
10. Cuantizar una voz generada mediante puntos de anclaje
•    Buscar un punto inicial fiable. 
•    Comprobar zonas posteriores. 
•    Crear anclajes. 
•    Aplicar Time Stretch. 
•    Realizar cortes si es necesario. 
•    Volver a comprobar con claqueta. 
El objetivo no es robotizar la interpretación, sino conseguir que su estructura temporal coincida con el proyecto.
11. Evitar acumulación de errores temporales
Un pequeño desfase al principio puede convertirse en un problema importante muchos compases después.
Por eso se utilizan varios puntos de comprobación a lo largo del audio en lugar de confiar únicamente en el comienzo. 
12. Tener más material vocal del necesario puede ser útil
•    Suno genera más duración de la solicitada. 
•    Inicialmente parece un error. 
•    Sin embargo, proporciona más frases para elegir. 
•    Principio: el material sobrante puede convertirse en una biblioteca de recursos. 
13. Cambiar una decisión artística cuando aparece algo mejor
Inicialmente el tema no estaba planteado como una producción especialmente cantada. La nueva voz cambia esa decisión.
Principio: una producción debe permanecer abierta a cambios cuando aparece una idea que mejora claramente el resultado.
14. Tratamiento inicial de voz femenina
•    Cadena de presets. 
•    Compresión. 
•    De-Esser específico. 
•    Ajuste de nivel. 
•    Escucha dentro del contexto. 
La prioridad inicial es conseguir una voz controlada y suficientemente presente para poder tomar decisiones estructurales.
15. No aceptar la estructura generada por IA como definitiva
La IA propone:
Estrofa → continuación → estribillo
Pero la producción necesita otra organización.
Por tanto:
se corta → se reorganiza → se adelanta el estribillo → se adapta a la estructura propia.
16. La estructura del tema manda sobre la generación
•    La voz debe adaptarse al tema. 
•    El tema no tiene por qué adaptarse a la canción generada. 
•    Los compases 81 y 97 actúan como referencias importantes. 
•    Las frases se reorganizan alrededor de esos puntos. 
17. Conservar material descartado
•    Una parte que ahora no funciona puede servir posteriormente. 
•    En lugar de eliminarla definitivamente, se aparta. 
•    Ventaja: permite recuperar frases sin tener que volver a generar material. 
18. Utilizar frases vocales como elementos estructurales
Fragmentos como “Let the music” no funcionan únicamente como letra. También pueden convertirse en:
•    Avisos. 
•    Enlaces. 
•    Preparaciones. 
•    Hooks. 
•    Elementos rítmicos. 
19. Trackspacer para crear espacio dinámico
•    Problema: Otro sonido comparte frecuencias con la voz. 
•    Solución: Trackspacer. 
•    La voz controla el procesamiento. 
•    Cuando canta, se reduce el rango conflictivo del otro elemento. 
•    Cuando deja de cantar, el sonido recupera su contenido original. 
20. Sidechain frecuencial frente a reducción de volumen
No siempre interesa bajar completamente un instrumento.
Si únicamente determinadas frecuencias molestan a la voz, es más preciso reducir solo esas frecuencias y solo cuando existe conflicto.
Esto permite conservar mayor energía en la mezcla.
21. Dejar la voz sola para aumentar el impacto
•    Se eliminan temporalmente otros elementos. 
•    La voz queda expuesta. 
•    Después reaparecen contras, acordes y ritmo. 
•    Resultado: la siguiente entrada parece más potente. 
Nuevamente, quitar elementos puede generar más energía que añadirlos.
22. Adaptar FX de otros tempos
•    FX original: 128 BPM. 
•    Proyecto: 165 BPM. 
•    Time Stretch. 
•    EQ. 
•    Cadena de procesamiento. 
•    Volumen. 
Una biblioteca de efectos puede reutilizarse en producciones de tempos muy diferentes.
23. Time Stretch vocal y naturalidad
•    Un pequeño estiramiento puede funcionar. 
•    Un estiramiento excesivo empieza a resultar audible. 
•    Las consonantes y finales de palabra pueden delatar especialmente el procesamiento. 
•    Objetivo: encontrar el límite entre duración y naturalidad. 
24. El vibrato como posible recurso correctivo
Cuando una nota vocal debe mantenerse durante más tiempo, el vibrato puede ayudar a que la extensión parezca más musical y menos estática.
En esta clase queda planteado como una posible solución para desarrollar posteriormente.
25. Combinar IA y producción tradicional
La Clase 11 muestra un flujo híbrido:
Idea humana → melodía de referencia → IA → selección → extracción → edición → cuantización → procesamiento → reconstrucción estructural → mezcla.
La herramienta generativa se incorpora dentro del flujo tradicional de producción, no lo sustituye.
26. La respuesta emocional también forma parte del criterio
Durante la sesión aparece varias veces una reacción de “piel de gallina” al escuchar determinadas partes.
Más allá de la técnica, esa respuesta sirve como indicador de que una combinación de melodía, voz, armonía y estructura está transmitiendo algo.
La producción no se evalúa únicamente mediante parámetros técnicos.
27. Resultado de la Clase 11
Al finalizar la sesión queda establecido:
•    Revisión completa del tramo hasta el compás 65. 
•    Corrección de pitidos. 
•    Reorganización de fragmentos Rap. 
•    Análisis del desarrollo 65–97. 
•    Decisión de incorporar voz femenina. 
•    Grabación de una referencia melódica. 
•    Generación vocal mediante Suno. 
•    Creación de letra y Prompt. 
•    Selección de una generación. 
•    Extracción de Lead Vocals. 
•    Obtención de versión seca. 
•    Conversión de frecuencia de muestreo. 
•    Cuantización mediante anclajes y Time Stretch. 
•    Comprobación con claqueta. 
•    Creación de “Voz Cantada 1”. 
•    Compresión y De-Esser. 
•    Reconstrucción de estrofa y estribillo. 
•    Adaptación de la voz a los compases 81 y 97. 
•    Uso de “Let the music” como recurso. 
•    Trackspacer para liberar espacio frecuencial. 
•    Vacíos para potenciar la voz. 
•    Incorporación de Down FX 3. 
•    Experimentación con “In your power, in your soul” y “Feel the power”. 
•    Primeros alargamientos vocales mediante Time Stretch. 
La Clase 11 representa además un cambio importante en la identidad de la producción. Hasta este momento las voces se utilizaban principalmente como Rap, samples o efectos. Ahora aparece por primera vez una voz femenina cantada con función melódica y estructural, capaz de convertirse en uno de los elementos protagonistas de la canción.
La idea fundamental de esta sesión es que las herramientas de inteligencia artificial pueden generar un material muy potente, pero sigue siendo necesario producirlo. La voz obtenida no se acepta tal como sale de la herramienta: se selecciona, se extrae, se sincroniza, se corta, se reorganiza, se procesa y se adapta a una estructura diseñada previamente. La IA aporta una interpretación que antes no existía; el trabajo del productor consiste en convertir esa interpretación en una parte coherente de su propia obra.