CLASE 12
La duodécima clase del Curso Express de Producción Mákina continúa directamente el trabajo vocal y estructural desarrollado en la Clase 11. A estas alturas, la esencia de la producción está prácticamente construida: ya existe una estructura sólida, se ha incorporado la voz femenina generada con Suno y se dispone de esa voz en formato Dry, lo que permite procesarla libremente sin depender de los efectos aplicados por la propia inteligencia artificial. El objetivo principal de esta sesión es terminar de desarrollar la zona comprendida entre los compases 65 y 97 y comenzar a construir uno de los momentos más importantes de toda la producción: la parada principal.
La primera parte se concentra en resolver un problema que había quedado pendiente en la clase anterior: el final de una frase vocal resulta demasiado corto. Se vuelve inicialmente a Suno para comprobar si alguna generación anterior contiene una versión más larga de esa misma palabra, pero el material disponible presenta glitches y no proporciona exactamente la terminación necesaria. Por ello se decide trabajar directamente sobre la voz original.
La frase seleccionada contiene la terminación “in your soul”. Ya se había utilizado Time Stretch para alargarla, pero ahora se profundiza en su edición mediante VariAudio. Al extender progresivamente el fragmento se localiza una zona de la interpretación que permite prolongar la nota. La combinación de Time Stretch y VariAudio consigue que la duración aumente manteniendo una sensación algo más humana y orgánica. Se valora incluso añadir vibrato únicamente al final, aunque finalmente se decide mantener la nota más plana.
Para tener mayor control sobre esta parte manipulada se crea una pista vocal independiente, destinada exclusivamente a los fragmentos estirados. Esta separación permite modificar volumen, entrada y efectos sin afectar al resto de la interpretación. Sobre ella se incrementan especialmente el Delay y el Feedback, consiguiendo que la cola ayude a prolongar perceptivamente la frase.
También se detecta una consonante “P” demasiado agresiva. En lugar de aplicar un procesamiento complejo sobre toda la voz, se actúa únicamente sobre ese pequeño ataque mediante un Fade In, suavizando la consonante sin alterar el resto de la interpretación.
A continuación se crea una variante de uno de los pitidos/FX existentes. Se elimina su procesamiento anterior y se utiliza un Ping Pong Delay completamente Wet, con bastante Feedback y sincronizado a negras. El objetivo es que la repetición del efecto rellene el espacio que quedaba demasiado corto justo antes de la entrada vocal.
Con la voz ya mucho mejor integrada, el trabajo avanza hacia los compases 81–97, justo antes de la parada principal. Se busca un nuevo Riser sutil que acompañe esta transición. El efecto seleccionado termina aproximadamente en Re, mientras que interesa que resuelva en Sol. Se comparan dos posibilidades: subirlo cinco semitonos o bajarlo siete semitonos. La elección no se basa únicamente en que ambas opciones puedan conducir a Sol, sino también en cuál conserva mejor el timbre del efecto. Finalmente se utiliza la transposición de +5 semitonos y se completa con Delay y EQ.
El siguiente paso consiste en crear un “Bass Break” específico para la parada. Se duplica la pista de bajo, se eliminan las partes innecesarias y se modifica la síntesis para obtener un carácter de bajo octavado Remember. En este caso no se considera necesario aplicar inicialmente Sidechain. Posteriormente se automatiza el Cutoff mediante Filtrator, haciendo que el bajo comience abierto y vaya cerrándose progresivamente hasta prácticamente desaparecer.
Después se recupera otro fragmento vocal destinado específicamente a esta sección, creando una “Voz Break”. Durante el proceso se detecta que una transformación anterior del audio no había quedado correctamente, por lo que se descarta y se conserva únicamente el material útil. La voz recibe una primera ecualización y queda preparada para integrarse posteriormente en la parada.
Construcción armónica de la parada
A partir de este punto comienza uno de los bloques más creativos de toda la clase: la construcción de la atmósfera armónica y cinematográfica de la parada.
En lugar de utilizar directamente un preset existente, se decide crear un Pad Break propio mediante Sylenth. Se configura una polifonía de ocho voces, se elimina el Retrigger, se utiliza Detune y posteriormente se aplica la cadena habitual de presets.
Para construir la armonía se analiza nuevamente el movimiento del bajo, que sigue la progresión:
Sol – Re – Mi – Do
El Pad se programa siguiendo esa misma progresión y recibe tratamiento adicional, incluyendo refuerzo de graves. Su función es convertirse en la capa que sustenta armónicamente toda la parada. La melodía principal se mutea temporalmente para comprobar que la sección pueda funcionar por sí misma antes de introducirla.
Aunque el Pad creado manualmente resulta convincente, se realiza una búsqueda adicional de material atmosférico y cinematográfico. Se exploran Pads, sonidos de Film Score y posteriormente Strings orquestales. Tras comparar diferentes opciones, se encuentra un sonido de cuerdas especialmente interesante en Sol mayor, que proporciona inmediatamente un carácter mucho más emocional y cinematográfico.
El resultado se describe como prácticamente “de película”, por lo que se decide combinar ese material con el Pad creado anteriormente. Se establecen así diferentes funciones:
Pad Strings → componente emocional y orquestal.
Pad Sub → soporte grave y profundidad.
El material orquestal no incluye MIDI, por lo que la armonía debe detectarse manualmente mediante escucha. Se analizan los cambios de nota y se identifican progresivamente diferentes fundamentales, entre ellas Mi y Do, valorando posteriormente la introducción de Re. A partir de esta información se construye manualmente el soporte subgrave que acompaña a los Strings.
Sobre este Pad/Sub se crean además automatizaciones para controlar su evolución. Mediante Filtrator se programa un cierre progresivo del filtro hasta conseguir que el sonido prácticamente desaparezca.
Con la base armónica ya construida se empieza a imaginar la dimensión final de la parada: explosiones, subidas, impactos y nuevos efectos. Se incorpora un primer golpe de gran tamaño, aunque posteriormente se reduce su volumen para evitar que resulte excesivo.
En este momento se verbaliza una idea fundamental para el desarrollo de la canción: la parada principal es una de las partes más importantes de toda la obra y debe resultar espectacular. Una vez resuelta esta sección, gran parte del recorrido posterior será más técnico porque reutilizará sonidos y conceptos ya creados.
Reconstrucción avanzada de una vocal generada con IA
La última parte de la clase vuelve a plantear un problema similar al inicial, esta vez sobre la frase “Feel the power, feel the light”.
La terminación vuelve a quedarse demasiado corta. Se revisa el material original mediante VariAudio y se comprueba que no existe realmente una prolongación natural suficiente. Además, el audio parece contener un Sidechain incorporado, lo que dificulta todavía más alargarlo porque el bombeo forma parte del propio archivo.
Ante la ausencia de material adicional, se plantea utilizar Delay. Se duplica nuevamente la pista y se selecciona únicamente la terminación que interesa. Durante este proceso aparece además un pequeño artefacto característico del audio generado por IA, que se elimina mediante edición.
Sobre la nueva pista se aplica un Ping Pong Delay 100 % Wet con bastante Feedback, consiguiendo una primera sensación de prolongación.
Pero la solución va todavía más lejos. Se plantea realizar lo que durante la clase se denomina “ingeniería de audio”: utilizar una única sílaba de la interpretación original y reconstruir manualmente una vocal más larga.
El fragmento se duplica y se estira aproximadamente al doble mediante Time Stretch. Esto crea un nuevo problema: como el Sidechain estaba incorporado al propio audio, al duplicar la duración su bombeo original deja de corresponder con el nuevo tiempo.
Por tanto, también se reconstruye manualmente ese comportamiento. Si originalmente el bombeo funcionaba aproximadamente a negras, al duplicar la duración debe reinterpretarse para funcionar a blancas. De esta forma se intenta recrear la sensación original sobre una vocal que ahora tiene una duración completamente diferente.
Se experimenta incluso con extensiones todavía mayores, pero se llega a un punto donde el resultado resulta excesivamente artificial. Esa opción se descarta y se conserva una versión más equilibrada. Finalmente se reconstruye el Sidechain, se combina con el Feedback del Delay y se comprueba todo dentro de la producción.
El experimento funciona.
La clase termina retirando provisionalmente algunos elementos porque el siguiente objetivo será conseguir que la melodía cobre protagonismo absoluto.
Puntos de Conocimiento
1. Descargar voces generadas en Dry
• Permite eliminar la dependencia del procesamiento de la IA.
• Facilita utilizar nuestros propios compresores, delays, reverbs y EQ.
• Proporciona mayor control de mezcla.
• Convierte la generación en verdadero material de producción.
2. Buscar primero material alternativo antes de reconstruir
Antes de manipular excesivamente una voz:
1. Revisar generaciones anteriores.
2. Buscar otra toma de la misma frase.
3. Comprobar si existe una terminación más larga.
4. Solo si no existe, reconstruirla.
3. Combinar Time Stretch y VariAudio
• Time Stretch: proporciona duración.
• VariAudio: permite trabajar más detalladamente la interpretación.
• Objetivo: conseguir una extensión menos artificial.
• La combinación puede ofrecer un resultado más orgánico que utilizar únicamente Time Stretch.
4. Trabajar únicamente la parte problemática
No es necesario procesar toda la voz cuando el problema afecta solo a una palabra o sílaba.
Se puede:
• Cortar el fragmento.
• Duplicar pista.
• Procesarlo independientemente.
• Volver a integrarlo.
5. Crear pistas vocales específicas para efectos
Separar una terminación permite controlar independientemente:
• Volumen.
• Delay.
• Feedback.
• Mix.
• Entrada.
• Automatización.
Esto proporciona mucha más precisión.
6. Corregir consonantes mediante edición
Una consonante agresiva no siempre necesita De-Esser o compresión.
En esta clase una “P” problemática se suaviza simplemente mediante Fade In.
La edición directa puede ser más precisa que un procesador global.
7. Delay como extensión de una frase
El Delay no funciona únicamente como efecto espacial.
También puede:
• Prolongar una palabra.
• Rellenar un hueco.
• Disimular un corte.
• Conectar una voz con la siguiente sección.
8. Ping Pong Delay completamente Wet
• Señal directa eliminada.
• Solo escuchamos las repeticiones.
• Feedback elevado.
• Aplicación especialmente útil para convertir un fragmento en FX.
9. Afinar un Riser según su resolución
El Riser seleccionado termina aproximadamente en Re.
Para llevarlo a Sol existen dos posibilidades:
• +5 semitonos.
• −7 semitonos.
Ambas pueden resolver tonalmente, pero producen un timbre diferente.
10. La transposición también es una decisión tímbrica
No basta con llegar a la nota correcta.
Subir o bajar un sample puede modificar:
• Brillo.
• Peso.
• Textura.
• Sensación de velocidad.
• Carácter.
Por ello se debe elegir también por oído.
11. Crear un Bajo específico para la parada
• Duplicación del bajo principal.
• Nueva función estructural.
• Sonido octavado.
• Carácter Remember.
• Procesamiento independiente.
12. Automatización descendente del Cutoff
En lugar de abrir progresivamente un filtro, en esta ocasión se realiza el proceso contrario:
Abierto → cierre progresivo → desaparición.
Esto permite retirar gradualmente el Bass Break y preparar el siguiente momento.
13. Crear un Pad desde cero
El Pad Break se construye mediante:
• Sylenth.
• Polifonía de 8 voces.
• Retrigger desactivado.
• Detune.
• Cadena de procesamiento.
El objetivo no es buscar inmediatamente un preset terminado, sino construir el soporte que necesita exactamente la producción.
14. Seguir la progresión del bajo
La armonía vuelve a apoyarse en:
Sol – Re – Mi – Do
El Pad utiliza esta progresión para mantener coherencia con el resto de la producción.
15. Construir una parada antes de introducir la melodía
• Se mutea temporalmente la melodía.
• Se comprueba si la parada funciona por sí misma.
• Se construye primero su atmósfera.
• La melodía se reserva para la siguiente fase.
Principio: si la base emocional funciona sin la melodía, su entrada posterior tendrá todavía más impacto.
16. Comparar creación propia con librerías
Se buscan Pads externos, pero inicialmente el sonido diseñado manualmente resulta más convincente.
Esto demuestra que las librerías son una herramienta, no una obligación.
17. Cambiar la búsqueda cuando no encontramos lo necesario
La búsqueda evoluciona:
Pad → Film Score → Pad Synth → Strings → Orquesta.
Modificar el término de búsqueda permite descubrir soluciones que inicialmente no se habían planteado.
18. Strings para aumentar emoción
Las cuerdas aportan:
• Amplitud.
• Emoción.
• Sensación cinematográfica.
• Contraste respecto a la contundencia rítmica de la Mákina.
19. Capas con funciones diferenciadas
La parada termina utilizando conceptos diferentes:
Strings: emoción y armonía superior.
Pad: cohesión.
Sub: profundidad y soporte grave.
Cada capa tiene una función concreta.
20. Detectar armonías de oído cuando no existe MIDI
El sample seleccionado no contiene MIDI.
Por tanto:
• Se escucha.
• Se toca una nota.
• Se compara.
• Se identifica el cambio.
• Se programa manualmente.
Se detectan notas como Mi, Do y Re para construir el acompañamiento.
21. Crear un Sub a partir de la armonía detectada
Una vez conocidas las fundamentales:
• Se baja una octava.
• Se ajusta el filtro.
• Se controla el volumen.
• Se siguen los cambios armónicos.
El Sub refuerza la sensación cinematográfica sin competir con los Strings.
22. Automatizar también los elementos atmosféricos
Pads y Strings no tienen por qué permanecer estáticos.
La automatización de filtro permite:
• Hacerlos crecer.
• Retirarlos.
• Ocultarlos progresivamente.
• Preparar la entrada siguiente.
23. Impactos como inicio de una gran parada
Una vez construida la armonía se empiezan a añadir:
• Explosiones.
• Subidas.
• Impactos.
• FX.
Primero se construye la emoción; después se añade el espectáculo.
24. La parada como momento fundamental de la obra
La sesión establece claramente que esta sección debe recibir especial atención porque representa uno de los puntos más importantes de toda la producción.
No debe resolverse rápidamente: tiene que resultar espectacular.
25. Los artefactos de IA forman parte del material a corregir
Una voz generada puede contener:
• Glitches.
• Cortes.
• Bombeos.
• Finales extraños.
• Artefactos digitales.
El productor debe detectarlos y decidir cuáles corregir, cortar o utilizar creativamente.
26. Reconstruir una vocal a partir de una sílaba
Cuando no existe una toma más larga:
1. Seleccionar una sílaba útil.
2. Duplicarla.
3. Aplicar Time Stretch.
4. Reorganizarla.
5. Añadir Delay.
6. Reconstruir su dinámica.
Esto permite crear material que no existía realmente en la grabación original.
27. Reconstruir un Sidechain incorporado
Si el audio generado ya contiene bombeo y posteriormente modificamos su duración, ese bombeo también cambia.
Por tanto hay que:
• Detectar su ritmo.
• Estirar el audio.
• Recalcular el movimiento.
• Recrear manualmente el Sidechain.
28. Adaptar el Sidechain al nuevo tiempo
En el ejemplo de la clase:
Duración original → bombeo aproximado a negras.
Al duplicar la duración:
Nueva duración → reinterpretación aproximadamente a blancas.
29. Saber dónde termina un experimento útil
Se prueba incluso a extender la vocal mucho más.
El resultado empieza a resultar excesivamente artificial y se descarta.
Principio: experimentar libremente no significa tener que conservar el resultado.
30. Ingeniería de audio aplicada creativamente
La clase demuestra que producir no consiste únicamente en elegir sonidos o utilizar plugins.
También implica resolver problemas mediante:
• Edición.
• Cortes.
• Duplicaciones.
• Time Stretch.
• VariAudio.
• Delay.
• Sidechain.
• Reconstrucción manual.
Cuando el material que necesitamos no existe, podemos intentar construirlo.
31. Resultado de la Clase 12
Al finalizar la sesión se ha conseguido:
• Revisar la estructura desarrollada hasta el compás 65.
• Mejorar la terminación “in your soul”.
• Combinar Time Stretch y VariAudio.
• Crear una pista específica para la voz estirada.
• Suavizar consonantes mediante Fade In.
• Utilizar Delay y Feedback para prolongar terminaciones.
• Crear una variante FX con Ping Pong Delay.
• Avanzar el tramo 81–97.
• Incorporar y afinar un nuevo Riser.
• Crear Bass Break.
• Diseñar un bajo octavado Remember.
• Automatizar su Cutoff.
• Crear Voz Break.
• Diseñar un Pad Break propio.
• Construir la progresión Sol–Re–Mi–Do.
• Incorporar Strings cinematográficos.
• Crear un Pad Sub.
• Detectar manualmente la armonía del material orquestal.
• Automatizar el filtro de la sección.
• Incorporar una explosión.
• Empezar a diseñar la parada principal.
• Trabajar “Feel the power, feel the light”.
• Detectar y eliminar artefactos de IA.
• Reconstruir una terminación vocal a partir de una sílaba.
• Recrear manualmente su Sidechain.
• Preparar el espacio para que posteriormente la melodía tenga todo el protagonismo.
La idea fundamental de la Clase 12 es que, cuando una producción alcanza este nivel de desarrollo, el productor deja de limitarse a utilizar el material disponible y empieza a construir exactamente el material que necesita. Una vocal demasiado corta puede alargarse y reconstruirse; un Sidechain integrado puede recrearse; una armonía sin MIDI puede identificarse de oído; un Pad puede diseñarse desde cero y combinarse con Strings para transformar una parada en un momento cinematográfico.
Esta clase representa, por tanto, el paso desde la simple organización de elementos hacia una fase de producción creativa avanzada, donde edición, síntesis, armonía, efectos y criterio artístico trabajan conjuntamente para preparar uno de los momentos emocionales más importantes de toda la canción.
