Saltar al contenido principal
Voz y acapellas

Edición de voz: comping, timing, afinación, Melodyne y Auto-Tune

Cómo editar voz: comping, timing y afinación natural o estilizada con Melodyne y Auto-Tune, sin perder formantes ni groove.

  • Intermedio
  • DJ · Técnico
  • 7 min de lectura
  • Revisado el 30/09/2026

Después de la grabación vocal casi nunca hay una sola toma: hay cinco, ocho o doce, y en ninguna está todo bien. La edición de voz consiste en convertir ese montón de material en una sola línea que se escuche como una interpretación continua, sin que se note el trabajo.

El recorrido tiene tres decisiones y una advertencia. Primero, el comping: qué tramos de cada toma se quedan. Segundo, el timing: cuánto mover la frase sin matar el groove. Tercero, la afinación: cuánto corregir y con qué herramienta, Melodyne o Auto-Tune. La advertencia es que afinar de más no es un fallo técnico, es una elección de estilo que conviene tomar a propósito.

De varias tomas a una sola voz

Comping es la abreviatura de take compuesto: seleccionar los mejores momentos de varias interpretaciones del mismo pasaje y juntarlos en una pista que suena a una sola. No se trata de la toma más limpia, sino de la combinación más convincente: la frase de la toma dos, el giro de la siete, la respiración que funciona de la cuatro.

La idea interesa tanto en DAW con herramientas dedicadas como en software de DJ con edición básica, porque el problema es siempre el mismo: ninguna toma tiene a la vez la mejor entrada, el mejor tono y el mejor final. Un comp bien montado es invisible; un comp mal montado se detecta por cortes que suenan a cambio de posición, por respiraciones quebradas o por un cambio brusco de timbre a mitad de palabra.

Comparativa
Criterio Qué miras Acción habitual
Tono Si la nota se sostiene o se desvía al finalCorregir la nota o probar otro tramo de otra toma
Timing Si la frase entra con el ritmo y la respiraciónMover la entrada unos milisegundos, no a la retícula
Ruido Suelo, clicks, respiraciones y plosivasEditar la zona o descartar esa toma
Interpretación Si la entrega suena creíble de principio a finElegir la toma aunque no sea técnicamente perfecta

Tabla de cuatro criterios para elegir entre tomas de voz: tono, sincronía con el ritmo, ruido presente y veracidad de la interpretación, con la acción habitual en cada caso.

Comping: montar la mejor versión toma a toma

Cada DAW resuelve el mismo flujo con su mecánica. Logic Pro agrupa las tomas superpuestas en carpetas y usa Quick Swipe Comping: arrastras sobre el tramo que quieres y la carpeta conmuta a esa toma, pudiendo además cambiar el inicio y el final de cada tramo o moverlos, y guardar comps con nombre para volver atrás. Ableton Live organiza las tomas en take lanes paralelas bajo la pista principal: audicionas cada carril, seleccionas el material que te interesa y lo copias a la pista principal, donde el material de origen queda resaltado en el color de la pista.

El método de trabajo es el mismo en ambos: escuchar la sección completa, decidir el tramo más largo que puedes tomar de una sola toma y cortar solo en los puntos donde la frase lo permite. Los cortes en mitad de una sílaba o justo en una consonante son los que delatan el montaje; cortar entre palabras o en silencios naturales, no. Conviene trabajar por bloques de compases y no por notas sueltas: cada corte de más es una oportunidad para que aparezca un cambio de tono o de volumen entre tomas.

Edición de timing: cuánto mover y cuánto no

El timing de una voz se corrige por zonas, no globalmente. Merece la pena mover lo que el oído percibe como error: entradas atrasadas respecto al bombo, palabras que se comen el primer tiempo de un compás, la última sílaba de un verso que se queda antes de la siguiente sección.

No merece la pena mover lo que es interpretación: el arrastre intencionado que da swing, las frases cantadas ligeramente por detrás que dan relaxed, el ritmo de respiración propio del cantante. Si cuadriculas toda la voz, la línea queda perfecta y al mismo tiempo muerta, porque el oído percibe la ausencia de microvariación como programación.

Una regla práctica: ajusta primero con la pista sonando, después en solitario, y vuelve a escuchar con la pista. Si solo funciona en solitario, es demasiado movimiento. La cuantización fuerte tiene sentido en fragmentos cortos que deben quedar clavados y en estilos donde la precisión rígida es parte del sonido; en el resto, se corrige lo justo.

Afinación natural frente a efecto estilizado

La afinación tiene dos objetivos distintos y no se logran con los mismos ajustes. La corrección natural busca que ninguna nota desentone sin que se perciba procesado: movimiento suave, respeto al vibrato y corrección por debajo de lo evidente. El efecto estilizado busca justo lo contrario: notas que saltan de forma instantánea al centro, con el carácter robótico que hizo famoso a cierto plug-in.

Antares documenta la escala de esa decisión en su parámetro Retune Speed: en milisegundos, 0 produce el efecto Auto-Tune icónico con cambios de pitch instantáneos, mientras que valores entre 10 y 50 se consideran típicos para una corrección más natural, porque dejan pasar vibrato y gestos interpretativos. Humanize actúa sobre las notas sostenidas aplicando una velocidad más lenta solo en su porción larga, y Flex Tune permite que la voz se desvíe dentro de una ventana alrededor de la nota antes de ser corregida.

Elegir la escala correcta es previo a cualquier ajuste: afinar contra la escala equivocada convierte una corrección en un error. Y hay que saber qué herramienta corresponde al material: Mono frente a polifonía.

Melodyne y Auto-Tune: monofonía y polifonía

Las dos herramientas parten de filosofías distintas. Auto-Tune trabaja en tiempo real sobre señal monofónica: una sola voz o un instrumento que toca una nota a la vez; Antares indica explícitamente que no puede corregir correctamente varias voces o instrumentos grabados en la misma pista. Su flujo es de pocos parámetros: tono y escala, velocidad de retune, humanize y, en directo, la cuestión de la latencia.

Melodyne trabaja por archivo: analiza el audio, detecta las notas y las muestra como blobs que se pueden mover en tono y en tiempo. Su algoritmo Melodic está pensado para la voz, porque es monofónica, e integra la detección de sibilantes para que las eses no se muevan con la nota. Los algoritmos polifónicos existen para instrumentos que suenan varias notas a la vez, y Celemony advierte de que cambiar de algoritmo después de editar obliga a redetectar y borra lo hecho, así que la elección se toma antes de empezar.

Para voz, la frontera es sencilla: una sola voz en la pista, ambas sirven; armonías dobladas o un coro en un canal, ninguna de las dos puede separarlo bien. En ese caso se trabajan las voces en pistas distintas.

Formantes y la voz de robot

Los formantes son los resonancias que dan al aparato vocal su timbre: por eso una voz grave y una aguda pueden cantar la misma nota y sonar a personas distintas. Cuando subes una nota en el software sin hacer nada más, el algoritmo traslada todo el espectro, incluidos esos resonancias, y la voz resultante adquiere el carácter de juguete.

La gestión de formantes es la diferencia entre una corrección transparente y un efecto evidente. Los plugins de corrección incluyen controles de formante para mantener el timbre mientras cambia el tono, y el mismo Antares ofrece controles de formantes y transposición vinculados en sus versiones con más recursos. La regla de escucha es simple: si al subir tres semitonos la voz empieza a sonar a caricatura, el problema no es la cantidad de afinación, es el formante.

Harmonizers y dobles armónicos

Los harmonizers generan voces derivadas que suenan como coros: toman la voz principal y crean dobles desafinados o desplazados armónicamente para engordar la frase. En producción se usan de dos maneras: como doble ideal para reforzar estribillos, y como efecto evidente cuando la armonía se percibe como tal.

El criterio de uso tiene que ver con la mezcla, no con el plugin. Un doble muy parecido a la principal produce combado y desenfoque; un doble desplazado y con otro carácter funciona como segunda voz. Y un doble siempre compite con la principal por el mismo espacio, así que su nivel y su ecualización se deciden más adelante, en la mezcla de voz, donde dobles y ad-libs se colocan para apoyar sin tapar.

Siguiente paso

Con la toma montada, sincronizada y afinada, la voz ya está lista para entrar en la cadena: mezcla de voz con EQ, compresión, de-essing, saturación, reverb y delay.

Preguntas frecuentes

¿Qué es exactamente el comping?

Es construir una toma compuesta seleccionando los mejores tramos de varias interpretaciones grabadas sobre el mismo pasaje. Logic Pro lo hace con carpetas de tomas y Quick Swipe Comping, y Ableton Live con take lanes donde el material elegido se copia a la pista principal.

¿Hasta cuánto puedo mover la voz en el timing?

Lo justo para que la frase respire con el ritmo, no para que quede perfectamente cuadriculada. Corregir entradas tardías y sílabas sueltas ayuda; llevarlo todo a la retícula mata el groove y hace que la voz parezca programada.

¿Melodyne y Auto-Tune hacen lo mismo?

No. Auto-Tune corre en tiempo real sobre señal monofónica con parámetros como Retune Speed y Humanize, mientras que Melodyne analiza el archivo y permite mover notas y tiempos sobre una visualización de blobs, con algoritmos distintos para material melódico, percusivo o polifónico.

¿Por qué mi voz afinada suena a robot?

Casi siempre por una corrección demasiado rápida unida a ignorar los formantes. Una velocidad de retune muy baja aplasta el vibrato natural, y si al subir la nota no se gestionan los formantes, el timbre cambia y aparece el clásico efecto de voz de juguete.

¿Afinar mucho es un error?

No, es una decisión estética. La afinación perfecta es una convención de géneros pop y urbano, no una norma técnica; en jazz o en folk, forzar todas las notas puede quitar carácter. Lo que sí es un error es afinar sin saber qué sonido querías.

Continúa aprendiendo

Siguiente lecciónMezcla de voz: EQ, compresión, de-essing, saturación, reverb y delay

Cadena de mezcla de voz paso a paso: EQ, compresión, de-essing, saturación, reverb, delay, throws, dobles y ad-libs.

Fuentes

  1. Edit comps in Logic Pro for Mac Documentación oficial Apple · consultado el 30/09/2026

    Documenta el comping en Logic Pro: cambiar el inicio y el final de los tramos de tomas, moverlos y alternar zonas entre tomas con Quick Swipe Comping, además de guardar y renombrar comps.

  2. Comping — Ableton Reference Manual Version 12 Documentación oficial Ableton · consultado el 30/09/2026

    Explica las take lanes de Live: pistas paralelas con tomas que se escuchan en modo audición y selecciones que se copian a la pista principal con Enter, resaltando qué material forma parte del comp.

  3. Audio characteristics and algorithms — Melodyne 5 Documentación oficial Celemony · consultado el 30/09/2026

    Describe los algoritmos de detección: Melodic para voz monofónica con detección de sibilantes, Universal para loops y mezclas, Percussive y las versiones polifónicas, y advierte de que cambiar de algoritmo tras editar borra los cambios.

  4. AutoTune 2026 FAQ Documentación oficial Antares Audio Technologies · consultado el 30/09/2026

    Define Retune Speed en milisegundos (0 para el efecto Auto-Tune, 10-50 para corrección natural), la función Humanize para notas sostenidas, Flex Tune para preservar gestos y el requisito de una fuente monofónica.

Última revisión técnica: 30/09/2026. Si detectas un error, indícalo para corregirlo.