Riverside ya clona a tu invitado: voz y gemelo de vídeo

Riverside documenta cómo crear un clon de voz y un gemelo de vídeo de un invitado a partir de un vídeo corto que graba él mismo.

El centro de ayuda de Riverside (enlace de afiliado: así me ayudas a seguir creando contenido) tiene hoy tres artículos que ayer no estaban. Su contador de artículos ha pasado de 954 a 957.

Dos de los tres van de lo mismo. Y no es un ajuste de menús.

Van de clonar a tu invitado. No tu voz. La suya.

Todo lo que te cuento sale de esos artículos. Ni un dato de mi cosecha.

Qué dice exactamente la documentación

Los títulos y las descripciones, tal cual aparecen en su centro de ayuda:

ArtículoQué dice que hace
Create an AI voice clone of a guestCrear una versión de IA reutilizable de la voz de un invitado a partir de un vídeo corto que graba él, y luego generar audio desde cualquier guion que escribas
Create an AI twin of a guestCrear un gemelo de IA de un invitado a partir de un vídeo corto que graba él, y luego generar vídeos nuevos de ese gemelo leyendo cualquier guion que escribas
Smooth video cutsUsar Smooth cuts para fundir los saltos entre tus cortes, para que el vídeo mantenga un flujo natural y continuo

Y hay un cuarto cambio, pequeño pero revelador: el artículo que tenían sobre clonar tu propia voz se llamaba Generate your AI voice clone y ahora se llama Create your AI voice clone. Mismo artículo, verbo nuevo.

Cuando una empresa se pone a renombrar artículos para que todos empiecen con el mismo verbo, suele ser porque está ordenando un bloque que va a crecer. No es una prueba de nada. Es un olor.

El gemelo del invitado es la novedad gorda

Quédate con la frase de la documentación: a partir de un vídeo corto que graba el invitado, generas vídeos nuevos de ese gemelo leyendo el guion que tú escribas.

O sea, el invitado graba una vez. Y después tú puedes ponerle en la boca frases que nunca ha dicho, con su cara.

Hasta ahora, en Riverside, lo que grababas con un invitado era lo que tenías. Si al montar te faltaba una frase, se te caía el trozo o directamente lo escribías en un rótulo. La opción de pedirle que se vuelva a sentar a grabar diez segundos existe, pero solo una vez. A la tercera vez que le escribes, el invitado deja de contestar.

Esto cambia esa ecuación entera.

¿En qué se diferencia del clon de voz que ya tenían?

En de quién es la voz, básicamente.

El artículo de siempre, el de tu propio clon, dice que creas una versión de IA reutilizable de tu voz y luego generas todo el audio que necesites desde cualquier guion. Eso lleva un tiempo ahí y es lo normal en el sector. Lo mismo que hace ElevenLabs cuando clonas tu voz paso a paso, solo que metido dentro de la herramienta donde ya grabas.

Lo nuevo son las dos versiones del invitado: una solo de voz, otra de voz y cara.

La diferencia práctica entre las dos es la que te imaginas. Con el clon de voz del invitado arreglas audio: un podcast, un trozo de narración, una frase que se cortó. Con el gemelo generas vídeo: el invitado, en pantalla, diciendo algo que tú has escrito.

Y hay una diferencia que la documentación no desarrolla y yo no me voy a inventar: no dice cuántos segundos de vídeo hacen falta para que el clon salga decente. Dice "un vídeo corto" y ahí se queda.

La etiqueta que aparece en la ficha del clon de voz

Un detalle de letra pequeña que me ha llamado la atención y que conviene tomar con pinzas.

En la ficha del artículo del clon de voz del invitado aparece la etiqueta enterprise_exclusive. No es un texto de la página de precios, es un metadato del artículo de ayuda.

Lo que sugiere es que esto no viene de serie con cualquier plan. Lo que no sé, porque no lo pone, es exactamente en qué plan entra ni si la limitación aplica igual al gemelo de vídeo, cuyo artículo no lleva esa etiqueta.

Si vas a hacer cálculos, hazlos sobre lo que sí está publicado. Te dejé el desglose entero de planes y del plan gratis en cuánto cuesta Riverside y qué da el plan gratis. Cuando aparezca en la página de precios, se sabrá. Hoy no se sabe.

Smooth cuts: la tercera del lote

Esta es la más humilde de las tres y probablemente la que vas a usar más.

La documentación dice que Smooth cuts funde los saltos entre tus cortes para que el vídeo mantenga un flujo natural y continuo.

Traducido: el problema clásico de editar por transcripción. Borras un "eeeh", borras una frase que se te fue por las ramas, y en el vídeo se ve el salto. La cabeza del que habla aparece de golpe tres centímetros a la derecha.

Es el mismo territorio que el zoom animado que ya documentaron, el que te conté en cómo poner efectos de zoom y paneo en el editor. Movimiento que tapa un corte. Solo que ahora lo hacen ellos y tú no tienes que fingir un zoom para esconder el salto.

Lo que la documentación no dice: en qué planes está, ni si se aplica corte a corte o a toda la línea de tiempo de una vez.

¿Para qué querrías tú un gemelo de tu invitado?

Vamos a lo práctico, que es donde esto se decide.

Si grabas entrevistas, hay tres situaciones en las que ahora mismo pierdes material. Y las tres las resuelve esto.

La primera: te falta una frase. El invitado se lió en la respuesta buena, o dijo mal un nombre, o se le cortó el audio justo ahí. Hoy eso es un corte y un rótulo.

La segunda: quieres una pieza corta para redes que no existe en la grabación. Un "hola, soy tal y hablo de esto en el episodio" que nunca llegaste a pedirle.

La tercera: idiomas. El invitado habló en español y tú tienes audiencia en otro idioma.

Y ahora la parte incómoda, porque esas tres me parecen razonables y la cuarta no.

La cuarta es ponerle a decir cosas que no piensa. Y la herramienta no distingue entre la primera y la cuarta. Eso lo distingues tú.

Dónde pongo yo la raya

Me flipa la IA, ya lo sabes. Pero aquí hay una diferencia que no es técnica, es de permiso.

Lo que sí dice la documentación, y me parece el dato más importante de todo lo de hoy: el vídeo lo graba el invitado. No subes un archivo viejo de una grabación que tienes guardada. La persona graba a propósito.

O sea, el flujo documentado exige que tu invitado se siente y grabe el material del que va a salir su gemelo. Eso no es un consentimiento firmado, pero tampoco es hacerlo a sus espaldas.

Lo que la documentación no dice, y es exactamente la pregunta que yo querría ver contestada: si el invitado puede revocarlo después. Si borra su cuenta, si te pide que lo elimines, si le avisan cuando generas un vídeo nuevo con su cara. Nada de eso aparece.

Yo tengo mi propia voz clonada y la uso. Y tengo escrita la raya de hasta dónde dejo que una IA hable en mi nombre, que no es la misma raya que la de hablar en nombre de otro. Lo conté en hasta dónde dejo que una IA hable por mí, y la versión larga del asunto, cuando el clon es de una persona entera y no solo de su voz, está en los riesgos éticos del clon digital de una persona.

La regla que uso con esto es cortita. Si tienes que pensar si se lo cuentas al invitado, ya tienes la respuesta.

Resumiendo lo que sabemos hoy

Tres artículos nuevos: clon de voz de un invitado, gemelo de vídeo de un invitado y Smooth cuts. Un artículo renombrado, el del clon de tu propia voz. Contador de 954 a 957.

Precios, planes, límites de duración y política de revocación: no publicados. Cuando lo estén, te lo cuento.

¿Quieres saber en qué punto estás con la IA y qué herramientas te compensan de verdad? Hazte el test y te digo tu nivel: ¿Cuál es tu nivel de IA?

Relacionado

Sigue leyendo