Hice un anuncio de 79 segundos con mi abuela convertida en personaje de videojuego, sin grabar un solo plano de ella. Aquí está el método completo, los prompts que usé y el kit de montaje. Cada error que me costó créditos está convertido en un paso para que tú no lo repitas.
10 planos generados
79 s de vídeo
1 día
~1.200 créditos siguiendo esta guía
1.764 me costó a mí, con los errores
La regla que lo cambia todo: el estilo no se describe, se enseña. Escribir "estilo GTA" en el prompt me dio una foto real, y escribir "render de videojuego" me dio dibujos animados. Lo que funcionó fue pasarle capturas reales del juego y fijar el look en una imagen aprobada antes de generar ni un segundo de vídeo.
El kit de montaje
El HUD de juego, el montador, la música y todos los prompts. Un solo fichero de configuración, probado de principio a fin con este vídeo.
Su licencia permite vídeo comercial y prohíbe repartir el fichero. Descárgala tú.
Conectar los dos servicios a Claude Code
claude mcp add --transport http higgsfield https://mcp.higgsfield.ai/mcp
claude mcp add nanobanana -e GOOGLE_AI_API_KEY=tu_clave -e NANOBANANA_MODEL=gemini-3.1-flash-image-preview -- npx -y @ycse/nanobanana-mcp
Dos detalles que hacen perder una tarde: sin --transport http, Higgsfield se guarda como si fuera un programa local y falla al arrancar. Y después de autorizarlo en /mcp, sus herramientas solo aparecen al abrir una sesión nueva de Claude Code: cierra y vuelve a entrar.
Vídeo Seedance 2.0
6 s
8 s
720p
27 créditos
36 créditos
1080p
≈54 créditos
72 créditos
Precios de Higgsfield medidos el 27-09-2026 con su comprobación de coste antes de lanzar (el de 6 s a 1080p, calculado a partir del de 8 s). Cuenta 10 planos a 1080p con 2 variantes de cada uno: unos 1.200 créditos. Las pruebas, a 720p.
01
Las tres capas
Clave
Qué genera la IA de vídeo, qué va en el montaje y qué se graba de verdad.
⌄
La IA de vídeo genera
Personas, lugares y acción. Nada más.
El montaje pone
Todo lo que hace que parezca un juego: misión, objetivos, reloj, estrellas, minimapa, +XP y títulos grandes.
Se graba de verdad
La pantalla de tu producto, si sale. Una grabación real del móvil, recortada.
Por qué: si le pides a la IA de vídeo que pinte el HUD, escribe letras deformes y cambia de un plano a otro. Pon siempre "No on-screen text, no user interface, no logos" y añádelo tú después.
Y otra cosa: nunca pongas en un rótulo algo que tu producto no hace de verdad en la grabación. Si el HUD dice "x10" y la pantalla dice lo contrario, alguien lo pausará.
02
El guion de la misión
Claude
10 planos, y en cada uno qué cambia físicamente.
⌄
El formato que funciona: un objetivo, una cuenta atrás y un obstáculo. En el mío, una cena para 10, la tienda cierra en 13 minutos y faltan tres ingredientes.
Prompt · guion
Quiero hacer un vídeo corto estilo tráiler de videojuego de mundo abierto en el que [PERSONAJE]
cumple una misión: [MISIÓN EN UNA FRASE, con un objetivo, una cuenta atrás y un obstáculo].
Escríbeme el guion en 10 planos de 4 a 8 segundos. Para cada plano dame:
1. Qué pasa, en una frase, y qué cambia físicamente (quién se mueve, hacia dónde, qué objeto
cambia de estado: una puerta que se cierra, una persiana que baja, un producto que pasa de mano).
2. La frase que dice el personaje, máximo 10 palabras, y si hay otra persona hablando.
3. El rótulo de juego que va encima (objetivo, +XP, estrellas, cuenta atrás), que se pondrá en el montaje.
Reglas: el primer plano tiene que ser el momento más caótico (se usará como gancho), cada
personaje secundario tiene UNA frase, y el personaje principal remata con una frase seca.
Nada de nombres de juegos, estudios ni logos en lo que sale en pantalla.
Lo que dio risa de verdad: frases secas del personaje contra una línea normal del otro. "Hey, I saw it first." "And I saved it first." Si tienes un producto, que el remate lo nombre sin anunciarlo.
03
El personaje
Nano Banana
De 2-4 fotos a un personaje reconocible en 10 planos.
⌄
Prompt · personaje (con las fotos como referencia)
Create a full-body character portrait of the person in the reference photos, keeping her face,
age and features recognisable: [EDAD], [PELO]. Give her three fixed identity anchors that will
appear in every shot: [ACCESORIO 1, ej. black oversized sunglasses], [ACCESORIO 2, ej. a small
aqua turquoise silk scarf knotted at the neck], [ACCESORIO 3, ej. aqua turquoise nail polish].
Outfit: [ROPA, ej. long camel wool coat, cream silk blouse, pearl necklace].
Standing in [LUGAR], confident and unbothered. Neutral light, full body visible, vertical frame.
No text, no logos.
Las tres anclas (gafas, pañuelo, uñas) son lo que hace que la reconozcas en todos los planos. Escríbelas igual, palabra por palabra, en todos los prompts que vienen después. En el único plano en el que se perdió el pañuelo, dejó de parecer ella.
Si es una persona real, pregúntale antes. Y al publicar, activa la etiqueta de contenido generado con IA.
04
El estilo: el paso que lo decide todo
Clave
Una sola imagen del plano más difícil, con capturas reales del juego.
⌄
✕ Pidiendo "estilo de videojuego" con palabras: foto real.✕ Pidiendo "render 3D de juego": dibujos animados.✓ Con 3 capturas reales del tráiler como referencia.
Busca 3 o 4 capturas reales del juego que quieres imitar: fotogramas del tráiler, con personas de cerca y luz de noche si tu historia es de noche.
Elige tu plano más difícil (el que tiene más gente y más detalle). Si ese sale bien, los demás salen.
Genera con las referencias en este orden: personaje, captura 1, captura 2, captura 3.
Prompt · prueba de estilo
Render this scene EXACTLY in the visual style of reference images 2, 3 and 4: an in-engine
cutscene from a next-generation AAA open-world game (Grand Theft Auto VI trailer look). Characters are high-end 3D game models:
realistic proportions and faces, but with that subtle not-quite-real game look: matte smooth skin
with soft baked detail, slightly stiff sculpted facial features, soft temporal anti-aliasing
softness, physically based materials. Lighting is soft global illumination with deep natural
shadows, a natural slightly desaturated cinematic grade, NOT oversaturated, NOT glossy,
NOT cartoon, NOT illustration, and NOT a photograph. Copy the colour grade, the softness and the
skin rendering of reference 2.
The main character is the game-model version of the person in reference image 1, [EDAD]:
[DESCRIPCIÓN FÍSICA + LAS TRES ANCLAS + ROPA]. [ACTITUD, ej. Smug and unbothered].
Framing: [PLANO, ej. medium close-up, she fills the right half of the frame from the chest up].
[ACCIÓN CONGELADA EN UN INSTANTE].
[FONDO Y SECUNDARIOS, con edades concretas y lo que tienen en las manos].
Setting: [LUGAR con 4-5 objetos concretos]. [LUZ]. Widescreen cinematic frame.
No text, no subtitles, no user interface, no button prompts, no logos, no watermark.
Si sale con pinta de foto o de dibujos, no toques el texto: cambia las capturas. Yo reescribí el prompt tres veces y lo que lo arregló fue enseñarle imágenes.
05
Un fotograma por plano
Nano Banana
Se aprueba cada imagen antes de gastar un crédito de vídeo.
⌄
Referencias en cada plano, en este orden: personaje, la prueba de estilo aprobada (arrastra el look y el personaje ya convertido) y dos capturas del juego. Si el plano pasa en el mismo sitio que otro ya aprobado, usa ese fotograma como segunda referencia: mantiene el lugar y la luz.
Prompt · fotograma de un plano
Render EXACTLY in the look of reference image 2 (same character model, same rendering, same colour
grade) and references 3 and 4: an in-engine cutscene from a next-generation AAA open-world game (GTA VI
trailer look). High-end 3D game character models with realistic proportions but a subtle not-quite-real game look:
matte smooth skin, slightly stiff sculpted features, soft anti-aliasing softness, soft global
illumination, deep natural shadows, natural slightly desaturated cinematic grade.
NOT a photograph, NOT cartoon.
Character: the same [PERSONA] as in references 1 and 2, [DESCRIPCIÓN + TRES ANCLAS + ROPA].
Scene: [LUGAR, momento del día]. [LO QUE HACE, en el PRIMER instante del plano]. [ESTADO DE LOS
OBJETOS QUE VAN A CAMBIAR, ej. the metal shutter is already half down, at waist height].
[PLANO Y CÁMARA]. Widescreen cinematic frame. No text, no readable signs, no labels on packaging,
no user interface, no logos, no watermark.
Antes de aprobar cada fotograma, mira estas 8 cosas
Mira
Qué me pasó
Arreglo
Letras y logos
Salió un hotel con su marca y bolsas de patatas de marcas reales
A
Hora del día
Cielo de atardecer en una escena de medianoche
B
El estado de lo que va a cambiar
La persiana tenía que estar bajando y en el fotograma estaba arriba
Descríbelo en el prompt
"El último producto"
Peleaban por la última nata con la nevera llena
C (regenerando)
Hacia dónde va
Figura pequeña de frente: el vídeo la movió marcha atrás
Cámara detrás de ella
Qué tiene cada uno en la mano
Copas de vino al lado de los niños
D
Edades de los secundarios
"Family of all ages" dio una mesa de señores mayores
Edades concretas y "she is the only grey-haired person"
Las tres anclas
En un plano desapareció el pañuelo
Nómbralo con "clearly visible"
Arreglos · edición de la imagen aprobada
A · QUITAR TEXTOS Y LOGOS
Remove ALL text, letters, numbers and brand logos from every sign, package and building in the
image: signs become plain glowing panels, packages become plain unlabeled packaging in solid
colours. Keep everything else identical: characters, poses, lighting, composition, rendering style.
B · PASAR A NOCHE
Change the sky to a dark midnight blue night sky so it is clearly late at night. Keep everything
else identical: characters, poses, lighting on the characters, composition, rendering style.
C · EL ÚLTIMO PRODUCTO (aquí editar no basta: regenera el fotograma con esta frase en la escena)
The fridge shelves behind them are completely EMPTY: bare lit white shelves, not a single
[PRODUCTO] left. [SECUNDARIO] holds the LAST [PRODUCTO] in his hand; [PERSONAJE] steps in right
next to him, her hand already reaching for it.
D · CAMBIAR UN OBJETO CONCRETO
Change ONLY [OBJETO Y DÓNDE ESTÁ]: replace it with [OBJETO NUEVO]. Do not change anything else:
same people, same faces, same lighting, same colour grade, same composition, same rendering style.
06
El vídeo desde el fotograma
Higgsfield · Seedance 2.0
La imagen como fotograma de inicio, 2 variantes, y la física escrita en mayúsculas.
⌄
Cómo se pasa la imagen
Como fotograma de inicio (start_image), no como referencia. Como referencia cambia el encuadre y pierde el look. Sin fotos del personaje aquí: el fotograma ya lo lleva todo.
Duración y variantes
6 s para una frase, 8 s para dos o para acción larga. Audio activado. 2 variantes de cada plano: sale más barato que repetir.
Prompt · vídeo de un plano
Continue from the start image keeping its exact look: an in-engine cutscene from a
next-generation open-world crime game (GTA VI trailer style), high-end 3D game character models, matte game skin,
soft global illumination, natural cinematic grade. Never live-action.
[ACCIÓN, EN ORDEN, UNA FRASE POR PASO:
1) lo que pasa primero y quién habla: The clerk keeps pulling the shutter DOWN and says: 'Sorry, we're closed.'
2) la respuesta: She says in English with a strong Spanish accent, low and dry: '[FRASE]'
3) lo que cambia después: He sighs and lifts the shutter back UP a little. She ducks under it into the shop.]
[CÁMARA: locked medium two-shot / third-person chase camera low behind her, motion blur].
[SI HAY MOVIMIENTO: She rides FORWARD, AWAY from the camera. Everything rushes past toward the
camera. Constant forward motion, never backwards.]
[SI HAY CAOS: Nobody gets hurt; it is cheeky mischief, not violence.]
Sound: [3 SONIDOS CONCRETOS]. No music. No on-screen text, no readable signs, no user interface, no logos.
✕ Figura pequeña vista de frente: el vídeo la hizo ir marcha atrás. Arreglo: fotograma con la cámara detrás y "FORWARD, AWAY".✕ La persiana subía cuando tenía que bajar. Arreglo: fotograma con la persiana a media altura y los pasos DOWN y luego UP.
Las frases, cortas y entre comillas simples, diciendo quién las dice y con qué acento. "With a strong Spanish accent, low and dry" funcionó en todos los planos.
Si habla otro personaje, que hable primero y que el protagonista responda. Por turnos, la boca sincroniza mejor.
Cada cambio físico, en mayúsculas: DOWN, UP, FORWARD, AWAY, EMPTY.
En planos sin diálogo mete música aunque pongas "No music". Se quita en el montaje.
Si Higgsfield te propone un preset en lugar de generar, recházalo y genera literal.
07
Revisar cada clip
2 minutos por plano
Una hoja de fotogramas y una transcripción antes de elegir.
⌄
Verlo una vez a velocidad normal no basta: los fallos de física se ven en una hoja de fotogramas, y los de diálogo en la transcripción.
Comandos · hoja de 8 fotogramas y transcripción con tiempos
Dice la frase entera, sin palabras de más. A mí se me coló un "though" que nadie escribió.
Siguen las tres anclas del personaje.
Si dos variantes fallan por lo mismo, no lances una tercera: cambia una sola cosa del prompt.
Pídeselo a Claude Code: "hazme la hoja y la transcripción de cada variante y dime cuál eliges y por qué".
08
El HUD de juego
Lo que lo convierte en GTA
Se escribe en un JSON y el kit lo pinta fotograma a fotograma.
⌄
La maqueta que aprobé antes de montar: misión y objetivos arriba a la izquierda, estrellas y dinero arriba a la derecha, minimapa con ruta rosa, "+XP" en mitad de la acción y el botón de la acción abajo.
Elemento
Cuándo usarlo
Caja de misión con objetivos
Toda la misión. Los objetivos se ponen en rojo cuando faltan y se tachan cuando se consiguen, en el segundo exacto.
Cuenta atrás
Desde que se dice el límite. Por debajo de un minuto parpadea.
Estrellas
Suben cuando el personaje hace algo temerario.
"+XP" con etiqueta
Cada momento gracioso: NEAR MISS, TERRACE WRECKED, OBJECTIVE SECURED.
Etiqueta de NPC
Sobre el personaje secundario cuando aparece: "NPC: HUNGOVER GUY · LVL 19".
Stingers
NEW MISSION al empezar, X MINUTES EARLIER tras el gancho, MISSION PASSED al final.
Copia montaje.ejemplo.json a montaje.json. Es el vídeo entero de la abuela: cambia los textos y los tiempos.
Los tiempos van relativos a cada plano: ["G", 1.5] es el segundo 1,5 del plano G. Si alargas un plano, todo se recoloca solo.
python3 montaje.py revisar montaje.json te da en segundos 6 fotogramas reales con el HUD encima. Comprueba que ningún rótulo tapa una cara.
Tamaño: en el móvil, un vídeo horizontal se ve al 56%. El kit ya trae la caja de misión y los subtítulos a un tamaño que se lee en esas condiciones. Si los achicas, compruébalo en el móvil.
09
Música y sonido
Kit
Que se oigan las frases: es lo primero que falla.
⌄
Higgsfield no genera música suelta. El kit compone un beat original (G-funk oscuro con trap) y los efectos: golpe de misión, ding de XP, estrellas y fanfarria final. Es tuyo y no tiene derechos de nadie. Si prefieres una canción, pon su ruta en audio.musica, y que tenga licencia.
Nivel
Valor
Por qué
Voz
+5 dB (1.8)
En mi primera versión la música tapaba las frases.
Música bajo diálogo
0.3 y se aparta sola cuando alguien habla
Más alto, la voz desaparece en el altavoz del móvil.
Música sin diálogo (pantallas)
1.1
Ahí no hay nada que tapar.
Efectos
Sin normalizar, entre 0.35 y 0.8
Normalizados a tope, el zumbido de "falta" tapaba justo la frase que lo explicaba.
Total
Normalizado a -14 LUFS (el vídeo final mide -15,6)
El kit lo aplica solo al final.
10
El montaje y el gancho
Kit
El momento más loco primero, congelado, y luego la historia.
⌄
0-4 s: el plano más caótico con el HUD a tope (estrellas, "+50 XP"). Se congela y entra un stinger: "12 MINUTES EARLIER".
Tu producto: la grabación del móvil, acelerada al triple mientras escribes y a velocidad normal cuando aparece la respuesta, con un rótulo encima.
NEW MISSION a pantalla completa sobre el primer fotograma de la misión, congelado 1,6 s.
La historia en orden, con los objetivos cambiando en el segundo exacto de cada frase.
MISSION PASSED sobre el último fotograma de la escena final, congelado, con la batería en silencio para que suene la fanfarria.
El remate y tu marca.
La grabación de tu producto: elige el tramo en el que se ve hacer justo lo que dice el rótulo que va encima. Si en la pantalla se lee algo que contradice el rótulo, el que está mal es el rótulo: cámbialo.
Sin desfases: el kit corta cada plano en fotogramas enteros. Si lo cortas en segundos, cada plano pierde unas centésimas y al final del vídeo la voz va por detrás de la boca. A mí se me acumularon 0,33 s antes de darme cuenta.
Prompt · montaje con Claude Code
Tengo mis clips elegidos en clips/ y una grabación de pantalla de mi app en
clips/pantalla-movil.mp4. Usa el kit de esta carpeta (LEEME.md y montaje.ejemplo.json).
1. Transcribe cada clip con marcas de tiempo por palabra y dime qué frase dice y en qué segundo.
2. Escribe montaje.json siguiendo montaje.ejemplo.json: el gancho primero (el plano más caótico,
3-4 s, congelado con un stinger de "X MINUTES EARLIER"), después la historia en orden.
Los subtítulos con los tiempos reales de la transcripción, nunca a ojo.
3. Ejecuta `python3 montaje.py revisar montaje.json` y enséñame las 6 imágenes de revisión.
4. Cuando te dé el OK, `python3 montaje.py todo montaje.json`.
Antes de terminar, extrae 12 fotogramas del vídeo final y comprueba que ningún rótulo tapa una cara
y que ninguna frase del HUD dice algo que el vídeo no enseña.
11
Publicar
TikTok · Reels
Etiqueta, duplicados, formato y hashtags.
⌄
Activa la etiqueta de contenido generado con IA en TikTok y en Instagram. Un hashtag como #aivideo no la sustituye.
No subas el mismo fichero a dos cuentas. TikTok dice que no recomienda contenido duplicado. En tu otra cuenta sube el making of, no el mismo vídeo.
Horizontal o vertical: no hay ninguna penalización oficial por subir un 16:9. En TikTok es defendible si dura más de 1 minuto: llegó a decir que empujaba esos horizontales (Tubefilter, 2024). En Reels no he encontrado ninguna fuente que defienda el 16:9, así que para Instagram prueba también el formato vertical del kit ("formato": "vertical"). En los dos casos, lo que importa es que el texto se lea en el móvil.
Hashtags: TikTok los usa para saber de qué va el vídeo. Pon el tema que sale (el juego, "grandma") antes que tu marca.
Nombres y logos del juego: nunca en lo que sale en pantalla. Los prompts sí lo nombran como referencia de estilo, como en los que usé.
Generar vídeo antes de fijar el estilo: 10 planos con pinta de foto real
Unos 290 créditos tirados
Paso 04
Describir el estilo con palabras en lugar de capturas
3 pruebas de estilo
Paso 04
Pasar la imagen como referencia y no como fotograma de inicio
El encuadre cambió
Paso 06
Figura pequeña de frente en el fotograma
Patinete marcha atrás, plano repetido
Pasos 05 y 06
No fijar el estado inicial de la persiana
Subía en vez de bajar, plano repetido
Pasos 05 y 06
Nevera llena en una pelea por "el último"
No tenía sentido, plano repetido
Paso 05, arreglo C
Frases sin gracia en el guion
Tres planos repetidos para cambiar la frase
Paso 02
Música alta y efectos normalizados
No se entendían las frases
Paso 09
Cortar planos en segundos y no en fotogramas
0,33 s de desfase acumulado
Paso 10 (el kit ya lo hace)
Un rótulo que prometía más de lo que enseñaba la grabación
Rehacer el tramo del móvil
Pasos 01 y 10
Gancho flojo: 2 s de alguien mirando el móvil
Rehacer el montaje
Paso 10
13
El prompt maestro
Todo en uno
Para Claude Code con los dos conectores y el kit en la carpeta.
⌄
Prompt maestro
Vamos a hacer un vídeo corto estilo tráiler de videojuego de mundo abierto siguiendo la guía
marbuilds.dev/resources/video-gta-ia y los prompts de prompts.md de esta carpeta.
Personaje: fotos en fotos/. Estilo: capturas del juego en estilo/. Misión: [UNA FRASE].
Trabaja por fases y PARA al final de cada una hasta que yo apruebe:
1. Guion en 10 planos (prompt 1).
2. Personaje (prompt 2). Enséñamelo.
3. Prueba de estilo del plano más difícil (prompt 3). Enséñamela. No sigas sin mi OK.
4. Un fotograma por plano (prompt 4), revisando las 8 cosas de la tabla. Enséñamelos en una hoja
de contacto y dime qué has arreglado.
5. Vídeo de cada plano desde su fotograma (prompt 5), 2 variantes, [720p para probar / 1080p final].
Antes de lanzar, dime cuántos créditos cuesta. Revisa cada clip con una hoja de fotogramas y una
transcripción, y dime cuál eliges y por qué.
6. Montaje con el kit (prompt 6).
Nunca inventes lo que hace mi producto en un rótulo: solo lo que se ve en la grabación real.
Por qué por fases: cada parada es un punto donde un error sale barato. Un fotograma mal se arregla en Nano Banana; un plano de vídeo mal cuesta 54-72 créditos.