# Prompts del kit · vídeo estilo GTA 6 con IA

marbuilds.dev/resources/video-gta-ia · @itsmarbuilds

Todos salen de un vídeo real (79 s, 10 planos). Los de imagen y vídeo son los que se usaron, con los
datos de cada plano cambiados por huecos.
Los huecos van entre [CORCHETES]. Los prompts de imagen y vídeo van en inglés porque los modelos
responden mejor; lo que dicen los personajes puede ir en el idioma que quieras.

---

## 1 · Guion de la misión (Claude)

```
Quiero hacer un vídeo corto estilo tráiler de videojuego de mundo abierto en el que [PERSONAJE]
cumple una misión: [MISIÓN EN UNA FRASE, con un objetivo, una cuenta atrás y un obstáculo].
Escríbeme el guion en 10 planos de 4 a 8 segundos. Para cada plano dame:
1. Qué pasa, en una frase, y qué cambia físicamente (quién se mueve, hacia dónde, qué objeto
   cambia de estado: una puerta que se cierra, una persiana que baja, un producto que pasa de mano).
2. La frase que dice el personaje, máximo 10 palabras, y si hay otra persona hablando.
3. El rótulo de juego que va encima (objetivo, +XP, estrellas, cuenta atrás), que se pondrá en el montaje.
Reglas: el primer plano tiene que ser el momento más caótico (se usará como gancho), cada
personaje secundario tiene UNA frase, y el personaje principal remata con una frase seca.
Nada de nombres de juegos, estudios ni logos en lo que sale en pantalla.
```

---

## 2 · El personaje (Nano Banana, con 2-4 fotos de la persona)

```
Create a full-body character portrait of the person in the reference photos, keeping her face,
age and features recognisable: [EDAD], [PELO]. Give her three fixed identity anchors that will
appear in every shot: [ACCESORIO 1, ej. black oversized sunglasses], [ACCESORIO 2, ej. a small
aqua turquoise silk scarf knotted at the neck], [ACCESORIO 3, ej. aqua turquoise nail polish].
Outfit: [ROPA, ej. long camel wool coat, cream silk blouse, pearl necklace].
Standing in [LUGAR], confident and unbothered. Neutral light, full body visible, vertical frame.
No text, no logos.
```

**Las tres anclas son lo que hace que la reconozcas en 10 planos distintos.** Escríbelas igual,
palabra por palabra, en todos los prompts que vienen después.

---

## 3 · La prueba de estilo (el paso que lo decide todo)

Antes de hacer nada más, genera UNA imagen del plano más difícil (el que tiene más gente y más
detalle) con estas referencias, en este orden:

1. La imagen del personaje.
2. Tres o cuatro capturas REALES del juego que quieres imitar (fotogramas del tráiler, a ser posible con personas de cerca).

```
Render this scene EXACTLY in the visual style of reference images 2, 3 and 4: an in-engine
cutscene from a next-generation AAA open-world game (Grand Theft Auto VI trailer look). Characters are high-end 3D game models:
realistic proportions and faces, but with that subtle not-quite-real game look: matte smooth skin
with soft baked detail, slightly stiff sculpted facial features, soft temporal anti-aliasing
softness, physically based materials. Lighting is soft global illumination with deep natural
shadows, a natural slightly desaturated cinematic grade, NOT oversaturated, NOT glossy,
NOT cartoon, NOT illustration, and NOT a photograph. Copy the colour grade, the softness and the
skin rendering of reference 2.

The main character is the game-model version of the person in reference image 1, [EDAD]:
[DESCRIPCIÓN FÍSICA + LAS TRES ANCLAS + ROPA]. [ACTITUD, ej. Smug and unbothered].

Framing: [PLANO, ej. medium close-up, she fills the right half of the frame from the chest up].
[ACCIÓN CONGELADA EN UN INSTANTE].

[FONDO Y SECUNDARIOS, con edades concretas y lo que tienen en las manos].

Setting: [LUGAR con 4-5 objetos concretos]. [LUZ]. Widescreen cinematic frame.
No text, no subtitles, no user interface, no button prompts, no logos, no watermark.
```

**Si sale con pinta de foto real o de dibujos animados, NO cambies palabras: cambia las capturas de
referencia** por otras más cercanas a lo que quieres. El estilo lo fijan las imágenes, no el texto.

---

## 4 · Un fotograma por plano (Nano Banana)

Referencias en cada plano, en este orden:
1. La imagen del personaje.
2. **La prueba de estilo aprobada** (arrastra el look, la luz y el personaje ya convertido). Si el plano
   pasa en el mismo sitio que otro ya aprobado (la misma calle, la misma tienda), usa ese fotograma:
   mantiene el lugar y la luz.
3. y 4. Dos de tus capturas del juego.

```
Render EXACTLY in the look of reference image 2 (same character model, same rendering, same colour
grade) and references 3 and 4: an in-engine cutscene from a next-generation AAA open-world game (GTA VI
trailer look). High-end 3D game character models with realistic proportions but a subtle not-quite-real game look:
matte smooth skin, slightly stiff sculpted features, soft anti-aliasing softness, soft global
illumination, deep natural shadows, natural slightly desaturated cinematic grade.
NOT a photograph, NOT cartoon.

Character: the same [PERSONA] as in references 1 and 2, [DESCRIPCIÓN + TRES ANCLAS + ROPA].

Scene: [LUGAR, momento del día]. [LO QUE HACE, en el PRIMER instante del plano]. [ESTADO DE LOS
OBJETOS QUE VAN A CAMBIAR, ej. the metal shutter is already half down, at waist height].
[PLANO Y CÁMARA]. Widescreen cinematic frame. No text, no readable signs, no labels on packaging,
no user interface, no logos, no watermark.
```

### Antes de aprobar cada fotograma, mira estas 8 cosas

| Mira | Por qué | Si falla |
|---|---|---|
| Letras o logos (carteles, envases, edificios) | Salen marcas reales: nos pasó con un hotel y con bolsas de patatas | Arreglo A |
| Hora del día | A veces pone atardecer en una escena de noche | Arreglo B |
| El estado inicial de lo que va a cambiar | El vídeo solo sabe hacer lo que empieza bien | Regenera describiendo el estado |
| "El último producto" | Si pelean por lo último, la estantería tiene que estar vacía | Arreglo C (regenerando) |
| Hacia dónde mira y hacia dónde va | Con la figura pequeña o de frente, el vídeo la puede mover marcha atrás | Cámara detrás, avanzando |
| Qué tiene cada secundario en la mano | Nos puso copas de vino al lado de los niños | Arreglo D |
| Edades de los secundarios | "Family of all ages" dio una mesa de señores mayores | Escribe edades y "she is the only grey-haired person" |
| Las tres anclas del personaje | Si falta una (nos pasó con el pañuelo), no la reconoces | Regenera nombrándola "clearly visible" |

### Arreglos (edición de la imagen aprobada, Nano Banana edit)

**A · Quitar textos y logos**
```
Remove ALL text, letters, numbers and brand logos from every sign, package and building in the
image: signs become plain glowing panels, packages become plain unlabeled packaging in solid
colours. Keep everything else identical: characters, poses, lighting, composition, rendering style.
```

**B · Pasar a noche**
```
Change the sky to a dark midnight blue night sky so it is clearly late at night. Keep everything
else identical: characters, poses, lighting on the characters, composition, rendering style.
```

**C · El último producto** (aquí editar no basta: regenera el fotograma con esta frase en la escena)
```
The fridge shelves behind them are completely EMPTY: bare lit white shelves, not a single
[PRODUCTO] left. [SECUNDARIO] holds the LAST [PRODUCTO] in his hand; [PERSONAJE] steps in right
next to him, her hand already reaching for it.
```

**D · Cambiar un objeto concreto**
```
Change ONLY [OBJETO Y DÓNDE ESTÁ]: replace it with [OBJETO NUEVO]. Do not change anything else:
same people, same faces, same lighting, same colour grade, same composition, same rendering style.
```

---

## 5 · El vídeo desde el fotograma (Higgsfield · Seedance 2.0)

- **La imagen va como fotograma de inicio (`start_image`), no como referencia.** Como referencia,
  el vídeo cambia el encuadre y pierde el look.
- Sin imágenes de personaje aquí: el fotograma ya lo lleva todo.
- Duración 6 s para una frase, 8 s para dos frases o acción larga. Audio activado.
- Pide **2 variantes** de cada plano. Sale más barato que repetir.

```
Continue from the start image keeping its exact look: an in-engine cutscene from a
next-generation open-world crime game (GTA VI trailer style), high-end 3D game character models, matte game skin,
soft global illumination, natural cinematic grade. Never live-action.

[ACCIÓN, EN ORDEN, UNA FRASE POR PASO:
 1) lo que pasa primero y quién habla: The clerk keeps pulling the shutter DOWN and says: 'Sorry, we're closed.'
 2) la respuesta: She says in English with a strong Spanish accent, low and dry: '[FRASE]'
 3) lo que cambia después: He sighs and lifts the shutter back UP a little. She ducks under it into the shop.]
[CÁMARA: locked medium two-shot / third-person chase camera low behind her, motion blur].
[SI HAY MOVIMIENTO: She rides FORWARD, AWAY from the camera. Everything rushes past toward the
camera. Constant forward motion, never backwards.]
[SI HAY CAOS: Nobody gets hurt; it is cheeky mischief, not violence.]

Sound: [3 SONIDOS CONCRETOS]. No music. No on-screen text, no readable signs, no user interface, no logos.
```

**Reglas que evitan repetir planos:**
- Las frases, entre comillas simples y cortas. Di quién las dice y con qué acento.
- Si el otro personaje habla, que hable PRIMERO y que ella responda: la boca sincroniza mejor por turnos.
- Cada cambio físico, en mayúsculas: DOWN, UP, FORWARD, AWAY, EMPTY.
- "No music": aun así, en planos sin diálogo a veces mete música. Se quita en el montaje (`"silenciar": true`).
- Si la plataforma te propone un preset en vez de generar, recházalo y genera literal.

---

## 6 · El montaje.json (Claude Code)

```
Tengo mis clips elegidos en clips/ y una grabación de pantalla de mi app en
clips/pantalla-movil.mp4. Usa el kit de esta carpeta (LEEME.md y montaje.ejemplo.json).
1. Transcribe cada clip con marcas de tiempo por palabra y dime qué frase dice y en qué segundo.
2. Escribe montaje.json siguiendo montaje.ejemplo.json: el gancho primero (el plano más caótico,
   3-4 s, congelado con un stinger de "X MINUTES EARLIER"), después la historia en orden.
   Los subtítulos con los tiempos reales de la transcripción, nunca a ojo.
3. Ejecuta `python3 montaje.py revisar montaje.json` y enséñame las 6 imágenes de revisión.
4. Cuando te dé el OK, `python3 montaje.py todo montaje.json`.
Antes de terminar, extrae 12 fotogramas del vídeo final y comprueba que ningún rótulo tapa una cara
y que ninguna frase del HUD dice algo que el vídeo no enseña.
```

---

## 7 · El prompt maestro (Claude Code con los dos conectores)

```
Vamos a hacer un vídeo corto estilo tráiler de videojuego de mundo abierto siguiendo la guía
marbuilds.dev/resources/video-gta-ia y los prompts de prompts.md de esta carpeta.
Personaje: fotos en fotos/. Estilo: capturas del juego en estilo/. Misión: [UNA FRASE].
Trabaja por fases y PARA al final de cada una hasta que yo apruebe:
1. Guion en 10 planos (prompt 1).
2. Personaje (prompt 2). Enséñamelo.
3. Prueba de estilo del plano más difícil (prompt 3). Enséñamela. No sigas sin mi OK.
4. Un fotograma por plano (prompt 4), revisando las 8 cosas de la tabla. Enséñamelos en una hoja
   de contacto y dime qué has arreglado.
5. Vídeo de cada plano desde su fotograma (prompt 5), 2 variantes, [720p para probar / 1080p final].
   Antes de lanzar, dime cuántos créditos cuesta. Revisa cada clip con una hoja de fotogramas y una
   transcripción, y dime cuál eliges y por qué.
6. Montaje con el kit (prompt 6).
Nunca inventes lo que hace mi producto en un rótulo: solo lo que se ve en la grabación real.
```
