marbuildsDatos / el mismo vídeo, dos agentes / medidos el 05-10-2026
el mismo clip · el mismo prompt · cada una por su lado

Claude Code contra Codex, en cifras.

Le di la misma toma a Claude Code y a Codex con el mismo encargo: cada cosa que pido en voz alta es un efecto, y el cómo es cosa suya. Esto es lo que gastó cada una, sacado de sus propios registros.

12 efectos pedidos con gestos 0 correcciones, en las dos bruto de 1:59 en 4K a 60 fps 29-09-2026

Las cifras, lado a lado

Claude CodeCodex
Coste a precio de API24,07 $67,48 $
Tokens procesados67,9 M49,6 M
Tiempo de trabajo del agente3 h 27 min2 h 44 min
Llamadas a herramientas266364
Duración del máster50,2 s44,9 s
Correcciones00
Pagó algo aparteSí, con mi permiso: una imagen de Nano Banana, 0,039 $No, todo gratis y en local

De dónde sale el coste

Claude Code gastó más tokens y aun así costó casi tres veces menos. El 98 % de los tokens de las dos son contexto que el agente vuelve a leer en cada paso desde la caché, y releer le cuesta a GPT-6 Astra cinco veces más: 1 $ por millón frente a 0,20 $. De ahí salen 35 de los 43 $ de diferencia.

Precio por millón de tokensOpus 5.5GPT-6 Astra
Entrada4 $10 $
Caché leída0,20 $1 $
Escritura en caché8 $ (caché de 1 h)12,50 $
Salida20 $50 $
Tokens: caché leída · nuevos · salida66,96 M · 0,75 M · 0,23 M48,45 M · 0,95 M · 0,19 M

Es lo que costaría pagando por API. Con una suscripción pagas la cuota, no esto; la cifra sirve para comparar cuánto trabajo gastó cada una. Codex no informa de sus escrituras en caché; si sus tokens nuevos lo fueran, su total subiría a 69,85 $. Ninguna de sus peticiones pasó de 272 mil tokens, el umbral en el que GPT-6 Astra cobra tarifa de contexto largo.

Herramientas, tarea a tarea

Partían del mismo material y de las mismas herramientas instaladas. Las dos montaron con Remotion y eligieron Three.js para el 3D. Donde más se separaron fue en el fondo.

TareaClaude CodeCodex
MontajeRemotion las dosRemotion
Logos en 3DThree.js: Claude extruido de su SVG oficial, y el icono oficial de Codex sobre una pieza en 3D las dosThree.js: los dos extruidos de sus SVG oficiales
Recortarme del fondoRobustVideoMatting, a 1080x1920 las dosRobustVideoMatting, máscaras a 360x640
TranscripciónWhisper large-v3-turbo, en local las dosWhisper large-v3-turbo, en local
Seguir mis manosMediaPipe HandsOpenCV, y a mano en el lanzamiento
La habitación sin míLa pared real + Nano Banana para el hueco, con mi permisoStable Diffusion en local, gratis, y quitó la silla
SubtítulosDentro de RemotionQuemados con ffmpeg
Efectos de sonidoSintetizados por código las dosSintetizados en local
Skills que leyeron las dosLas skills oficiales de Remotion y mi skill de edición, solo como consulta de subtítulos y marca.
Solo Claude CodeUsó la skill de Nano Banana una vez, para generar la parte de la habitación que yo tapaba.

Hazlo tú, paso a paso

Así preparé la mía, en orden. Lo que más cambia el resultado pasa antes de abrir el agente: el guion de la toma y cómo grabas.

  1. Escribe el guion de la toma. Una lista de órdenes y, para cada una, lo que dices, el gesto y el efecto que quieres. La primera frase tiene que funcionar sola, porque es tu gancho. Guárdalo como guion-toma.md. Tres de las mías:
    • "Pon el logo de Claude aquí, en 3D." · palma abierta hacia arriba · el logo flotando sobre la mano
    • "Escóndeme." · te tapas la cara · desapareces del plano
    • "Pantalla completa." · chasquido de dedos · vuelta al plano entero
  2. Grábalo pensando en la edición. Vertical, 4K a 60 fps y en trípode: la cámara no se mueve en todo el clip. Micro de solapa, para tener las dos manos libres. Plano medio con aire a los lados, para que las manos no se salgan al abrir los brazos. Empieza con 3 segundos de plano vacío, sin ti: es el fondo limpio que necesitan los efectos en los que desapareces. Entre orden y orden, manos abajo un segundo, y después de cada orden sostén el gesto un segundo y medio en silencio: ahí va el efecto.
  3. Prepara la carpeta. El clip, guion-toma.md, una carpeta logos/ con los logos oficiales de cada marca que nombras (del kit de prensa de cada una) y tus vídeos si alguna orden los usa.
  4. Abre el agente en esa carpeta y pega el prompt. Yo usé Claude Code con Opus 5.5 en effort medium; Codex con GPT-6 Astra también lo hizo. Rellena lo que va entre corchetes.
  5. Revisa en cada fase. Primero la lista de efectos con sus segundos: aquí se corrige casi todo. Después el primer efecto, que fija el estilo de los demás. Al final, el máster. Pide cambios concretos ("que el logo entre 3 fotogramas antes", "más grande") y no un "mejóralo".
  6. Cuenta con unas horas. A mí, un vídeo de menos de un minuto le llevó al agente 3 h 27 min de trabajo, y a precio de API habrían sido unos 24 $ con Claude Code.

El prompt, listo para tu clip

Es el mismo encargo que les di a las dos, con su misma libertad: qué quiero, no cómo hacerlo. Con esa libertad sacaron lo mejor; las dos eligieron sus herramientas y casi coincidieron. Lo que era de mi proyecto ahora son huecos entre corchetes para lo tuyo, y he añadido dos cosas que aprendí en la prueba: grabar el plano vacío y revisar la sincronía antes del máster.

Edita mi clip [nombre-del-clip.mov] (vídeo vertical para [TikTok / Instagram], en [idioma]).

Trabaja solo en esta carpeta. Si es un repo de git, trabaja en una rama nueva, nunca uses git add -A y no integres nada en main sin mi OK.

Antes de nada, lee guion-toma.md: las órdenes que doy en el clip, cada una con su gesto y el efecto que pido.

Todo lo que necesitas está en esta carpeta:
- [nombre-del-clip.mov]: el bruto. No lo muevas, no lo borres y no lo modifiques.
- logos/: los logos oficiales de las marcas que nombro. No los recolorees ni los deformes.
- [mis-videos/]: vídeos míos, para las órdenes que los usan.

El encargo: en el clip pido efectos en voz alta, uno tras otro, cada uno con su gesto. Cada cosa que pido es una instrucción de edición. Hazlas todas, lo mejor que sepas: tiene que quedar espectacular, y cada efecto tiene que caer justo en su gesto. El cómo es tuyo. Usa las herramientas que hagan falta:
- Ya tengo instalado: [ffmpeg, Remotion, RobustVideoMatting para recortarme del fondo, Whisper para transcribir y Playwright]. Pon lo que tengas tú, y dónde está.
- Remotion tiene skills oficiales para agentes en github.com/remotion-dev/skills: léelas si vas a usar Remotion.
- Si te falta algo gratuito (seguimiento de manos, 3D, recorte por capas, relleno de fondo), instálalo dentro de esta carpeta o en un entorno propio, nunca de forma global, y apúntalo. Si algo es de pago o necesita una cuenta, pregúntame antes.

Lo que ya sé del clip:
- [Lo que sobra al principio y al final.]
- [Palabras que la transcripción puede entender mal. Ejemplo: donde digo "Cloud" es "Claude".]
- [Si repetí una orden: quédate con la mejor.]
- Los primeros 3 segundos son el plano vacío, sin mí: es el fondo limpio para los efectos en los que desaparezco o me separo en capas. La cámara no se mueve en todo el clip.
- [Si una orden pide explicar algo en pantalla, el contenido exacto. Ejemplo: "CRISPR en tres pasos: el álbum, las tijeras y escribir".]
- Subtítulos en [idioma] quemados, abajo, salvo cuando abajo haya un efecto.

Fases:
1. Transcribe el clip y dame la lista de efectos con su segundo exacto y cómo piensas hacer cada uno (qué herramienta). Espera mi OK.
2. Haz el primer efecto y enséñamelo. Espera mi OK.
3. Haz el resto. Antes de darme el máster, mira fotograma a fotograma el momento de cada efecto y comprueba que la voz va sincronizada con la imagen; arregla lo que veas y entrégalo.

Entrega, en esta carpeta:
- el máster con subtítulos ([1080x1920], [60] fps);
- el mismo máster sin subtítulos, con los mismos tiempos;
- una lista de cortes: qué segundo del bruto va en qué segundo del máster. No cambies la velocidad del clip;
- un INFORME.md corto: qué herramienta usaste para cada efecto, qué instalaste y qué no te salió y por qué.

Cómo lo medí

Tokens y costeDel registro local de cada sesión: el uso de cada respuesta en Claude Code y el último contador de Codex antes de terminar la edición. Precios oficiales de Anthropic; los de OpenAI, de dos fuentes que coinciden.
TiempoEl mismo método en las dos: desde cada mensaje mío hasta la última acción del agente antes del siguiente. No cuenta lo que tardaba yo en contestar. Las dos trabajaron a la vez en el mismo ordenador.
CorreccionesCero en las dos: ningún efecto tuvo que rehacerse.
Lo que no mideCuál editó mejor. Eso lo decides tú viendo el vídeo.