
Piezas dirigidas y terminadas yo solo con modelos generativos: una serie animada para niños, un videoclip con lip-sync real, unos cortos sobre una reforma electoral colombiana y producción con IA para una organización ciudadana de Malasia. Empezó como pasatiempo y lo sigue siendo. Lo que lo vuelve útil es todo lo de debajo: cómo se sostienen los personajes, cómo una boca encaja con una canción y qué modelo hace qué.
Un pasatiempo que se volvió herramienta
Los hago de noche, por razones mías: cuentos para niños, y vídeo para organizaciones que tienen algo que decir y ningún presupuesto para rodarlo. Sigue siendo un pasatiempo. Lo que cambió es que las piezas dejaron de ser pruebas y pasaron a ser películas terminadas: con calendario, con un estilo fijo y con una duración que alguien aguanta de verdad.
Esa es la parte que sirve para trabajar. Generar un clip bonito de ocho segundos es fácil. Generar doscientos y que parezcan la misma película es un problema de producción, y los problemas de producción se resuelven con proceso, no con prompts.
Cómo se hace una
Nada se genera en el orden en que se ve. Primero los personajes, dibujados una vez en tres vistas —frente, perfil y espalda, a la misma escala—, y esos dibujos son lo único que el modelo de vídeo llega a ver. Después una imagen fija por toma, aprobada antes de gastar un segundo de vídeo, porque rehacer un fotograma no cuesta nada y rehacer un clip sí. Y sólo entonces los clips, de unos diez segundos cada uno: un capítulo de tres minutos llega en veinticinco piezas sueltas.
La canción va antes que la imagen. La música se escribe y se graba primero, y las tomas que cantan se generan con la letra real, encuadradas para que la boca se vea; así las formas salen cerca antes de corregir nada. Los modelos de vídeo no admiten audio, de modo que la sincronía es una segunda pasada, vídeo contra voz, sólo en las pocas tomas que la necesitan. El salto de stop-motion se añade al final, donde además tapa la desviación que quede.
Y luego se monta como cualquier cosa: el audio del modelo silenciado, la mezcla real debajo, y el ritmo, los rótulos y los silencios decididos a mano.
Que siga siendo la misma película
Cada clip se genera solo y no recuerda nada. La continuidad se construye, no se hereda. Cada personaje lleva un color y un objeto para que la silueta se lea aunque el modelo se desvíe, y cada voz sale de una línea de descripción pegada en todos los prompts sin cambiarle una coma.
Cuando dos tomas son en realidad un mismo momento que continúa, la segunda arranca del último fotograma de la primera, que se lleva al otro lado del corte la posición, la luz y el color; pero sólo en tramos de dos o tres. Encadena un capítulo entero y a la quinta generación el personaje se ha derretido en otro.
Un modelo para cada tarea
Ningún modelo es bueno en todo, y usar el caro en todas partes es como te quedas sin créditos a mitad de camino. Las imágenes fijas y las hojas de personaje salen de Nano Banana. El movimiento y el sonido, de Veo y Gemini Omni Flash, dentro de Google Flow. Las canciones de Suno, las voces de ElevenLabs y Gemini. El lip-sync de sync.so, Kling u OmniHuman según la toma. Y después Premiere o CapCut: la herramienta más vieja de la lista y todavía la que decide si aquello funciona.
El Valle
Diez capítulos para niños de tres a seis años sobre convivir: compartir, decir que no, ayudar, aprender mirando. Papel recortado, seis voces y un motivo de tres notas que abre y cierra todos. Sale como Chigüiro Director en Instagram.
Lleva dentro dos silencios que no se dejan llenar: diez segundos sobre una piedra quieta a mitad de episodio, y cuatro segundos absolutos cuando el cuento le pregunta algo al niño. Si algo suena en esos cuatro segundos, el niño no contesta. Eso no es una decisión técnica, y es justo el tipo de decisión sobre la que las herramientas no tienen ninguna opinión.
Ordena Tu Voto
Una campaña por un cambio en la forma en que Colombia elige presidente: un voto ordenado en lugar de la segunda vuelta. Cuatro piezas defienden lo mismo de cuatro maneras distintas —el menos malo, la cuenta, el restaurante, la firma que obliga— porque una sola pieza no llega más que a quien ya estaba escrita para él.
Vertical, fotorrealista, en español colombiano: el registro contrario al del papel recortado, salido exactamente del mismo proceso.
KUASA
Trabajo con esta organización ciudadana de Malasia desde 2022: marca, programas de alfabetización mediática y un informativo semanal. La producción con IA llegó ahí por la razón de siempre: un equipo pequeño con mucho más que decir de lo que puede permitirse rodar. Ahora corren dos líneas, las dos en malayo: una serie de historia política de Malasia y unas piezas sobre las elecciones municipales, el mismo asunto de la encuesta de base en Selangor que ayudé a diseñar. Archivo, documental, gente hablando a cámara: otra cosa distinta.
Lo que es y lo que no
Esto no sustituye a un equipo de rodaje, y no sale más barato que uno cuando ya lo tienes. Lo que cambia es quién llega a hacer una pieza siquiera: una organización sin presupuesto de producción, una serie infantil que existe porque una sola persona podía terminarla, un argumento que necesita existir en cuatro versiones antes de que alguien respalde la primera.
Sigue siendo un pasatiempo. Sólo que ahora sé exactamente cómo funciona.