GAN

Dos redes que compiten —una genera, otra descubre falsificaciones— y el origen de la imagen sintética moderna.

Una GAN (red generativa antagónica) es una arquitectura de aprendizaje profundo de 2014 donde dos redes compiten: el generador produce imágenes falsas y el discriminador intenta distinguirlas de las reales. Ese juego adversarial fue la primera técnica capaz de sintetizar rostros fotorrealistas y dio origen a los primeros deepfakes.

El juego adversarial de 2014

La idea, publicada por Goodfellow et al. en 2014, es de teoría de juegos: el generador parte de ruido aleatorio e intenta producir muestras que parezcan reales; el discriminador recibe mezcladas muestras reales y generadas y aprende a separarlas. Cada mejora de uno obliga al otro a mejorar, hasta que —en el equilibrio ideal— las falsificaciones son indistinguibles. El entrenamiento es notoriamente inestable (colapso de modos, oscilaciones), pero cuando converge produce resultados nítidos con una sola pasada de inferencia, algo que la difusión solo igualó años después con técnicas de destilación.

Los hitos marcaron una década: las GAN condicionales tipo pix2pix (2016) tradujeron imágenes entre dominios —bocetos a fotos, día a noche—, CycleGAN (2017) lo logró sin pares de entrenamiento, y StyleGAN (2018) de NVIDIA —refinada después en StyleGAN2— generó los rostros sintéticos que popularizó el sitio «this person does not exist».

El papel de las GAN en la historia de la categoría

Las GAN son la tecnología fundacional de la categoría que cubre este sitio. Los primeros deepfakes de 2017 usaban autoencoders adversariales para intercambiar rostros, y DeepNude (2019) era una GAN condicional derivada de pix2pix entrenada para sustituir ropa por anatomía. Aquella generación tenía límites claros: cada tarea exigía entrenar un modelo dedicado con miles de imágenes, los resultados degradaban con poses inusuales y la resolución era baja.

La transición a los modelos de difusión a partir de 2022 eliminó esas barreras — un solo modelo general, guiado por texto, con inpainting nativo— y multiplicó la oferta de servicios. Entender esa genealogía técnica ayuda a leer el mercado actual: los servicios serios documentan qué generación tecnológica usan, y la diferencia se nota en coherencia anatómica, resolución y manejo de prendas complejas, criterios que puntuamos en cada reseña. El contexto general del fenómeno está en ¿qué es Clothoff?.

Dónde siguen vivas y qué legado dejan

Aunque la difusión domina la generación desde texto, las GAN no desaparecieron. Sobreviven donde su velocidad de inferencia importa: super-resolución en tiempo real, transferencia de estilo en video, generación de texturas en videojuegos y compresión neuronal. También siguen en el corazón de muchos sistemas de intercambio facial en vivo, donde generar a 30 cuadros por segundo excluye a los modelos de difusión de decenas de pasos.

Su otro legado es conceptual: el discriminador —una red entrenada para detectar falsificaciones— es el antepasado directo de los detectores modernos de contenido sintético. La dinámica adversarial que definió su entrenamiento describe hoy la relación entre generadores y detectores a escala de industria: cada avance en síntesis degrada los detectores existentes y obliga a reentrenarlos, la carrera que documentamos en detección de deepfakes. Por eso la respuesta regulatoria — el etiquetado de procedencia del EU AI Act— apuesta por marcar el contenido en origen en lugar de confiar solo en detectarlo después.

Para el lector no técnico, la síntesis es esta: las GAN demostraron que una red puede aprender a fabricar imágenes indistinguibles de las reales, y esa demostración redefinió el valor probatorio de la fotografía. Todo lo que siguió —la difusión, el etiquetado obligatorio, la detección forense— es la respuesta del ecosistema a aquel resultado de 2014.

Preguntas frecuentes sobre GAN

¿Las GAN ya están obsoletas?

Para generación desde texto sí fueron desplazadas por la difusión, pero siguen activas en super-resolución, face swap en tiempo real y tareas donde importa la velocidad: una GAN genera en una pasada lo que un modelo de difusión tarda decenas de pasos.

¿Qué significa «antagónico» en este contexto?

Que las dos redes tienen objetivos opuestos y se entrenan una contra la otra: el generador maximiza el error del discriminador y el discriminador lo minimiza. El término técnico es entrenamiento adversarial, de la teoría de juegos.

¿DeepNude usaba una GAN?

Sí, una GAN condicional derivada de pix2pix entrenada con pares de imágenes. Es el motivo de sus límites característicos: baja resolución, fallos con poses inusuales y anatomía incoherente — problemas que los servicios modernos de difusión redujeron.

¿Los rostros de «this person does not exist» son GAN?

Sí, StyleGAN de NVIDIA. Cada recarga muestra un rostro sintetizado desde ruido aleatorio; ninguna de esas personas existe. Fue la demostración pública de que la síntesis facial fotorrealista era trivial de escalar.