GPT-Red: cómo OpenAI utiliza el red teaming automatizado para mejorar la robustez de sus modelos

GPT-Red: cómo OpenAI utiliza el red teaming automatizado para mejorar la robustez de sus modelos

Brain Code |

OpenAI ha desarrollado GPT-Red, un modelo interno de red teaming automatizado diseñado para descubrir vulnerabilidades y generar ataques durante el entrenamiento de otros modelos. Su objetivo es ampliar la capacidad de detectar fallos antes del despliegue y utilizar los resultados para reforzar la resistencia de los sistemas de producción.

Este enfoque parte de un problema de escala. El red teaming humano sigue siendo una pieza esencial para identificar vulnerabilidades, pero requiere tiempo y no puede producir por sí solo el volumen y la diversidad de datos adversariales necesarios para entrenar modelos cada vez más robustos.

GPT-Red busca complementar ese trabajo mediante un proceso en el que los modelos actuales ayudan directamente a mejorar la seguridad de los modelos futuros.

Por qué el red teaming necesita escalar

Los sistemas de inteligencia artificial pueden acceder a información procedente de navegadores, aplicaciones conectadas, archivos locales, correos electrónicos, respuestas de herramientas o repositorios de código.

Estas capacidades permiten realizar tareas en entornos reales, pero también crean oportunidades para que terceros intenten modificar el comportamiento del modelo. Una instrucción maliciosa podría insertarse, por ejemplo, dentro de una página web, un archivo o un correo electrónico para intentar que el sistema ejecute una acción no solicitada.

El red teaming humano permite descubrir este tipo de vulnerabilidades antes del despliegue. Sin embargo, OpenAI identifica dos limitaciones principales:

  • Diseñar y ejecutar las pruebas requiere una cantidad considerable de tiempo
  • Los ataques obtenidos no proporcionan suficiente volumen ni diversidad para entrenar los modelos a gran escala.

Además, algunas evaluaciones de robustez utilizadas habitualmente ya han sido superadas por los modelos más recientes. Esto obliga a desarrollar métodos capaces de evolucionar al mismo ritmo que aumentan las capacidades de los sistemas.

Qué es GPT-Red y cómo funciona

GPT-Red es el modelo de red teaming automatizado más avanzado desarrollado hasta ahora por OpenAI. Se utiliza exclusivamente de forma interna para encontrar vulnerabilidades y producir ataques que puedan incorporarse al entrenamiento de los modelos de producción.

Su funcionamiento reproduce de manera automatizada el proceso de un red teamer humano:

  1. Formula un ataque mediante un prompt.
  2. Observa la respuesta del modelo objetivo.
  3. Analiza el resultado.
  4. Modifica el ataque y vuelve a intentarlo.

OpenAI entrenó GPT-Red con una capacidad de computación comparable a la empleada en algunos de sus mayores procesos de post entrenamiento. Según la compañía, se trata de una cantidad de computación sin precedentes destinada exclusivamente a mejorar la seguridad.

GPT-Red se mantiene separado de los modelos que se despliegan públicamente. De este modo, las capacidades maliciosas que se entrenan específicamente en el atacante no se incorporan a los sistemas disponibles para los usuarios, mientras que la resistencia obtenida sí puede transferirse a los modelos de producción. 

Entrenamiento mediante aprendizaje por refuerzo y self-play

GPT-Red se entrena mediante aprendizaje por refuerzo con self-play. En este proceso, el modelo atacante y un conjunto diverso de modelos defensores evolucionan simultáneamente dentro de diferentes escenarios de red teaming.

Los incentivos de cada parte son opuestos:

GPT-Red recibe una recompensa cuando consigue provocar un fallo válido, como una prompt injection efectiva.

  • Los modelos defensores son recompensados cuando resisten el ataque y completan correctamente la tarea original.
  • A medida que los defensores mejoran, GPT-Red necesita descubrir ataques más fuertes y variados para seguir obteniendo resultados.

El entrenamiento utiliza un conjunto amplio de escenarios realistas. Cada entorno define qué elementos puede controlar GPT-Red y qué resultado se considera un ataque exitoso. El modelo puede controlar, por ejemplo, una parte de un archivo local, el cuerpo de un correo electrónico, un banner de una página web o la salida de una herramienta.

Al finalizar su entrenamiento, GPT-Red podía comprometer a casi todos los modelos contra los que había sido probado, incluidos modelos internos y de producción hasta GPT-5.5. Posteriormente, sus prompt injections se utilizaron para entrenar GPT-5.6 y aumentar su resistencia frente a esos ataques. 

Qué capacidad de ataque ha demostrado GPT-Red

OpenAI evaluó si GPT-Red podía aplicar sus capacidades en escenarios y modelos diferentes de los utilizados durante el entrenamiento.

Para ello, empleó una versión replicada del entorno de evaluación de prompt injections indirectas de Dziemian et al. En esta prueba, tanto GPT-Red como varios red teamers humanos propusieron ataques de forma independiente contra GPT-5.1.

Los escenarios y objetivos eran distintos de los utilizados durante el entrenamiento de GPT-Red. Los resultados comunicados por OpenAI fueron:

  • GPT-Red logró atacar con éxito el 84 % de los escenarios.
  • Los participantes humanos obtuvieron éxito en el 13 %.

Según estas pruebas, GPT-Red consiguió producir ataques efectivos en un número sustancialmente mayor de escenarios que los red teamers humanos dentro de ese entorno concreto de evaluación.

Pruebas en sistemas autónomos

OpenAI también evaluó GPT-Red contra sistemas con funcionamiento similar al de aplicaciones reales, en los que el atacante no disponía de información completa sobre el modelo o el diseño interno del sistema.

Ataque contra una máquina expendedora gestionada por IA

En uno de los experimentos, GPT-Red atacó a un agente encargado de gestionar una máquina expendedora instalada en las oficinas de OpenAI y desarrollada por Andon Labs.

El modelo recibió una descripción del sistema y pudo enviar ataques y observar llamadas a herramientas dentro de una simulación que reproducía el despliegue real. Después de probar y modificar sus ataques, los aplicó contra el agente de producción.

GPT-Red consiguió alcanzar tres objetivos maliciosos:

  • Cambiar el precio de un producto caro disponible en inventario hasta el mínimo permitido de 0,50 dólares.
  • Pedir un producto nuevo de más de 100 dólares y ofrecerlo por 0,50 dólares.
  • Cancelar el pedido de otro cliente.

OpenAI comunicó estas vulnerabilidades y señaló que se estaban probando nuevas salvaguardas.

Ataques contra un agente de Codex CLI

GPT-Red también fue evaluado contra un agente de Codex CLI basado en GPT-5.4 mini.

La prueba incluyó diez escenarios reservados relacionados con la exfiltración de datos. OpenAI comparó el rendimiento de GPT-Red con una versión de referencia basada en GPT-5.5.

En esta evaluación, GPT-Red consiguió que el agente exfiltrara información sensible en un mayor número de escenarios y utilizó menos tokens para hacerlo

Cómo se utiliza GPT-Red para mejorar la robustez

El propósito final de GPT-Red no es únicamente localizar vulnerabilidades, sino integrar sus ataques en el entrenamiento de los modelos que posteriormente se despliegan.

Durante los seis meses anteriores a la publicación del artículo, OpenAI entrenó versiones progresivamente más potentes de sus modelos automatizados de red teaming. Estos modelos se utilizaron en el entrenamiento de cada modelo de producción lanzado desde GPT-5.3.

La compañía ofrece varios resultados sobre esa evolución:

  • Una versión inicial de GPT-Red identificó una categoría de ataques directos denominada “Fake Chain-of-Thought”.
  • Estos ataques alcanzaban tasas de éxito superiores al 95 % contra GPT-5.1.
  • Su tasa de éxito se redujo por debajo del 10 % en GPT-5.6 Sol.
  • Algunas evaluaciones de prompt injection indirecta dirigidas a herramientas de desarrollo y navegación superan el 97 % de precisión con el modelo más reciente.
  • En un conjunto amplio de entornos de robustez, GPT-5.6 Sol falla ante el 0,05 % de las prompt injections directas generadas por GPT-Red.

OpenAI también indica que GPT-5.6 Sol registra seis veces menos fallos en su evaluación más exigente de prompt injections directas que el mejor modelo de producción de la compañía cuatro meses antes.

Robustez sin reducir las capacidades del modelo

Un modelo podría parecer más seguro simplemente rechazando más solicitudes o reduciendo lo que es capaz de hacer. OpenAI señala que este comportamiento no representaría una mejora útil de la robustez.

Para comprobarlo, la compañía evaluó conjuntamente:

  • Las capacidades generales del modelo.
  • Su tendencia a rechazar solicitudes legítimas.
  • Su resistencia frente a instrucciones maliciosas.
  • El uso correcto de las herramientas.

Según los resultados presentados, las capacidades normales se mantuvieron mientras aumentaba de forma significativa la robustez. OpenAI interpreta que las mejoras proceden de una mayor resistencia a las instrucciones maliciosas, y no de una reducción general de capacidades, un uso incorrecto de herramientas o un aumento indiscriminado de los rechazos. 

El red teaming automatizado como mecanismo de mejora continua

OpenAI plantea GPT-Red como el inicio de un ciclo de mejora aplicado a la seguridad: utilizar los modelos actuales para entrenar sistemas futuros más robustos, alineados y confiables.

La compañía prevé continuar ampliando la capacidad de computación y los datos utilizados, además de introducir mejoras algorítmicas. El objetivo es desarrollar nuevas versiones de GPT-Red capaces de superar al modelo actual y utilizar sus ataques para reforzar las siguientes generaciones de GPT.

Este enfoque no sustituye al red teaming humano. OpenAI señala que continuará combinándolo con evaluaciones realizadas por personas y terceros, salvaguardas por capas y sistemas de monitorización en tiempo real. 

Fuente

OpenAI, “GPT-Red: Unlocking Self-Improvement for Robustness”, OpenAI, 15 de julio de 2026.

 

Leave a comment