OpenAI ha creado un LLM ‘superhacker’ llamado GPT-Red que actúa como compañero de sparring para ayudar a sus otros modelos a reforzar sus defensas contra ciberataques. La compañía acaba de lanzar GPT-5.6, su modelo insignia más reciente, y afirma que entrenarlo contra GPT-Red lo ha convertido en su lanzamiento más robusto hasta la fecha en materia de seguridad.¿Qué es GPT-Red?GPT-Red automatiza una práctica conocida como ‘red-teaming’: un tipo de evaluación de seguridad donde se buscan sistemáticamente formas de vulnerar o secuestrar un sistema. Tradicionalmente, esto lo realizan equipos de expertos humanos que intentan hackear el sistema antes de su lanzamiento para que los desarrolladores puedan parchear los puntos débiles.Pero a medida que los LLM se vuelven más complejos y se utilizan en más tareas —especialmente como agentes autónomos que navegan por la web, leen correos, editan código e interactúan con otros agentes—, a los humanos les resulta cada vez más difícil mantener el ritmo. «La superficie de riesgo crece y el radio de impacto también lo hace», explica Nikhil Kandpal, científico investigador en OpenAI y cocreador de GPT-Red.Cómo entrena OpenAI a su superhackerPara desarrollar GPT-Red, los investigadores utilizaron un LLM sin entrenamiento previo en hacking y lo configuraron en un bucle de autoaprendizaje con varios modelos. El objetivo: GPT-Red intentaba atacar a los otros modelos, mientras estos intentaban defenderse. Tras miles de rondas, GPT-Red se volvió cada vez más hábil atacando, y los otros modelos mejoraron sus defensas.El entrenamiento tuvo lugar en un ‘dojo’ digital que simula escenarios del mundo real: navegar por webs, leer correos electrónicos, manejar calendarios y editar código. Cuando GPT-Red descubría un nuevo tipo de ataque, exploraba múltiples variantes para encontrar la más eficaz.El descubrimiento más preocupanteOpenAI afirma que GPT-Red descubrió un tipo de ataque de inyección de prompt completamente nuevo, al que llaman ‘cadena de pensamiento falsa’. La cadena de pensamiento es una especie de diario interno donde un LLM toma notas mientras resuelve problemas. GPT-Red encontró la forma de insertar una entrada falsa en ese diario, engañando al modelo para que actuara basándose en información inventada.«Es como si te dijera que 1+1=3 y que ya lo has verificado», explica Chris Choquette-Choo, científico del equipo. «El modelo responde: ‘Oh, vale, claro’, y simplemente arroja un 3».Resultados espectacularesOpenAI probó los ataques más potentes de GPT-Red contra sus propios modelos:- Más del 90% de los ataques funcionaron contra GPT-5 (lanzado en agosto de 2025)- Menos del 23% funcionaron contra el nuevo GPT-5.6La compañía también probó a GPT-Red contra Vendy, un agente para máquinas expendedoras desarrollado por Andon Labs. GPT-Red logró hackearlo para modificar precios y cancelar pedidos de clientes.En una comparativa directa con expertos humanos en red-teaming, GPT-Red identificó ataques efectivos con más éxito que las personas.Limitaciones y futuroGPT-Red no es perfecto. Se le dan mal los ataques que requieren conversaciones de ida y vuelta entre atacante y objetivo, y tampoco sabe explotar bien imágenes para inyectar prompts maliciosos. OpenAI asegura que GPT-Red complementa, no reemplaza, a los equipos humanos de seguridad.OpenAI no tiene intención de lanzar GPT-Red públicamente. La compañía confía en que su superhacker es más potente que cualquier imitador que alguien pueda intentar crear, ya que han trabajado en él durante más de un año con los recursos computacionales de una de las empresas más ricas del mundo.«No es algo trivial que alguien pueda hacer fácilmente», sentencia Choquette-Choo.Fuente: MIT Technology Review (15 julio 2026)
OpenAI crea GPT-Red: el ‘superhacker’ de inteligencia artificial que enseña a los LLM a defenderse de ciberataques






