GPT-Red

Nace GPT-Red: la IA que intenta engañar a otras IA para hacerlas más seguras

ChatGPT será casi imposible de engañar

ChatGPT y otras IAs son cada vez más eficientes. Sus algoritmos aprenden de nosotros, pero también pueden aprender cuando otras IAs les muestran el camino. Pero entre tanto, también hay muchos intentos de encontrar la forma de saltarse sus límites. Hay usuarios que prueban instrucciones extrañas, cadenas de mensajes largas o trucos de redacción para conseguir que un modelo haga algo que, en teoría, no debería hacer.

OpenAI quiere anticiparse a ese tipo de ataques con GPT-Red, un nuevo modelo interno diseñado para poner a prueba sus propias inteligencias artificiales. En este caso no se dedica a crear imágenes ni responder consultas, ya que su misión es encontrar fallos que se salten sus límites.

¿Qué es GPT-Red?

GPT-Red es lo que OpenAI llama un sistema de red teaming automatizado. El nombre viene de los equipos rojos, grupos de especialistas que intentan atacar un producto, una red o un sistema para descubrir sus puntos débiles antes de que lo haga alguien con malas intenciones. Una parte de ese trabajo la realiza otra IA. GPT-Red prueba de forma automática distintos métodos para engañar a los modelos defensores de OpenAI, localizar comportamientos no deseados y detectar posibles vulnerabilidades.

OpenAI ha dejado claro que no sustituye por completo a los expertos humanos, porque las personas siguen siendo necesarias para revisar riesgos complejos, interpretar resultados y encontrar problemas que una IA puede pasar por alto. Lo que hace es escalar el trabajo a un nivel imposible para un equipo humano.

logo de open AI

Su objetivo principal es evitar engaños

Uno de los riesgos que busca GPT-Red son las llamadas inyecciones de prompts. Hablamos de intentos de introducir instrucciones diseñadas para que una IA ignore sus propias normas, revele información que no debería o ejecute acciones fuera de lo permitido. Algunos usuarios intentan convencer a un asistente virtual de que deje de seguir sus reglas. Esto suele hacerse dándole una vuelta a la petición o escondiendo instrucciones dentro de otro texto.

También ha dado resultado cuando se ha usado un documento aparentemente inocente o confundiendo al modelo mediante una conversación larga. OpenAI entrena a GPT-Red con diferentes ataques y engaños a otras IAs. A medida que sus defensas se vuelven más fuertes, GPT-Red tiene que inventar trucos más complejos.

ChatGPT Limites 03

Hackeando una máquina expendedora

Lo más sorprendente es que las pruebas de GPT-Red han llegado al mundo físico. Según OpenAI, GPT-Red atacó a Vendy, un agente de IA que gestiona una máquina expendedora real en la oficina de OpenAI, creada por Andon Labs. Cambió los precios, rebajó un producto caro y canceló un pedido. OpenAI asegura que ha comunicado estas vulnerabilidades.

OpenAI ya ha entrenado a GPT-5.6 contra GPT-Red y detalla que es su modelo más robusto hasta ahora ante posibles engaños y hackeos. También han dejado claro que no van a distribuir este modelo especializado en ataques para evitar que sus capacidades lleguen a verdaderos secuestradores de agentes de IA.

Total
0
Shares
Prev
La función desconocida de ChatGPT que te ayuda a planificar tus finanzas personales
Interfaz de inicio de ChatGPT mostrando columnas de ejemplos, capacidades y limitaciones sobre un fondo azul oscuro.

La función desconocida de ChatGPT que te ayuda a planificar tus finanzas personales

Ahora sabrás exactamente a dónde va tu dinero

Next
Esta app del tiempo es la que usan los quieren saber de verdad qué tiempo va a hacer
Windy app fondo

Esta app del tiempo es la que usan los quieren saber de verdad qué tiempo va a hacer

Profesional y llega de opciones

You May Also Like