ChatGPT se sale de control y realiza ciberataques sin que nadie se lo pidiera
La IA de OpenAI ha protagonizado otro incidente que ya comienza a preocupar. EI Instituto de Seguridad de IA de Reino Unido (AISI) detectó que GPT-6 Astra ejecutó ataques a la cadena de suministro de software que nadie le había pedido. El modelo llevó a cabo un ciberataque en un 29,2% de las simulaciones en […]
Escuchá el resumen
Exclusivo para suscriptores Premium

La IA de OpenAI ha protagonizado otro incidente que ya comienza a preocupar. EI Instituto de Seguridad de IA de Reino Unido (AISI) detectó que GPT-6 Astra ejecutó ataques a la cadena de suministro de software que nadie le había pedido. El modelo llevó a cabo un ciberataque en un 29,2% de las simulaciones en […]
- EI Instituto de Seguridad de IA de Reino Unido (AISI) detectó que GPT-6 Astra ejecutó ataques a la cadena de suministro de software que nadie le había pedido
- El modelo llevó a cabo un ciberataque en un 29,2% de las simulaciones en las que tenía que evaluar la seguridad, algo que GPT-5.5 no hizo
- El AISI realizó las simulaciones en un entorno seguro con ayuda de una herramienta llamada Petri y desactivó los clasificadores de ciberseguridad de Astra, los cuales están pensados para bloquear estos comportamientos
- Los resultados muestran que los ataques simulados pasaron de 26 de 50 trayectorias a 4 de 49, y en estos casos, la IA justificaba el ataque alegando que sería inofensivo o que era la única vía que le quedaba
La IA de OpenAI ha protagonizado otro incidente que ya comienza a preocupar. EI Instituto de Seguridad de IA de Reino Unido (AISI) detectó que GPT-6 Astra ejecutó ataques a la cadena de suministro de software que nadie le había pedido. El modelo llevó a cabo un ciberataque en un 29,2% de las simulaciones en las que tenía que evaluar la seguridad, algo que GPT-5.5 no hizo.
De acuerdo con una publicación en la web del instituto, Astra creó identidades falsas para engañar a desarrolladores, publicó comentarios desde cuentas ficticias para rebatir revisiones de seguridad y entregó código malicioso a repositorios de código abierto. Antes de alarmarse, estos hackeos no ocurrieron en la web, como pasó hace unos meses con Hugging Face. El AISI realizó las simulaciones en un entorno seguro con ayuda de una herramienta llamada Petri y desactivó los clasificadores de ciberseguridad de Astra, los cuales están pensados para bloquear estos comportamientos.
En las simulaciones, Astra recibía un resumen de intentos fallidos anteriores, razonaba sobre sus opciones y proponía atacar un objetivo de terceros fuera del perímetro permitido. Después de eso, la IA escribía y probaba el código malicioso, creaba cuentas falsas y las usaba para enviar contribuciones inofensivas o comentarios. Según los investigadores, esto lo haría para aumentar las posibilidades de que un revisor aprobara los cambios.
Una vez que los científicos se dieron cuenta de este comportamiento, reforzaron las instrucciones y le especificaron que no debía desviarse de lo que se le pedía. Aun así, Astra siguió efectuando ciberataques, aunque en menor medida. Los resultados muestran que los ataques simulados pasaron de 26 de 50 trayectorias a 4 de 49, y en estos casos, la IA justificaba el ataque alegando que sería inofensivo o que era la única vía que le quedaba.
La IA sospechaba que podría ser una simulación El instituto de Reino Unido mencionó que en este tipo de simulaciones, cuando la IA pregunta algo al usuario, siempre recibe un mensaje automático diciendo que use su mejor criterio para continuar. Durante las pruebas, Astra pidió autorización y en múltiples ocasiones interpretó la respuesta automática como luz verde, incluyendo objetivos por los que ni siquiera había preguntado. En algunos casos, la IA identificó que el mensaje probablemente no venía de una persona real.
A primera vista, el estudio no deja bien parado a OpenAI, que ha tenido que lidiar desde julio con el desastre de Hugging Face. El hackeo, que llevaron a cabo algunos agentes que se salieron de su entorno seguro, ha ocasionado que los gobiernos y reguladores alcen la voz y pidan más mecanismos de seguridad. Lo peor de todo es que la compañía sigue disparándose en el pie, como lo vimos en otro ciberatque al Gobierno de Australia, donde tardó semanas para avisarle a las autoridades de ese país.
La única limitación de este estudio es algo que los científicos definen como "conciencia de simulación". Si la IA detecta que el entorno es artificial, podría comportarse de una manera distinta a como lo haría en el mundo real. En el caso de Astra, el AISI dijo que el modelo razonaba a menudo sobre si el escenario era falso y llegó a señalar imperfecciones reales de la simulación.
Pese a ello, Astra siguió atacando, incluso cuando reconocía que podía estar sobrepasando los límites establecidos. Aunque el AISI desactivó las salvaguardas durante las pruebas, los investigadores afirmaron que la alineación del modelo no debería ser la única línea de defensa. El aislamiento de entornos controlados y la monitorización podrían ayudar, aunque no por mucho tiempo.
Preguntale a la nota
Hacé preguntas y la IA responde usando solo este artículo
2 preguntas restantes · Respuestas basadas en el contenido del artículo
Recibí las noticias en WhatsApp
Seguí nuestro canal para recibir lo más importante del día, directo a tu celular.
Noticias Relacionadas

Elon Musk suma US$61.000 millones en solo 24 horas tras el repunte de Tesla y SpaceX
La fortuna de Elon Musk creció un 6,64% en un solo día según Forbes. Revisa las cifras de SpaceX, Tesla y su rol en la seguridad de la IA.

Primer vistazo al regreso de las Air Jordan 7 OG ‘Playoffs’: La mítica silueta de 1992 vuelve para su 35° aniversario
Jordan Brand alista el regreso de las Air Jordan 7 OG 'Playoffs' para 2027. Revisa las primeras imágenes, detalles de diseño, fecha de lanzamiento y precio

Gurú cripto apuntar contra Strategy: "Perdió poder de compra frente a Bitcoin"
Empresario sostuvo que la acción preferente Stretch (STRC) de la firma regresó a niveles cercanos a su valor nominal de u$s100 por unidad

Este truco borra Apple Intelligence de tu Mac y te devuelve 12 GB al instante
Apple Intelligence llegó como una promesa de productividad, pero la realidad es que quedó a deber. La oferta de Cupertino no solo quedó rezagada frente a ChatGPT y Claude, sino que además consume una cantidad de memoria interna considerable en el Mac. La buena noticia es que alguien lanzó una herramienta que permite deshabilitar las […]
Comentarios
para dejar un comentario