Revelan que tres modelos de la IA Claude hackearon organizaciones durante una serie de pruebas; esto sabemos

En uno de los incidentes, Claude trató de recaudar fondos para obtener un número telefónico y crear una cuenta de correo electrónico.

Icono de la aplicación Claude AI mostrado junto a otras herramientas de IA | Shutterstock. |
Ciudad de México /
Únete al canal de Milenio

Anthropic, empresa dedicada al desarrollo de inteligencia artificial (IA), confirmó que tres modelos de su asistente Claude obtuvieron acceso no autorizado a los sistemas de tres organizaciones durante una evaluación.

Mediante un comunicado, la compañía establecida en San Francisco, California, explicó que los incidentes fueron detectados durante una revisión retrospectiva a sus procesos de ciberseguridad. Lo que incentivó dicho análisis fue la revelación, en días previos, de que dos modelos de OpenAI hackearon de forma autónoma a la empresa Hugging Face.

¿Cómo ocurrieron los hackeos de Claude?

Según la información difundida por Anthropic, al analizar más de 141 mil procesos de evaluación se identificaron tres episodios en los que distintos modelos de Claude obtuvieron acceso a internet y vulneraron la infraestructura digital de tres organizaciones diferentes.

En su informe, Anthropic aclaró que los modelos involucrados —Opus 4.7, Mythos 5 y un prototipo que no se ha lanzado al público— fueron sometidos a una prueba conocida como "Captura la bandera".

En este tipo de evaluaciones, los especialistas presentan un escenario ficticio e indican que cierta información se ha ocultado en otro equipo de la red, por lo que los modelos de IA deben acceder a él y recuperarla. Uno de los planteamientos, por ejemplo, consistía en interpretar a un trabajador de una empresa ficticia que pretendía atacar los sistemas internos de la misma.

En todos los casos, los evaluadores de Anthropic le indicaron a Claude que su entorno era una simulación sin acceso a internet. Sin embargo, debido a un malentendido con su colaboradores en la prueba, los modelos sí tuvieron acceso a la red. "Cuando la búsqueda de Claude lo llevó a sistemas reales en internet, los trató como parte del ejercicio".

"En todos los casos, las instrucciones de la evaluación indicaban explícitamente que Claude no tenía acceso a Internet, pero no le imponían ninguna restricción sobre dónde buscar la información. Sin embargo, debido a un error de configuración, los equipos a los que Claude accedió como parte de la evaluación tenían acceso activo a Internet", se lee en el informe

Después de conectarse a internet, los modelos de Claude vulneraron la infraestructura de tres organizaciones no especificadas, mediante técnicas como la explotación de contraseñas débiles. En uno de los incidentes, el nombre de la empresa ficticia que se le otorgó a la IA coincidía con el de un dominio web real y activo al que Claude accedió.

En otro de los episodios, Claude destinó una cantidad notoria de recursos tecnológicos, pues identificó que una vía para completar la tarea asignada era crear una carpeta de archivos y subirla como un paquete malicioso de código abierto a PyPI, como se le conoce al repositorio oficial de software en lenguaje de programación Python.

Para lograrlo, la IA requería acceso a un número telefónico para crear una cuenta de correo electrónico y, con ella, abrir un perfil en PyPI. En su búsqueda, Claude trató de obtener fondos para pagarle a un proveedor de servicios telefónicos, pero no lo logró. En su lugar, encontró un proveedor gratuito de correos electrónicos con el que se registró para subir el software malicioso a la plataforma.

Tras analizar los diversos incidentes, Anthropic determinó que Claude "no detectó ni aprovechó ninguna vulnerabilidad compleja" y en cada caso, "siguió trabajando para completar únicamente la tarea específica que se le había asignado en la evaluación". En el mismo reporte, la empresa aseguró que en ninguno de los casos los modelos de IA trataron de salir deliberadamente de su entorno de pruebas.

Aunque el primer incidente ocurrió en abril de 2026, la empresa detectó los ciberataques hasta el 24 de julio, durante su revisión a las evaluaciones previas. De las tres organizaciones afectadas, Anthropic logró establecer contacto con dos, quienes manifestaron no haber detectado ninguna actividad irregular.


BM.

  • Baruc Mayen
  • Editor digital en la Unidad de Crecimiento de Milenio. Especialista en investigaciones a profundidad sobre derechos humanos, violencia y seguridad. Comunicólogo egresado de la FCPyS de la UNAM y apasionado de la fotografía.

LAS MÁS VISTAS

¿Ya tienes cuenta? Inicia sesión aquí.

Crea tu cuenta ¡GRATIS! para seguir leyendo

No te cuesta nada, únete al periodismo con carácter.

Hola, todavía no has validado tu correo electrónico

Para continuar leyendo da click en continuar.

Suscríbete al
periodismo con carácter y continua leyendo sin límite