OpenAI exhibe casos donde la IA generó instrucciones para ignorar a sus creadores

Estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos.

OpenAI es la empresa detrás de ChatGPT. Foto: Reuters
México /
Únete al canal de Milenio

OpenAI reveló varios casos en los que modelos de Inteligencia Artificial (IA) generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de "desalineamiento" de sus sistemas.

Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas.

Te recomendamos leer...
¿Qué es el RSI? La técnica que podría hacer que la IA se mejore a sí misma y se salga de control

IA reescribe sus propias instrucciones

En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.

La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba.

Otro agente subió un archivo a internet para utilizarlo posteriormente como fuente de información, mientras que otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.

OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025.

La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos.

Empleados de OpenAI reportará incidentes detectados

El nuevo marco permitirá a cualquier empleado de OpenAI señalar un posible incidente para que sea revisado por los equipos de seguridad y alineamiento.

Los casos serán clasificados en tres vías según su complejidad: aquellos listos para ser divulgados, investigaciones menores y casos que requieran una investigación más amplia.

La compañía reconoció que, hasta ahora, sus informes sobre desalineamiento habían sido publicados de forma irregular y con menor frecuencia de la deseada.

OpenAI afirmó que pretende publicar los incidentes con mayor regularidad y que el nuevo sistema pueda contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.

el dato

¿Qué es la IA?

La IA es un campo de la informática que se enfoca en crear máquinas inteligentes que puedan realizar tareas que normalmente requieren inteligencia humana, como aprender, razonar y resolver problemas. Los sistemas de IA aprenden de grandes cantidades de datos, identifican patrones para hacer predicciones o tomar decisiones sin estar programados explícitamente para cada situación. Piensa en ello como enseñarle a una computadora mostrándole un millón de ejemplos en lugar de escribir un millón de reglas.

RM

  • Agencia EFE
  • Agencia de noticias con 84 años de trayectoria

LAS MÁS VISTAS

¿Ya tienes cuenta? Inicia sesión aquí.

Crea tu cuenta ¡GRATIS! para seguir leyendo

No te cuesta nada, únete al periodismo con carácter.

Hola, todavía no has validado tu correo electrónico

Para continuar leyendo da click en continuar.

Suscríbete al
periodismo con carácter y continua leyendo sin límite