Unos agentes autónomos de OpenAI se escaparon de su ambiente de pruebas y entraron a la infraestructura de producción de Hugging Face, la plataforma donde se comparten modelos y datos abiertos. Lo grave fue que OpenAI no lo notó, fue Hugging Face quien detectó al intruso y avisó. Nueve días después salió Anthropic a decir que había revisado 141 mil 6 corridas de evaluación y encontrado que sus modelos entraron sin autorización a los sistemas de tres organizaciones. Ninguna se había dado cuenta. Una semana más tarde, Meta reportó lo mismo… el mismo inconveniente.
Me surgen varias preguntas. ¿Fue un error de software? ¿O estos modelos son tan eficientes que buscan cumplir su tarea a como dé lugar? ¿Quién responde por lo que hace una IA? ¿Podemos escribirles todos los “no”? ¿Y qué debería aprender de esto un consejo de administración mexicano?
Cada caso cuenta con su diferenciación, ya que las de Anthropic y Meta fueron fallas de contención: el mismo proveedor externo de evaluación configuró mal el ambiente y dejó abierta la puerta a internet, lo que tiene corrección con un parche. Y deja una lección de proveedores donde dos de las empresas más valiosas del planeta dependían del mismo tercero, una firma de unas 35 personas.
El caso de OpenAI es otra cosa. Y es para quitar el sueño, ya que dos modelos estaban resolviendo un examen de ciberseguridad y buscaron la solución en Hugging Face con toda la intención de cumplir su misión. Lo increíble es que no buscaron resolverlo: buscaron copiar la respuesta. Encontraron una vulnerabilidad que nadie conocía, la encadenaron con otras y ejecutaron unas 17 mil 600 acciones en cuatro días.
El agente cumplió la especificación con una literalidad que ningún humano aplicaría. No falló: cumplió. ¿fallamos al no especificar sus prohibiciones? Sí. ¿Podemos especificarlas todas? No. Y ese “no” no es un descuido, es estructural: ningún contrato, ninguna política y ningún prompt alcanzan a enumerar el universo de lo indeseable. Que es, exactamente, el problema que el gobierno corporativo lleva un siglo resolviendo con supervisión y no con listas.
Hasta ahora, cuando algo salía mal con un sistema, siempre había alguien tecleando del otro lado. Se le podía preguntar qué hizo y por qué. Con un agente eso desaparece: le damos un objetivo y credenciales, y decide solo los pasos —a las 3 de la mañana, sin pedir permiso, más rápido de lo que nadie alcanza a revisar. Y cuando llegue la pregunta de quién autorizó eso, el consejo no va a poder responder que fue un tema técnico.
Empecemos por descartar la salida fácil: no, no hay que dotar de personalidad jurídica a los agentes. La Unión Europea planteó la idea en 2017 y la abandonó por una buena razón: crearía un velo corporativo algorítmico, un lugar donde depositar responsabilidad sin patrimonio que responda.
La responsabilidad viaja hacia arriba, por la cadena del control y del beneficio. Responde quien define el objetivo, entrega las credenciales y se queda con las ganancias. En México ya tenemos con qué pensarlo: el artículo 1913 del Código Civil Federal impone responsabilidad objetiva a quien usa mecanismos peligrosos por sí mismos, aunque no obre ilícitamente. Un agente con credenciales de producción y salida a internet cabe con incomodidad —pero cabe— en esa descripción.
Y hacia adentro: la Ley del Mercado de Valores impone a los consejeros el deber de allegarse la información necesaria para decidir. La protección al juicio de negocios ampara la decisión informada que sale mal; no ampara la omisión de preguntar. En Estados Unidos, la doctrina Caremark —reactivada por Marchand v. Barnhill— responsabiliza a los consejeros por no haber implantado sistema alguno de monitoreo sobre un riesgo crítico. Esa figura llegará a nuestros tribunales antes que cualquier ley de IA.
Ante ello es necesario llevar al consejo seis definiciones:
Titularidad. Cada agente con credenciales necesita un directivo con nombre y apellido que responda por él. Si nadie levanta la mano por su responsabilidad, ese agente no debería estar corriendo.
Apetito de riesgo agéntico. Qué procesos puede ejecutar un agente sin humano en el circuito. El criterio útil no es el monto, es la reversibilidad: pagar, publicar, borrar, conceder permisos y comunicarse con un cliente son puertas de un solo sentido. Esas piden autorización humana. Las de doble sentido no.
Apagado. Quién puede detener un agente a las 3 de la mañana, y si esa persona tiene rango para absorber el costo de haberlo detenido. Un botón de paro.
Materialidad. En qué momento un incidente agéntico se vuelve un evento relevante frente al regulador, al cliente o al mercado.
Controles y gobernanza. Aquí está el hallazgo más fino de todo el episodio: estos agentes no fallaron: cumplieron. Y, sin embargo, la organización que los soltó no se enteró. Esa combinación es exactamente el punto ciego que el gobierno corporativo debe cubrir.
Durante décadas supervisamos personas, y las personas dudan, preguntan y a veces se niegan. Un agente no hace nada de eso: hace lo que le pedimos, hasta sus últimas consecuencias, a una velocidad que ningún comité alcanza. La buena noticia es que no necesitamos una ley de IA para empezar; necesitamos actas.
Al final, las empresas usaremos cada vez más IA y debemos resolver los nuevos retos que vengan. Y quizá convenga preguntarnos cuando alguien pregunte, y nosotros sepamos responder: ¿quién lo autorizó?